StableVQ:稳定训练向量量化 Tokenizer 的实用指南
StableVQ 针对自回归和掩码图像生成模型所使用的离散视觉 tokenizer 的训练不稳定问题提出改进方案。作者认为,问题源于编码器—解码器与 codebook 的训练相互纠缠,使系统在训练压力较大时容易失稳。该方法通过 Dynamic STE 改进编码器的学习目标,利用 Region VQ Loss 让 codebook 能够独立跟踪编码器输出分布,并采用解耦训练计划,为两个子系统设置不同的优化动态。StableVQ 建立在共享投影 codebook 之上,不增加可学习参数。ImageNet 实验显示,在不同 codebook 规模和初始化设置下,该方法都能稳定提升训练稳定性、codebook 利用率和重建质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。