原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.26774
立即前往原文

StableVQ:稳定训练向量量化 Tokenizer 的实用指南

StableVQ 针对自回归和掩码图像生成模型所使用的离散视觉 tokenizer 的训练不稳定问题提出改进方案。作者认为,问题源于编码器—解码器与 codebook 的训练相互纠缠,使系统在训练压力较大时容易失稳。该方法通过 Dynamic STE 改进编码器的学习目标,利用 Region VQ Loss 让 codebook 能够独立跟踪编码器输出分布,并采用解耦训练计划,为两个子系统设置不同的优化动态。StableVQ 建立在共享投影 codebook 之上,不增加可学习参数。ImageNet 实验显示,在不同 codebook 规模和初始化设置下,该方法都能稳定提升训练稳定性、codebook 利用率和重建质量。
行业资讯 AI模型 研究 2026-09-23 13:00:56 638 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。