研究统一多模态模型中的图像标记器及其视觉语言特性
该研究分析图像标记器如何影响统一自回归多模态模型对图像和文本标记的联合建模。研究人员在多模态持续预训练过程中,跟踪文本、图像、文本到图像以及图像到文本预测的任务特定验证损失。结果表明,不同任务的损失呈现不同的扩展规律,并会对标记器产生不同的排序。基于共享文本词表计算的图像到文本损失,在跨标记器评估生成质量和视觉理解能力时,比文本到图像损失提供了更一致的信号。更好的图像重建能力并不一定带来更低的任务损失或更强的下游性能。此外,标记器的选择可能在联合优化过程中影响文本建模。研究还考察了判别器、语义监督和词表规模等设计因素。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。