原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.12209
立即前往原文

将生成作为辅助监督,在不增加推理开销的情况下提升视觉理解

该研究提出GAS,一种面向多模态大语言模型的训练框架,将视觉生成重新定义为表征学习的辅助监督。GAS在解耦的Mixture-of-Transformers架构中采用下一嵌入预测,通过生成任务增强共享视觉路径,同时避免生成梯度直接干扰上层理解模块。训练完成后,生成分支会被移除,因此推理阶段无需额外计算。实验表明,GAS能够提升多模态理解能力,其中在视觉感知和空间理解方面的收益最为稳定。
行业资讯 AI模型 研究 2026-08-17 12:02:20 822 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。