超越视觉思维链:面向主动视频推理的内化视觉思考
该研究提出了 Internalized Visual Thinking(IVT),一种用于多模态语言模型的后训练框架。IVT训练模型在生成文本答案的同时,预测未来视频帧的潜在表示。与视觉思维链方法不同,IVT在推理阶段无需生成或重新编码中间图像。在六种评估设置中,IVT的表现优于直接答案微调,并达到或超过显式Visual CoT的效果。其平均端到端延迟也降低了五倍以上。研究结果表明,预测式视觉世界建模可以在训练阶段被内化,从而在不进行像素级生成的情况下,提高主动视频推理的效率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。