原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.15869
立即前往原文

超越视觉思维链:面向主动视频推理的内化视觉思考

该研究提出了 Internalized Visual Thinking(IVT),一种用于多模态语言模型的后训练框架。IVT训练模型在生成文本答案的同时,预测未来视频帧的潜在表示。与视觉思维链方法不同,IVT在推理阶段无需生成或重新编码中间图像。在六种评估设置中,IVT的表现优于直接答案微调,并达到或超过显式Visual CoT的效果。其平均端到端延迟也降低了五倍以上。研究结果表明,预测式视觉世界建模可以在训练阶段被内化,从而在不进行像素级生成的情况下,提高主动视频推理的效率。
行业资讯 AI模型 研究 2026-08-19 03:30:57 424 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。