在潜空间中推理:让潜在视觉推理成为必要计算
该研究提出因果视觉循环推理(CVRR),旨在确保多模态模型生成答案时真正使用潜在视觉计算。CVRR在预训练视觉语言模型处理图像后,从问题表示初始化循环状态,并通过反复读取相同的视觉证据来更新该状态。在解码前,系统会移除视觉状态和原始多模态KV缓存,因此只有最终循环状态能够将图像条件信息传递给答案。在多个基准测试中,CVRR在这一严格接口下仍保持了较强的视觉能力,而兼容的潜在推理方法未能恢复相当的性能。因果干预实验还表明,模型预测仍对循环内容敏感,持续存在的视觉证据会因果性地改变推理轨迹。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。