LoopVL:循环式视觉智能
LoopVL研究了能否将Loop Transformer有效扩展到视觉语言模型。该模型结合Module-Loop与Model-Loop计算,通过共享模块迭代更新统一的视觉语言状态。LoopVL从零开始训练,经历语言预训练、多模态训练和后训练。在多模态理解和视觉推理基准测试中,其表现优于多个规模相近或更大的非循环模型。研究人员还观察到,随着循环迭代,视觉注意力会发生显著变化。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。