仅使用 MLP:高效重建多模态语言模型的视觉状态
该研究提出 δ-Vision,在不丢弃视觉 token 的情况下,降低多模态语言模型的计算成本。研究发现,视觉信息对文本的影响集中在低维子空间中,轻量级 MLP 能够准确重建各层所需的视觉状态。在图像和视频基准测试中,δ-Vision 的准确率超过视觉 token 剪枝方法,同时计算量相当或更低。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。