原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34972
立即前往原文

仅使用 MLP:高效重建多模态语言模型的视觉状态

该研究提出 δ-Vision,在不丢弃视觉 token 的情况下,降低多模态语言模型的计算成本。研究发现,视觉信息对文本的影响集中在低维子空间中,轻量级 MLP 能够准确重建各层所需的视觉状态。在图像和视频基准测试中,δ-Vision 的准确率超过视觉 token 剪枝方法,同时计算量相当或更低。
行业资讯 AI模型 研究 2026-09-29 11:01:14 956 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。