原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.32353
立即前往原文

更少 Token,更多自我学习:用于极限视觉 Token 压缩的策略内自蒸馏

该研究提出 LT-OPD,一种用于减少多模态大语言模型视觉 Token 的训练框架。高度压缩的学生模型仅使用少量视觉 Token 生成回答,而同一模型的完整 Token 版本以冻结状态提供分布监督。训练过程中,预算课程会逐步降低 Token 上限。在 9 项基准测试中,仅保留 5% 的视觉 Token,平均保留性能便从 68.6% 提升至 82.3%。该方法在多个模型系列上均实现迁移,并在不增加推理开销的情况下,将 KV 缓存使用量和预填充 FLOPs 降低约 85%。
行业资讯 应用 AI模型 研究 2026-09-29 10:31:01 374 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。