原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.36651
立即前往原文

FocusVTC:基于自适应分辨率的高效高性能视觉文本压缩

FocusVTC是一种视觉文本压缩方法,旨在降低大语言模型处理长上下文时的计算和内存成本。该方法先以低分辨率图像呈现文档的全局视图,再选择性增强与推理相关的区域。研究团队构建了2.94万个推理证据定位样本,用于训练模型识别重要区域,并通过策略优化学习何时提高分辨率以及如何利用增强后的信息。在RULER v1测试中,FocusVTC在输入压缩2.9倍时获得87.4分,高于Glyph在3.0倍压缩下的57.5分。它还在LongBench上略微超过文本输入基座模型,将MRCR宏平均提升13.91分,并在在线端到端延迟测试中实现相对文本输入2.79倍的加速。整体多模态能力得到保持或提升。
行业资讯 AI模型 研究 2026-09-30 23:31:55 454 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。