原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.03820
立即前往原文

选择、压缩、再投资:长视频多模态大语言模型视觉令牌分配的受控研究

一项研究评估多模态大语言模型处理一小时视频时如何分配视觉令牌。在受控条件下,帧选择是影响最大的因素:在 LongVideoBench 的一小时片段中,按查询选择的 8 帧比均匀采样的 16 帧高出 6.9 分。数十年前提出的稀疏近似算法正交匹配追踪(Orthogonal Matching Pursuit),在三个基准测试中与专门设计的选择器表现相当,或仅低不到 1 分。保持时间戳不变,将每帧的空间令牌预算减半,准确率最多下降 0.44 分。把节省的预算用于增加一倍的压缩帧数量,还能带来 2 至 3 分的提升。研究还发现,作者自有的 AKS 基线实现存在错误;不同评测框架运行相同方法时,结果相差 0.07 至 3.74 分。这说明相关比较应在统一的受控评测环境中进行,而不应直接跨论文比较。
行业资讯 AI模型 研究 2026-09-05 01:01:06 387 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。