原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.04318
立即前往原文

重新思考长视频效率:联合分配帧、像素与前端延迟

一项关于视觉语言模型(VLM)高效理解长视频的研究发现,在相同的 token 预算下,低分辨率密集时间采样可能优于原生分辨率稀疏采样。不过,对分辨率敏感的任务仍能从精选的高分辨率帧中受益。研究还表明,对于时长达一小时的视频,前端解码延迟主要取决于候选帧池的大小,而不是最终 token 预算。研究人员提出了无需训练、单次处理的 LoHi 框架,通过 VLM 原生的视频和图像通路,将低分辨率密集视频流与少量高分辨率图像帧结合起来。高分辨率帧可依据编解码器 I 帧元数据,或利用 CLIP 特征计算查询相关性和视觉多样性来选择。在三个长视频基准测试中,LoHi 相比原生分辨率基线将平均准确率提高 10.6 个百分点,相比此前最强的效率方法提高 5.2 个百分点,并将长视频前端解码延迟最多降低 7 倍。
行业资讯 AI模型 研究 2026-10-06 10:31:24 360 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。