重新思考长视频效率:联合分配帧、像素与前端延迟
一项关于视觉语言模型(VLM)高效理解长视频的研究发现,在相同的 token 预算下,低分辨率密集时间采样可能优于原生分辨率稀疏采样。不过,对分辨率敏感的任务仍能从精选的高分辨率帧中受益。研究还表明,对于时长达一小时的视频,前端解码延迟主要取决于候选帧池的大小,而不是最终 token 预算。研究人员提出了无需训练、单次处理的 LoHi 框架,通过 VLM 原生的视频和图像通路,将低分辨率密集视频流与少量高分辨率图像帧结合起来。高分辨率帧可依据编解码器 I 帧元数据,或利用 CLIP 特征计算查询相关性和视觉多样性来选择。在三个长视频基准测试中,LoHi 相比原生分辨率基线将平均准确率提高 10.6 个百分点,相比此前最强的效率方法提高 5.2 个百分点,并将长视频前端解码延迟最多降低 7 倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。