为什么视频处理仍然如此昂贵?视频与视听大语言模型推理效率机制综述
该综述研究降低视频和视听大语言模型计算与内存成本的方法,分析帧采样、模态编码、连接器层面的令牌压缩,以及语言模型预填充和解码环节的瓶颈。文章整理了在参数量、FLOPs、延迟、内存使用量和视觉或音频令牌数量方面报告具体削减效果的研究。在条件允许时,作者基于相同的基础模型和输入协议比较准确率与成本,并将其与跨论文、实验条件不一致的证据区分开来。研究指出,视听模型的效率优化和标准化评估仍存在明显不足。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。