原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.10355
立即前往原文

为什么视频处理仍然如此昂贵?视频与视听大语言模型推理效率机制综述

该综述研究降低视频和视听大语言模型计算与内存成本的方法,分析帧采样、模态编码、连接器层面的令牌压缩,以及语言模型预填充和解码环节的瓶颈。文章整理了在参数量、FLOPs、延迟、内存使用量和视觉或音频令牌数量方面报告具体削减效果的研究。在条件允许时,作者基于相同的基础模型和输入协议比较准确率与成本,并将其与跨论文、实验条件不一致的证据区分开来。研究指出,视听模型的效率优化和标准化评估仍存在明显不足。
行业资讯 AI模型 研究 开源 2026-09-10 18:01:08 999 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。