原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/31510
立即前往原文

VoxMem揭示:音频大模型记不住谁说了什么,也记不住说话方式

墨尔本大学与新南威尔士大学联合团队推出VoxMem,用于评估音频大模型在长时间、多轮对话中的记忆能力。该基准包含3,196个评测实例和34,743段语音会话,总计约177小时音频。VoxMem将说话人身份、语气、情绪和背景音等声学线索,与记忆操作分开评估,并在8K至64K不同上下文长度下保持题目不变。对15个主流音频模型的测试显示,在32K上下文下,所有模型的整体准确率都低于40%。模型对语义内容的记忆明显强于对说话人身份、副语言线索和环境声的记忆。随着对话历史变长,各类信息的准确率均下降。研究团队认为,当前瓶颈主要在于识别、定位和绑定声学信息,而不只是推理能力。
行业资讯 应用 行业新闻 AI模型 研究 2026-10-09 18:30:38 949 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。