VoxMem揭示:音频大模型记不住谁说了什么,也记不住说话方式
墨尔本大学与新南威尔士大学联合团队推出VoxMem,用于评估音频大模型在长时间、多轮对话中的记忆能力。该基准包含3,196个评测实例和34,743段语音会话,总计约177小时音频。VoxMem将说话人身份、语气、情绪和背景音等声学线索,与记忆操作分开评估,并在8K至64K不同上下文长度下保持题目不变。对15个主流音频模型的测试显示,在32K上下文下,所有模型的整体准确率都低于40%。模型对语义内容的记忆明显强于对说话人身份、副语言线索和环境声的记忆。随着对话历史变长,各类信息的准确率均下降。研究团队认为,当前瓶颈主要在于识别、定位和绑定声学信息,而不只是推理能力。
本文来源:AIbase,仅供学习参考,版权归原作者所有。