我刚才说了什么?全双工语音模型的自我聆听
全双工语音模型能够同时听和说,但由于文本生成、语音合成与音频播放是异步进行的,模型认为自己说过的内容可能与用户实际听到的内容不一致。研究人员提出“Self-Listening”方法,将模型实际播放出的语音作为输入流反馈给模型。这样,模型就能根据用户真正听到的最后内容,在被打断后更准确地继续回答。研究还推出了 AnchorSpeech 数据集,用于追踪结构化回答中的哪些项目已经被说出。实验表明,加入自我聆听机制的模型在中断衔接表现上优于现有的全双工基线模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。