检索效果更好,鲁棒性却更差:多跳 RAG 如何放大上游 ASR 错误
一项研究分析了自动语音识别(ASR)错误如何影响执行多跳推理的语音检索增强生成(RAG)系统。研究人员使用四种英语口音、三个多跳问答基准和四种 RAG 配置,测试了实体图链接与迭代式查询改写。结构更复杂的配置通常取得更高的绝对 F1 分数,但与基础密集检索相比,它们使干净文本与含 ASR 错误输入之间的性能差距扩大了 36% 至 67%。查询实体被破坏是主要失败原因。两种轻量级表面形式修正只能弥补很小一部分差距。研究人员已公开代码和数据。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。