迈向量化 ASR 模型的基准优化
一项研究提出了一种方法,用于衡量自动语音识别模型是否针对公开基准进行了优化,却没有相应提升通用转录能力。研究关注音频本身无法唯一确定参考文本,或音频与基准参考文本相矛盾的情况。通过参考文本不一致、遮蔽数字恢复和正字法切换三类行为探测,研究发现,表现最好的开源模型即使面对矛盾、被遮蔽或含糊的音频,也会逐字输出基准参考文本片段。机制分析表明,模型会依赖狭窄的声学线索,选择有利于基准成绩的策略,而不是忠实反映音频内容。在某些情况下,这种行为可以通过低秩线性引导,或简单地将音频追加到片段末尾来因果性地改变。研究结果表明,高基准分数可能反映模型受基准条件影响的行为,并不一定代表通用语音转录能力得到提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。