重新思考自动语音相似度评估:从EER转向嵌入几何
一项研究质疑将说话人验证模型的等错误率(EER)作为人类语音相似度判断代理指标的普遍做法。研究人员通过建立人类感知对齐指标发现,对齐程度更多取决于模型的训练目标,而不是验证性能。AAM-Softmax等基于间隔的分类损失,其感知对齐效果明显低于原型式度量损失;EER也无法可靠反映人类判断。研究将这种差异归因于嵌入空间的几何结构:有效维度与感知对齐程度呈-0.95的秩相关。加入维度瓶颈后,感知对齐指标从0.08提升至0.74,为评估语音相似度提供了几何学标准。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。