PRISM提升音频文本模型在严重声学噪声下的鲁棒性
该研究提出PRISM,一种无需训练、也无需访问源数据的适应方法,用于应对严重声学噪声下的音频文本模型。PRISM利用冻结的文本原型作为几何锚点,从未标注的目标批次中估计失真,并通过静态投影矩阵进行校正。研究人员称,推理阶段的适应只需进行一次矩阵向量乘法,耗时0.0009毫秒。在UrbanSound8K数据集上,PRISM较零样本基线提升12.94个百分点,并比使用特权噪声信息的测试时适应基线高出9.41个百分点。研究还发现了多声部类别中的“Polyphonic Trap”失败模式,并通过置信度感知回归最多恢复8.16个百分点的性能。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。