VākQA:泰卢固语语音事实问答基准与评测研究
VākQA是一个面向泰卢固语语音问答的新基准,包含来自六个领域的2,001组事实型问答、2.53小时语音数据、双语转写以及经人工验证的参考答案。研究将自动评测方法与人工判断进行比较,发现由Gemini担任评审时最接近人类评分,但严格程度并不统一。开放权重评审模型会系统性地低估措辞不同于参考答案、但实际正确的泰卢固语回答。对专有模型和开放权重模型的测试还表明,翻译会丢失泰卢固语中的文化特异性,而语音输入可能引入音韵混淆,改变问题含义。自动语音识别与机器翻译串联使用时,错误会逐步累积。VākQA已公开发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。