构建面向生产环境的希腊语—英语语音识别系统
一项持续数月的工程计划介绍了 Sophea,这是一个面向生产环境的希腊语和英语双语自动语音识别系统。团队围绕词错误率、语言识别能力以及在非语音音频上的幻觉现象,设置了九项生产标准进行评估。在 23 次训练迭代中,没有任何训练数据配置同时通过全部九项标准。由三个模型组成的 ROVER 集成系统通过了全部标准,并将重叠语音场景下的词错误率相对降低 29%。另一个模型在八个公开英语测试集上的平均词错误率为 4.26%,在真实嘈杂环境的希腊语流量中为 25.88%。报告还记录了测量工具出现错误的案例,以及最终未部署的方案。模型权重和训练数据未公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。