Cultivar:用于研究数据污染与本地化鲁棒性的对比式区域翻译基准
多语言翻译基准通常以英语文本为源,再翻译成其他语言。这种设计容易随着时间推移受到数据污染,也会忽视地区和文化差异。Cultivar构建了FLORES的本地化子集,用于开展按地区划分的对比式翻译评估。通过比较本地化与未本地化版本,可以探查训练数据污染和本地化鲁棒性。对32个开放权重模型的测试显示,机器翻译专用模型的鲁棒性较低,少数模型可能对FLORES过拟合;此外,无论目标语言是什么,模型通常都能比翻译其他地区的内容更好地翻译美国内容。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。