面向多语言机器翻译的开放式大语言模型无参考后训练
一项研究探讨了开放式大语言模型在46种语言机器翻译任务中的无参考后训练方法。研究人员以监督微调的MiLMMT-46-v0.1模型为基础,采用Group Relative Policy Optimization(GRPO),奖励信号取自两个无参考质量评估模型的平均值,并加入语言识别门控。随后,他们对监督微调和强化学习模型的检查点进行线性插值,得到MiLMMT-46-v1.0。根据论文报告的评测结果,新模型相较监督微调基线均有稳定提升,并超过多个近期开放模型;与参与评测的专有系统相比,也取得了领先的无参考评分。研究还发现,在线策略蒸馏能够达到、但无法超越强化学习结合检查点插值所实现的质量上限。研究团队已公开模型和代码,以支持后续研究。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。