原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.39071
立即前往原文

LexReward:面向法律语言模型的分类体系驱动奖励框架

LexReward从三个维度评估法律回答:文风、事实和法规等法律要素,以及法律推理的结构与完整性。该框架为每个维度制定评估标准和质量等级,并将生成的偏好数据用于直接偏好优化(DPO)训练。实验表明,这种评分方式能够可靠地区分回答质量;按维度训练的奖励模型也能通过强化学习提升相应表现,且在评估时无需参考答案。
行业资讯 AI模型 研究 2026-10-05 12:31:01 355 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。