原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33781
立即前往原文

意外的成功与反复的失败:面向大模型推理探索的熵引导信用分配

研究人员提出了熵优势策略优化(EAPO),用于改进大语言模型基于可验证奖励的强化学习。EAPO利用策略熵,对成功和失败回答中的不同 token 进行非对称的信用分配:成功回答中的不确定决策会获得更强的强化,而失败回答中的自信决策会受到更强的惩罚。对于不确定的失败,方法会减轻惩罚,以保留模型探索其他解法的机会。该方法无需额外的辅助模型、采样或特权信息,直接利用现有 rollout 信号生成 token 级信用。在多项推理任务上的实验显示,EAPO提升了总体表现、问题覆盖范围和候选答案的多样性。
行业资讯 AI模型 研究 2026-09-29 12:01:24 130 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。