PACT:从信用分配到评论器对齐
这项研究通过完整性、前缀一致性和中立性三项条件,形式化定义了语言模型后训练中的 token 级信用分配。研究人员据此分析现有训练信号,并提出 Policy Aligned Critic Training(PACT)。PACT 先更新 actor,再通过重要性采样校正,使 critic 训练与更新后的策略保持一致。在四项智能体数学推理基准测试中,PACT 的平均准确率为 72.87%,比 GRPO 高 8.80 个百分点,比 PPO 高 13.16 个百分点。在 SWE-bench Verified 上,其通过率达到 67.4%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。