原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.24696
立即前往原文

基于可验证奖励的在线策略蒸馏

该研究提出OPDVR,将在线策略蒸馏与基于可验证奖励的强化学习结合起来。该方法利用教师模型提供的密集令牌级指导信号,并通过ReLU门控机制,使蒸馏信号与完整轨迹的正确性保持一致。正确轨迹获得非负奖励,错误轨迹获得非正奖励,同时无需增加额外超参数。在六项推理基准测试中,OPDVR均优于标准在线策略蒸馏。相关代码已在GitHub上公开。
行业资讯 研究 开源 2026-08-26 10:30:50 678 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。