原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.03241
立即前往原文

FlowBalance:基于验证器的在策略推理经验自我改进

FlowBalance是一种利用推理模型自身在策略经验提升能力的方法。它将可靠但稀疏的终端验证器反馈,与同一模型生成的更密集自我引导结合起来。该方法根据验证器得出的组优势校准自我引导:对成功轨迹予以保留,对失败轨迹进行反向处理,在采样组没有结果偏好时则关闭引导。通过轨迹平衡,FlowBalance能够拟合归一化目标分布,而无需额外的词元级模仿损失。理论分析涵盖组内对比保持、最小变化的反向KL特性、验证器对目标奖励的单调控制,以及对错误正向自我引导的精确修正。在数学推理实验中,Qwen3-4B和Qwen3-8B的平均表现优于FlowRL,训练速度和稳定性也有所提升。
行业资讯 AI模型 研究 2026-09-08 14:01:28 813 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。