FlowBalance:基于验证器的在策略推理经验自我改进
FlowBalance是一种利用推理模型自身在策略经验提升能力的方法。它将可靠但稀疏的终端验证器反馈,与同一模型生成的更密集自我引导结合起来。该方法根据验证器得出的组优势校准自我引导:对成功轨迹予以保留,对失败轨迹进行反向处理,在采样组没有结果偏好时则关闭引导。通过轨迹平衡,FlowBalance能够拟合归一化目标分布,而无需额外的词元级模仿损失。理论分析涵盖组内对比保持、最小变化的反向KL特性、验证器对目标奖励的单调控制,以及对错误正向自我引导的精确修正。在数学推理实验中,Qwen3-4B和Qwen3-8B的平均表现优于FlowRL,训练速度和稳定性也有所提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。