以“永不放弃”方法学习解决大语言模型的强化学习难题
研究表明,强化学习(RL)对大语言模型(LLM)的提升并不均衡:模型原本擅长的简单问题进步明显,而困难问题的改善较小。研究人员将这一现象称为RL中的“马太效应”,并认为现代RL方法在简单问题上浪费了过多计算资源。他们提出自适应采样方法“Never Give Up(NGU)”,针对每个问题持续生成样本,直到找到正确答案,从而将更多计算资源分配给难题。在DeepScaler数学基准测试中,NGU提升了单位计算量的性能,尤其是在困难问题上。在Manufactoria编程任务中,标准GRPO无法完全解决包含难易不同测试的问题,而NGU能够逐步解决更难的测试,最终完整解决编程问题。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。