原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.13443
立即前往原文

以“永不放弃”方法学习解决大语言模型的强化学习难题

研究表明,强化学习(RL)对大语言模型(LLM)的提升并不均衡:模型原本擅长的简单问题进步明显,而困难问题的改善较小。研究人员将这一现象称为RL中的“马太效应”,并认为现代RL方法在简单问题上浪费了过多计算资源。他们提出自适应采样方法“Never Give Up(NGU)”,针对每个问题持续生成样本,直到找到正确答案,从而将更多计算资源分配给难题。在DeepScaler数学基准测试中,NGU提升了单位计算量的性能,尤其是在困难问题上。在Manufactoria编程任务中,标准GRPO无法完全解决包含难易不同测试的问题,而NGU能够逐步解决更难的测试,最终完整解决编程问题。
行业资讯 AI模型 研究 2026-09-16 03:30:58 775 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。