J-Zero:从零数据出发的 Challenger、Solver、Judge 统一协同进化
J-Zero 是一种无需额外训练数据、用于推动语言模型自我改进的框架。Challenger 生成难度不断增加的任务,Solver 学习给出质量更高的回答;与此同时,Judge 根据回答的生成方式,利用顺序预先确定的偏好对进行自适应。作者报告称,与基线方法相比,J-Zero 在可验证领域平均提升 4.2 分,在不可验证领域提升 8.0 分。J-Zero 至少持续迭代改进了十轮,而基线方法在两轮后出现性能下降。研究结果表明,将对抗式任务生成、求解和评判结合起来,可能有助于拓展语言模型的自我改进能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。