Co-RL:多智能体强化学习中的多样化模型群体涌现无监督推理
该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3% 至 7.2%。相关代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。