原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17253
立即前往原文

Co-RL:多智能体强化学习中的多样化模型群体涌现无监督推理

该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3% 至 7.2%。相关代码已公开。
行业资讯 AI模型 研究 开源 2026-08-20 13:01:04 619 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。