原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.11959
立即前往原文

MiMo-V2.6:扩大强化学习规模,推动模型自我改进

报告介绍了多模态模型系列 MiMo-V2.6,通过扩大强化学习(RL)的计算规模来提升模型能力。其流程先使用广泛的多模态数据进行中期训练,再在编程、通用任务、视觉和网络安全等多种环境中开展 RL。异步训练系统每步处理 1,568 个样本和 27 亿至 37 亿个 token,支持最长 100 万 token 的上下文。分组式智能体评估旨在改善长周期任务的奖励信号。报告还介绍了稳定大规模训练及防范奖励黑客行为的措施,并称将开源训练动态、RL 环境和框架。
行业资讯 AI模型 研究 开源 2026-10-09 14:30:55 880 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。