MiMo-V2.6:扩大强化学习规模,推动模型自我改进
报告介绍了多模态模型系列 MiMo-V2.6,通过扩大强化学习(RL)的计算规模来提升模型能力。其流程先使用广泛的多模态数据进行中期训练,再在编程、通用任务、视觉和网络安全等多种环境中开展 RL。异步训练系统每步处理 1,568 个样本和 27 亿至 37 亿个 token,支持最长 100 万 token 的上下文。分组式智能体评估旨在改善长周期任务的奖励信号。报告还介绍了稳定大规模训练及防范奖励黑客行为的措施,并称将开源训练动态、RL 环境和框架。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。