Miles v0.1:面向前沿模型的生产级后训练系统
Miles v0.1 是一个用于大型 AI 模型后训练的开源全栈系统。该平台以可验证、可定制的组件为核心设计强化学习流程,提供基于 SGLang 的 rollout 引擎、支持 NVIDIA Megatron-LM 和 PyTorch FSDP 的训练器,以及适应不同部署拓扑的三种权重同步方式。系统支持全参数 RL、LoRA RL、on-policy 蒸馏、监督微调,以及 rollout 与训练之间的真正 on-policy 对齐。案例研究使用 64 张 NVIDIA GB300 GPU,在拥有 7440 亿参数的 GLM-5.2 模型上运行了异步智能体 RL。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。