原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.08368
立即前往原文

Miles v0.1:面向前沿模型的生产级后训练系统

Miles v0.1 是一个用于大型 AI 模型后训练的开源全栈系统。该平台以可验证、可定制的组件为核心设计强化学习流程,提供基于 SGLang 的 rollout 引擎、支持 NVIDIA Megatron-LM 和 PyTorch FSDP 的训练器,以及适应不同部署拓扑的三种权重同步方式。系统支持全参数 RL、LoRA RL、on-policy 蒸馏、监督微调,以及 rollout 与训练之间的真正 on-policy 对齐。案例研究使用 64 张 NVIDIA GB300 GPU,在拥有 7440 亿参数的 GLM-5.2 模型上运行了异步智能体 RL。
行业资讯 AI模型 研究 开源 2026-09-09 12:01:41 717 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。