从生产流量到后训练:构建覆盖企业请求组合的自托管大语言模型
数据驻留要求迫使企业自行托管大语言模型,但持续引入新模型而不淘汰旧模型,会扩大服务模型集群并分散有限的 GPU 资源。该方案将 200 多个内部应用的流量整合到一个模型上,并根据生产环境错误分析,围绕指令遵循、函数调用和内部任务分布三个维度进行后训练。团队分别为每个维度训练 GRPO 专家,再通过两阶段 SLERP 合并。在内部 Arena 评测中,该方案超过了总参数量为其 7 倍的基线模型,同时提升了指令遵循和函数调用表现。目前,该模型以更低的服务成本承载平台 50% 的流量,即每月 1.16 亿次请求。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。