原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/30357
立即前往原文

告别单机模型“虚胖”:百灵团队与 AReno 打通本地智能体强化学习闭环

百灵团队与开源社区共同维护的本地大语言模型后训练工具包 AReno,展示了一套轻量级智能体强化学习流程。团队在 DGX Spark 环境中,以井字棋作为验证任务,对总参数量 79 亿、激活参数量 13 亿的 Ling-3.0-tiny 进行后训练。通过规则化奖励和 GSPO 算法完成 400 个训练步骤后,模型的平均奖励提升,非法动作减少,工具调用和动作选择也更加稳定。这项工作提出了一套可复现的方法:精准发现错误、定义可验证反馈、完成本地训练,并在同一环境中复测。该方法可进一步用于工具调用修复、结构化字段抽取、领域指令遵循和业务流程智能体。Ling-3.0-tiny 已在 Hugging Face 和魔搭社区提供 BF16、FP8 及 INT4 版本。
行业资讯 应用 AI模型 研究 开源 2026-08-14 15:30:47 803 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。