NeoHorse-1通过智能体后训练探索递归式自我改进
NeoHorse-1是一组用于研究递归式自我改进的智能体模型。系统将请求路由到异构模型池,并记录能力需求、服务层级、工具调用和运行框架上下文,将其转化为训练数据。该方法结合结构验证、语义评估、课程式微调、路由引导的知识蒸馏,以及基于能力的训练数据分配。在涵盖智能体、工具使用、编程和指令遵循的11项基准测试中,4B模型的宏平均从58.94提升至64.87,9B模型则从65.60提升至69.04。这项工作展示了反馈驱动训练的早期原型,但尚未证明通用递归式自我改进或通用人工智能。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。