Agent Memory Distillation 通过分层教师记忆增强小型大语言模型智能体
Agent Memory Distillation(AMD)是一种无需训练的框架,通过分层记忆将大型教师智能体的结构化知识传递给小型语言模型。工作流记忆编码任务级策略,子任务记忆提供具体行为示例,函数记忆则记录函数调用规范和常见错误。在三个工具使用基准测试中,研究使用 GPT-5-mini 作为教师,评估了四个参数规模为 4B 至 8B 的学生模型。AMD 使平均准确率分别提升 27.2、11.2 和 3.4 个百分点,并持续优于现有记忆方法。子任务记忆贡献最大,4B 学生模型的收益最为明显。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。