获取、修复与保持:面向小型模型对话游戏智能体的诊断驱动后训练方法
一项在 LM Playschool Challenge 中开展的研究,使用一个拥有 20 亿参数的开放权重模型评估互动式对话游戏能力。研究发现,许多失败并非主要源于广泛知识不足,而是局部决策问题,例如重复猜测、生成格式错误的动作,以及违背刚刚收到的反馈。研究提出的方法包括广泛的监督微调、针对单一对话游戏系列的定向修复,以及保持模型的一般能力。公开 clemscore 从 10.67 提升至 38.92,静态任务的总体表现基本保持不变。但域外 clemscore 仍只有 7.88,说明能力迁移主要集中在同一游戏系列内。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。