原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.28458
立即前往原文

获取、修复与保持:面向小型模型对话游戏智能体的诊断驱动后训练方法

一项在 LM Playschool Challenge 中开展的研究,使用一个拥有 20 亿参数的开放权重模型评估互动式对话游戏能力。研究发现,许多失败并非主要源于广泛知识不足,而是局部决策问题,例如重复猜测、生成格式错误的动作,以及违背刚刚收到的反馈。研究提出的方法包括广泛的监督微调、针对单一对话游戏系列的定向修复,以及保持模型的一般能力。公开 clemscore 从 10.67 提升至 38.92,静态任务的总体表现基本保持不变。但域外 clemscore 仍只有 7.88,说明能力迁移主要集中在同一游戏系列内。
行业资讯 应用 AI模型 研究 开源 2026-09-01 04:01:24 687 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。