研究探索语言代理与非语言代理的协作方式
一项研究考察,将非语言代理的连续状态表示压缩为简短文本摘要,是否会限制其与大型语言模型的协作。研究人员推出 LLAMIA-Bench,包含六项协作式国际象棋任务,涵盖行为模仿、状态评估和自然语言解释。作为语言化传递的替代方案,潜在状态内化方法将专用代理的表示直接投射到语言模型的 token 流中,以学习得到的状态 token 进行编码,并随环境状态变化动态重新编码。实验结果显示,基于语言描述的整合存在持续的性能差距,该差距会在训练过程中扩大,即使模型从 40 亿参数扩展到 140 亿参数仍然存在。研究称,采用该方法训练的 140 亿参数模型 LLAMIA,在所有基准任务上都能达到或超过专用系统以及可使用工具的 GPT-5.1 等前沿模型。相关结果目前基于国际象棋任务,仍需在机器人等更广泛的环境中验证。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。