Learn2Play Bench:LLM智能体在陌生环境中能从经验中学得多好?
Learn2Play Bench是一套文本游戏基准测试,游戏规则新颖或反直觉,智能体必须通过互动来学习。该基准旨在区分经验学习与依靠预训练知识进行推理。可复现的反馈和自动评分支持对多次尝试进行受控评估;不同的游戏实例则用于检验智能体能否将所学应用于新情境。研究发现,保留完整的行动和反馈记录,可能比将经验概括为规则或策略更有助于学习。顶尖人类玩家的最高分高于受测智能体,并会尝试更多样的策略。此外,在固定基础模型的情况下,更换智能体的运行框架可以提升表现,同时降低估算的推理成本。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。