ExplorationBench:衡量 AI 系统探索可验证异世界的能力
ExplorationBench 是一项评测基准,用于检验 AI 系统能否通过探索学习并应用陌生规则。它采用两个规则可执行的模拟异世界,因此答案可以得到精确验证,也无法仅凭熟悉的已有知识完成任务。在每个环境中,系统会获得一份有缺陷的手册、针对任务的反馈和实验工具,随后解决未见过的任务。对 10 个 AI 系统的评测显示,能力较强的系统能够习得并应用陌生规则。不过,不同探索过程的表现差异显著,继续探索有时会使此前的进步停滞甚至倒退。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。