PACE-Bench 评估动态环境中的代码演化物理适应能力
PACE-Bench 是一个基于模拟器的基准测试,用于评估自我进化 AI 智能体能否在物理环境变化后调整代码驱动的设计。该基准涵盖六个物理领域,共包含 144 组源环境到目标环境的适应任务。一个在源环境中有效的设计会在经过变异的目标环境中失效,智能体必须在有限尝试次数内利用诊断沙盒反馈完成修改。对十种方法的比较显示,该基准仍远未饱和。Reflexion 搭配 Qwen3-14B 仅解决了全部任务的 35.9%,GPT-5.5 则在静力学子集上达到 66.7%。结果表明,基于模拟器的反思比未经验证的自我修订更可靠;记忆机制容易固守早期设计,广度树搜索则难以收敛。即使提供确切的物理变化信息,性能上限也没有明显提升,说明核心瓶颈是机制重新设计,而非简单的参数推断。代码和数据已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。