WhatWorkedBench:评估 AI 智能体的实验理解能力
WhatWorkedBench 用于衡量 AI 研究智能体预测组件变化对实验结果影响的准确度。智能体检查代码、选择测量项,并预测不同配置的得分;参考影响通过在 CPU 上穷举运行所有配置得出。该基准涵盖来自 30 个数据源的 36 项任务,以及八类工作流。在评估中,对智能体观测结果拟合高斯过程提高了影响恢复能力;将行为相同的配置编码为等价项也提升了准确度。WhatWorkedBench 旨在支持实验智能体、自适应实验设计和数值推断方面的研究。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。