AutoSciBench:自动生成用于评估科学智能体的基准测试
AutoSciBench 是一个自动创建并迭代更新科学人工智能智能体基准测试的框架。每项任务由高层概念和详细方案组成,分别描述科学领域、数据形式、所需推理方式,以及问题、环境和标准答案的构建与验证方法。系统分析智能体的解题轨迹和评审反馈,修正任务中的捷径,使其更重视原始数据复核、中间结果解读和证据整合。在计算生物学、材料科学和临床成像测试中,与人工构建的基准相比,生成的基准使前两个领域的智能体平均准确率分别下降22.4和25.5个百分点。生成任务在三个领域也获得了更高的平均质量评分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。