原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05140
立即前往原文

AutoSciBench:自动生成用于评估科学智能体的基准测试

AutoSciBench 是一个自动创建并迭代更新科学人工智能智能体基准测试的框架。每项任务由高层概念和详细方案组成,分别描述科学领域、数据形式、所需推理方式,以及问题、环境和标准答案的构建与验证方法。系统分析智能体的解题轨迹和评审反馈,修正任务中的捷径,使其更重视原始数据复核、中间结果解读和证据整合。在计算生物学、材料科学和临床成像测试中,与人工构建的基准相比,生成的基准使前两个领域的智能体平均准确率分别下降22.4和25.5个百分点。生成任务在三个领域也获得了更高的平均质量评分。
行业资讯 应用 研究 2026-10-07 11:00:57 228 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。