先学会评估再改进:面向自主科研智能体的自动评估规则生成
AutoSciRub 是一个面向自主科研智能体的框架,能够在研究开始前生成针对具体任务的可执行评估规则。它将定义不充分的研究指令拆解为原子化科学目标,并结合相关文献和可用数据,制定具体且可验证的标准。评估规则可指导实验与分析;逐项验证则能发现未满足的要求,并针对性地改进研究报告及其支撑成果。在 ResearchClawBench 和 AstaBench E2E Discovery 测试中,AutoSciRub 在多种语言模型和智能体框架上都取得了平均性能提升,同时保持或增加了成功完成的任务数量。代码已在 GitHub 开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。