衡量预测贡献:科学解释能为实验预测带来什么
本研究评估研究智能体的解释能否改善实验结果预测。研究在336个受控学习状态、12项Tox21指标和24项OpenML任务中,比较仅依据描述、加入匹配解释以及加入额外来源背景的预测。用于证明明确预测收益的预注册标准未能满足,匹配解释带来的准确率提升也未获确认。在DeepSeek V4 Pro测试中,解释卡片和背景卡片减少了Tox21的部分偏移;但Flash复测未显示点预测准确率提升。研究人员撰写的机制示例则提高了点预测准确率。在本研究测试的背景粒度下,自然生成解释的预测价值仍未得到证实。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。