SAEScientist-Bench:AI 代理能否自主开展 SAE 可解释性研究?
论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文本生成进行因果引导方面落后较多。进一步分析发现,代理能够设计实验排除虚假候选项,却经常误解实验测量结果。该研究将模型的实验性理解定义为自主 AI 研发中一种可衡量的能力。代码已在 GitHub 上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。