原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.07594
立即前往原文

具备内在可解释性的语言模型可随规模扩展

一项新研究将可解释性作为训练流程中的约束,而不是在模型完成后再进行分析。研究人员在三个数量级的计算规模上,对自回归和扩散式语言模型进行了实验,结果表明,可解释性可能与模型能力同步提升。研究中的扩散式模型 Steerling-8B 能将生成的词元归因于相关输入词元、人类可理解的概念以及训练数据。这使系统能够诊断输出、检索相似训练数据,并通过概念引导修正模型行为,无需重新训练。研究称,Steerling-8B 使用的计算量显著低于部分开放模型,但仍保持了竞争力。
行业资讯 伦理与安全 AI模型 研究 2026-08-11 14:00:51 838 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。