具备内在可解释性的语言模型可随规模扩展
一项新研究将可解释性作为训练流程中的约束,而不是在模型完成后再进行分析。研究人员在三个数量级的计算规模上,对自回归和扩散式语言模型进行了实验,结果表明,可解释性可能与模型能力同步提升。研究中的扩散式模型 Steerling-8B 能将生成的词元归因于相关输入词元、人类可理解的概念以及训练数据。这使系统能够诊断输出、检索相似训练数据,并通过概念引导修正模型行为,无需重新训练。研究称,Steerling-8B 使用的计算量显著低于部分开放模型,但仍保持了竞争力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。