掩码不是模型本身:审计注意力、状态空间与混合序列模型中的前缀不变性
一项研究对前缀不变性进行了形式化定义:位置 t 的表示不应依赖未来输入。研究提出的轻量审计只需两次前向传播,无需训练或梯度,即可精确定位因果性失效的位置。仅检查注意力掩码并不充分,因为扫描操作或归一化也可能导致信息泄漏。在针对8个检查点进行的192次故障注入测试中,掩码检查一个问题也没有发现,而该审计定位了全部192个故障。研究还发现了Zamba2和Nemotron-H中的缺陷。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。