通过方向分解解析 Transformer 中的表征演化
该研究分析了 Transformer 表征如何通过学习到的加法更新发生演化。研究人员将相对于当前隐藏状态的更新分解为平行分量和垂直分量。在多个预训练模型中,他们发现除了残差恒等路径之外,还存在显著的平行分量。针对注意力和 MLP 更新的实验表明,在值空间中仅调整非自身信息的聚合,同时保留当前 token 的直接信息,比在残差空间或垂直分量上进行操作更加稳健。这种分解还可用于诊断压缩导致的更新误差,其中垂直误差比平行误差更能区分不同压缩方法。在从头预训练时,抑制完整聚合的平行更新能够降低验证损失并提升下游任务平均表现,值空间版本效果最好。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。