原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.05136
立即前往原文

损失函数看不见基底,但 Adam 看得见

一项理论与实证研究解释了:在因式分解模型 W = UVᵀ 中,梯度下降会隐式偏好低秩解,而 Adam 即使从相同的小幅初始化出发,也不会表现出这一特性。差异源于损失函数的规范对称性。若要保留梯度流产生低秩解的机制,优化器必须对 U 和 V 的等价变换保持等变性。梯度下降、动量法、共享标量 Adam、Muon 和 Shampoo 满足这一条件;Adam、RMSProp 及其他按坐标更新的方法则不满足。矩阵感知实验显示,从按坐标预条件化转向共享标量预条件化,可以逐步恢复低秩偏置。在 Transformer 中,Adam 会将规范等价的初始化分离到不同解上。在两个高光谱数据集上,在最低采样密度下,梯度下降将留出误差降低了 43% 至 44%。
行业资讯 研究 2026-08-11 20:00:58 517 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。