Power-Law Graph Attention:缩放点积注意力的精确推广与推理时的经验性坍缩
该研究提出 PLDR-LLM 及其 Power-Law Graph Attention 机制。该机制用由输入生成的算子取代缩放点积注意力固定的双线性形式,算子由正张量和逐元素幂律构成。研究证明,PLGA 将标准注意力精确地包含为特殊情况,并分析其 Perron–Frobenius 结构、无环约束以及保持相对位置依赖性的条件。推理坍缩定理指出,如果演绎输出对输入完全不变,该机制将退化为使用常数算子的广义标准注意力。测量显示相对波动达到 10^-6 或更低,但尚不足以完全证明缓存推理。部分核心证明已在 Lean 4 中完成机器验证。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。