原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10288
立即前往原文

Power-Law Graph Attention:缩放点积注意力的精确推广与推理时的经验性坍缩

该研究提出 PLDR-LLM 及其 Power-Law Graph Attention 机制。该机制用由输入生成的算子取代缩放点积注意力固定的双线性形式,算子由正张量和逐元素幂律构成。研究证明,PLGA 将标准注意力精确地包含为特殊情况,并分析其 Perron–Frobenius 结构、无环约束以及保持相对位置依赖性的条件。推理坍缩定理指出,如果演绎输出对输入完全不变,该机制将退化为使用常数算子的广义标准注意力。测量显示相对波动达到 10^-6 或更低,但尚不足以完全证明缓存推理。部分核心证明已在 Lean 4 中完成机器验证。
行业资讯 AI模型 研究 2026-08-12 17:31:02 147 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。