具有对数线性复杂度的块稀疏注意力
自注意力的二次计算成本限制了长上下文处理。研究提出 PISA,通过分层 Top-K 策略选择相关键块,并利用 LogSumExp 分数逐步缩小候选范围。作者称,该方法可将复杂度降至 O(N log N)。面向硬件优化的 Triton 内核支持训练和推理,无需生成完整的查询—键分数矩阵。在语言建模任务中,作者报告称,该方法在常识推理基准上表现相当,在检索任务上取得更好结果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。