CRISP:面向长上下文大语言模型的输入自适应稀疏预填充
CRISP是一种加速长上下文大语言模型推理中注意力预填充阶段的方法。它利用代理注意力图的结构,直接识别适合的稀疏注意力模式,从而替代开销较高的路由计算。该方法还引入了考虑注意力汇聚标记的阈值,以减少在长上下文中选择相关位置时不断累积的背景噪声。根据作者的实验,在两个模型系列以及InfiniteBench、RULER和LongBench评测中,CRISP在512,000个词元下实现了最高5.30倍的注意力加速,并在检索任务上较基线稀疏方法提升最多28个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。