Random Attention:重新思考高效推理中的 KV 缓存淘汰
Random Attention 对根据缓存 Token 未来重要性进行评分和保留的 KV 缓存压缩方法提出质疑。该方法保留提示内容,并在每个注意力头内均匀随机淘汰 Token,完全省去评分计算。在四个模型和六项推理任务上的测试显示,其效果可与此前最强的淘汰方法相当,同时在 vLLM 部署中的吞吐量提升 32% 至 43%。受控实验表明,提示是缓存中最脆弱的部分;推理轨迹则依靠文本中的重复表述以及不同注意力头之间的冗余得到保护。相关代码已在 GitHub 上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。