原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04971
立即前往原文

BeaconKV:由信标查询引导的大型推理模型高效推理键值缓存压缩

大型推理模型会生成很长的思维链,导致键值(KV)缓存随序列长度线性增长,并造成严重的 GPU 内存瓶颈。该研究发现,现有压缩方法可能忽略推理后续会重新关注的远距离上下文。BeaconKV 是一种无需训练的方法,通过保留相似查询簇的紧凑代表——信标查询,来预测将被再次访问的 KV 对。在四个开源推理模型和多个基准测试上的评估显示,该方法最多可将内存占用降低 5.8 倍,在基本保持完整缓存准确率的同时,将吞吐量提升超过 4.3 倍。
行业资讯 AI模型 研究 2026-09-09 13:31:03 831 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。