原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.08097
立即前往原文

OasisKV通过前瞻式稀疏预取将解码KV缓存扩展到HBM之外

OasisKV是一套旨在降低大语言模型推理内存需求的研究系统。在解码过程中,它只将对注意力计算最重要的KV缓存条目保留在高带宽内存(HBM)中,并从主机内存或远程内存等容量更大的存储层预取其他条目。系统利用推测解码生成的前瞻令牌,预测下一步所需的KV块。基于vLLM实现的原型在2048个令牌的KV预算下,相比完整注意力的准确率差距控制在0.7个百分点以内。与密集型vLLM相比,OasisKV在推理工作负载上的吞吐量最高提升至1.69倍,在多GPU长上下文服务上的吞吐量最高提升至2.1倍。
行业资讯 应用 硬件 研究 2026-08-11 13:00:59 684 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。