原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34054
立即前往原文

PReCache:通过低秩预计算与中性重构高效共享 Multi-LoRA 智能体的 KV 缓存

PReCache 是一种无需训练的 KV 缓存共享框架,面向 Multi-LoRA 智能体系统。该方法共享基础模型缓存,同时预先计算紧凑的智能体专属低秩缓存,从而避免重复处理共享上下文。ReBaseShared 设计从未应用适配器的隐藏状态中重构共享基础缓存,以减少复用其他 LoRA 适配器生成的表示所造成的精度损失。在多个模型和智能体基准测试中,与不共享 KV 缓存的推理相比,PReCache 最多可将首个 token 延迟提升 3.1 倍,并将单请求吞吐量提高 2.3 倍。ReBaseShared 的整体精度保持最佳,平均仅下降 1.1 个百分点。
行业资讯 应用 研究 2026-09-29 13:01:03 475 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。