PReCache:通过低秩预计算与中性重构高效共享 Multi-LoRA 智能体的 KV 缓存
PReCache 是一种无需训练的 KV 缓存共享框架,面向 Multi-LoRA 智能体系统。该方法共享基础模型缓存,同时预先计算紧凑的智能体专属低秩缓存,从而避免重复处理共享上下文。ReBaseShared 设计从未应用适配器的隐藏状态中重构共享基础缓存,以减少复用其他 LoRA 适配器生成的表示所造成的精度损失。在多个模型和智能体基准测试中,与不共享 KV 缓存的推理相比,PReCache 最多可将首个 token 延迟提升 3.1 倍,并将单请求吞吐量提高 2.3 倍。ReBaseShared 的整体精度保持最佳,平均仅下降 1.1 个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。