原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34060
立即前往原文

KVCMAS:面向多智能体系统共享上下文的高效 KV 缓存校正

KVCMAS 是一种用于多智能体系统高效共享 KV 缓存的框架。它使用紧凑的低秩状态表示不同智能体之间的缓存偏差,并沿智能体工作流串联校正,无需额外进行参考缓存预填充。该方法支持动态变化的共享上下文,同时保持第一个智能体缓存的精确性。在语言和视觉语言工作负载测试中,KVCMAS 的准确率达到或超过现有 KV 缓存共享方法。在高并发服务场景下,与不共享 KV 缓存的推理相比,其首 token 延迟提升 2 倍;相较于一种已有的缓存校正方法,峰值 GPU 内存占用最多降低 3.7 倍。
行业资讯 应用 AI模型 研究 2026-09-29 13:01:03 410 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。