KVCMAS:面向多智能体系统共享上下文的高效 KV 缓存校正
KVCMAS 是一种用于多智能体系统高效共享 KV 缓存的框架。它使用紧凑的低秩状态表示不同智能体之间的缓存偏差,并沿智能体工作流串联校正,无需额外进行参考缓存预填充。该方法支持动态变化的共享上下文,同时保持第一个智能体缓存的精确性。在语言和视觉语言工作负载测试中,KVCMAS 的准确率达到或超过现有 KV 缓存共享方法。在高并发服务场景下,与不共享 KV 缓存的推理相比,其首 token 延迟提升 2 倍;相较于一种已有的缓存校正方法,峰值 GPU 内存占用最多降低 3.7 倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。