原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.32259
立即前往原文

异构 LLM 系列间无需预填充的 KV 缓存传输

HeteroFold 可在不同系列的语言模型之间传输键值(KV)缓存,无需接收模型重新预填充共享上下文。该方法对齐模型结构,将发送方的缓存映射到接收方的表示空间并进行校准,同时保持两个模型不变。在六种传输方向上,它在全部四项长上下文基准测试和大多数短上下文设置中取得最佳结果。上下文长度为 32K 时,从 Llama-3.1-8B 到 Ministral-3-14B 的传输速度是原生预填充的 10.7 倍,比受测的免预填充基线方法快 1.18 至 1.47 倍。
行业资讯 AI模型 研究 2026-10-05 04:00:55 140 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。