原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/30238
立即前往原文

英伟达实现AI模型间KV缓存迁移,推理速度最高提升25倍

英伟达研究团队提出了一种在不同语言模型之间迁移KV缓存的方法,使目标模型能够跳过计算量较大的预填充阶段。根据模型和上下文的复杂程度,缓存转换速度据称比重新处理整个上下文快2.7至25倍。这项技术有望降低长对话和长文档场景下的推理延迟与成本,尤其是在切换或升级模型时。不过,其实际影响仍取决于模型之间的兼容性,以及能否在生产环境中得到广泛部署。
行业资讯 硬件 行业新闻 AI模型 研究 2026-08-11 10:30:40 726 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。