英伟达实现AI模型间KV缓存迁移,推理速度最高提升25倍
英伟达研究团队提出了一种在不同语言模型之间迁移KV缓存的方法,使目标模型能够跳过计算量较大的预填充阶段。根据模型和上下文的复杂程度,缓存转换速度据称比重新处理整个上下文快2.7至25倍。这项技术有望降低长对话和长文档场景下的推理延迟与成本,尤其是在切换或升级模型时。不过,其实际影响仍取决于模型之间的兼容性,以及能否在生产环境中得到广泛部署。
本文来源:AIbase,仅供学习参考,版权归原作者所有。