原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.26796
立即前往原文

Flash-dLLM:面向高速、内存高效扩散式大语言模型的I/O感知KV缓存与并行解码

Flash-dLLM是一种无需训练的推理加速框架,旨在提升扩散式大语言模型(dLLM)的运行效率。研究发现,在启用KV缓存的dLLM推理中,GPU内存I/O是主要瓶颈,因此提出I/O感知的融合式KV缓存内核,以减少冗余的数据搬运。该方法还采用由KV缓存驱动的草稿生成与验证策略,由同一个dLLM同时充当草稿模型和验证器,无需额外辅助模型。在数学推理和代码生成基准测试中,Flash-dLLM在推理速度和内存效率方面均优于现有dLLM加速方法。与Elastic-Cache相比,作者报告其在GSM8K和HumanEval上分别实现了5.1倍和11.0倍加速。
行业资讯 应用 AI模型 研究 2026-09-23 10:31:04 471 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。