原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.19969
立即前往原文

DeepSeek-V4.1-Flash:突破 KV 缓存压缩极限

DeepSeek 发布了 DeepSeek-V4.1-Flash,这是一款拥有 5520 亿骨干参数、支持最长 100 万 token 上下文的多模态混合专家模型。其因果编码器—解码器架构在解码阶段每个 token 激活 160 亿参数,在预填充阶段仅激活 80 亿参数。通过跨层 KV 缓存复用、FP4 KV 缓存和 SWA Bounded Replay 部署优化,该模型将 HBM 中的 KV 缓存占用降至每个 token 890 字节,并将持久化 KV 缓存占用降至前代模型的约八分之一。模型使用 45 万亿个多模态 token 进行预训练,面向文本和多模态智能体任务。模型检查点已在 Hugging Face 上提供。
行业资讯 行业新闻 AI模型 研究 开源 2026-09-18 11:01:05 464 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。