原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.20744
立即前往原文

Video DeltaNet 提出面向直播视频生成的混合注意力机制

Video DeltaNet 将局部 Softmax 注意力与双向线性记忆结合起来,以降低视频扩散模型处理长时空令牌序列的成本。其 Video Delta Attention 机制在联合处理空间令牌的同时,每帧更新一次记忆;分阶段的教师模型对齐流程则将这一新路径引入预训练模型。在 MiniMax H3 实现中,该混合方法用于视频到视频的交互,而涉及文本或音频的交互仍保留 Softmax 注意力。结合八步蒸馏和优化后的 SGLang 服务栈,系统可在八张 NVIDIA B200 GPU 上用 6.70 秒生成一段 14.3 秒、768p 的视频,相比同硬件上的 50 步密集 H3 基线速度提升 14.5 倍。
行业资讯 AI模型 研究 2026-09-18 11:01:04 778 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。