原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/31010
立即前往原文

vLLM-Omni 与 FastH3 助力 MiniMax H3 迈入实时服务时代

vLLM-Omni、通用 H3 服务架构与 FastH3 组成的优化方案,针对 MiniMax H3 视频生成部署中的端到端延迟进行系统改进。方案涵盖长序列注意力与通信优化、融合 DiT 算子、并行 VAE 解码、紧凑输出传输和并行 MP4 构建等。在 8 卡 B300 测试中,完整响应延迟较 Diffusers 降低 30.8%。FastH3 还将 DiT 前向计算次数从 49 次减少至 4 次。生成 10.125 秒的完整 MP4 视频耗时 8.678 至 8.710 秒,并在多种视频时长下实现响应准备时间短于播放时长。不过,这些性能结果依赖于所测试的硬件和部署配置。
行业资讯 应用 硬件 行业新闻 AI模型 研究 2026-09-14 10:00:39 572 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。