vLLM-Omni 与 FastH3 助力 MiniMax H3 迈入实时服务时代
vLLM-Omni、通用 H3 服务架构与 FastH3 组成的优化方案,针对 MiniMax H3 视频生成部署中的端到端延迟进行系统改进。方案涵盖长序列注意力与通信优化、融合 DiT 算子、并行 VAE 解码、紧凑输出传输和并行 MP4 构建等。在 8 卡 B300 测试中,完整响应延迟较 Diffusers 降低 30.8%。FastH3 还将 DiT 前向计算次数从 49 次减少至 4 次。生成 10.125 秒的完整 MP4 视频耗时 8.678 至 8.710 秒,并在多种视频时长下实现响应准备时间短于播放时长。不过,这些性能结果依赖于所测试的硬件和部署配置。
本文来源:AIbase,仅供学习参考,版权归原作者所有。