H3-World:将语言理解转化为交互式世界控制
H3-World是一种高效框架,可将拥有330亿参数的MiniMax-H3视频生成模型转化为交互式世界模型。该系统无需引入专用动作模块,即可通过自然语言指令更精确地控制角色行为和摄像机运动,并实现时间层面的控制。系统将每个动作表示为角色指令与摄像机指令的结构化组合,并与对应时间段的视频潜在表示对齐。时间注意力路由会将每条指令限制在指定时间区间内,从而减少不同动作之间的控制干扰。使用8,000个游戏样本、10,000步LoRA优化以及仅0.199%的可训练参数,H3-World在保持较高生成质量的同时实现了有效控制,并能泛化到未见过的场景。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。