VideoGen-Agent 通过学习工具调用提升视频生成能力
研究人员推出 VideoGen-Agent,这是一种通过多任务智能体强化学习训练、能够协调外部视频生成工具的多模态智能体。该系统在多轮交互中使用增强、生成和验证工具,以应对专业知识、特定身份保持、物理一致性、场景构图和事件顺序等问题。在包含600个提示的全新 VABench 基准测试中,VideoGen-Agent 将基础文本生成视频模型的得分从56.5提升至75.6。升级生成工具后,无需额外训练智能体,得分进一步达到86.1。在人工评测中,升级后的配置在84.3%的比较中优于最强的独立基线模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。