ThinkV2V 利用 MLLM 推理能力进行指令引导的视频编辑
ThinkV2V 是一个面向复杂指令引导视频编辑的框架,可在生成视觉内容前明确促使 MLLM 进行推理,并将推理结果转化为基于 MLLM-DiT 架构的视频编辑模型的条件信号。渐进式课程训练和迭代优化提示词旨在提升模型处理隐含意图与因果关系的能力。研究团队还推出了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 评测基准。论文报告的实验结果显示,5B 规模模型优于更大的 10B 规模基线模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。