以镜头为单位思考:通过智能体推理实现一致的多镜头视频编辑
生成式人工智能推动了视频编辑技术的发展,但按照多项指令编辑长视频仍然十分困难。按固定时长切分视频可能导致人物和物体被割裂、产生编辑幻觉,并破坏时间连续性。该研究提出多指令多镜头长视频编辑(MMLVE)任务以及 MMLVE-Bench 数据集。其智能体框架结合大语言模型和视觉语言模型,在镜头级别拆分视频,并更准确地解析编辑指令。研究还提出三项指标,用于评估跨镜头一致性、多指令解耦以及时空结构的保持程度。作者报告的实验显示,MMLVE-Agent 的表现超过了包括 Seedance 2.0 在内的现有闭源先进系统。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。