原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.26809
立即前往原文

以镜头为单位思考:通过智能体推理实现一致的多镜头视频编辑

生成式人工智能推动了视频编辑技术的发展,但按照多项指令编辑长视频仍然十分困难。按固定时长切分视频可能导致人物和物体被割裂、产生编辑幻觉,并破坏时间连续性。该研究提出多指令多镜头长视频编辑(MMLVE)任务以及 MMLVE-Bench 数据集。其智能体框架结合大语言模型和视觉语言模型,在镜头级别拆分视频,并更准确地解析编辑指令。研究还提出三项指标,用于评估跨镜头一致性、多指令解耦以及时空结构的保持程度。作者报告的实验显示,MMLVE-Agent 的表现超过了包括 Seedance 2.0 在内的现有闭源先进系统。
行业资讯 应用 研究 2026-08-28 15:31:03 591 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。