CoinVE-200K:面向组合式指令引导视频编辑的大规模高质量数据集
CoinVE-200K 是一个面向组合式指令引导视频编辑的数据集,旨在让模型在同一段视频中理解并执行多个编辑意图。该数据集包含最高 201 帧的 1080p 视频编辑对,每个样本涵盖 2 至 5 个原子编辑操作,涉及人物、物体和背景,并支持添加、移除、修改和风格化。研究团队还推出了用于评估组合式视频编辑的 CoinVE-Bench,以及基于 Wan2.1-T2V-14B 和 Qwen3-VL-8B-Instruct 构建的 220 亿参数模型 CoinVE-Edit。该模型通过区域感知注意力机制实现多区域精确编辑,同时尽量保留无关内容并维持时间一致性。实验显示,它在指令遵循、组合编辑准确性、视觉质量和时间一致性方面表现较强。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。