WanPE:面向现代文本生成视频的电影化提示词增强
论文介绍了 WanPE,这是一个拥有 3970 亿参数、使用 105 万个真实视频训练的提示词增强模型。它按镜头制定电影化规划,并力求在多个镜头和时间推进过程中保留用户要求。研究团队还构建了 WanPEval 评测集,由人工标注,并包含约 1.1 万次盲测成对比较。与 Wan3.0 搭配时,相比未经修改的用户提示词,WanPE 在 5 至 15 秒视频中的人类偏好度提高了 10.66 至 18.84 个百分点,在 30 秒视频中提高了 50.86 个百分点。它在 5 至 15 秒时长范围内优于受评测的商业方案,在 30 秒时长下则与 Seedance 2.5 竞争力相当。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。