SemComp-Bench:视频生成中的语义任务完成度基准
SemComp-Bench提出了一项面向结果的视频生成评测基准。只有同时实现预期结果,并保持与参考图像相关的任务语义对应,生成结果才算成功。其数据集SemComp-Data覆盖六个领域,包含参考图像、详细和简短指令,以及以结果为中心的视频片段。一个四阶段数据整理流程将原始视频转换为标准化样本。评测使用视觉语言模型回答结构化二元问题,并分别报告结果达成度和生成可靠性分数。对多种代表性视频生成模型的实验表明,现有模型在完成预期任务的同时保持参考图像中的相关语义,仍然面临较大挑战。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。