Sci-VBench评估科学领域知识与推理密集型视频生成
Sci-VBench是一项用于评估科学视频生成模型的基准测试,重点考察需要知识和推理的任务。该数据集包含1,253个由专家标注的样例,覆盖自然科学、医疗、人文与社会科学、工程四大领域的60个主题。评估不仅关注视觉逼真度,还衡量提示词遵循度、科学正确性和因果正确性。对16个闭源和开源模型的测试显示,各系统的自动感知质量分数较为接近,但在科学推理和因果准确性方面存在显著差异,闭源模型与开源模型之间也出现明显性能差距。研究表明,视觉真实感的提升尚未转化为对科学知识和因果动态的可靠建模能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。