Principia:视频模型的关系物理测试
评估视频模型的物理推理能力很困难,因为绝对运动测量依赖帧率、物体尺度和摄像机标定,而生成视频通常缺少这些信息。Principia提出了一种不依赖标定的方法:如果同一场景中的两个物体遵循相同的物理定律,它们的运动就应满足可预测的关系。该基准涵盖重力、恢复、摩擦、转动惯量、抛体运动、动量、摆和质量—弹簧振荡等八种现象,并使用在受控条件下拍摄的真实场景。在六个先进视频生成模型产生的数千个样本中,没有任何模型在Principia上超过0.42分,尽管它们在VBench上的得分约为0.8。视觉语言模型检测物理关系违例的能力也较弱,最佳模型准确率仅为67%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。