HappyWorld-Bench评估世界模型的可靠性
HappyWorld-Bench是一套用于评估世界模型的综合基准。它不仅衡量生成世界的视觉质量,还测试模型在探索、交互和修改过程中的一致性与响应能力。该框架围绕六项能力,覆盖视频、空间和具身世界模型三个评测方向。研究评估了14个视频模型、9个空间系统和8个具身模型候选,并结合自动化行为指标、人工A/B比较和Elo评分。结果显示,三类模型都存在明显的可靠性缺口:视频模型在长时间生成和重新访问时一致性下降;空间模型的最高摆放准确率为70.14%,编辑执行准确率为73.33%;具身模型则难以在多步操作中保持状态,也难以准确应对变化后的行动条件和物理规则。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。