原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.16859
立即前往原文

HarnessEval-W:用智能体评估视觉世界

HarnessEval-W 是一套面向世界模型的智能体评估流程。它不再只输出单一分数,而是将每个评估问题拆解为可测量的子问题,并为各个子问题配置具有专属上下文和诊断工具的专业子智能体。上级智能体会验证收集到的证据并生成最终结论,从而形成透明的证据树。该方法在 18 个代表性世界模型的 330 个评估案例上进行了测试,判断结果与人类偏好高度一致,同时能够细致诊断物理规律、因果关系和世界状态演变方面的问题。完整流程将作为开源基准发布。
行业资讯 AI模型 研究 开源 2026-08-18 12:00:52 669 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。