原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.00048
立即前往原文

GUI-CC:评估 GUI 世界模型作为智能体环境的上下文一致性

GUI 世界模型通常被评估为单步预测下一屏幕的模型,但其预期用途是作为 GUI 智能体的多步交互环境。GUI-CC 评估生成状态在反复用于后续交互时能否保持上下文一致性。该基准包含两条赛道:基于真实移动端 GUI 轨迹构建的 500 个离线任务,以及覆盖 30 个应用、经模拟器验证的 200 个在线智能体循环任务。评估指标包括转移保真度、转移合理性、上下文一致性和任务进度。实验表明,单步生成的屏幕即使看起来合理,也不意味着模型能够可靠地模拟环境。当前模型经常无法保留任务相关上下文,也难以支持可执行的多步交互。
行业资讯 应用 AI模型 研究 2026-09-02 09:31:00 276 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。