GUI-CC:评估 GUI 世界模型作为智能体环境的上下文一致性
GUI 世界模型通常被评估为单步预测下一屏幕的模型,但其预期用途是作为 GUI 智能体的多步交互环境。GUI-CC 评估生成状态在反复用于后续交互时能否保持上下文一致性。该基准包含两条赛道:基于真实移动端 GUI 轨迹构建的 500 个离线任务,以及覆盖 30 个应用、经模拟器验证的 200 个在线智能体循环任务。评估指标包括转移保真度、转移合理性、上下文一致性和任务进度。实验表明,单步生成的屏幕即使看起来合理,也不意味着模型能够可靠地模拟环境。当前模型经常无法保留任务相关上下文,也难以支持可执行的多步交互。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。