AutoGUIWorld:将图像生成器用作 GUI 智能体的视觉世界模型
AutoGUIWorld 是一个 GUI 智能体训练数据生成框架,无需运行相应的软件环境即可合成交互轨迹。规划器负责指定操作及其预期视觉效果,图像生成器则逐步编辑屏幕截图,生成后续观察画面。该框架为 Ubuntu、Windows、macOS 和 Chrome 生成了 79,266 个带空间标注的训练步骤。使用这些轨迹微调 Qwen3.5-35B-A3B 后,其 OSWorld 平均任务得分从 33.0% 提升至 40.8%,ScienceBoard 成功率从 14.0% 提升至 32.2%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。