原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.13287
立即前往原文

LLaDA-UI 将分块扩散引入视觉语言 GUI 智能体

LLaDA-UI 是一个拥有 167 亿参数的 GUI 智能体,将混合专家架构与分块扩散生成相结合。该系统先进行多模态预训练,随后使用移动端、桌面端、网页界面和视觉定位数据进行有监督微调。在多项定位与导航基准测试中,LLaDA-UI 的表现超过 Qwen2.5-VL-7B,并在报告的六项 GUI 基准中的四项超过 Qwen3-VL-8B。研究结果表明,分块扩散可以成为多模态 GUI 智能体的一种实用生成范式。
行业资讯 应用 AI模型 研究 2026-09-15 10:30:56 302 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。