原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.29387
立即前往原文

EvoGenUI-Bench评估大语言模型作为多轮生成式UI助手的能力

EvoGenUI-Bench是一项评估大语言模型能否在用户需求持续变化时维护可执行网页界面的基准测试。该测试包含150个五轮任务,共750轮,覆盖信息展示、可执行交互和工具支撑的外部状态三类场景。生成的界面会在浏览器中运行,并通过截图、源代码与DOM证据、操作轨迹及运行日志进行评估。在测试的8个模型中,表现最好的模型单轮通过率为74.9%,但完整完成五轮任务的比例仅为37.3%。在工具支撑任务中,相邻轮次通过保持率进一步降至52.4%。诊断结果显示,失败原因包括信息架构、派生状态传递、交互控件绑定、外部状态对齐以及需求分解。这项研究表明,生成式UI评估不应只关注单次输出,还应检验界面行为、派生状态、外部状态和助手陈述能否在界面持续演化时保持同步。
行业资讯 应用 AI模型 研究 2026-09-01 18:30:57 895 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。