原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.09823
立即前往原文

UltraText Bench:全面评估图像生成中视觉文本呈现的双语基准

UltraText Bench 用于评估图像生成模型在英文和中文场景中呈现密集文本的可靠性。该基准包含 432 个提示,涵盖 24 类真实场景和三个难度等级。每个提示为四至十二个文本区域提供精确字符串,以及内容、位置和视觉属性的结构化参考。视觉语言模型 Q-Judger 评估文本保真度、清晰度、空间质量和场景质量。对 24 种模型配置的测试显示各有优劣:Z-Image-Turbo 的清晰度比 Z-Image-Base 高 3.81 分,但保真度低 14.76 分。任务难度增加时,性能也会下降;Qwen-Image-2512 的英文综合得分从 L1 的 86.50 降至 L3 的 42.86。共有 10 名参与者参与自动评分的人工评估。
行业资讯 AI模型 研究 2026-10-08 17:01:07 770 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。