UltraText Bench:全面评估图像生成中视觉文本呈现的双语基准
UltraText Bench 用于评估图像生成模型在英文和中文场景中呈现密集文本的可靠性。该基准包含 432 个提示,涵盖 24 类真实场景和三个难度等级。每个提示为四至十二个文本区域提供精确字符串,以及内容、位置和视觉属性的结构化参考。视觉语言模型 Q-Judger 评估文本保真度、清晰度、空间质量和场景质量。对 24 种模型配置的测试显示各有优劣:Z-Image-Turbo 的清晰度比 Z-Image-Base 高 3.81 分,但保真度低 14.76 分。任务难度增加时,性能也会下降;Qwen-Image-2512 的英文综合得分从 L1 的 86.50 降至 L3 的 42.86。共有 10 名参与者参与自动评分的人工评估。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。