CPI-Bench:面向真实世界图像编辑的综合实用基准
CPI-Bench是一项用于评估AI图像编辑模型的新基准,重点测试模型在真实应用场景中的表现。它包含三个子集:覆盖多种编辑任务并首次纳入多图像编辑评估的CPI-General-Bench,聚焦高频用户场景的CPI-Practical-Bench,以及评估高难度推理式编辑能力的CPI-Intelligent-Bench。对主流图像编辑模型的评估表明,该基准能够更有效地区分模型在通用编辑、实际部署和高级推理方面的能力差异。研究团队还指出,CPI-Bench的模型排名与Arena Image Edit Leaderboard高度一致,表明其结果可能较好地反映人类评估者的偏好和感知判断。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。