Paint What You See:评测多模态智能体的精细视觉工具使用能力
EASEL 是一项用于评估多模态智能体在闭环环境中精确使用视觉工具能力的新基准。核心任务要求智能体逐步在数字画布上作画,使结果匹配参考图像,同时测试区域标注、手写和路径规划。EASEL-Data 包含 44 万条训练样本。基于该数据训练的 EASEL-9B 相比基础模型取得 6.3% 的相对提升,在 25 个受测模型中排名第三。不过,结果表明当前多模态智能体仍存在明显不足:图像重建相似度较低,动作轨迹也十分不稳定,模型通常很早就达到瓶颈,或在达到峰值后出现性能下降。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。