基准测试称 AI 识别家具组装错误的准确率最高达 80%
Epoch AI 称,该机构使用故意装错的宜家家具照片测试多模态模型,要求模型对照官方说明书找出问题。据报告,GPT-6 Astra 准确率为 80%,Claude Fable 5.1 为 70%。测试共使用 60 张照片,评估模型定位并描述组装错误的能力。结果显示视觉与空间推理有所进步,但尚不能证明模型已能可靠地实时辅助组装;GPT-6 Astra 分析单张照片的中位耗时约为 3 分钟。
本文来源:IT之家,仅供学习参考,版权归原作者所有。