SimuVerity:面向工程级 Simulink 模型生成智能体的基准测试
SimuVerity 评估人工智能智能体能否生成满足工程要求的 Simulink 模型,而不仅是能够编译或与参考模型相似。该基准涵盖十个工程领域的 101 项文本到可执行模型任务,先检查成果交付、原生可执行性和工程合格性,再从准确性、输出质量、机制与因果完整性、运行域鲁棒性及动态响应等维度评分。在对六个智能体系统的评估中,最佳系统的总分仅为 42.86。结果表明,结构相似度并不能有效代表工程性能,部分高分模型仍存在严重的视觉布局混乱问题。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。