迈向通用科学人工智能:科学图像的多模态理解
科学图表和表格包含重要的实验依据,但数字图书馆和多模态人工智能系统仍难以检索和解读这些内容。ALD/E-ImageMiner基准和ICDAR 2026原子层沉积与蚀刻科学图表信息提取竞赛,收录了来自205篇出版物的1,951幅图表,并由专家完成标注。任务涵盖分类、表格数据提取、摘要生成和视觉问答。相关论文探讨如何评估视觉与定量阅读、基于领域知识的推理,以及利用证据进行论证的能力,并提出将“从图像理解科学概念”作为长期基准目标。未来方向包括扩展科学领域和图表类型、跨文档综合、假设评估、来源追踪、不确定性分析及反事实推理。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。