SpatialBlock 通过合成积木堆叠任务提升视觉语言模型的空间推理能力
研究团队提出 SpatialBlock-15k,这是一个包含 15,000 个积木堆叠问题的合成数据集,用于训练大型视觉语言模型的基础空间能力。任务涵盖 3D 到 2D 投影、视角变换和结构组合,并利用受控的颜色线索帮助模型在复杂视觉环境中进行推理。实验显示,采用直接回答或基于推理的训练方法都能优于基线模型,并推广到现实世界的空间任务。代码和数据已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。