原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.07064
立即前往原文

SpatialBlock 通过合成积木堆叠任务提升视觉语言模型的空间推理能力

研究团队提出 SpatialBlock-15k,这是一个包含 15,000 个积木堆叠问题的合成数据集,用于训练大型视觉语言模型的基础空间能力。任务涵盖 3D 到 2D 投影、视角变换和结构组合,并利用受控的颜色线索帮助模型在复杂视觉环境中进行推理。实验显示,采用直接回答或基于推理的训练方法都能优于基线模型,并推广到现实世界的空间任务。代码和数据已公开。
行业资讯 AI模型 研究 2026-09-11 11:00:57 545 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。