SpatialSpeak:结合局部与全局上下文的问答原生重建,用于空间链式思维推理
SpatialSpeak是一种用于提升视觉语言模型空间推理能力的两阶段框架。第一阶段通过问答任务,让模型从多视角输入中学习重建细粒度局部三维几何和全局场景上下文。第二阶段引入空间链式思维训练,并结合可靠性评估与视觉补偿来修正答案。在ReVSI上,重建预训练使CoT方法的提升幅度从2.6分增加到6.9分。作者报告称,该方法在ReVSI、VSI-Bench和SPAR-Bench上取得当时最佳结果;其ReVSI得分为62.8,比对比实验中的最强基线高8.7分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。