Imagine3D-LLM 教会多模态模型在回答前先想象 3D 场景
Imagine3D-LLM 是一种多模态大语言模型,先根据场景的多视角图像构建紧凑的 3D 表示,再利用这一表示生成答案。该方法将可学习的摘要标记解码为 3D Gaussian Splatting 表示,并结合光度重建损失与标准的下一标记预测目标进行训练。研究人员称,该模型在多项空间推理和 3D 理解基准测试中持续优于现有方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。