原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.38177
立即前往原文

Imagine3D-LLM 教会多模态模型在回答前先想象 3D 场景

Imagine3D-LLM 是一种多模态大语言模型,先根据场景的多视角图像构建紧凑的 3D 表示,再利用这一表示生成答案。该方法将可学习的摘要标记解码为 3D Gaussian Splatting 表示,并结合光度重建损失与标准的下一标记预测目标进行训练。研究人员称,该模型在多项空间推理和 3D 理解基准测试中持续优于现有方法。
行业资讯 AI模型 研究 2026-10-01 14:30:53 771 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。