SceneMosaic:通过混合式智能体布局演化高效生成多样化可仿真场景
SceneMosaic是一种高效生成多样化、可用于仿真的室内场景框架,面向互动娱乐和具身智能。该方法先利用从图像中学习的参数化先验生成初始场景,再通过视觉语言模型智能体进行演化和细化。系统将场景拆分为相互独立的局部单元,分别进行优化后再组合成完整场景,从而兼顾生成效率和物理合理性。在SceneEval-100基准测试中,SceneMosaic的语义布局质量与最强的智能体基线相当,但速度提升了24倍,同时显著减少物理违规,并获得最高的人类评价。研究团队已公开源代码。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。