智能体视觉生成:从生成模型到智能体控制
视觉生成正从通过单次调用使用的生成模型,发展为能够进行规划、选择工具、检查中间结果、修正失败并复用既有经验的智能体控制流程。该研究提出了一套分类框架,根据控制器在生成过程中能够直接做出的决策,判断系统的智能体程度。L1是条件控制,控制器只为预定生成器准备输入;L2能够选择并执行生成、编辑或渲染等实际操作;L3会观察中间结果,并调整当前任务中的后续操作;L4则利用已完成任务的经验影响未来决策。L0表示没有部署生成层面决策控制器的固定组件和流程。研究将这一框架应用于图像、视频、编辑、3D、世界、幻灯片和用户界面生成。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。