原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.20336
立即前往原文

WithEveryone:面向群体图像生成的统一规划与身份定位

WithEveryone 是一个用于生成包含最多 10 个指定人物身份的群体图像框架。该方法为每个身份注入带地址的标记,预测结构化的身份与布局规划,并将其作为视觉条件。其布局定位身份损失直接利用标注的人脸区域进行监督,避免依赖不稳定的基于嵌入的人脸匹配。在身份与训练数据不重叠的基准测试中,WithEveryone 的目标场景人脸相似度达到 0.499,高于 GPT-Image-2 的 0.462。同时,复制粘贴伪影从 0.169 降至 0.055,指定身份覆盖率达到 97.3%,重复率仅为 2.8%。结果表明,明确的身份与布局对齐有助于提升大规模群体场景中的身份保持能力。
行业资讯 AI模型 研究 2026-08-21 10:30:53 457 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。