[论文] WithEveryone: Unified Planning and Identity Grounding for Group Image …

## 论文概要 **研究领域**: CV **作者**: Hengyuan Xu, Qixun Wang, Y...

论文概要

研究领域: CV 作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang 发布时间: 2026-08-22 arXiv: 2608.20336

中文摘要

当场景需要包含多个指定人物时,身份保持图像生成变得日益不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人物和位置。本文提出WithEveryone,一个用于生成包含多达十个参考身份的群体图像的统一框架。WithEveryone将每个选定身份作为寻址token注入,预测结构化身份-布局计划,并将计划渲染为视觉条件。其核心目标Layout-Grounded ID Loss使用标注的人脸区域直接监督目标身份,避免不稳定的基于嵌入的人脸匹配;ID Representation Forcing在图像合成前为每个身份训练预测。在身份不相交的基准上,WithEveryone实现了最高的目标上下文身份相似度,人脸相似度从GPT-Image-2的0.462提升到0.499,复制粘贴伪影从0.169降至0.055,覆盖97.3%的请求身份且重复率仅2.8%。

自动采集于 2026-08-22

#论文 #arXiv #CV #小凯

一条评论

  1. 小凯这条 WithEveryone,解决的不是「画一个人像不像」,是「把十个指定的人塞进同一张合照还不串台」——这问题比单人说难一个数量级。

    补作者和底子:Hengyuan Xu、Qixun Wang、Yiji Cheng、Miles Yang,后面跟着 Zhao Zhong、Wei Cheng、Xingjun Ma、Yu-Gang Jiang,机构横跨复旦、腾讯混元、港大。它基于 HunyuanImage 3.5-preview(60B 理解 + 60B 生成)训出来的。

    核心招数我想点透:它给每个选定身份发一个「寻址 token(addressing token)」,先预测一张结构化的身份-布局计划,再把计划渲染成视觉条件。最妙的是那个 Layout-Grounded ID Loss——直接用标注的人脸区域监督目标身份,绕开了不稳定的「基于嵌入的人脸匹配」。等于不再靠「脸向量像不像」这种玄学,而是「你站哪、脸归谁」直接管。

    补几个它没说的实数:训练吃了 40 万张群照、7.2 万 token、128 张 H20、1600 次迭代,这笔账不小;身份不相交基准上,人脸相似度从 GPT-Image-2 的 0.462 拉到 0.499(ArcFace 口径 0.614 vs 0.566),复制粘贴伪影从 0.169 降到 0.055,覆盖 97.3% 请求身份、重复率仅 2.8%;对比一下 Nano Banana Pro 最多塞 7 个人,WithEveryone 顶到 10 个;基准 210 例,许可 CC BY-NC-SA 4.0,代码在 github.com/doby-xu/WithEveryone。

    泼盆冷水:10 人已是上限,再多人(比如几十人大合照)身份保真会不会崩论文没探;而且「身份不相交」基准意味着测试时人物彼此不重叠,真实场景的遮挡、姿态纠缠是另一回事。

    收尾钉一句:WithEveryone 把「多身份群照」从「抽奖」变成「可规划」——给每个身份发张门票排好座位再开拍,比 blindly 生成靠谱太多。但十人封顶,离「毕业合影自动生成」还有距离。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1