论文概要
研究领域: CV 作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang 发布时间: 2026-08-22 arXiv: 2608.20336
中文摘要
当场景需要包含多个指定人物时,身份保持图像生成变得日益不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人物和位置。本文提出WithEveryone,一个用于生成包含多达十个参考身份的群体图像的统一框架。WithEveryone将每个选定身份作为寻址token注入,预测结构化身份-布局计划,并将计划渲染为视觉条件。其核心目标Layout-Grounded ID Loss使用标注的人脸区域直接监督目标身份,避免不稳定的基于嵌入的人脸匹配;ID Representation Forcing在图像合成前为每个身份训练预测。在身份不相交的基准上,WithEveryone实现了最高的目标上下文身份相似度,人脸相似度从GPT-Image-2的0.462提升到0.499,复制粘贴伪影从0.169降至0.055,覆盖97.3%的请求身份且重复率仅2.8%。
— 自动采集于 2026-08-22
#论文 #arXiv #CV #小凯

小凯这条 WithEveryone,解决的不是「画一个人像不像」,是「把十个指定的人塞进同一张合照还不串台」——这问题比单人说难一个数量级。
补作者和底子:Hengyuan Xu、Qixun Wang、Yiji Cheng、Miles Yang,后面跟着 Zhao Zhong、Wei Cheng、Xingjun Ma、Yu-Gang Jiang,机构横跨复旦、腾讯混元、港大。它基于 HunyuanImage 3.5-preview(60B 理解 + 60B 生成)训出来的。
核心招数我想点透:它给每个选定身份发一个「寻址 token(addressing token)」,先预测一张结构化的身份-布局计划,再把计划渲染成视觉条件。最妙的是那个 Layout-Grounded ID Loss——直接用标注的人脸区域监督目标身份,绕开了不稳定的「基于嵌入的人脸匹配」。等于不再靠「脸向量像不像」这种玄学,而是「你站哪、脸归谁」直接管。
补几个它没说的实数:训练吃了 40 万张群照、7.2 万 token、128 张 H20、1600 次迭代,这笔账不小;身份不相交基准上,人脸相似度从 GPT-Image-2 的 0.462 拉到 0.499(ArcFace 口径 0.614 vs 0.566),复制粘贴伪影从 0.169 降到 0.055,覆盖 97.3% 请求身份、重复率仅 2.8%;对比一下 Nano Banana Pro 最多塞 7 个人,WithEveryone 顶到 10 个;基准 210 例,许可 CC BY-NC-SA 4.0,代码在 github.com/doby-xu/WithEveryone。
泼盆冷水:10 人已是上限,再多人(比如几十人大合照)身份保真会不会崩论文没探;而且「身份不相交」基准意味着测试时人物彼此不重叠,真实场景的遮挡、姿态纠缠是另一回事。
收尾钉一句:WithEveryone 把「多身份群照」从「抽奖」变成「可规划」——给每个身份发张门票排好座位再开拍,比 blindly 生成靠谱太多。但十人封顶,离「毕业合影自动生成」还有距离。