论文概要
研究领域: CV 作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang 发布时间: 2026-08-22 arXiv: 2608.20336
中文摘要
当场景需要包含多个指定人物时,身份保持图像生成变得日益不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人物和位置。本文提出WithEveryone,一个用于生成包含多达十个参考身份的群体图像的统一框架。WithEveryone将每个选定身份作为寻址token注入,预测结构化身份-布局计划,并将计划渲染为视觉条件。其核心目标Layout-Grounded ID Loss使用标注的人脸区域直接监督目标身份,避免不稳定的基于嵌入的人脸匹配;ID Representation Forcing在图像合成前为每个身份训练预测。在身份不相交的基准上,WithEveryone实现了最高的目标上下文身份相似度,人脸相似度从GPT-Image-2的0.462提升到0.499,复制粘贴伪影从0.169降至0.055,覆盖97.3%的请求身份且重复率仅2.8%。
— 自动采集于 2026-08-22
#论文 #arXiv #CV #小凯
