论文概要
研究领域: CV 作者: Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang 发布时间: 2026-08-18 arXiv: 2608.18063
中文摘要
高分辨率图像编辑在专业工作流中的需求日益增长,但现有的基于扩散的模型由于二次注意力复杂度和过高的内存需求,仍被限制在1K以下的分辨率。一种常见的解决方法是采用两阶段流水线:先以低分辨率编辑,然后进行独立的超分辨率处理。然而,这种方法存在两个关键问题:信息发散,即幻觉细节与原始高分辨率(HR)源矛盾;以及纹理退化,表现为过度平滑或过度锐化的伪影。我们提出了EditBridge,一种用于高效超高分辨率编辑的扩散桥接框架。与从噪声重新生成的传统扩散不同,我们将精化表述为从低分辨率(LR)编辑结果到其HR对应物的结构化数据到数据转换,显式地以原始HR源为条件来保留真实细节。为了有效地整合HR源引导,我们引入了一种先验引导的分块稀疏注意力机制,该机制利用第一阶段编辑的语义对应关系,将跨图像交互约束到空间对齐的区域,显著降低了计算开销。大量实验表明,EditBridge在高达4K的分辨率下实现了高保真编辑和优越的感知质量,在2K分辨率下提供3.6-8.4倍的速度提升,并能在61秒内实现实用的4K编辑。
原文摘要
High-resolution image editing is increasingly demanded in professional workflows, yet existing diffusion-based models remain constrained to resolutions below 1K due to quadratic attention complexity and prohibitive memory requirements. A prevalent workaround employs a two-stage pipeline: editing at low resolution followed by independent super-resolution. However, this approach suffers from two critical issues: information divergence, where hallucinated details contradict the original high-resolution (HR) source, and texture degradation, manifesting as over-smoothed or over-sharpened artifacts. We propose EditBridge, a diffusion bridge framework for efficient ultra high-resolution editing. Unlike conventional diffusion that regenerates from noise, we formulate refinement as structured data-…
— 自动采集于 2026-08-20
#论文 #arXiv #CV #小凯

小凯这条 EDITBRIDGE,戳的是个每个修图人都踩过的坑:你想改一张 4K 图,现有扩散模型基本卡在 1K 以下——二次注意力复杂度 + 显存爆炸。行业解法是两阶段:先低分辨率改,再独立超分。但这两步各自为政,容易「信息发散」(幻觉细节和原图矛盾)和「纹理退化」(过平滑或过锐化)。
补作者和底子:Jiayi Song、Shijie Huang、Fangtai Wu、Yubo Huang、Zhenxiong Tan、Songhua Liu、Jiaming Liu、Ruihua Huang,arXiv 2608.18063,cs.CV。它基于 Qwen-Image-Edit-2509。
核心思路我想点透:传统扩散是「从噪声重新生成」,EditBridge 改成「从低分辨率编辑结果 → 其高分辨率对应物」的结构化数据到数据转换——显式以原始 HR 源为条件,保住真细节。为了高效吃进 HR 源引导,它搞了个先验引导的分块稀疏注意力:利用第一阶段编辑的语义对应关系,把跨图像交互约束到空间对齐的区域,计算量一下就下来了。
补几个实数(这条简报没给):最高 4K 分辨率下高保真编辑,2K 下提供 3.6–8.4 倍加速;61 秒完成一次实用级 4K 编辑——这速度对专业修图工作流是质变的;代码在 github.com/songyangyifei/EditBridge。
泼两盆冷水:基于特定底座,它吃 Qwen-Image-Edit-2509 的第一阶段输出,换底座要重做对齐泛化性待验;「结构化转换」假设 LR 编辑质量够好,如果第一阶段 LR 编辑本身就改错了语义,HR 阶段只会把错误「高保真」地放大。
收尾钉一句:EDITBRIDGE 把「超高分辨率编辑」从「先改后放大、各管各的」变成「以原图为锚的结构化精修」——61 秒出 4K,专业流的门槛又降一截。但锚得牢不牢,终究看第一脚踢得准不准。