A ²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑
把参考图里的物体自然地「搬进」另一张照片,是电商商品合成、虚拟试穿、影视换脸与个性化创作的关键能力。真正落地却要跨过两道门槛:模型往往只擅长某一类物体,且高度依赖像素级精细掩码。
上海交通大学联合上海创智学院团队提出 A²-Edit, 它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。
论文标题:A²-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
论文链接:https://arxiv.org/abs/2603.10685
GitHub 仓库:https://github.com/huayu-zheng/A2Edit
参考图引导编辑的两道固有枷锁
参考图引导图像修复的目标,是把参考图中的主体语义迁移到目标图的指定区域,既保住主体身份,又与周围场景自然融合。该任务可控性强、落地价值高,却在真实使用中仍受到 跨类别统一建模能力不足与精细掩码依赖严重 两方面的制约。
首先, 不同类别对象的编辑目标与表征需求存在显著差异: 服装关注纹理一致,人像强调身份保持与形变合理,车辆、家具和建筑等刚性对象则更依赖几何结构、透视关系与材质属性的准确建模。然而现有方法通常采用单一共享参数路径处理不同类别输入,缺乏面向类别差异的动态建模与专门化机制,导致模型在跨类别场景中的性能下降。
数据侧同样存在局限性, 品类分布高度同质,模型学不到通用表征。
其次,现有方法普遍要求高精度分割掩码来严格框定编辑区域,但真实场景中无论是用户手绘涂抹还是检测框自动生成,均难以获得与目标轮廓严格贴合的精细掩码。当输入掩码不够精确,模型性能通常显著下降,并容易产生边界伪影、内容泄漏、结构异常及背景破坏等问题。
专家路由 + 退火训练,架构层面双管齐下
A²-Edit 跳出「一条通路吃下所有品类」的旧范式,设计混合 Transformer 专家路由架构配合退火训练算法从架构层面解决模型跨类别统一建模能力不足的问题。
混合 Transformer 专家路由,实现品类差异化建模
模型将传统混合专家架构的条件路由机制由仅作用于前馈网络(FFN)扩展至注意力模块(Attention)与前馈网络的联合建模,并在各 Transformer 层中嵌入混合 Transformer 块(MoTB)。门控网络根据输入特征所包含的语义信息与类别属性,自适应计算各专家的路由权重,从而动态选择与当前编辑对象相匹配的参数分支。
路由采用锚点引导策略(AGR):主干专家作为稳定的知识锚点始终保持激活;辅助专家则根据门控网络输出进行动态选择。每层只路由一次,Attention 与 FFN 共享同一组权重。推理时仅激活主干与少量辅助专家;面对分布外输入,门控网络还能按特征相似度组合专家,提升泛化稳定性。
掩码退火训练策略,彻底摆脱精细掩码依赖
MATS 是在训练中逐级放宽掩码精度,引导模型从「依赖严格几何边界」转向「依靠上下文语义推理与内容生成」。
整个训练分为三个阶段:首先使用精细分割掩码学习基础编辑能力;随后通过形态学膨胀和 Perlin 噪声模拟真实用户的手绘误差;最后直接采用目标边界框进行训练,迫使模型依靠上下文推断目标的姿态、尺度和结构。
经过这样的渐进训练,模型面对粗掩码甚至检测框时依然能够生成自然、稳定的编辑结果。
UniEdit-500K:迄今覆盖最广的多品类编辑数据集
为支撑统一框架训练、破解数据同质化,团队自建 UniEdit-500K,共包含 50 万余组参考 — 目标图像对,覆盖服装、人像、动物、植物、配饰、家具、交通工具和建筑八大类别、209 个细分类别,是目前覆盖范围最广的多品类参考图编辑数据集之一。