登录

高通技术副总裁:图像生成的可控性到底卡在了哪里?


速读:图像生成因何困在「看起来好」的陷阱里? 1、目前大多数顶尖生成模型输出的图像分辨率都被限制在1K(1024×1024)左右。 系统不再依赖单一巨型模型,而是根据提示词特征,将任务路由给专门处理多样性、文本生成或特定风格的专家模型,通过编排实现最优输出。
2026年09月05日 15:1

在当下的生成式人工智能领域,文本生成图像(T2I)技术已从计算机视觉的前沿研究问题,演变为普通人都能轻松使用的工具,生成结果在视觉上往往「看起来很棒」。但当用户要求精确的身份保留、复杂的空间构图或超高分辨率输出时,现有模型仍频繁暴露出身份混淆、指令忽略与内存爆炸等系统性缺陷。这些缺陷导致从业者无法将模型稳定集成到专业工作流中。无论是需要严格保持角色一致性的影视预演、要求精准布局的广告设计,现有的能力都显得力不从心。

高通技术副总裁 Fatih Porikli 近期接受访谈,讨论了图像生成领域尚未解决的问题,以及他的团队在 CVPR 提出的几种应对这些挑战的方法。Porikli 指出图像生成的下一个前沿是弥合「逼真图像」与「精确结果」之间的差距,让系统变得可控、高效且可靠,从而稳定地生成符合用户真实意图的高质量图像。

目录

01.  图像生成因何困在「看起来好」的陷阱里? 图像生成的可控性、质量与效率各自面临哪些具体技术挑战 ? ...

02 . 强化学习与任务解耦如何提升生成的「可控性」 ? 「Disco」如何通过强化学习解决多人身份混淆问题? ...

03 . 潜空间操作如何突破「质量与效率」的物理极限?

「PixelRush」与「InvertFill」分别在分辨率与编辑质量上突破了哪些物理极限? ...

图像生成因何困在「看起来好」的陷阱里?

1、针对当提示词要求生成多个不同人物时,模型倾向于为所有人物生成高度相似的面部特征、发型甚至表情,Porikli 团队提出了 Disco(Diversity in Image Generation)方案,通过强化学习(RL)对现有基础模型进行微调,将「身份多样性」本身作为优化目标。

① Porikli 团队在论文「Disco」引入组相对策略优化(GRPO),设计了同时鼓励「图内多样性」(同一张图中不同人物面孔不同)和「跨次多样性」(相同提示词多次生成不同面孔)的奖励函数,并严格约束人物数量准确性。[2-1]

② 评测显示,Disco 在「独特面孔准确率」上达到 98%-99%,远超未加显式多样性目标的基座模型。同时,团队还发布了 DiverseHumans 基准测试集,推动社区标准化评估。

2、面对单一模型需要处理多项任务而后导致其顾此失彼问题,Porikli 认为,让人类艺术家作画时,会先规划构图(Architect),再进行细节渲染(Artist),AI 也应如此。Porikli 团队在论文「Ar2Can」中借鉴了人类艺术家的创作经验,提出了将场景规划与细节渲染相互解耦的架构逻辑。[2-2]

3、「Ar2Can」将图片生成过程拆分为两个阶段。首先由「Architect」模块根据提示词预测结构化布局(如输出三个人物的坐标位置),然后由「Artist」模块基于基于该空间计划合成逼真图像。

① 「Architect」模块包含两个变体。「Architect - A」使用监督式 Qwen 模型进行边界框预测。「Architect-B」利用强化学习调优的 Flux-Schnell 模型进行人体姿态的自适应规划,从而输出一组边界框(中心坐标)与可选的姿态骨架

② 「Artist」模块基于「Architect」提供的空间规划合成最终的照片级真实图像。它采用组相对策略优化(GRPO)进行训练,并使用一种组合奖励系统,将空间对齐与身份相似性相结合,以确保准确的面部渲染和身份保持。

③ Architect-A 在 MultiHuman-TestBench 上的人数准确率为 90.2%,WithAnyone 和 GPT-Image-1 分别为 89.8% 和 87.9%。Architect-B 的多身份相似度得分为 68.2%,论文列出的开源对比方法 MH-OmniGen 为 54.5%。

5、基于单一图像生成模型存在的局限,Porikli 认为未来的图像生成将走向「Agentic(智能体化)」管线。系统不再依赖单一巨型模型,而是根据提示词特征,将任务路由给专门处理多样性、文本生成或特定风格的专家模型,通过编排实现最优输出。

强化学习与任务解耦如何提升生成的「可控性」?

1、目前大多数顶尖生成模型输出的图像分辨率都被限制在 1K(1024×1024)左右。若要直接利用扩散模型生成 400 万乃至 1600 万像素的超高分辨率图像,现有的常规方案要么需要在空间几何尺度成倍膨胀的隐空间中持续保留特征,引发严重的显存爆炸,要么需要在云端耗费数分钟乃至十分钟以上的漫长计算 ...

 关注👇🏻 「机器之心PRO会员」,前往「收件箱」查看完整解读

主题:图像生成|质量|强化学习