登录

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM


速读:首先,该论文研究了视觉理解任务和生成任务在不同架构下会如何影响彼此学习到的视觉表示。 也就是说:视觉生成任务可以帮助理解任务学习到更好的视觉表征。 联合训练后,模型的视觉理解能力有所提升,但图像生成性能却出现下降。 视觉理解任务能够帮助生成任务的表征与文本表征更好地对齐。
2026年09月14日 09:24

理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。

但这里其实存在一个更基础的问题:

当视觉理解和生成被放进同一个模型之后,它们真的会互相帮助吗?

现有工作对此并没有给出一致答案。一方面,理解和生成可能共享视觉知识,从而形成正向迁移;另一方面,两种目标也可能竞争模型容量、产生表示冲突,最终只是功能上统一,却没有真正形成学习上的协同。

MMLab@南洋理工大学的最新论文《Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System》,尝试在一个受控的原生多模场景下回答这一问题。

论文链接:https://arxiv.org/abs/2609.01607

为了避免引入额外的视觉表征先验,该研究选择在原生多模架构(pixel in, pixel out)下将视觉理解与生成之间的关系拆成三个层次: Representation → Task → System 。

表征层面:

理解和生成都会帮助对方

但简单共享反而可能产生冲突

首先,该论文研究了视觉理解任务和生成任务在不同架构下会如何影响彼此学习到的视觉表示。

实验发现了一个有意思的双向关系。

在 Dense Sharing 架构中,文本、用于理解的 clean visual tokens 和用于生成的 noised visual tokens 都经过同一套 LLM 参数。联合训练后,模型的视觉理解能力有所提升,但图像生成性能却出现下降。

进一步的 frozen feature probing 表明,加入生成训练后,用于视觉理解的 feature 在 ImageNet classification、ADE20K segmentation 和 NYUv2 depth estimation 等任务上表现更好。

也就是说: 视觉生成任务可以帮助理解任务学习到更好的视觉表征 。

而当作者采用 modality-decoupled MoT,将视觉 token 放入单独的 visual branch 后,结果却恰好反过来:生成能力提升,理解能力下降。

进一步测量 text features 与 generative visual features 之间的 CKA 后发现,加入理解训练会显著增强二者的对齐关系:

视觉理解任务能够帮助生成任务的表征与文本表征更好地对齐 。 

这说明,在表征层面理解和生成其实都能够给对方提供有价值的 learning signal。而问题在于: 如果强迫两种目标使用同一套计算路径,其中一个目标很容易占据主导地位,另一个则退化成辅助监督 。

因此,论文进一步提出  Task-decoupled MoT :理解视觉 token 继续进入 language-anchored branch,而生成视觉 token 使用 generation-specialized branch;与此同时,两条路径仍然通过文本语义和 shared attention 保持联系。

这种「部分 specialize、部分 share」的设计,避免了前两种架构中一边提升、一边退化的问题。

任务层面:

知识互通的理解与生成任务可以实现相互促进

解决 representation conflict 后,论文进一步提出一个更实际的问题:

什么样的理解任务和生成任务放在一起训练会相互促进?

决定二者能否相互促进的,是它们是否依赖相同的 underlying knowledge 或 capability。

论文分别选择了三个 case study:几何推理、SVG 和 3D Spatial Intelligence 来验证。

例如,在几何推理场景中,理解几何题需要识别图形中的实体、关系和约束,而生成或编辑几何图,同样需要模型掌握这些结构知识。

主题:理解|生成|视觉理解|生成任务|理解任务|视觉表征|视觉理解任务