登录

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图


速读:模型权重、训练代码和完整配方同步开放。 人物、动物、食物与风景等LLaDA-Image生成样例。 更关键的是,为这个6BDiT建立视觉先验时,团队没有把caption作为预训练条件:2.2亿累计生成训练样本中,超过90%采用纯图片监督。
2026年09月07日 20:27

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到  53.53  和  53.38 ,在技术报告列出的开源模型中拿下双榜第一。

Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。

榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。

下面这组图里,哪些是真实照片?

人物、动物、食物与风景等 LLaDA-Image 生成样例。 人物、动物、食物与风景等 LLaDA-Image 生成样例。 答案是: 一张也没有 。

更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件: 2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督 。

从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果:

LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。 LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。 这套模型来自 Inclusion AI,名为  LLaDA-Image 。其核心是一套从零训练的  6B 参数 Diffusion Transformer(DiT) ,一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需  2—4 个采样步 。

真正让这项工作显得不一样的,是它重新回答了一个基础问题: 训练高质量文生图模型,图文对一定要从预训练第一天就上场吗?

LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说, 先学会画,再学会听话 。

这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理 约 2.2 亿个样本 ,最终交出了开篇榜单所示的中英文双榜开源第一成绩。

GitHub:github.com/inclusionAI/LLaDA-Image

模型:https://huggingface.co/collections/inclusionAI/llada-image

魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image

arxiv:https://arxiv.org/pdf/2609.03796

后端和生成都是扩散模型

LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用  LLaDA2.0-mini ,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。

图文对,可能并不是生成训练的 “入场券”

传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。

LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。

在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。

纯图片负责建立视觉世界,图文对负责把语言接入这个世界。

尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。

这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。

完整流程可以概括为六个阶段:

1. 先对理解骨干进行思维链监督微调(CoT SFT);

2. 在 

像素预算下进行纯图像预训练;

3. 在约 

像素预算和多宽高比桶上进行纯图像中期训练;

4. 依次在约 

 像素预算下引入图文对,完成文本对齐与高分辨率迁移;

和 

5. 以文生图(T2I)和图像编辑(I2I)1:1 混合训练,得到统一的 LLaDA-Image;

6. 使用 TwinFlow 蒸馏,得到 2—4 步推理的 LLaDA-Image-Turbo。

这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。

一张图,同时提供 “题目” 和 “答案”

给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。

换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个 从局部视觉线索恢复完整图像的任务 。

条件和目标来自同一块实际训练图像,两者天然对齐;

随机遮挡确保模型需要根据上下文推断完整内容;

恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律;

冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。

由于条件直接从裁剪后的图像提取,团队可以从高分辨率原图中随机截取原生分辨率为

主题:模型|LLaDA-Image|图文对|预训练