全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图
先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。
先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到 53.53 和 53.38 ,在技术报告列出的开源模型中拿下双榜第一。
Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。
榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。
下面这组图里,哪些是真实照片?
人物、动物、食物与风景等 LLaDA-Image 生成样例。 答案是: 一张也没有 。
更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件: 2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督 。
从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果:
LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。 这套模型来自 Inclusion AI,名为 LLaDA-Image 。其核心是一套从零训练的 6B 参数 Diffusion Transformer(DiT) ,一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需 2—4 个采样步 。
真正让这项工作显得不一样的,是它重新回答了一个基础问题: 训练高质量文生图模型,图文对一定要从预训练第一天就上场吗?
LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说, 先学会画,再学会听话 。
这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理 约 2.2 亿个样本 ,最终交出了开篇榜单所示的中英文双榜开源第一成绩。
GitHub:github.com/inclusionAI/LLaDA-Image
模型:https://huggingface.co/collections/inclusionAI/llada-image
魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image
arxiv:https://arxiv.org/pdf/2609.03796
后端和生成都是扩散模型
LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用 LLaDA2.0-mini ,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。
图文对,可能并不是生成训练的 “入场券”
传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。
LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。
在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。
纯图片负责建立视觉世界,图文对负责把语言接入这个世界。
尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。
这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。
完整流程可以概括为六个阶段:
1. 先对理解骨干进行思维链监督微调(CoT SFT);
2. 在
像素预算下进行纯图像预训练;
3. 在约
像素预算和多宽高比桶上进行纯图像中期训练;
4. 依次在约
像素预算下引入图文对,完成文本对齐与高分辨率迁移;
和
5. 以文生图(T2I)和图像编辑(I2I)1:1 混合训练,得到统一的 LLaDA-Image;
6. 使用 TwinFlow 蒸馏,得到 2—4 步推理的 LLaDA-Image-Turbo。
这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。
一张图,同时提供 “题目” 和 “答案”
给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。
换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个 从局部视觉线索恢复完整图像的任务 。
条件和目标来自同一块实际训练图像,两者天然对齐;
随机遮挡确保模型需要根据上下文推断完整内容;
恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律;
冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。
由于条件直接从裁剪后的图像提取,团队可以从高分辨率原图中随机截取原生分辨率为
主题:模型|LLaDA-Image|图文对|预训练