网易首页 > 网易号 > 正文 申请入驻

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

0
分享至

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。



先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到,在技术报告列出的开源模型中拿下双榜第一。



Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。

榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。

下面这组图里,哪些是真实照片?



人物、动物、食物与风景等 LLaDA-Image 生成样例。

答案是:一张也没有

更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件:2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督

从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果:



LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。

这套模型来自 Inclusion AI,名为LLaDA-Image。其核心是一套从零训练的6B 参数 Diffusion Transformer(DiT),一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需2—4 个采样步

真正让这项工作显得不一样的,是它重新回答了一个基础问题:训练高质量文生图模型,图文对一定要从预训练第一天就上场吗?

LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说,先学会画,再学会听话

这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理约 2.2 亿个样本,最终交出了开篇榜单所示的中英文双榜开源第一成绩。

  • GitHub:github.com/inclusionAI/LLaDA-Image
  • 模型:https://huggingface.co/collections/inclusionAI/llada-image
  • 魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image
  • arxiv:https://arxiv.org/pdf/2609.03796

后端和生成都是扩散模型

LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用LLaDA2.0-mini,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。

图文对,可能并不是生成训练的 “入场券”

传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。

LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。

在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。

纯图片负责建立视觉世界,图文对负责把语言接入这个世界。

尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。

这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。

完整流程可以概括为六个阶段:



这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。

一张图,同时提供 “题目” 和 “答案”

给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。

换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个从局部视觉线索恢复完整图像的任务

  • 条件和目标来自同一块实际训练图像,两者天然对齐;
  • 随机遮挡确保模型需要根据上下文推断完整内容;
  • 恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律;
  • 冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。





技术报告给出的 SFT 加权数据分布估计。训练内容覆盖自然、设计、人物与少量合成数据;图像预训练和中期训练只使用真实图像。

这条 “视觉优先” 的路线让真实图像的优势随着训练推进逐步显现。报告称,以真实图像为主的配方能够持续提升生成真实感,并展现出更高的长期能力上限。SFT 阶段因此一直让真实图像占绝对多数,同时在后期定向增加文字密集图像与人像数据。

从统计口径看,报告所说的 2.2 亿样本是图像生成管线各阶段的累计样本处理量;理解骨干的 CoT SFT 采用独立口径统计。

一个模型,怎样同时负责生成和编辑?

LLaDA-Image 的模型主体可以分为三部分:负责理解条件的 dLLM 视觉语言模型、连接理解与生成空间的轻量接口,以及真正生成图像的单流 DiT。



LLaDA-Image 架构。文本经 RQA、LLaDA2.0-mini 和 Connector 进入单流 DiT;编辑任务额外接收参考图像的语义特征和干净 VAE 潜变量。

先理解,再交给 DiT 生成

理解模块建立在 LLaDA2.0-mini 扩散语言模型之上。它不只是把提示词变成一组静态文本嵌入,而是作为统一的多模态语义接口,处理文本、训练时的视觉条件和结构化推理信息。

语言模型与图像生成器分别面向语义理解和视觉去噪,二者需要一套专门接口完成表示转换。为此,团队在中间加入了两层桥梁:

  • RQA在理解模型前放入一组可学习查询,通过交叉注意力从输入中提取与生成最相关的信息;
  • Transformer Connector再把理解模型的隐藏状态投影到 DiT 所需的条件空间。

视觉生成部分则是一套纯单流 DiT。文本条件 token、时间信息和图像 token 进入同一组 Transformer 模块,在每一层直接交互,最终预测 Flow Matching(流匹配)速度场。

编辑时,参考图像不经过语言模型

生成和编辑共享同一个理解接口与 DiT 主干,但参考图片走的是一条独立通道。

编辑指令仍由 RQA—dLLM—Connector 路径处理;参考图则完全绕过语言模型,同时提供两类互补信息:

  • SigLIP-VQ 特征提供高层语义信息,帮助模型识别参考图里 “是什么”;
  • 干净的 FLUX2-VAE 潜变量直接提供像素级证据,帮助保留原有身份、结构、纹理与背景。

这两类信号形成了互补:高层语义帮助模型理解编辑对象与指令,像素条件则强化身份、结构和纹理的一致性。两种参考信号一起进入同一个 DiT,使一套权重可以同时承担开放式生成与参考保持编辑。

编辑训练阶段,团队以 1:1 混合 T2I 与 I2I 数据。文生图样本在这里相当于 “能力回放”,持续巩固模型的开放生成、画质和文本对齐能力,让生成与编辑在共享主干上协同演进。

下面是报告中的四组编辑示例:



LLaDA-Image 指令图像编辑示例。

训练稳定性:为什么要拿掉 Norm 里的可学习参数?

对于一个需要长程训练的 6B 参数 DiT,稳定的网络 scaling 和 gradient norm 是整套工程得以持续扩展的基础。

团队在长程训练监控中发现,LayerNorm 或常规 RMSNorm 里的可学习参数会持续改变特征尺度;这种变化在深层网络和长训练周期中累积后,可能表现为 scaling 波动,并在后期带来gradient norm(梯度范数)快速上升

基于这一发现,LLaDA-Image 将归一化层设为无仿射参数形式,在整套 DiT 中统一使用无可学习参数的 RMSNorm。这个改动看起来很小,却直接针对长程训练中逐步累积的尺度漂移:它按照均方根对特征做归一化,并以固定形式维持尺度一致性。

优化器方面,团队在所有生成训练阶段都采用Muon,将其定位为训练系统中的工程选择;归一化层的无参数设计则直接负责改善 scaling 与后期 gradient norm 的稳定性。



临近收敛时,团队合并相邻训练状态的权重,以平滑不同 mini-batch 数据构成带来的指标波动。这些渐进训练、时间步采样和 checkpoint 处理共同组成了完整工程流程;其中,无可学习参数的 RMSNorm专门改善长程训练中的 scaling 与 gradient norm 稳定性。

从 50 步到 2—4 步:同一个 DiT 的 “正负两班制”

基础版 LLaDA-Image 追求完整的多步生成能力,技术报告把它列为 50 步采样。部署时,团队再用 TwinFlow 将它蒸馏为 LLaDA-Image-Turbo,把推理压缩到 2—4 步。

TwinFlow 建立在分布匹配蒸馏(DMD)之上。传统 DMD 训练通常同时需要:

  • 一个冻结的真实分布 score 模型;
  • 一个在线跟踪学生分布的 fake-score 模型;
  • 一个真正要部署的生成器。

传统 DMD 为生成器和在线 fake-score 估计器分别维护相应角色;TwinFlow 则进一步思考,能否用一套共享主干完成这两项工作。

TwinFlow 最巧妙的地方,可以概括成同一个 DiT 的 “正负两班制”:正时间负责生成,负时间负责跟踪学生分布。 具体来说, +t表示生成器更新,-t表示 fake-score 更新;两者共享主干、使用两个输出头,训练时以 1:2 的比例交替更新生成器与 fake-score 分支。

到了推理阶段,系统只保留生成头,fake-score 输出头完成训练使命后退出,部署开销与单生成头保持一致。

在 Qwen-Image-Bench 上,基础版的英文、中文总分分别为 53.53 和 53.38;4 步评测的 Turbo 则达到 50.98 和 50.27。同一模型家族由此形成两种互补部署档位:基础版侧重完整质量,Turbo 侧重推理速度。

九成样本不带文本,最终做到了什么?

技术报告用 Qwen-Image-Bench 作为主要综合生成基准。该基准包含 1,000 条分层提示词,考察画面质量、美学、提示词对齐、现实世界保真和创意生成,并分别提供英文与中文评测。

下面进一步选取报告中分数相近的部分开源与闭源模型进行比较:



Qwen-Image-Bench 部分模型结果,分数来自技术报告。各模型均采用标准推理设置和原始提示词进行比较。

最直观的参照是:把开源与闭源模型放进同一张榜单,LLaDA-Image 在中英文两条轨道上的总分,均位于 GPT Image 1 与 Imagen 4.0 Ultra 之间。

在报告列出的开源模型中,LLaDA-Image 的英文总分领先第二名 Z-Image-Turbo 1.87 分,中文领先 0.67 分;质量、美学和提示词对齐三个分项,在中英文开源模型中也均排名第一。

文字生成方面,LLaDA-Image 在 LongText-Bench 英文和中文部分分别达到0.923、0.913。在包含广告、海报、表情包和街景等多文字区域的 CVTG-2K 上,其平均单词准确率为、归一化编辑距离(NED)为 0.945、CLIPScore 为;在包含 2—5 个文字区域的不同难度设置下,单词准确率保持在 0.857—0.892。

指令编辑方面,LLaDA-Image 在 GEdit-Bench 英文、中文轨道上的总分分别为。这组结果展示了一套共享权重同时完成文生图与双语图像编辑的能力,也体现了统一模型路线的价值。

报告还给出了两个传统诊断基准:GenEval 总分为0.85,DPG-Bench 总分为。其中 GenEval 的单物体和双物体得分分别为 1.00 和 0.98,属性绑定为 0.84;计数能力目前为 0.53,也是后续可以继续提升的方向。

“全栈开源”,这次具体开放了什么?

榜单成绩提供了一个醒目的结果,完整开放的训练链条进一步扩展了这项工作的研究价值。LLaDA-Image 把从 “图片如何变成视觉先验” 到 “模型如何压缩到 2—4 步” 的路径连了起来。

具体来看,这次开放覆盖了五个关键环节:



这里的 6B 参数对应核心 DiT;完整系统还包括冻结的 LLaDA2.0-mini 理解骨干、视觉编码器、VAE、RQA 和 Connector。模块边界和各阶段配方一并给出,使研究者既可以观察完整系统如何协同,也可以按自身需求复用其中的纯图片预训练、统一编辑或少步蒸馏模块。

“开源 SOTA” 的口径同样清晰:它指 LLaDA-Image 在技术报告所列模型及标准评测设置下,取得 Qwen-Image-Bench 英文、中文开源模型第一。与此同时,同一套权重还覆盖双语长文本渲染与指令图像编辑,形成了从综合生成、文字能力到编辑能力的完整验证。

报告也给出了下一步方向:继续扩展世界知识、提高长文本与多区域排版的稳定性,并推进原生 2K 生成。对于社区而言,这套开放框架也为后续探索留下了清晰接口。

SGLang Day-0 支持 LLaDA-Image 推理

在 LLaDA-Image 开源之际,InclusionAI 与 SGLang 社区协作完成了 Day-0 推理适配。针对模型的多组件推理链路,双方完成了少步采样、序列并行和 FP8 推理等适配。基于 SGLang Diffusion,用户可通过同一套推理框架部署 Base、Turbo 及相应的 FP8 版本,支持文生图和图像编辑,并可通过兼容 OpenAI Images API 的接口提供服务。

结语

LLaDA-Image 的核心路线可以压缩成八个字:先学会画,再学会听话。 纯图片承担大规模视觉先验学习,图文对集中完成语言对齐;生成、编辑与快速部署,则继续接到同一套系统中。

模型权重、训练代码与详细配方的同步开放,让这个 6B DiT 从图片出发、走过语言对齐与统一编辑、最终落到 2—4 步部署的全过程,都成为可以研究和继续推进的技术路径。

当图文对不再是预训练的入场券,纯图片也就从 “等待配上文字的数据”,变成了视觉生成预训练的主角。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
每体:库巴西已成巴萨后防核心,不出意外将获得今年的金童奖

每体:库巴西已成巴萨后防核心,不出意外将获得今年的金童奖

懂球帝
2026-09-08 14:13:38
杨毅:没有张子宇,中国女篮下一拨就是亚洲前六

杨毅:没有张子宇,中国女篮下一拨就是亚洲前六

日常碎碎念啊
2026-09-07 22:35:53
神奇!郑钦文在美网3天2次上演奇迹 0-5落后连赢7局 打懵前世界第1

神奇!郑钦文在美网3天2次上演奇迹 0-5落后连赢7局 打懵前世界第1

我爱英超
2026-09-08 00:54:48
逼近TOP50!郑钦文7连胜飙升69位,再赢一场重返金花一姐位置

逼近TOP50!郑钦文7连胜飙升69位,再赢一场重返金花一姐位置

全景体育V
2026-09-08 04:28:18
台湾问题红线已破,俄罗斯的错误不能犯,必须断掉援台路

台湾问题红线已破,俄罗斯的错误不能犯,必须断掉援台路

狗子的快乐
2026-09-04 22:57:57
爸妈给我饭卡充近2万,我花70买牛排,男友竟拍桌大骂,我一句话没说,拎包扭头就走,他当场愣在原地

爸妈给我饭卡充近2万,我花70买牛排,男友竟拍桌大骂,我一句话没说,拎包扭头就走,他当场愣在原地

晓艾故事汇
2026-09-03 17:18:04
这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

宇宙时空
2026-05-26 18:20:10
女篮世界杯12强及资格赛对阵出炉,中国vs波多黎各直播预告

女篮世界杯12强及资格赛对阵出炉,中国vs波多黎各直播预告

真理是我亲戚
2026-09-08 10:54:40
替胡锡进对线汤家凤:75%发明来自英语国家,你都不用了?!

替胡锡进对线汤家凤:75%发明来自英语国家,你都不用了?!

小小河
2026-09-08 02:46:43
贝克汉姆大儿子回应妻子身材评论:“不许谈论我的妻子,她美得无可挑剔,你永远不该对女性的身材评头论足,这种行为很可耻”

贝克汉姆大儿子回应妻子身材评论:“不许谈论我的妻子,她美得无可挑剔,你永远不该对女性的身材评头论足,这种行为很可耻”

韩小娱
2026-09-08 07:20:30
狄龙也来习武了!登武当山学舞剑棍术 新赛季NBA赛场秀新招?

狄龙也来习武了!登武当山学舞剑棍术 新赛季NBA赛场秀新招?

罗说NBA
2026-09-08 06:02:37
随着中国5-0、朝鲜2-0,U20女足世界杯最新积分榜出炉

随着中国5-0、朝鲜2-0,U20女足世界杯最新积分榜出炉

侧身凌空斩
2026-09-07 23:05:30
四妻共侍一夫仅开胃菜,何超琼曝家族猛料,所以她拒绝再婚生子

四妻共侍一夫仅开胃菜,何超琼曝家族猛料,所以她拒绝再婚生子

乐天闲聊
2026-09-06 23:07:19
不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

天天热点见闻
2026-08-29 08:53:35
我领馆提醒:所有计划前往的中国游客,取消行程!

我领馆提醒:所有计划前往的中国游客,取消行程!

第一财经资讯
2026-09-06 17:17:43
算盘打得太响了!租客两娃,老大刚用完学位就退租,深圳房东发帖哭诉,能阻止老二继续占用学位吗

算盘打得太响了!租客两娃,老大刚用完学位就退租,深圳房东发帖哭诉,能阻止老二继续占用学位吗

火山詩话
2026-09-07 06:22:08
容易让中年女人喜欢的四种男人,第二种很多女人喜欢!

容易让中年女人喜欢的四种男人,第二种很多女人喜欢!

朗威谈星座
2026-09-08 17:05:41
人社部释放重要信号,退休人员关心的养老金,讲清楚中长期方向

人社部释放重要信号,退休人员关心的养老金,讲清楚中长期方向

王姐懒人家常菜
2026-09-07 08:11:22
满八十的老人有两笔钱可以拿,你知道吗?

满八十的老人有两笔钱可以拿,你知道吗?

周哥一影视
2026-09-08 08:49:41
郑钦文1/4决赛对手出炉!将战现役世界第2 已输4次+今年两度被逆转

郑钦文1/4决赛对手出炉!将战现役世界第2 已输4次+今年两度被逆转

我爱英超
2026-09-08 05:49:43
2026-09-08 18:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13947文章数 142729关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

小区上百台空调突然集体"罢工" 维修人员上门一查愣了

头条要闻

小区上百台空调突然集体"罢工" 维修人员上门一查愣了

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

旅游
房产
本地
时尚
游戏

旅游要闻

看北京|孤木成林!圆明园这棵古槐火了

房产要闻

真快啊!海口这个超级城更,又有大动作!

本地新闻

宁波,中国制造的隐藏大佬

秋冬穿对红黄橙,温暖又高级

70把比赛里骂人2万3千次!CS低素质玩家排行榜走红

无障碍浏览 进入关怀版