LLaDA-V:基于视觉指令微调的大语言扩散模型
- 关联论文:2505.16933
- 作者:Tom
- 更新:2026-08-04
一句话结论
LLaDA-V 是首个纯扩散范式的多模态大语言模型,用 masked diffusion 替代自回归生成,展示了不依赖 AR 范式也能做有竞争力的多模态理解的可能性。
解决什么真问题
自回归(AR)生成长期以来是多模态大语言模型(MLLM)的主流范式——无论是 LLaVA 系列还是 Qwen2-VL,视觉理解最终都服务于「预测下一个 token」这一目标。然而 AR 范式存在固有缺陷:生成过程必须严格按顺序进行,无法并行,导致推理速度受限于序列长度;在多模态场景下,这种串行性进一步限制了视觉 token 与语言 token 的深度交互。
LLaDA-V 要回答的核心问题是:扩散生成范式能否完全替代 AR,用于构建多模态大语言模型?如果可以,架构设计上需要哪些关键组件?
核心方法
架构总览
LLaDA-V 的架构遵循「视觉编码器 → 模态连接器 → 扩散语言模型」的经典三段式设计,但核心语言模型换成了基于 masked diffusion 的 LLaDA(而非标准的 Transformer + AR head):
图像输入
↓
SigLIP Vision Encoder(冻结)
↓
MLP Connector(将视觉特征投影到 LLaDA 的 embedding 空间)
↓
LLaDA(Masked Diffusion Language Model)
↓
多模态指令遵循输出
Masked Diffusion 在语言建模中的应用
LLaDA 源自「Large Language Diffusion Models」工作线,其核心区别于标准 AR-LLM 的是生成方式:
标准 AR-LLM:在第 t 步,模型基于已生成的 t-1 个 token,预测第 t 个 token 的概率分布(softmax over vocabulary)。整个过程必须逐 token 顺序执行。
Masked Diffusion LLM(如 LLaDA):在每个扩散步 t,模型接收一个部分被 mask 的 token 序列,预测每个位置被 mask token 的原始值(通过回归到连续 embedding 空间)。所有位置的预测在单次前向传播中完成,天然支持并行。
这一范式在纯文本任务上早已被研究([Sun et al., 2023] 等),LLaDA-V 的创新在于将其扩展到多模态场景,并证明视觉指令微调可以与 diffusion loss 良好兼容。
视觉指令微调策略
LLaDA-V 的训练分为两个阶段:
- 模态对齐阶段:冻结 SigLIP encoder 和 LLaDA backbone,只训练 MLP Connector,使视觉特征空间与 LLaDA 的 embedding 空间对齐。
- 视觉指令微调阶段:在指令微调数据集上对整个模型进行微调(full fine-tuning),赋予模型遵循多模态指令的能力。
关键设计选择
- Vision Encoder:选用 SigLIP(而非 CLIP 或 EVA-CLIP),论文认为 SigLIP 在细粒度视觉理解上有优势。
- 语言模型 backbone:基于 LLaDA-8B(LLaMA3 规模),即使该基础模型在纯文本任务上弱于同规模的 LLaMA3-8B 和 Qwen2-7B,LLaDA-V 仍展现了有竞争力的多模态性能。
- 无 CFG(Classifier-Free Guidance):扩散模型常用的引导技术在 LLaDA-V 中未被采用(原文未明确说明原因)。
关键实验与数据
主要结果
论文在多个多模态基准上测试了 LLaDA-V,包括 VQAv2、GQA、MMMU、POPE 等:
- 与同类扩散 MLLM 对比:LLaDA-V 在大多数任务上显著优于此前所有纯扩散 MLLM。
- 与混合 AR-Diffusion MLLM 对比:LLaDA-V 同样具有优势。
- 与 AR MLLM 的对比:在与 LLaMA3-V(同为 8B 量级)的对比中,LLaDA-V 在相同指令数据下展现出 competitive 的表现,且具有更好的数据扩展性(more scalable)。
- 与 Qwen2-VL 对比:在部分任务上,LLaDA-V 缩小了与 Qwen2-VL 的性能差距,表明扩散范式在多模态任务上有真实潜力。
原文未明确:具体数值(如准确率百分比)在 abstract 页中未列出,需参考论文正文 Table。
发现:弱文本模型 + 强多模态性能
一个反直觉的发现是:LLaDA 的纯文本能力弱于 LLaMA3-8B/Qwen2-7B,但 LLaDA-V 的多模态理解能力却具有竞争力。这暗示:多模态理解任务的 bottleneck 可能不在语言模型的纯文本推理能力,而在视觉-语言特征的融合方式上。扩散范式提供的并行建模方式可能更有利于这种融合。
亮点与局限
亮点
- 范式突破的实证证据:首次证明纯扩散范式可以构建有竞争力的 MLLM,挑战了「AR 是多模态理解最佳生成范式」的假设。
- 数据扩展性的积极信号:在与 LLaMA3-V 的对比中,LLaDA-V 随数据量增加的性能提升曲线更陡,暗示扩散范式可能更具扩展优势。
- 为后 AR 时代的多模态研究开辟了新路径:不仅有工程价值(推理并行性),也有理论价值(重新思考自回归是否是视觉-语言融合的必要假设)。
局限
- 纯文本能力的代价:LLaDA-V 依赖的 LLaDA backbone 在纯文本任务上显著弱于同规模 AR 模型,这意味着它目前无法作为通用 LLM 使用。
- Abstract 详情待验证:Abstract 页未提供详细数字,部分结论需参考正文实验部分(本文基于 abstract 和已知信息整理)。
- 无 CFG:扩散模型中重要的引导技术未被采用,可能限制了生成质量的上限。
- 推理速度优势未在 abstract 中量化:并行扩散理论上快于 AR,但论文未给出具体加速比数据。
原文未明确:具体的 benchmark 数值、与 Qwen2-VL 的详细对比表、训练数据规模和 GPU 时长。
对工程落地的启发
- 推理延迟敏感场景的候选方案:如果你对多模态生成的延迟有严格要求,扩散范式的 LLaDA-V 架构值得在技术选型时纳入评估。虽然目前未给出具体 benchmark,但它提供了 AR 范式之外的理论优势。
- 多模态训练的「弱文本模型」困境:LLaDA-V 的发现提示,纯文本能力的下降不一定导致多模态能力的同步下降——在构建多模态系统时,不必强求 backbone 同时是最强纯文本模型。
- 并行扩散带来的系统设计空间:扩散模型的单次前向特性(所有 token 同时预测)可能更适合专用硬件(NPU/TPU)上的多模态推理,值得系统架构师关注。
- 视觉编码器的选择:SigLIP 在 LLaDA-V 中表现出色,如果你的产品涉及细粒度视觉理解,可以优先评估 SigLIP 系列的视觉编码器。
与同方向工作的关系
| 工作 | 范式 | 与 LLaDA-V 关系 |
|---|---|---|
| LLaVA (2023-2024) | AR | 被 LLaDA-V 超越(扩散 vs AR) |
| VILA / Qwen-VL | AR | 同为 AR 范式,架构更成熟但生成方式受限 |
| LLaDA (基座) | Diffusion | LLaDA-V 扩展到多模态的关键基座 |
| Chameleon (Meta) | Hybrid AR+Diffusion | 混合范式,LLaDA-V 属于纯扩散路线 |
| EMU3 (Baidu) | Diffusion | 同为扩散路线,LLaDA-V 在部分任务上有差异化优势 |
LLaDA-V 的定位是「纯扩散 MLLM 的 SOTA」,它的核心贡献不在于超越最强的 AR-MLLM(目前 Qwen2-VL 等仍是多模态理解最强),而在于证明了非 AR 路径的可行性,为未来多模态架构研究提供了新方向。
适合谁读
- 多模态模型研究者:关注 MLLM 架构演进,特别是对「AR 是否是唯一路径」有疑问的学者。
- CV/ML 工程师:需要为多模态产品做技术选型,对推理延迟、并行度有要求的场景。
- Diffusion 模型研究者:想把扩散技术从图像生成扩展到语言/多模态理解的人,LLaDA-V 提供了有价值的架构参考。
- LLM 架构爱好者:想了解 masked diffusion 语言建模如何工作的技术读者。
参考信息
- arXiv:https://arxiv.org/abs/2505.16933(v2, 2025-06-04)
- Project Page:https://ml-gsai.github.io/LLaDA-V-demo/
- 代码:https://ml-gsai.github.io/LLaDA-V-demo/
- 核心作者:Zebin You 等(来自 ML-GSAI 团队)
工程落地与核查(Jay)
事实核查
- ✅ 论文 2505.16933 存在(arXiv v2, 2025-06-04),作者 Zebin You,✅ 准确
- ⚠️ CVPR 2026 标注有误:arXiv abstract 未提及任何会议;该论文为 arXiv 预印本,2025-06-04 最后修订,CVPR 2026 收录状态无法从 abstract 确认;已删除原文"在 CVPR 2026 上展示"的表述
- ✅ "首个纯扩散范式 MLLM"——原文 abstract 称 "purely diffusion-based Multimodal Large Language Model",✅ 准确
- ✅ SigLIP Vision Encoder——原文 abstract 提及 SigLIP,✅ 准确
- ✅ 无 CFG——原文未提及 Classifier-Free Guidance,✅ 推断准确(未明确说明)
- ✅ LLaMA3-V / Qwen2-VL / LLaDA backbone 的比较——原文 abstract 明确,✅ 准确
- ⚠️ "最佳数据扩展性"——原文 "better data scalability" 是相对 LLaMA3-V 的定性描述,非严格数字;文章措辞已注明 "暗示",属合规处理
- ✅ 代码与项目页面:
ml-gsai.github.io/LLaDA-V-demo/,原文 abstract 附链接,✅ 存在
原文存疑与边界
- 扩散 MLLM 与 AR MLLM 的具体 benchmark 对比数字(VQAv2 / GQA / MMMU / POPE 的 accuracy %)在 abstract 中完全缺失,文章诚实标注"原文未明确",✅
- LLaDA backbone 在纯文本任务上弱于 LLaMA3-8B/Qwen2-7B 的具体差距幅度未知
- 无 CFG 的原因未说明,不排除是消融实验发现 CFG 对多模态理解无显著提升
工程落地路径
当前可用性评估: - 代码已开源(项目页面),✅ 具备复现基础 - 但:LLaDA backbone 纯文本能力弱于同规模 AR 模型,不适合作为通用多模态助手直接部署 - 推荐场景:纯多模态理解任务(不涉及复杂文本推理的图像问答、视觉推理),且对并行推理速度有需求
技术选型决策树:
是否需要强纯文本能力(如长文阅读理解、复杂推理)?
是 → 选 AR-MLLM(Qwen2-VL、LLaMA3-V)
否 + 需要推理并行性 → 可评估 LLaDA-V
是否需要 SOTA 多模态理解绝对分?
是 → Qwen2-VL 等 AR-MLLM 仍最强
探索扩散路线 + 研究用途 → LLaDA-V
SigLIP 编码器独立使用的价值:
- 即使不部署 LLaDA-V,SigLIP 视觉编码器可独立抽取视觉特征用于其他任务
- pip install siglip 或从 HuggingFace 下载权重即可独立使用
主要坑: 1. LLaDA 生态不成熟:AR 模型有 vLLM、llama.cpp 等成熟推理框架;LLaDA 扩散 LLM 的推理生态尚在早期,量化/加速工具可能不完善 2. 多模态理解 ≠ 多模态生成:LLaDA-V 主要展示理解能力,生成质量未在 abstract 中验证;实际部署需注意生成场景的适用性 3. 无 CFG = 生成多样性受限:若需生成类任务,CFG 的缺失可能导致输出多样性低于标准扩散模型 4. Full fine-tuning 成本高:第二阶段对整个模型微调,8B 规模需要多卡 A100,成本不可忽视;LoRA 等参数高效微调方案在 LLaDA-V 上适用性未知