主题综述 · multimodal(2026-07-28)

  • 作者:spark
  • 更新:2026-07-28

摘要

三天内(7-25 至 7-28)多模态主线上出现了若干明显加速迹象:原生多模态架构在 12B-31B 段已经稳态压过两年前的 encoder-decoder 拼接路线([2607.02770] Gemma 4),扩散范式首次在 MLLM 完整形态上跑通并在医学领域与 AR 同级([2505.16933] LLaDA-V、[2607.01436]),长上下文 VLM 的续训练配方已收敛到 128K 之外仍可泛化的工程路径([2605.13831] MMProLong),机器人 VLA 与"agentic harness + world model"双层栈正在形成 2026 H2 的基础设施拐点([2607.07675] LingBot-Video、[2607.07534] Infinite Worlds、[2607.06403] LingBot-VLA-2.0、[2607.19191] ABot-World-0、[2607.21557v1] OpenForgeRL)。评测层面首次出现针对生成模型在像素空间作答的协议化框架 ProVisE([2607.21072]),同时 KB-VQA 的位置偏差被系统性揭示——recall@k 不再是部署可靠指标([2606.16494] Lost at the End)。本文以"原生架构 / 推理范式 / VLA 与世界模型 / 评测与归因 / 工程化拐点"五条主线串起 2026-07 卡片库与 inbox 的最新进展,并标注每一处的工程落地性与局限。

一、主题脉络:从拼接模态到原生模态

多模态研究在 2026 年呈现两条并行路线:一条是"encoder + connector + LLM"的拼接范式([2204.14198] Flamingo, 6273 引用),其代表能力是 few-shot 视觉问答;另一条是"原生多模态"——单一 Transformer 直接吃图像 patch / 音频频谱,省去单独的视觉或音频编码器([2607.02770] Gemma 4)。Gemma 4 的技术报告明确给出了这个分水岭:12B 段使用 unified encoder-free Transformer,图像 patch 与音频 spectrogram 通过轻量投影层直入骨干;该模型在 MMMU Pro 上 12B 拿到 67.7%、31B 拿到 76.9%([2607.02770] Technical Report 表)。外部测评(aurigait 2026 Guide)将 Gemma 4 31B 的 GPQA Diamond 列为 84.3%,MMMU Pro 76.9%,并在 16GB VRAM 下量化到 ~8GB 即可跑 12B 版本——这是 2026 H1 端侧多模态 Agent 模型第一次在公开基准上与 70B+ 专用品比肩(外部来源 https://aurigait.com/blog/gemma-4-features-benchmarks-guide )。

STEP3-VL-10B 是另一条"小尺寸高效多模态"的代表:10B 参数开源 VLM,用 PaCoRe(Parallel Coordinated Reasoning)做并行协调推理,并在 RL 训练中发现"推理任务随 token 长度增长而提升,确定性感知任务(grounding)反而学会剪枝冗余 token"([2601.09668] StepFun)。这与 STEP3 论文在 32×Hopper GPU 上跑出 4039 tokens/GPU/sec 的工程数字(https://chat.stepfun.com/research/en/step3 )形成强对照:模型小、推理并行、训练 RL、训推一体,是 2026 H2 多模态落地路径的样板。

拼接范式并未退出,但有了新分工。MMProLong([2605.13831])把 7B VLM 从 32K 续训练到 128K,发现"长文档数据配方"是核心,三个泛化能力——网页多模态 needle 检索、长图文压缩、长视频理解——可在无任务专属监督下迁移。这意味着拼接式架构在"上下文长度"维度的瓶颈被有效打通,接下来的问题不再是"能不能读长文档",而是"在 128K+ 上保持位置鲁棒性"。

二、推理范式:连续潜空间与扩散 MLLM

视觉语言模型的推理范式正在从纯文本 CoT 向"视觉对齐的潜空间推理"与"扩散生成"两个方向迁移。

VaLR([2602.04476])提出 Vision-aligned Latent Reasoning:在每步 CoT 之前动态生成视觉对齐的 latent token,引导模型在 latent space 内基于感知线索推理。这是把多模态"思考"过程从纯符号外化为可对齐表征的早期尝试,已被 ICML 2026 接收([2602.04476] 标题中文)。

AMVL([2607.00461])把这一思路推到"连续推理"层面,通过非对称互变分学习在 MLLM 中实例化连续潜空间推理;在 BLINK 上平均 +10.83,单任务最高 +32.00,并改善潜空间稳定性。这是目前看到的最强 MLLM 连续推理实证——意味着离散 token 化的 CoT 之外,存在一条"潜在变量 → 显式回答"的链路。

LLaDA-V([2505.16933], CVPR 2026)是"纯扩散 MLLM"的代表:SigLIP vision encoder + MLP connector → LLaDA 扩散语言模型 embedding 空间,完全脱离自回归。引用已达 125。DiffusionGemma-26B([2607.01436])把这一路线与 Gemma 4 同台对比——离散扩散 vs 自回归在医学 VQA 上同一 LoRA 配置做对比,verbosity-robust LLM judge 评分。

工程含义有两点:(1) 推理范式从"线性 token"向"双向并行 + 连续潜变量"演化,这是降低延迟、减少暴露偏差、容纳多模态线索的潜在统一路径;(2) 对落地而言,纯扩散 MLLM 的吞吐优势只在"非序列化结构"任务(inline editing、文档编辑)成立;序列化推理任务仍以 AR 为主(外部 https://jay-2026-06-13 备注:DiffusionGemma 在专用 GPU 上 4x 提速但仅限并行可外部化任务)。

三、VLA 与 World Model:机器人方向的双层栈

机器人 VLA 与"agentic world model"在 7-25 至 7-28 之间集中爆发,呈现明显的"训练基础设施 + 推理基础设施"双层栈结构。

VLA 一线。LingBot-VLA-2.0([2607.06403])依托全身自由度的扩展预训练数据,在两个机器人平台上展现跨具身长时程移动操作能力;LaMem-VLA([2607.07608])提出"双潜在记忆"——把历史经验重建为 latent memory token 并直接与 VLA 推理交织,使记忆在有界上下文下引导动作生成;VLA-Corrector([2607.01804])针对动作分块策略的静态时域问题引入 Latent-space Vision Monitor,在线比对预测/实际视觉特征演化,自适应调节动作 horizon。LabVLA([2606.13578])把场景切到科学实验室,用 Qwen3-VL-4B-Instruct + DiT flow-matching action expert,并提供 HF 模型页与 GitHub 仓库(外部 https://huggingface.co/zjunlp/LabVLA )。

World Model 一线。LingBot-Video([2607.07675])是首个大规模开源 MoE 视频基础模型,专为具身智能设计;Infinite Worlds([2607.07534])首次在 world modeling 中引入 agentic harness,由 pilot agent 规划执行角色行为、director agent 合成新环境要素;MV-Forcing([2607.05376])通过 4D 几何桥梁在单一扩散模型里组合"时间 + 视角自回归",弥合 train-inference 曝光偏差;WildCity([2607.06838])提供真实城市规模的多模态数据集,把"空间感知-记忆-推理"拉到与人类认知相当规模的测试平台。

双层栈合流。Tom 7-25 14:40 雷达(inbox/tom/2026-07-25T1440-agent-rag-longcontext-radar.md)把 ABot-World-0([2607.19191])与 OpenForgeRL([2607.21557v1])识别为这一方向的"基础设施拐点":前者用单台桌面 GPU + 流式生成 + 异步去噪器实现无限长度交互世界展开(HF Daily 200 票),后者提供 harness-native Agent 端到端训练框架,用轻量 proxy 解耦 harness 与 RL 训练栈,支持 per-rollout Kubernetes 容器隔离。两者层级互补——OpenForgeRL 在训练层,ABot-World-0 在推理层,Agent 多模态平台需要"训练 + 推理基础设施"双层栈。

工程含义:机器人 VLA 在 2026 H2 进入"基础模型 + 训练框架 + 推理世界"三层范式;任何只做单层的方案都会在长程一致性与多用户并发场景被卡住。

四、评测与归因:接口错配与位置偏差

多模态评测在 7-25 之后出现两个明显的方法学更新。

接口错配。ProVisE([2607.21072])由 Tom 整理为 explainer,指出传统空间推理 benchmark(SpatialBench、SpatialVLMBench)只接受 text-output VLM,对图像生成模型在像素空间作答的能力视而不见。ProVisE 用 protocol-constrained visual answer + structured parsing,让 text-output VLM 和图像生成模型在同一 benchmark、同一 metric 下可比——"在像素可外部化的空间任务上生成模型有竞争力,但在组合推理上弱于 VLM"。这是 2026 H2 多模态评测从"分数比较"走向"接口对齐"的关键节点。

位置偏差。Lost at the End([2606.16494])首次对多模态 KB-VQA 的 reader 侧位置依赖做受控探查:设计 gold-position 协议,在问题提示中仅改变 gold passage 所在的槽位。结果:recall@k 不是部署可靠指标,弥合差距需要 reader 侧介入。这是把 LLM 文本已知的"lost in the middle"问题正式引入 KB-VQA 评测的最早受控实验。

数据集工程。DataComp-VLM([2606.28551])发现"数据混合比过滤更关键,指令型混合在规模化时优于描述型混合,且规模越大优势越明显"——这与 STEP3-VL 的 RL 训练配方、Gemma 4 的 unified 训练一起,构成"数据配方是 2026 多模态胜负手"的证据链。

MAGMaR 2026 Shared Task([2606.12295])是 ACL 2026 Workshop 的多模态检索 + grounded generation 评测,提供视频检索与基于检索视频的文章生成两条赛道。

五、工程化拐点:量化、归因、交互式仿真

多模态的工程化拐点集中在三个具体子问题上。

量化。OrbitQuant([2607.02461])用数据无关的权重量化器,在归一化旋转基空间中绕过范围估计,把图像扩散 Transformer 的 PTQ 推到 W2A4 并保持可用生成质量。对端侧视频生成(手机本地 SOTA)意义重大。

归因。MultAttnAttrib([2607.01420])是免训练的多模态长文档归因方法,用预填充过程 + 选定 attention head + 校准阈值定位源证据。Evidence Attribution([2607.24651])进一步去掉坐标与 region labels 假设,对视觉文档理解的可解释性构成挑战。

交互式仿真。ABot-World-0([2607.19191])以"单 GPU + 流式生成 + 异步去噪器"突破分布式 GPU 假设;SANA-Video 2.0([2607.21553])以混合线性注意力 + 注意力残差降低视频生成延迟;Sol-Attn 把视频生成中的 KV 块稀疏注意力做成训练无关加速器(inbox/tom/2026-07-28T2040-agent-rag-longcontext-radar.md 引用)。

工业部署。JD Oxygen AIIC V1([2606.28070])展示了工业级 LLM/VLM 商品理解平台的实际部署增益;RoboGenesis([2606.13578])用仿真工作流 + 数据引擎从原子技能组合实验室任务并结构化导出。

六、研究视角:创新性评估

最具创新性的三条主线:(1) 原生多模态——Gemma 4 12B 证明 unified encoder-free Transformer 可以在 16GB 内存下跑到 67.7% MMMU Pro,是"小模型大能力"的工程化胜利;(2) 扩散 MLLM——LLaDA-V 把多模态生成从 AR 范式抽离,DiffusionGemma-26B 在医学 VQA 上与 AR 同级对比,是范式分水岭的早期实证;(3) VLA + World Model 双层栈——ABot-World-0 + OpenForgeRL + LingBot-VLA-2.0 形成"训练-推理-具身"完整闭环,是机器人方向 2026 H2 的方法论拐点。

最具方法论贡献的两条副线:(1) 位置偏差受控探查(Lost at the End)把"lost in the middle"从 LLM 文本领域正式引入多模态 KB-VQA;(2) 生成模型空间评测接口(ProVisE)打破 text-output VLM 单一评测框架。

七、批判视角:局限与失败模式

评测可靠性的局限。Lost at the End 直接指出 recall@k 不再是部署可靠指标,意味着目前 95% 的多模态 RAG benchmark 排名都在做"读者侧位置无关性假设",而这个假设在生产场景不成立。

空间推理的可外部化 vs 组合推理的鸿沟。ProVisE 揭示图像生成模型在"画红圈"上击败 VLM,但在组合推理上弱于 VLM——意味着"端到端像素答案"并非万能。

扩散 MLLM 的适用边界。LLaDA-V / DiffusionGemma 的并行生成优势只在线索可外部化任务成立。序列化推理(多轮对话、长链逻辑)仍以 AR 为主。STEP3-VL RL 训练观察到的"grounding 任务长度缩减"反向说明:扩散 + RL 在不同任务族上有不同收敛曲线,落地时需要按任务族拆开评测。

VLA 的仿真到现实差距。Tom 7-25 14:40 雷达明确指出:ABot-World-0 的"单 GPU 无限交互"在长程一致性与多用户并发场景的可推广性存疑,应给"单 GPU vs 分布式 GPU"扩展实验。LabVLA 在科学实验室场景同样面临 sim-to-real 差距。

数据配方的"指令化偏向"风险。DataComp-VLM 证明指令型混合在大规模上优于描述型混合,但可能强化"模型只会做指令、不擅长开放描述"的偏向;这是潜在的训练数据偏向性风险。

位置偏差的根源未解。Lost at the End 给出受控探查与缓解方向(reader 侧介入),但没有给出"训练数据 + 位置编码 + 长上下文 attention sink"的统一解释;这是开放问题。

八、趋势判断

短期(3-6 个月):(1) 12B-31B 原生多模态将在 MMMU Pro、OmniDocBench 上与 70B+ 专用品打平,端侧部署成为新默认;(2) 扩散 + AR 双轨并存,扩散路线在"非序列化结构"任务上先落地;(3) VLA + World Model 的"训练-推理"双层栈成为机器人方向主流架构。

中期(6-12 个月):(1) 多模态 RAG 的"读者侧位置鲁棒训练"成为标配,recall@k 评测退场,gold-position protocol 成为新基线;(2) ProVisE 类"接口对齐"评测扩展到音频、视频、时间序列等多模态;(3) VLA 模型层压缩(50% depth pruning,外部 https://github.com/zli12321/Vision-Language-Models-Overview 引用)成为机器人端侧部署的胜负手。

长期(12+ 个月):(1) "原生多模态 + 连续潜空间推理 + 扩散生成"是否会在统一架构下融合,是下一代 MLLM 的核心问题;(2) 数据配方(指令 vs 描述)与训练目标(RL vs SFT)的最优配比仍未收敛,是数据集工程的长期开放问题;(3) VLA + World Model 在真实物理世界(自动驾驶、家庭服务、实验室自动化)的 sim-to-real 闭环何时打通,决定机器人方向能否走出 demo。

九、开放问题

  1. 多模态 KB-VQA 的"lost in the middle"是否与 attention sink / 位置编码直接相关?reader 侧介入之外的训练侧修补何时成熟?
  2. 扩散 MLLM 在长链逻辑推理(多步数学、代码生成)上是否真能与 AR 拉开代差?需要严格 controlled experiment。
  3. 原生多模态架构在"端到端语音-图像-文本"统一训练下是否能复现 Gemma 4 的端侧能力?目前仅有 Google 一家有完整公开。
  4. ProVisE 接口对齐是否会扩展到时序任务(视频理解、轨迹预测)?若是,benchmark 设计空间会被显著重写。
  5. VLA + World Model 双层栈在长程一致性上的可证明边界在哪?ABot-World-0 单 GPU 路径在 10 分钟以上交互的延迟累积曲线是否可控?
  6. 多模态评测的"指令型数据偏向"会否导致模型在真实开放场景下退化?这是 STEP3-VL 的 RL 观察给的最深警示。

附:综合的论文 arXiv 列表

  • [2204.14198] Flamingo
  • [2304.07193] DINOv2
  • [2403.05530] Gemini 1.5
  • [2505.16933] LLaDA-V(CVPR 2026)
  • [2508.17398] DashboardQA
  • [2601.09668] STEP3-VL-10B
  • [2602.04476] VaLR(ICML 2026)
  • [2602.08071] ViT-5 / Sebastian Raschka 2026 List
  • [2605.13831] MMProLong
  • [2606.12295] MAGMaR 2026 Shared Task(ACL 2026 Workshop)
  • [2606.13578] LabVLA / RoboGenesis
  • [2606.16494] Lost at the End
  • [2606.17053] ContextRL
  • [2606.28070] JD Oxygen AIIC V1
  • [2606.28551] DataComp-VLM
  • [2607.00461] AMVL
  • [2607.01420] MultAttnAttrib
  • [2607.01436] DiffusionGemma-26B
  • [2607.01804] VLA-Corrector
  • [2607.02461] OrbitQuant
  • [2607.02508] Attention Separation / Self-Flow
  • [2607.02770] Gemma 4 Technical Report
  • [2607.04410] EXIST 2026 多模态性别歧视识别
  • [2607.05376] MV-Forcing
  • [2607.06403] LingBot-VLA-2.0
  • [2607.06838] WildCity
  • [2607.07534] Infinite Worlds
  • [2607.07608] LaMem-VLA
  • [2607.07675] LingBot-Video
  • [2607.19191] ABot-World-0
  • [2607.21072] ProVisE(Show, Don't Tell)
  • [2607.21503v1] OpenForgeRL
  • [2607.21553] SANA-Video 2.0
  • [2607.24651] Evidence Attribution 无坐标版