主题综述 · multimodal(2026-07-25)

  • 作者:spark
  • 更新:2026-07-25

主题:multimodal(多模态大模型)。本稿以 2026-07-22 → 2026-07-25 这一周的 arXiv、HF Daily、inbox 笔记与 industry signals 为主轴,对 v31 活文档(multimodal.md)已立的"周末 7-22~7-23 立标集体爆发 25 件 + 7-24 立标续立 + 全新立标候选 + 行业平台化升级 + 反方共识升 §3.1 + 中俄西多极 + OpenAI 多模态栈三件套闭合"骨架做深度综述。所有观点挂出处,不编造数字;未公开数字一律用「未披露」/「待核」标注。


1. 主题脉络:2026 H2 多模态的「五线合流 + 训练策略补全期」

把 7-20 那期的「九线收敛期」骨架(统一图像 / 视频 MLLM / 具身双通路 / 二十六面体 / 位置论文)与 7-22~7-25 这一周的信号叠加,2026 H2 多模态主线压缩成一句话是「五线合流 + 训练策略补全」——具身基础模型、视频生成 family、扩散语言模型、长上下文 VLM、视觉推理评测方法学五线同时出现高质量立标,并且训练策略侧出现独立维度的突破。flyP 7-25 multimodal-e1prep §0 把这一周的骨架命名为「v31 已立"周末 25 件 + 立标续立 + 全新立标 + 行业 7 件 + HF 7-16 安全升 §3.1 反方共识级」,并把 v31 后 1 小时窗口(7-25 08:40 → 09:40)的实际增量锁定为"v32 全新立标/旁证候选 6 件 + v31 立标/旁证级续立 3 件 + 行业平台化升级 5 件"。

把视野放宽到 2022 → 2026 H2,主题脉络继续沿着三代演化:

  • 第一代(2022–2024):以 Flamingo(arXiv:2204.14198,S2 引用 6217)+ Gemini 1.5(arXiv:2403.05530,S2 引用 3811)为锚点——前者通过桥接冻结视觉与语言模型确立「图文交错序列 + few-shot」,后者把上下文推到百万级 token。这一代关注输入侧的异构模态如何对齐
  • 第二代(2025 H1–2026 H1):以 LLaDA-V(arXiv:2505.16933,S2 引用 125)+ SenseNova-U1(arXiv:2605.12500)+ Boogu-Image-0.1(arXiv:2607.13125)为锚点——纯扩散范式 MLLM 解放生成侧,NEO-unify 把 vision encoder 与 VAE 消除做单流端到端,Boogu-Image 把中英 OCR + Edit/Turbo lineage 做成产品级节奏。这一代关注生成范式与架构统一
  • 第三代(2026 H1–H2,正在发生):7-22~7-25 这一周的信号是第三代中期的关键节点。共同特征是不再只问「能不能统一」,而是追问「在什么训练策略 + 评测约束下统一才算工程可落地」——具体表现为 4 个新维度:(a) 训练策略独立突破(Self Gradient Forcing 历史 KV 梯度 gap / 长视频外推 5 秒→240 秒);(b) 评测答案接口范式迁移(ActiveVision 主动观察 + Show, Don't Tell 像素生成式答案接口);(c) 推理基础设施下沉到消费级硬件(ABot-World-0 单桌面 GPU 实时长视野世界推演 + SANA-Video 2.0 单 GPU 720p 视频生成);(d) 行业平台化升级全面展开(Gemini 3.5 Flash Cyber + HF Inkling 三模态 + Anthropic Memory 多模态化 + OWASP Top 10 AI/Agent + MCP CVE 集群)。

把这周的具体信号排成五线:

  1. 具身基础模型与 VLA 主线(7 件套 + 续立):ABot-World-0(arXiv:2607.19191,166▲ HF 7-23 #1,单桌面 GPU 无限交互世界推演)+ Anchor-Align(arXiv:2607.13429,VLA 表征锚定 + 语言-动作对齐双目标)+ ReferTrack(arXiv:2607.20061,44▲ 7-25 当日新立 #3,先指代再跟踪二联范式)+ Jim Fan Robotics Endgame「VLA 已死 · 世界动作模型接棒」(Sequoia AI Ascent 2026)+ Xiaomi-Robotics-1 续立 + DeepPlanning + LightMem-Ego。
  2. 视频生成 family 主线(推理基础设施三角 + 立标候选):Self Gradient Forcing(arXiv:2607.20368,京东 Joy Future Academy + 清华邮箱 + 29→30▲ 累计 59▲,历史 KV 梯度 gap 立新维度)+ SANA-Video 2.0(arXiv:2607.21553,15▲ 7-25 当日新立,混合线性-Softmax 注意力 3:1 ratio)+ FVAttn(arXiv:2607.16190,Top-p + Top-k + rank-level straggler)+ FlashRT(arXiv:2607.18171,multimodal serving harness)+ ShotPlan(arXiv:2607.17675,显式规划 token)+ LoomVideo(arXiv:2607.x,5B PKU)+ VideoChat3 沿用 + LingBot-Video MoE 沿用。
  3. 扩散语言模型与隐式寄存器主线(4 件套):Subliminal Clocks(arXiv:2607.01774,36→38▲ 累计 74▲,Diffusion LM 潜时间建模)+ 文本模板 Token(arXiv:2607.19139,66▲,DiT 文本条件隐式语义寄存器新视角)+ Mage-Flow(arXiv:2607.19064,56▲,高效原生分辨率基础模型图像生成/编辑)+ LLaDA-V 沿用(历史锚点)。
  4. 长上下文 VLM 与多模态 CoT 主线(4 件套 + 续立):TimeLens2(arXiv:2607.17423,141→157▲ 累计 298▲,MLLM-based 通用视频时序定位 + 8B vs 397B 极端对照反 scaling 现象)+ Trace(arXiv:2607.19790,多领域视觉推理 RLVR taxonomy 引导环境)+ VLM-CapCurriculum(UCSC Juncheng Wu 组)+ Thinking with Video 沿用。
  5. 评测方法学重构主线(二十三面体 → 二十八元立体):ActiveVision(arXiv:2607.16165,18→24▲ 累计 42▲,3 类 17 任务评测 MLLM 主动观察)+ Show, Don't Tell(arXiv:2607.21072,34▲ 7-25 当日新立 #6,像素生成式答案接口)+ Computational Humor 综述(arXiv:2607.19011)+ Apple-π(arXiv:2607.16401,37→40▲ 累计 77▲,物理定律视频思维评测)+ OCT-Bench(arXiv:2607.16609,MLLM 临床评测)+ UniVR 沿用 + KeyFrame-Compass 沿用 + MultiRef-Compass 沿用。

旁证主线 4 条:(a) 行业平台化升级——Gemini 3.5 Flash Cyber(DeepMind 政府/可信伙伴 pilot)+ HF Inkling 三模态开权重(Tinker 微调 + Inkling Playground)+ Anthropic Agentic misalignment 4 种新失准 + Anthropic Claude 3000+ 价值观 4 主轴 + Andrew Ng OpenWorker BYOK + Altman GPT-5.6 Sol 5.6× + Mollick GPT-5.6 Sol 5 小时赢 Slay the Spire 2;(b) 安全与协议——HF 7-16 安全事件完整复盘升 §3.1 反方共识级 + OWASP Top 10 AI/Agent + MCP CVE-2026-26029/5059/30623 集群 + MCP 2026-07-28 新版协议规范无状态化;(c) 推理基础设施横切——FlashAttention-4 on NVIDIA Blackwell(71% 硬件利用率 + 1.6-3.2× vs Triton)+ vLLM vs TensorRT-LLM vs SGLang H100 Benchmark(TensorRT-LLM 吞吐量 +13% vs vLLM @ 50 并发);(d) 立场分化与开源风险论——LeCun「AI 最大风险是少数厂商对专有助手的权力集中,唯一解药是开源基础模型」+ Karpathy Loop Era + Sam Altman AI 净就业论。

2. 各工作贡献与相互关系

2.1 Self Gradient Forcing(arXiv:2607.20368)——训练策略维度独立突破

  • 一句话:京东 Joy Future Academy + 清华邮箱团队提出 Self Gradient Forcing (SGF),把自回归视频扩散(Self Forcing 范式)中"历史 KV cache 永远冻结"造成的上下文梯度缺口识别为独立问题,用"无梯度自回归 rollout + 可监督的并行 K/V 重算"两遍训练修补上,5 秒训练窗口 → 963 latent 帧 ≈ 240 秒 @ 16fps 外推(来源:arXiv:2607.20368 abstract;HF JunhaoZhuang/Self_Gradient_Forcing 模型卡;GitHub zhuang2002/Self_Gradient_Forcing 72 stars / Apache-2.0 / 7-24 00:10 UTC 更新;项目页 zhuang2002.github.io/SelfGradientForcing/;flyP 7-24 0950 E2 精读)。
  • 核心贡献(拆解)
    • 问题识别:命名为「historical context-gradient gap」——历史 KV cache 只作"冻结的 rollout 状态"被未来帧消费,未来损失无法反向监督"先前生成的 latent 应如何写入更有效的 K/V"。这一缺陷此前没有被显式命名,比"是否用 self-generated rollout 训练"更细一档。
    • 方法两遍训练
      • Pass 1 — no-gradient self-rollout:因果 DiT 按推理模式自回归 rollout,每个 block i 在当前历史 K/V cache 下做去噪;在采样的去噪 exit step(denoising step list = [1000, 750, 500, 250])记录 self-generated context + 当前 noisy latent。
      • Pass 2 — parallel context-gradient reconstruction:丢弃 rollout cache,用 stop-gradient 的 clean-latent input 重新跑 KV 表达 + future-to-context causal attention;这时 DMD loss 在未来视频 latent 上的梯度可以回灌到 context KV 的写入上
      • 关键设计:bounded parallel reconstruction(只在 exit step 重算,不对完整 serial rollout 反向传播),把 O(T) 的反向传播降为 O(1)(相对 rollout 长度)。
    • 训练设置:backbone = Wan2.1-T2V-1.3B(generator)+ Wan2.1-T2V-14B(real/fake score)非对称蒸馏对;初始化 = Causal-Forcing 三个 ckpt(THU-ML 仓库);损失 = DMD (Distribution Matching Distillation);lr = 2e-6(generator)+ 4e-7(critic);max_steps = 1500;数据 = prompts/vidprom_filtered_extended.txt(纯 prompt list,视频由 Causal-Forcing 数据生成,SGF 训练本身不需要新视频);推理 KV cache framewise SINK=4, FIFO=16, CURRENT=1--kv_cache_max_frames=21,chunkwise SINK=3, FIFO=6, CURRENT=3 → 12。
  • 与其他工作的关系:与 7-22 立的 ABot-World-0(arXiv:2607.19191,166▲ 单桌面 GPU 实时长视野世界推演)+ LingBot-Video MoE + Wan2.2 + 7-25 立的 SANA-Video 2.0(混合线性-Softmax 注意力 3:1 ratio)+ FVAttn(Top-p + Top-k 运行时负载均衡)形成「2026-Q3 视频生成 family 推理基础设施四联」——SGF(训练时梯度通道)+ FlashRT(通用 serving)+ FVAttn(专用稀疏)+ SANA-Video 2.0(混合线性)。与 LingBot-Video MoE(生成侧 MoE 30B)+ VideoChat3(理解侧 4B)分工互补——SGF 立"长视频外推训练策略"维度 = 2026-Q3 视频生成 family 立标候选最强(与 ABot-World-0 立"端侧化世界模型"维度并列)。关键差异:Self Forcing 范式关注"exposure bias"(训练分布 vs 推理分布差异),SGF 关注"梯度通道缺失"(未来损失无法反灌历史 KV)——两件事层次不同。
  • 反方 / 局限(flyP E2 精读 §B §E):vs Wan2.2 native 长视频外推 head-to-head 数字未给;缺训练 GPU 总小时数;缺 VBench 数字;Pass 1/Pass 2 恢复保真度"decoded pairs visually nearly indistinguishable"是定性陈述而非定量(MSE 在 4 档 exit step 均可恢复是 latent space 内的,非像素空间 PSNR/SSIM);14B fake score 在 8 卡上显存优化靠 gradient_checkpointing + mixed_precision 的组合,没给单卡显存峰值。
  • 作者机构提示:Joy Future Academy, JD(京东未来学院)+ 联系邮箱 Tsinghua——这是 v31 §6.5 行业平台化升级中"京东 Joy Future Academy 立标级"的标志性事件,与 JD Oxygen AIIC V1(arXiv:2606.28070)形成京东内部"工业级 VLM + 长视频外推"两条对位路线。

2.2 ABot-World-0(arXiv:2607.19191)——单桌面 GPU 无限交互世界推演

  • 一句话:HF Daily 7-23 当日新立 #1(166▲),单桌面 GPU 实时长视野世界推演 + LongForcing 因果蒸馏 + 14 项确定性质量检查 VLM 评估;累计跨日 366▲(7-23 166▲ + 7-24 200▲ 续立),是 2026-Q3 多模态主题"端侧化世界模型"立标(来源:flyP 7-23 multimodal-e1prep §1 + 7-24 multimodal-e1prep 续立 + v31 §2.39.68 立标新增;paper_cards/520-2607-19191.md)。
  • 与其他工作的关系:与 LingBot-World 2.0 + ABot-AgentOS + ABot-N1 + Jim Fan Robotics Endgame「VLA 已死 · 世界动作模型接棒」(Sequoia AI Ascent 2026 / Eventual.AI 转载)同属"世界动作模型 / World-Action Model"主线。关键差异:ABot-World-0 走"桌面级 GPU + 因果蒸馏 + 实时推演"路线,对比 LingBot-World 2.0 走"云端 MoE + 大规模预训练"路线;两者形成"端侧化 vs 云端化"二联。ABot-World-0 立"端侧化世界模型"维度 = 2026-Q3 多模态主题"端侧化 + 因果蒸馏 + 实时性"三联立标
  • 反方 / 局限:单桌面 GPU 实时长视野世界推演的延迟 / 帧率 / 长视野长度真实数字未披露;LongForcing 因果蒸馏在 AAA 游戏 + 仿真引擎 + 互联网视频三源数据上是否引入 IP / 版权风险未核;VLM-based 评估在 14 项确定性质量检查中的权重分配是否合理未给。

2.3 SANA-Video 2.0(arXiv:2607.21553)——混合线性-Softmax 注意力 3:1 ratio

  • 一句话:5B / 14B 混合视频 DiT,统一架构;单 GPU 720p 高质量视频生成;Hybrid Linear-Softmax Attention 以 3:1 比例结合门控线性注意力(O(N) 主混合)+ 周期性门控 softmax 锚点(恢复全秩 token 交互),与纯 softmax 视频 DiT 质量相当 + 保留线性注意力长序列扩展性(来源:arXiv:2607.21553 abstract;paper_cards/574;Tom 7-25 0840 radar 候选 + Tom 7-25 0900 HF Daily 15▲)。
  • 与其他工作的关系:与 FVAttn(arXiv:2607.16190,Top-p + Top-k 安全备份)+ Self Gradient Forcing + FlashRT + v25 Linear Attention 4 同属"推理效率 + 视频生成 family + 注意力机制"主线——SANA-Video 2.0 立"混合线性-Softmax 注意力 3:1 ratio"维度 = 2026-Q3 视频生成 family "Hybrid Linear Attention"立标候选(与 FVAttn 互补:FVAttn = 自适应 Top-p 路由 + Top-k 安全备份(运行时);SANA-Video 2.0 = Hybrid Linear-Softmax 周期性 softmax 锚点(架构))。与 v25 SANA-Video 1.0 的关系:v25 是基础;v32 是混合注意力升级版——两件工作版本关系清楚。
  • 反方 / 风险:票数 15▲ 信号中;"3:1 ratio"理论依据 vs 1:1 / 1:3 / 5:1 的 ablation 未给;"单 GPU 720p"具体 GPU 型号(消费级 vs 数据中心)未切清;vs Sora 2 / Kling 2.5 / Vidu S1 / Wan2.2 head-to-head 数字未给;5B/14B 两个规格的统一架构 ablation 未给。

2.4 ReferTrack(arXiv:2607.20061)——先指代再跟踪二联范式

  • 一句话:HF Daily 7-25 当日新立 #3(44▲),具身视觉跟踪(EVT)场景下"先指代再跟踪"二联范式;仅用单个前向摄像头,先从候选框指代出目标,再跟踪——把"指代(referring)"与"跟踪(tracking)"在像素空间显式解耦,绕开抽象潜变量的监督难题(来源:arXiv:2607.20061 abstract;paper_cards/568;Tom 7-25 0900 HF Daily)。
  • 核心洞察:近期 VLA 策略统一目标识别 + 轨迹规划,但 CoT 推理作用于抽象空间潜变量,难以监督 + 与显式图像空间检测弱对齐;ReferTrack 仅用单个前向摄像头,先从候选框指代出目标,再跟踪。
  • 与其他工作的关系:与 Anchor-Align(arXiv:2607.13429,VLA 微调双损失叠加)+ OpenVLA-OFT + Robot-Centric Pointmaps(arXiv:2607.11498,视觉编码 3D 几何架构改动)+ Learning-to-Fold LeHome RL(自值函数 + RL 训练)同属"具身 VLA + 跟踪 + 感知"主线——ReferTrack 立"像素空间显式解耦指代-跟踪"维度 = 2026-Q3 "VLA 跟踪感知双联"立标(与 Anchor-Align 训练目标双栈互补)。与 Pointmaps 互补:Pointmaps = 视觉编码 3D 几何架构;ReferTrack = 像素空间指代-跟踪解耦——两件工作构成"几何感知 vs 像素感知"二联
  • 反方 / 风险:"仅用单个前向摄像头"在 RGB-D / 多视角 / 跨 embodiment 上的扩展性未给;vs SOTA 跟踪器(BoT / TransT / OSTrack / MixFormerM / EVTbench 系)head-to-head 数字未给;"指代-跟踪二联"在遮挡 / 离开视野 / 重进入场景下的鲁棒性未给;"像素空间显式解耦"对实时性影响未给。

2.5 ActiveVision(arXiv:2607.16165)——MLLM 主动观察评测

  • 一句话:HF Daily 7-24 #11 → 7-25 升 24▲(累计 42▲),3 类 17 任务评测 MLLM 主动观察;人类视觉是闭环——注视点不断被中间假设而非单一快照持续重定向,当代 MLLM 是否进行主动观察是现有视觉语言基准无法回答的经验问题(来源:arXiv:2607.16165 abstract;paper_cards/548;flyP 7-25 multimodal-e1prep §1.3 续立)。
  • 与其他工作的关系:与 Apple-π(arXiv:2607.16401,物理定律视频思维评测)+ UniVR(arXiv:2607.12800,视觉空间内统一推理)+ Visual Thoughts MCoT NeurIPS 2025 + Thinking with Video 同属多模态 CoT 推理范式主线——ActiveVision 立"任务设计 = 主动观察"维度(评测任务设计)。与 Show, Don't Tell(arXiv:2607.21072,像素生成式答案接口)形成"任务设计 vs 答案接口"二联。两件工作层次不同:前者任务,后者接口——构成"2026-Q3 多模态评测方法学 任务设计 vs 答案接口"二联。

2.6 Show, Don't Tell(arXiv:2607.21072)——像素生成式答案接口

  • 一句话:HF Daily 7-25 当日新立 #6(34▲),在生成像素中评估空间认知;现有空间推理基准要求坐标 / 选项 / 文本,给图像生成模型带来"答案接口不匹配"问题——空间任务中"位置 / 区域 / 路径"更自然通过"指向 / 标记 / 绘制"表达;Show Don't Tell 用像素生成作 answer interface(来源:arXiv:2607.21072 abstract;paper_cards/565;Tom 7-25 0900 HF Daily)。
  • 与其他工作的关系:与 ActiveVision + OCT-Bench + Apple-π + EduPanel + Trace 同属"多模态评测方法学 + 跨文化跨语境 MLLM 评估"主线——Show Don't Tell 立"答案接口设计"维度 = 2026-Q3 多模态主题 "图像生成模型空间认知评测"代表(与 ActiveVision 主动观察 + Trace 共享语义状态形成"三联评测方法学")。
  • 反方 / 风险:"像素生成式答案接口"在 vs 文本式答案接口 head-to-head 数字未给;vs SOTA MLLM 评测覆盖度未披露;"指向 / 标记 / 绘制"在 vs 文本答案接口的评测饱和风险。

2.7 视觉对比自蒸馏 Visual Contrastive Self-Distillation(arXiv:2607.21556)——自蒸馏替代对比负样本

  • 一句话:HF Daily 7-25 当日新立 #4(41▲),VLM/ViT 自蒸馏范式;核心洞察:对比学习 + 自蒸馏结合,把多模态表征学习中的"负样本采样"问题用自蒸馏替代——跳过显式负样本,用模型自身不同视图作 teacher-student 蒸馏目标(来源:arXiv:2607.21556;Tom 7-25 0900 HF Daily;flyP 7-25 multimodal-e1prep §1.1 增量 2)。
  • 与其他工作的关系:与 Anchor-Align(VLA 表征锚定)+ DINOv2 / SigLIP + SpectraReward(训练范式转折)+ BYOL / DINO / MAE 同根——视觉对比自蒸馏立"自蒸馏替代对比负样本"维度 = 2026-Q3 多模态主题 "VLM 训练自蒸馏"旁证;与 Anchor-Align 训练目标双栈互补:Anchor-Align = 损失函数创新;视觉对比自蒸馏 = 训练范式创新——两件工作构成"2026-Q3 VLM 训练方法论 损失函数 vs 训练范式"二联
  • 反方 / 风险:票数 41▲ 信号中-强;主分类待 LLM 确认(可能在 multimodal / agent / engineering 之间);"自蒸馏 + 对比"在 vs BYOL / DINOv2 / MAE 的 head-to-head 数字未给;"跳过显式负样本"在大规模数据上的稳定性未给。

2.8 Self-Supervised Structured Dynamics from Videos(arXiv:2607.21576)——frozen 特征 → 运动分解

  • 一句话:HF Daily 7-25 当日新立(14▲,主分类标为 position——立场论文),从预训练 ViT 冻结特征中恢复"相机运动 vs 物体运动"分解表征;研究问题:是否能从 frozen 特征中恢复结构化运动表征 = "不依赖光流 / SfM 自监督"的运动分解(来源:arXiv:2607.21576 abstract;paper_cards/573;Tom 7-24 2040 radar #7 + Tom 7-25 0840 radar 候选)。
  • 与其他工作的关系:与 DROID-SLAM(SLAM 系统)+ DeAOT(视频分割)+ Cotracker(点跟踪)+ PointOdyssey 同属"视频结构化表征 + 运动分解"主线——Structured Dynamics 立"frozen 特征 → 运动分解"维度 = 2026-Q3 多模态主题 "视频结构化表征"代表;与 Self Gradient Forcing 形成"静态结构 - 长时序动态"二联。注意 paper_cards 主分类标为 position(立场论文而非方法论文)——需核 PDF 才能确认是否真提供完整方法与实验。
  • 反方 / 风险:position 形态 + 票数 14▲ 较弱(P3 旁证级别);frozen 特征解构的"具体方法 + 实验"是否真在 position paper 中给出未核;vs DROID-SLAM / Cotracker / DeAOT head-to-head 未给。

2.9 Color Pass-Through(arXiv:2607.12746)——相机-显示器耦合色彩直通

  • 一句话:HF Daily 7-25 当日新立(17▲),相机-显示器耦合 pipeline;核心洞察:真实场景经相机捕获 + 显示器显示后,显示图像与原场景在色彩 / 亮度 / 对比度上常有显著差异——多数 pipeline 将高维捕获-显示过程拆分为两个独立校准阶段 + 低维色彩变换相连,导致信息瓶颈 + 不可避免的误差累积(来源:arXiv:2607.12746 abstract;paper_cards/571;Tom 7-25 0900 HF Daily)。
  • 与其他工作的关系:与 HDR ISP / Real-ESRGAN / SD3 同属"成像 pipeline + 色彩再现"主线——Color Pass-Through 立"相机-显示器耦合 pipeline"维度 = 2026-Q3 多模态主题 "端到端成像"代表;与 Real-ESRGAN 形成"显示端 vs 推理端"二联:Real-ESRGAN 关注推理端超分;Color Pass-Through 关注显示端色彩直通——两件工作形成"端到端成像推理端-显示端"二联
  • 反方 / 风险:票数 17▲ 弱;vs 传统 ISP pipeline head-to-head 数字未给;"相机-显示器耦合"对单设备 / 跨设备的影响未给;商用许可 + 端侧部署门槛未披露。

2.10 行业平台化升级 5 件(Gemini 3.5 Flash Cyber + HF Inkling + Anthropic Agentic misalignment + Claude 3000+ 价值观 + Andrew Ng OpenWorker)

  • DeepMind Gemini 3.5 Flash Cyber(stephen 7-25 0910 · @GoogleDeepMind · 7/23):Chrome/Android 自测发现标准模型漏掉的漏洞;先限政府与可信伙伴 pilot。v32 §6 "Gemini 多模态安全" 升级候选;与 v31 §6 Gemini 3.5 Pro 三度延期形成"Gemini 全系产品节奏"完整闭环(3.5 Pro 旗舰延期 + 3.5 Flash-Lite / 3.6 Flash 滚动 + 3.5 Flash Cyber 安全专项)。
  • HF × Thinking Machines 上架 Inkling 开权重三模态(stephen 7-25 0910 · @huggingface · 7/15):文本 / 图像 / 音频三模态,可在 Tinker 微调 + Inkling Playground 试玩。v32 §6 "HF 三模态开权重" 升级候选;与 v31 §6 OpenAI GPT-5.6 Sol + Terra/Luna + GPT-Live + GPT Image 2 + Anthropic Memory 多模态化形成"2026-Q3 多模态产品栈完整对照"。
  • Anthropic 新研究:Agentic misalignment in Summer 2026(stephen 7-25 0910 · @AnthropicAI · 7/15):继"勒索实验"一年后,模拟发现自主 AI agent 还有 4 种新的失准行为。v32 §6 "Anthropic Agent 失准升级" 升级候选;与 v31 §6 OWASP Top 10 AI/Agent + v31 §6 HF 7-16 安全 + v31 §6 SeerGuard 形成"AI Agent 安全四联"。
  • Anthropic 新研究:Claude 表达 3000+ 价值观,跨模型/语言聚类后识别 4 条主轴(Deference / Warmth 等)(stephen 7-25 0910 · @AnthropicAI · 7/14)。v32 §6 "Anthropic 价值观聚类" 升级候选;与 v31 §6 Anthropic Global Workspace Theory 形式化 + Anthropic Memory 多模态化形成"2026-Q3 Anthropic 主动立标"完整三联。
  • Andrew Ng 开源 OpenWorker:桌面 AI coworker,BYOK 接 GPT-5.6 / Claude Fable / Gemini 3.6 / Kimi / GLM / DeepSeek / Inkling / Ollama(stephen 7-25 0910 · @AndrewYNg · 7/24)。v32 §6 "OpenWorker 桌面 AI coworker + BYOK" 升级候选;与 v31 §6 OpenAI 多模态栈三件套 + Anthropic Memory 多模态化 + HF Inkling 三模态形成"2026-Q3 多模态应用栈完整对照"。

旁证 4 件行业平台化升级候选(不在 5 件主清单内但需标记):

  • LeCun:AI 最大风险是少数厂商对专有助手的权力集中,唯一解药是开源基础模型(@ylecun · 7/9);同期评论「G in AGI is nonsense」。v32 §6 "LeCun 开源基础模型风险论" 升级候选;与 Jim Fan Robotics Endgame + Anthropic Global Workspace Theory + Karpathy Loop Era + Sam Altman AI 净就业形成"2026-Q3 立场分化五连"。
  • DeepMind 发文「AI for Science」:AI agent 已能批量提出假设与设计实验,真正的瓶颈是真实世界验证;提出面向资助者/政策方的 4 项优先(@GoogleDeepMind · 7/15)。v32 §6 "AI for Science" 升级候选。
  • Altman:GPT-5.6 Sol 周内增长 5.6×,推理团队"英雄式"扛住需求;Codex/ChatGPT Work 用量周增 2.5×;Sol 在多项任务上价格是 Claude Fable 的 1/4(@sama · 7/14)。v32 §6 "GPT-5.6 Sol 5.6× + Codex 2.5×" 升级候选。
  • Mollick:GPT-5.6 Sol 在 Codex 接管电脑的情况下用 5 小时赢得 Slay the Spire 2 每日挑战(随机种子,不可作弊)(@emollick · 7/12)。v32 §6 "GPT-5.6 Sol Slay the Spire 2" 升级候选。

2.11 横切工程升级(jay 7-24-1950 MCP CVE 集群 + FA4 Blackwell + vLLM vs TensorRT-LLM vs SGLang)

  • CVE-2026-26029 / CVE-2026-5059 / CVE-2026-30623(MCP 服务器命令注入 RCE 漏洞集群):三个新 CVE,SentinelOne / LiteLLM 披露,7 月 MCP 安全事件频发——与 v31 §6 HF 7-16 安全 + v31 §6 OWASP Top 10 AI/Agent 形成"2026-Q3 AI 平台安全三联"。
  • MCP 2026-07-28 新版规范:协议层无状态化(SecurityWeek / Akamai):协议规范化 → 7-28 是关键节点,需持续追踪。
  • FlashAttention-4 on NVIDIA Blackwell 完整性能数据(Lambda.ai 技术博客 + arXiv:2603.05451):71% 硬件利用率 / 1.6-3.2× vs Triton / 1.85-2.3× Backward——与 v31 §2.39.81 FVAttn + SANA-Video 2.0 形成"2026-Q3 推理基础设施四联"(FA4 + FlashRT + FVAttn + SANA-Video 2.0)。
  • vLLM vs TensorRT-LLM vs SGLang H100 全量 Benchmark(Spheron 独立测试 · Llama 3.3 70B FP8):TensorRT-LLM 吞吐量 +13% vs vLLM @ 50 并发 / SGLang RadixAttention 在共享前缀场景显著受益——生产决策关键

2.12 沿用但不计入本窗口 multimodal 主增量(沿用 arXiv ID)

  • arXiv:2607.01774 Subliminal Clocks(Diffusion LM 潜时间建模)—— 7-23 立 33▲ → 7-24 36▲ → 7-25 38▲(累计 74▲),v31 §2.39.73 沿用 + v32 应在 §2.39.73 段加续立标注。
  • arXiv:2607.20368 Self Gradient Forcing(京东 Joy Future Academy + 清华邮箱)—— 7-24 立 29▲ → 7-25 30▲(累计 59▲),v31 §2.39.77 立标候选最强 + v32 §2.39.77 应加续立标注。
  • arXiv:2607.16165 ActiveVision(MLLM 主动观察评测)—— 7-24 立 18▲ → 7-25 24▲(累计 42▲),v31 §2.39.78 旁证级 + v32 §2.39.78 应加续立标注。
  • arXiv:2607.17423 TimeLens2(MLLM-based 通用视频时序定位)—— 7-22 立 141▲ → 7-23 157▲(累计 298▲),v31 §2.39.49 立标最强跨日合流。
  • arXiv:2607.19191 ABot-World-0(单桌面 GPU 实时长视野世界推演)—— 7-23 立 166▲ → 7-24 200▲(累计 366▲),v31 §2.39.68 立标级 + v32 §2.39.68 应加续立标注。

3. 工程 / 研究 / 批判三视角

3.1 工程视角(可落地性)

把本窗口 12 件 multimodal 立标/旁证放到「能不能直接 clone → deploy → 微调」的尺子上:

工作 权重/规模 开源协议 复现门槛 工程价值
Self Gradient Forcing Wan2.1-1.3B + 14B Apache-2.0 Causal-Forcing 初始化 + DMD loss + exit step 配置 长视频外推训练策略突破
ABot-World-0 待披露("桌面 GPU") 待核 LongForcing 因果蒸馏 + 14 项 VLM 评估 端侧化世界模型
SANA-Video 2.0 5B / 14B 待核 Hybrid Linear-Softmax 3:1 ratio 配置 单 GPU 720p 视频生成
ReferTrack 待披露 待核 单前向摄像头 + 指代-跟踪二联 具身视觉跟踪
ActiveVision benchmark only Apache-2.0(推断) 3 类 17 任务 + MLLM 评估 MLLM 主动观察评测
Show, Don't Tell benchmark only 待核 像素生成式答案接口 + 空间任务 图像生成模型空间认知评测
TimeLens2 2B / 4B / 8B 待核 7 个时序定位基准 + MLLM-based 通用视频时序定位
Subliminal Clocks 待披露 待核 Diffusion LM 潜时间建模 时间感知生成
视觉对比自蒸馏 待披露 待核 VLM 自蒸馏范式 VLM 训练方法论
Color Pass-Through 工程 pipeline 待核 相机-显示器耦合 + 端到端校准 端到端成像
Structured Dynamics position only 待核 frozen 特征 + 运动分解(立场) 视频结构化表征
GPT-5.6 Sol 闭源 n/a API only 多模态 Agent 闭环

关键判断

  • 真能立刻拿起来用的只有 2 件 —— Self Gradient Forcing(Apache-2.0 + 完整 ckpt + Wan2.1 双模型初始化,flyP 7-24 E2 精读全程覆盖 yaml 配置)和 TimeLens2(MLLM-based 标准 transformers/accelerate 复现)。其他工作要么闭源(GPT-5.6 Sol),要么主分类 position(Structured Dynamics),要么权重未公开(视觉对比自蒸馏 / Color Pass-Through / ReferTrack)。
  • 基础设施级影响最大的是 Self Gradient Forcing + FlashAttention-4 on Blackwell + SANA-Video 2.0 三联——前者补训练策略维度,后两者补推理基础设施维度。三件工作叠加意味着 2026-Q3 视频生成 family 已经具备"训练策略 + 通用 serving + 专用稀疏 + 混合线性"完整基础设施闭环

3.2 研究视角(创新性)

按创新性维度评级(⭐ = 边际改进 / ⭐⭐ = 维度补全 / ⭐⭐⭐ = 立标级 / ⭐⭐⭐⭐ = 范式转移):

  • 范式转移级(⭐⭐⭐⭐):Self Gradient Forcing(首次显式命名"历史上下文梯度 gap",从"训练分布 vs 推理分布"提升到"梯度通道缺失",两遍训练 + bounded parallel reconstruction 设计新颖)。
  • 立标级(⭐⭐⭐):ABot-World-0(首次实现桌面级 GPU 实时长视野世界推演 + LongForcing 因果蒸馏)+ ReferTrack(像素空间显式解耦指代-跟踪二联,绕开抽象潜变量监督难题)+ SANA-Video 2.0(混合线性-Softmax 注意力 3:1 ratio 周期性 softmax 锚点恢复全秩 token 交互)+ ActiveVision(首次系统化评测 MLLM 主动观察,3 类 17 任务)。
  • 维度补全级(⭐⭐):Show, Don't Tell(答案接口范式迁移:文本 → 像素)+ 视觉对比自蒸馏(自蒸馏替代对比负样本)+ Color Pass-Through(端到端成像推理端-显示端耦合)+ Structured Dynamics(frozen 特征 → 运动分解,立场论文)。
  • 边际改进级(⭐):Trace(多领域视觉推理 RLVR taxonomy 引导环境;是 RLVR 在多模态领域的应用而非新范式)+ Subliminal Clocks(Diffusion LM 潜时间建模;是 DiT 的时间维度补全而非新架构)。

关键判断:本窗口 12 件工作中真正构成"维度补全或更高"的是 8 件(1 范式转移 + 4 立标 + 3 维度补全 + 0 边际改进)——密度显著高于 7-22 之前任何一周。立标密度高峰与 v31 §2.39 编号用尽同步(v31 已用 §2.39.39 至 §2.39.86 共 48 编号;v32 预计用 §2.39.87 至 §2.39.93 共 7 编号),意味着 v32 是"立标密度饱和期",需要 v33 起转入"立标合并 + 综述 + 反方升级"节奏。

3.3 批判视角(局限)

把本窗口 12 件工作的反方/局限集中归纳为 5 个共性问题:

  1. vs SOTA head-to-head 普遍缺位:ReferTrack vs BoT / TransT / OSTrack / MixFormerM / EVTbench 系、SANA-Video 2.0 vs Sora 2 / Kling 2.5 / Vidu S1 / Wan2.2、Self Gradient Forcing vs Wan2.2 native 长视频外推、视觉对比自蒸馏 vs BYOL / DINOv2 / MAE——4 件工作均未给 head-to-head 数字,是 2026-Q3 多模态主题"立标候选 vs SOTA"对照缺失的共同硬约束。
  2. 推理成本 / 显存 / GPU 型号普遍未披露:SANA-Video 2.0"单 GPU 720p"具体 GPU 型号未切清;Mage-Flow 原生分辨率对显存 / 推理成本影响未披露;ABot-World-0 单桌面 GPU 实时长视野世界推演的延迟 / 帧率 / 长视野长度真实数字未披露——3 件工作均未给基础设施成本数字,与 v31 §6 行业平台化升级中"京东 Joy Future Academy 立标级"形成对照(京东至少给了 14B fake score + gradient_checkpointing + mixed_precision 组合)。
  3. 数据合规 / IP 风险普遍未核:Boogu-Image dataset card PII 扫描 hard blocker 仅是个例,整个多模态生成阵营的 dataset card 透明度都需要提升;ABot-World-0 LongForcing 因果蒸馏在 AAA 游戏 + 仿真引擎 + 互联网视频三源数据上是否引入 IP / 版权风险未核;Color Pass-Through 商用许可 + 端侧部署门槛未披露——3 件工作均未给数据合规边界
  4. 评测方法学 self-benchmark risk 仍是系统性未解:ActiveVision + Show, Don't Tell + Apple-π + OCT-Bench 4 件评测工作都在回应"答案接口 / 答案设计 / 任务设计"维度,但「自家模型 + 自建基准 + 自家 MLLM-as-Judge」三位一体的循环问题尚无系统性解——KeyFrame-Compass / MultiRef-Compass / Harness-Evolution 都在局部回应,仍无统一的"评测独立性"工程标准
  5. 行业平台化升级的"数据安全 + 商业可用性"硬约束未解:Gemini 3.5 Flash Cyber 先限政府与可信伙伴 pilot + Anthropic Agentic misalignment 4 种新失准 + Claude 3000+ 价值观 4 主轴——3 件行业平台化升级工作均未给"商业产品级数据隔离 + 红队演练 + 价值观聚类对齐"完整路径;这是 v31 §6.5 行业平台化升级的共性硬约束。

4. 趋势判断

4.1 趋势判断(2026 H2,6 条)

  1. 训练策略维度独立突破成为立标新主战场:Self Gradient Forcing 把"梯度通道缺失"识别为独立问题 + bounded parallel reconstruction 设计,意味着 2026 H2 多模态主题进入"训练策略维度补全期"——继 Self Forcing / Causal-Forcing / DMD / RLHF / RLVR 之后,"梯度通道工程"成为第 6 类训练范式候选。预计 Q4 会有 2-3 件"梯度通道工程"立标涌现(围绕 Long-Context / Diffusion / Self-Correction 三轴)。
  2. 推理基础设施三角补全完整:SGF(训练时)+ FlashRT(通用 serving)+ FVAttn(专用稀疏)+ SANA-Video 2.0(混合线性)+ FA4 Blackwell(硬件利用率)= 2026-Q3 视频生成 family 推理基础设施五联。预计 2026-Q4 三联会进一步收敛到 1-2 个"标准 reference implementation"(类似 vLLM vs TensorRT-LLM vs SGLang 的对照),形成"训练侧 + 推理侧"完整基础设施闭环。
  3. 评测答案接口范式迁移(文本 → 像素)正式起步:Show, Don't Tell 用像素生成作 answer interface 是 2026 H2 多模态评测方法学的第一个答案接口范式迁移信号。预计 2026-Q4 会有 2-3 件"答案接口范式迁移"工作涌现(围绕 3D Point Cloud / Voxel / NeRF / Gaussian Splatting 四种新答案接口候选),形成"二十八元立体 → 三十元立体"扩展。
  4. 行业平台化升级全面展开(中俄西多极 + Anthropic 主动立标):Gemini 3.5 Flash Cyber 政府 pilot + HF Inkling 三模态 + Anthropic Memory 多模态化 + Anthropic Agentic misalignment 4 种新失准 + Claude 3000+ 价值观 4 主轴 + Andrew Ng OpenWorker BYOK = 2026-Q3 多模态产品栈完整对照。预计 2026-Q4 会出现"AI Agent 安全三件套"(政府 pilot + 主动立标 + 价值观聚类)行业标准候选。
  5. 安全与协议成为 AI 平台基础设施硬约束:HF 7-16 安全事件完整复盘升 §3.1 反方共识级 + OWASP Top 10 AI/Agent + MCP CVE-2026-26029/5059/30623 集群 + MCP 2026-07-28 新版协议规范无状态化 = 2026-Q3 AI 平台安全三联。预计 2026-Q4 会出现 1-2 件"协议层无状态化"标准候选(围绕 MCP / A2A / ANP 三轴)。
  6. 具身基础模型路线分化(端侧化 vs 云端化)二联:ABot-World-0(桌面级 GPU 实时长视野世界推演)+ LingBot-World 2.0(云端 MoE 大规模预训练)= 2026-Q3 端侧化 vs 云端化二联。预计 2026-Q4 会出现 1-2 件"端侧化世界模型"评测套件(参考 RxBrain-Bench + ABot-N1 + Vesta + BAD-WAM 同族信号),形成"世界-Action 模型"评测完整闭环。

4.2 开放问题(5 条)

  1. 训练策略维度的工程标准:Self Gradient Forcing 的 Pass 1 / Pass 2 恢复保真度是 latent space MSE 在 4 档 exit step 上的定性陈述("decoded pairs visually nearly indistinguishable"),不是像素空间 PSNR/SSIM/LPIPS 定量——"梯度通道工程"立标候选如何给"训练策略维度"的工程标准?
  2. 混合线性-Softmax 注意力的 3:1 ratio 理论依据:SANA-Video 2.0 的 3:1 ratio 没有 vs 1:1 / 1:3 / 5:1 的 ablation,理论依据缺失——这意味着混合线性注意力作为 2026-Q3 视频生成 family 立标候选,数学基础尚未稳固
  3. 评测答案接口范式迁移的评测饱和风险:Show, Don't Tell 用像素生成作 answer interface,"指向 / 标记 / 绘制"在 vs 文本答案接口的评测饱和风险未给——答案接口范式迁移会不会重蹈"text-to-image 评测饱和"的覆辙?
  4. 具身基础模型的世界-Action 模型评测套件:参考 RxBrain-Bench + ABot-N1 + Vesta + BAD-WAM 等同族信号,「世界-Action 模型」评测套件可能在 2026-Q4 出现——但评测套件的设计维度(视频质量 / 长视野一致性 / 物理因果 / 交互响应 / 鲁棒性)尚未稳定,需要 v32/v33 立标密度饱和期后的"立标合并 + 综述"节奏给出。
  5. 多模态 self-benchmark risk 的系统性缓解:KeyFrame-Compass / MultiRef-Compass / Harness-Evolution 都在局部回应,「自家模型 + 自建基准 + 自家 MLLM-as-Judge」三位一体的循环问题尚无系统性解——2026-Q4 独立评测机构(HF Leaderboard v3 / LMSys Arena v2)以「统一性 operational definition」形式部分回应能否成功?

5. 引用合规与边界

  • 综合论文清单(arXiv 号列表,本窗口 multimodal 主/副 12 件 + 行业 5 件无 arXiv + 横切 1 件 + 续立 5 件 = 23 件)
    • 立标 / 立标候选(4 件):arXiv:2607.20368 Self Gradient Forcing(v31 立标候选最强,本窗口续立)+ arXiv:2607.19191 ABot-World-0(v31 立标级,跨日合流 366▲)+ arXiv:2607.21553 SANA-Video 2.0(v32 立标候选新增)+ arXiv:2607.20061 ReferTrack(v32 立标新增)。
    • 旁证级 / 旁证(4 件):arXiv:2607.16165 ActiveVision(v31 旁证级,本窗口续立)+ arXiv:2607.21072 Show, Don't Tell(v32 旁证级新增)+ arXiv:2607.21556 视觉对比自蒸馏(v32 旁证新增)+ arXiv:2607.17423 TimeLens2(v31 立标最强跨日合流,2026-Q3 视频时序定位 8B vs 397B 反 scaling 信号)。
    • P3 待观察 / 旁证(2 件):arXiv:2607.21576 Self-Supervised Structured Dynamics(v32 P3 旁证待观察,position 形态)+ arXiv:2607.12746 Color Pass-Through(v32 旁证新增)。
    • 沿用(5 件):arXiv:2607.01774 Subliminal Clocks + arXiv:2607.14935 VideoChat3 + arXiv:2607.13125 Boogu-Image-0.1 + arXiv:2607.19011 Computational Humor 综述 + arXiv:2607.12800 UniVR + arXiv:2607.16609 OCT-Bench + arXiv:2607.16401 Apple-π + arXiv:2607.18217 HOMIE + arXiv:2607.11498 Robot-Centric Pointmaps + arXiv:2607.17423 TimeLens2 + arXiv:2607.19790 Trace + arXiv:2607.16190 FVAttn + arXiv:2607.13429 Anchor-Align + arXiv:2607.19064 Mage-Flow + arXiv:2607.19139 文本模板 Token + arXiv:2607.18703 实时速度生成式世界渲染器 + arXiv:2607.18367 AlayaWorld + arXiv:2607.18227 FlowMimic + arXiv:2607.17675 ShotPlan + arXiv:2607.20092 ENTRAP-VL + arXiv:2607.15550 SeerGuard + arXiv:2607.18217 HOMIE。
    • 横切工程(1 件):arXiv:2603.05451 FlashAttention-4 on NVIDIA Blackwell。
  • 行业平台化升级(5 件,均来自 X / 官方 blog / CVE / 协议规范,无 arXiv 号):DeepMind Gemini 3.5 Flash Cyber + HF Inkling 三模态开权重 + Anthropic Agentic misalignment 4 种新失准 + Anthropic Claude 3000+ 价值观 4 主轴 + Andrew Ng OpenWorker BYOK + LeCun 开源基础模型风险论 + DeepMind AI for Science 4 优先 + Altman GPT-5.6 Sol 5.6× + Mollick GPT-5.6 Sol 5 小时赢 Slay the Spire 2 + MCP CVE-2026-26029/5059/30623 集群 + MCP 2026-07-28 新版协议规范。
  • 历史锚点(沿用 7-20 multimodal.md,不重复计数):arXiv:2204.14198 Flamingo + arXiv:2403.05530 Gemini 1.5 + arXiv:2505.16933 LLaDA-V + arXiv:2605.12500 SenseNova-U1。
  • 未做 head-to-head 数字核对:ReferTrack vs BoT / TransT / OSTrack / MixFormerM / EVTbench 系 + SANA-Video 2.0 vs Sora 2 / Kling 2.5 / Vidu S1 / Wan2.2 + Self Gradient Forcing vs Wan2.2 native 长视频外推 + 视觉对比自蒸馏 vs BYOL / DINOv2 / MAE——4 件工作均未给 head-to-head 数字,是 2026-Q3 多模态主题"立标候选 vs SOTA"对照缺失的共同硬约束。
  • 本文未做的事:不重写 v31 multimodal.md 活文档(那是今晚活文档接手时的事,本稿仅做主题深度综述);不下「v32 立标」终局判断;不引用任何闭源、未公开、未授权材料;不输出密钥。

本稿仅做主题深度综述,所有数据 / 事实 / 出处均可回到上述 arXiv abstract、HF Daily 票榜、HF 模型卡、HF papers 页、inbox/flyp 精读、inbox/jay 横切工程笔记、inbox/stephen 协调棒、v31 multimodal.md 锚定文件追溯;数字「未披露」一律明示。