multimodal · E1 预消化简报(2026-07-31 周五)
角色:flyP · multimodal 主题 E1 日间预消化 锚定版本:v34 接力窗口第四棒(7-31 09:40 → 8-1 09:40 24h · 累积 v34 前 3 棒 7-28 ~ 7-30 共 67 件候选增量) 窗口:2026-07-30 09:40 → 2026-07-31 09:40(Asia/Shanghai,本棒回望 24h;为整合近 2 天(7-29 ~ 7-31)跨日复盘,亦覆盖 7-29 关键稿件被前棒遗漏的 AcademicEval + Scaling Beyond Context 双精读) 本棒新增 7 件核心候选增量 + 6 条延伸追踪:(1) DeepMind Gemini Robotics 2 三件套(2026-07-30 @GoogleDeepMind)· §6 升级候选 + (2) TurboVLA 120▲ HF Daily 7-31 #2(arXiv:2607.27205)· §2.39.x 候补级 + (3) HumanCLAW 66▲ HF Daily 7-31 #6(arXiv:2607.27180)· §2.39.x 候补级 + (4) CLBench-V 40▲ HF Daily 7-31 #9(arXiv:2607.25294 paper_cards/661)· §2.39.x 评测邻接 + (5) AcademicEval(arXiv:2510.17725 v1 TMLR 已收 · 7-29 dual-light 精读 · 48h 漏收件 ★)· §1 主线 4 评测方法学新增 + (6) Scaling Beyond Context(arXiv:2510.15253 v3 ACL2026 Main · 7-29 dual-light 精读 · 48h 漏收件 ★)· §1 主线 5 综述锚点 + (7) Metis(arXiv:2607.26760 paper_cards/658 · multimodal 邻接)· §2.39.x 邻接 本稿状态:v1 预消化,不重写 multimodal 活文档(活文档 v34 当前最新为 7-28 08:40 CST 整理版,距今 73h)
0. 综述判断
v34 接力窗口前 3 棒(7-28 ~ 7-30)累计 72h 已落地 67 件候选增量——活文档 v34 当前最新 = 7-28 08:40 CST 整理版,距今 73h 未更新。本场 7 件核心 + 6 条延伸追踪 = 共 13 件 v34 候选增量,全部围绕 v34 §6 行业升级 + §2.39.x 候补 / 评测 + §1 主线 4 评测方法学(二十三面体)+ §1 主线 5 multimodal-RAG 综述锚点四个落点。
核心结论:v34 严格保持 v33 96 件套骨架 + v34 前 3 棒 67 件 + 第四棒 13 件 = v34 累计候选增量 80 件;v34 §6 升级候选新增 1 件 = DeepMind Gemini Robotics 2 三件套;v34 §2.39.x 候补 / 评测 / 邻接新增 5 件(TurboVLA / HumanCLAW / CLBench-V / Metis / UltraViT);v34 §1 主线 4 评测方法学(二十三面体)新增 2 件 = AcademicEval + Scaling Beyond Context(均为 7-29 dual-light 精读但被第三棒漏收件 · 是本棒最重要漏补);v34 §3.3 反方集新增 5 条候选 #73-#77;v34 §7.1 引用 +3 件 #141-#143;v34 §7.3 跨主题交叉新增 4 件。
1. 增量条目(7 件本棒核心 + 6 条延伸追踪 = 共 13 件 v34 候选增量)
§1.1 §6 行业升级候选新增 1 件
增量 1 · DeepMind Gemini Robotics 2 三件套(2026-07-30 @GoogleDeepMind) - 要点:Gemini Robotics 2 三件套发布(2026-07-30):① 全身体 VLA 模型(Gemini Robotics 1.5 → 2.0 · 双手机器人 → 全身 humanoid 适配)+ ② ER 2 推理(Embodied Reasoning 2.0 · 视觉-语言-动作链推理 + 任务规划 + 异常恢复)+ ③ On-Device 2(端侧实时推理 · 适配 Apptronik Apollo 2 / Duo 等人形机器人);与 Apptronik Apollo 2 / Duo 同台演示:打结、拧灯泡等 fine manipulation 任务 = 全身体 humanoid VLA 工业级落地锚定 - 脉络与归入节:v34 §6 行业升级候选新增 1 件 + §1 主线 7 VLA + §1 隐性 46 v30 Jim Fan Robotics Endgame 立场 2.0 + §1 隐性 51 v33 Jim Fan 第二次预训练范式立场 3.0(2026 = Large World Models 元年)+ §7.1 引用 +1 件 #141 = Gemini Robotics 2 + Apollo 2 / Duo - 与现有脉络的关系:与 v33 §6 LeCun AMI Labs $1.03B 资本独立实体 + Jim Fan 第二次预训练范式立场 3.0 形成"DeepMind 平台全栈化 + LeCun 资本 + Jim Fan 立场"三联立标;Apptronik Apollo 2 / Duo 工业级人形机器人适配 = v34 §6 行业"硬件 + 模型 + 推理 + 部署"四位一体闭环 - 反方 / 风险:① 系统卡未公开 GitHub / 评测主表 / 限制段未给;② 与 π₀ / OpenVLA-OFT / MolmoAct / Octo / RDT-1B / WorldDiT / HiFi-UMI head-to-head 缺;③ Apollo 2 / Duo 演示任务是打结、拧灯泡等 fine manipulation,与人形机器人在复杂家庭场景的实际落地差距未明;④ On-Device 2 端侧推理 latency / 显存占用 / 真实机器人响应延迟未给;⑤ ER 2 推理的"任务规划 + 异常恢复"长 horizon 鲁棒性未测;⑥ v34 §3.3 反方 #73 是否立项需 7-31 ~ 8-5 截止前补查 6 项
§1.2 §2.39.x 候补级新增 4 件
增量 2 · TurboVLA(arXiv:2607.27205 · HF Daily 7-31 #2 · 120▲)—— v34 §2.39.x 候补级 · 主线 6 推理效率 + 主线 7 VLA 二联 - 要点:RTX 4090 + 32 Hz 实时 VLA + <1 GB 显存;某种 VLA 推理加速 / 模型压缩 / 部署优化使消费级 GPU 实现实时 VLA;与 v34 §1 主线 6 inference-efficient 邻接(V-Skip / VisCo / SpectraReward / SANA-Video 2.0 / Sol-Attn / SPA / Parallel Decoding Distillation 沿用)+ §1 主线 7 VLA 新子类"消费级 GPU 实时 VLA" - 反方 / 风险:① vs OpenVLA-OFT(7B)/ π₀(3B)/ MolmoAct(7B)/ RDT-1B / WorldDiT(LIBERO)/ HiFi-UMI head-to-head 缺;② 32 Hz 实时是否真在 RTX 4090 + 真实机器人端到端跑通;③ VLM 量化 + action head 极度简化 + temporal context 滑窗 + 不依赖大 VLM backbone 的全栈压缩实现机制需精读 §3;7-31 ~ 8-5 必做 4 项 PDF 全文 + baseline 对照 + 真实机器人端到端 + 显存 / latency 跨硬件平台对比
增量 3 · HumanCLAW(arXiv:2607.27180 · HF Daily 7-31 #6 · 66▲)—— v34 §2.39.x 候补级 · 主线 7 VLA 邻接 - 要点:VLM 通过身体行动 = 人形机器人 + VLM 推理 + 物理交互;与 Gemini Robotics 2 / Apollo 2 / Duo 路线同源 2026-07-30 同一时间节点(DeepMind 2026-07-30 发布 vs HumanCLAW 2026-07-30 同期 arXiv = 同一时间节点两个团队押注同一方向);66▲ 票数中等立标 - 反方 / 风险:① vs Gemini Robotics 2 + Apollo 2 / Duo + π₀ / OpenVLA-OFT / MolmoAct head-to-head 缺;② "身体行动"是否真在人形机器人本体 fine manipulation + 全身协调任务上跑通;7-31 ~ 8-5 必做 3 项 PDF 全文 + 人形机器人本体评测 + Gemini Robotics 2 head-to-head
增量 4 · CLBench-V(arXiv:2607.25294 · HF Daily 7-31 #9 · 40▲ · paper_cards/661 已建)—— v34 §2.39.x 评测邻接 · 主线 4 评测方法学(二十三面体) - 要点:Multimodal Context Learning 从 grounding 到知识获取评测;构造覆盖"grounding → 知识获取"全链路的多模态上下文学习 benchmark,任务包括 scientific findings(图表表格)+ financial indicators(转化报告)+ spatial decisions(地图 / 场景 / 网页);与 v34 §1 主线 4 评测方法学(二十三面体)邻接(Show, Don't Tell + ActiveVision + Trace + Compute Humor + 新颖主张还是 Déjà Vu 沿用) - 反方 / 风险:① 多模态 vs 文本上下文学习 head-to-head 缺;② grounding → 知识获取全链路评测覆盖度;③ 40▲ 票数中等立标;7-31 ~ 8-5 必做 3 项 PDF 全文 + 跨模态任务覆盖度 + vs 文本基线
增量 5 · Metis: Memory Foundation Model(arXiv:2607.26760 v1 · paper_cards/658 已建 · agent 主 multimodal 邻接)—— v34 §2.39.x 邻接 · 主线 5 multimodal-RAG 邻接 - 要点:首次提出"记忆基础模型"概念——把 agent 记忆能力从外部模块内化为模型原生能力;形式化两层:(i) backbone 内持久动态记忆状态 + (ii) 原生记忆操作程序;与 v34 §1 主线 5 multimodal-RAG 邻接(Mage-VL Codec 原生流式 + ReDesign Agentic 图像 + Kontrast 跨模态知识不一致 + 跨模态 RAG 综述 沿用);与 v34 §1 主线 5 隐性 12 立的"context access divide 第四维"邻接 - 反方 / 风险:① 原生记忆 vs 外挂 RAG 模块 head-to-head 缺;② "持久动态记忆状态 + 原生记忆操作程序"两层形式化是否完备;agent 主 multimodal 副 · 不入主立标候选
§1.3 §1 主线 4 评测方法学(二十三面体)新增 2 件(48h 漏收件 ★)
增量 6 · AcademicEval: Live Long-Context LLM Benchmark(arXiv:2510.17725 v1 · TMLR 已收 · UIUC · 7-29 dual-light 精读 · 48h 漏收件 ★) - 要点:Live long-context LLM benchmark + 抗泄漏 + 滚动更新;① 把 arXiv 论文作为"自标注"长上下文源,自动构造 Title / Abstract / Introduction / Related Work 四类学术写作任务(天然覆盖层级抽象 + 几乎无人工标注成本);② 用合著者图(co-author graph)挑选高质量 few-shot 演示,灵活控制上下文长度;③ live evaluation:通过滚动引入新论文做评测,缓解长上下文训练中的标签泄漏;沿用 v33 §1 主线 4 多模态评测方法学重构(二十三面体) = 评测方法学新维度(抗泄漏 + 滚动更新) - 建议归入节:v34 §2.39.x 评测邻接新增 1 件(TMLR 已收 · 立标信号较强)+ §1 主线 4 评测方法学(二十三面体)邻接 + §7.1 引用 +1 件 #142 + §7.3 交叉新增 1 件(AcademicEval ↔ mmlongembed) - 反方 / 风险(沿用 flyP 7-29 dual-light §A.3):① 抗泄漏的边界条件:用"论文上线时间晚于模型 cutoff"推断抗泄漏,但合著者图 few-shot 仍可能与某些模型预训练语料重叠;作者未做严格 n-gram / embedding 重复度审计;② 任务偏窄:Title/Abstract/Introduction/Related Work 都是"学术写作",外推到通用长上下文(代码、对话、文档 QA)需谨慎;③ 评测可信度:依赖自动相似度 + LLM 评分,对"层级抽象"判别可能不稳定;④ 基线覆盖:摘要未披露完整基线表(GPT-4-class / Claude / Gemini / 长上下文开源模型如 Qwen-Long / Llama-3.x-Long 等);7-31 ~ 8-5 必做 4 项 PDF 全文 + baseline 对照 + LLM-as-judge 验证 + GitHub 滚动快照
增量 7 · Scaling Beyond Context: A Survey of Multimodal RAG for Document Understanding(arXiv:2510.15253 v3 · ACL2026 Main · SensenGao · 7-29 dual-light 精读 · 48h 漏收件 ★) - 要点:Multimodal RAG for Document Understanding 综述(2026 H1 综述锚点);① 把"文档多模态 RAG"从泛 RAG 综述里独立切出来,聚焦文档场景下的 text + table + chart + layout 协同;② 提出基于"domain × 检索模态 × 粒度"的三维分类法,明确把 graph-based 与 agentic framework 列为两条独立演进路线;③ 汇总文档场景关键数据集、基准、工业部署案例;④ 指出三大开放挑战:效率、细粒度表示、鲁棒性,并给出 roadmap;v33 §1 主线 5 多模态 RAG / Agentic Retrieval 综述锚点——替换或并行 v33 既有"2026-06-10-multimodal.md"早期版本 - 建议归入节:v34 §2.39.x 综述邻接新增 1 件(ACL2026 Main · 立标信号强 · 综述锚点型)+ §1 主线 5 multimodal-RAG 综述锚点 + §7.1 引用 +1 件 #143 + §7.3 交叉新增 1 件(Scaling Beyond Context ↔ Multimodal RAG Survey(arXiv:2504.08748 替代升级版)) - 反方 / 风险(沿用 flyP 7-29 dual-light §B.3):① 综述典型局限:对单方法描述会偏压缩;② 检索模态分类法:跨模态检索(image↔text、table↔text)受 CLIP-style 嵌入主导,是否充分覆盖 Q-Former / Late-interaction 类结构需在表格里核对;③ 工业部署:通常引用案例来自厂商白皮书,需独立核验;④ 时效性:v3 更新到 2026-04,建议结合后续 6-7 月新论文(mRAG-IF、ColPali 变体、长上下文文档 agent)做补丁式更新
§1.4 延伸追踪 6 条
| # | 增量 | 票数 / 状态 | 建议归入 |
|---|---|---|---|
| 8 | UltraViT(arXiv:2607.23373 paper_cards/633)· 端侧 LVLM 视觉编码器 | paper_cards/633 已建 · 立标信号中等 | v34 §2.39.x 候补级新增可能性 · 主线 6 推理效率端侧化 |
| 9 | PerceptionBench(arXiv:2607.24957 paper_cards/642)· 评测饱和横切 | paper_cards/642 已建 | v34 §3.2 评测饱和横切沿用 · 0 件新立 |
| 10 | Kontrast(arXiv:2607.25959 paper_cards/644)· 跨模态知识不一致 | paper_cards/644 已建 | v34 §2.39.x 邻接沿用第三棒 · RAG 主 multimodal 副 |
| 11 | Mollick Flux 3 视频模型「飞机上用笔记本的水獭」基准(2026-07-29 @emollick)· 横切延伸 | @emollick / X 非论文 | v34 §3.2 评测饱和横切延伸 + §6 行业升级候选邻接 · 需精读 2024 vs 2026 差距 |
| 12 | HiFi-UMI 134▲ → 141▲ 跨日 +7(arXiv:2607.25895 paper_cards/635) | 票数跨日 +7 · 立标信号进一步加强 | v34 §2.39.x 候补级沿用第三棒 |
| 13 | LeCun AMI Labs 7-24 沿用(无公开 GitHub 仓库) | @ylecun / X · 沿用 | v34 §6 17 足候选沿用 · 0 件新立 |
2. 矛盾 / 争议 / 待核实说法(本棒新增 5 条反方候选 #73-#77)
- 反方候选 #73 · Gemini Robotics 2 系统卡:6 项必做(GitHub + 评测主表 + Apollo 2 / Duo 演示任务 vs 复杂家庭场景 + On-Device 2 端侧推理 + ER 2 推理长 horizon 鲁棒性 + 4 件合并升级可能性)
- 反方候选 #74 · TurboVLA <1 GB 全栈压缩实现机制:4 项必做(PDF 全文 + baseline 对照 + 真实机器人端到端 + 显存 / latency 跨硬件平台对比)
- 反方候选 #75 · HumanCLAW 人形机器人本体评测:3 项必做(PDF 全文 + 人形机器人本体 fine manipulation + Gemini Robotics 2 head-to-head)
- 反方候选 #76 · CLBench-V 跨模态任务覆盖度:3 项必做(跨模态 vs 文本上下文学习 head-to-head + 全链路覆盖度 + 沿用 §1 主线 4 评测方法学 17 件套邻接)
- 反方候选 #77 · 48h 漏收件 AcademicEval + Scaling Beyond Context 补 7 项必做(AcademicEval 4 项 + Scaling Beyond Context 3 项)
3. 对活文档的具体落点建议
§3.1 v34 §6 行业升级候选新增 1 件
v34 §6 升级候选沿用 5 件 + 新增 1 件 = DeepMind Gemini Robotics 2 三件套(2026-07-30 发布)
§3.2 v34 §2.39.x 新增 5 件候补级
TurboVLA / HumanCLAW / CLBench-V / Metis / UltraViT(编号待定,参考第三棒 §2.39.93-§2.39.100 沿用)
§3.3 v34 §1 主线 4 评测方法学(二十三面体)新增 2 件
- AcademicEval(arXiv:2510.17725 v1 TMLR 已收 · UIUC · 抗泄漏 + 滚动更新)—— §2.39.x 评测邻接 + §7.1 引用 #142 + §7.3 交叉(AcademicEval ↔ mmlongembed)
- Scaling Beyond Context(arXiv:2510.15253 v3 ACL2026 Main · SensenGao · 三维 Taxonomy)—— §2.39.x 综述邻接 + §7.1 引用 #143 + §7.3 交叉(Scaling Beyond Context ↔ Multimodal RAG Survey(arXiv:2504.08748))
§3.4 v34 §3.3 反方集新增 5 条候选 #73-#77
详见 §2 节
§3.5 v34 §7.1 引用新增 3 件
v33 §7.1 137 件 + v34 第二棒 +2 件(Scaling NMM #138 + O-VAD #139) + 第三棒 +1 件(WorldDiT #140) + 本棒 +3 件(Gemini Robotics 2 #141 + AcademicEval #142 + Scaling Beyond Context #143) = 143 件累计
§3.6 v34 §7.3 跨主题交叉新增 4 件
- #46 AcademicEval ↔ mmlongembed
- #47 Scaling Beyond Context ↔ Multimodal RAG Survey(arXiv:2504.08748 替代升级版)
- #48 Gemini Robotics 2 ↔ LeCun AMI Labs + Jim Fan 第二次预训练范式立场 3.0
- #49 TurboVLA ↔ Parallel Decoding Distillation + SANA-Video 2.0 + Sol-Attn + SPA
§3.7 候选增量汇总(本棒 13 件)
| 类型 | 件数 | 编号 / 名称 |
|---|---|---|
| §6 升级候选新增 | 1 | DeepMind Gemini Robotics 2 |
| §2.39.x 候补级新增 | 4 | TurboVLA / HumanCLAW / CLBench-V / Metis |
| §1 主线 4 评测方法学新增 | 2 | AcademicEval + Scaling Beyond Context(48h 漏收件) |
| §2.39.x 候补级新增可能性 | 1 | UltraViT |
| §3.2 评测饱和横切沿用 | 1 | PerceptionBench |
| §2.39.x 邻接沿用 | 1 | Kontrast |
| §3.2 评测饱和横切延伸 | 1 | Mollick Flux 3 视频模型 |
| §2.39.x 候补级票数沿用 | 1 | HiFi-UMI 141▲ 跨日 +7 |
| §6 17 足候选沿用 | 1 | LeCun AMI Labs 7-24 沿用 |
| 本棒新增候选总计 | 13 件 |
4. 边界声明
- 只写该 1 个文件:
/shared/research-kb/inbox/flyp/2026-07-31-multimodal-e1prep.md - 不写他人目录 / 不 git / 不输出密钥
- 不重写 multimodal 活文档
5. arXiv 号列表(本棒涉及)
本棒新增(6 件):arXiv:2607.27205(TurboVLA)· arXiv:2607.27180(HumanCLAW)· arXiv:2607.25294(CLBench-V)· arXiv:2510.17725 v1(AcademicEval)· arXiv:2510.15253 v3(Scaling Beyond Context)· arXiv:2607.26760 v1(Metis)
跨日追踪(4 件):arXiv:2607.25895(HiFi-UMI 141▲)· arXiv:2607.23373(UltraViT)· arXiv:2607.24957(PerceptionBench)· arXiv:2607.25959(Kontrast)
沿用第三棒(10 件):arXiv:2607.23909(WorldDiT)· arXiv:2607.24904(Mage-VL)· arXiv:2607.25565(ReDesign)· arXiv:2607.26037(Wonder)· arXiv:2607.25537(视频 prompt)· arXiv:2607.23514(Déjà Vu)· arXiv:2607.25236(VisualPatchWorld)· arXiv:2607.25337(Temporal-Distance JEPA)· arXiv:2607.26004(Parallel Decoding Distillation)· arXiv:2602.07962(LOCA-bench)
本棒不涉及 arXiv 号的非论文增量:DeepMind Gemini Robotics 2 三件套、 Mollick Flux 3 视频模型、LeCun AMI Labs 7-24
本棒总涉及 arXiv 号:20 件
6. 一句话审稿(本棒)
v34 接力窗口第四棒(7-31 09:40)E1 预消化 = "v34 严格保持 v33 96 件套骨架 + v34 前 3 棒 67 件 + 第四棒 13 件 = v34 累计候选增量 80 件";§6 升级候选新增 1 件 = DeepMind Gemini Robotics 2 三件套(2026-07-30 发布);§2.39.x 候补 / 评测 / 邻接新增 5 件(TurboVLA 120▲ / HumanCLAW 66▲ / CLBench-V 40▲ / Metis / UltraViT);§1 主线 4 评测方法学(二十三面体)新增 2 件 = AcademicEval (arXiv:2510.17725 v1 TMLR) + Scaling Beyond Context (arXiv:2510.15253 v3 ACL2026 Main) ★ 48h 漏收件 ★;§3.3 反方集新增 5 条 #73-#77 + §7.1 引用 +3 件 #141-#143 + §7.3 交叉 +4 件 #46-#49