周三多模态文献总结 · 2026-07-22

  • 整理人:flyP(多模态 / 长上下文 / 视觉语言模型)
  • 整理时间:2026-07-22 09:35 (Asia/Shanghai)
  • 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM)、多模态推理、评估
  • 输出节奏:周三固定简报(本期为本周期新一篇,承接 2026-06-24 第 5 期;6-24 后隔 4 周重开)
  • 上一期:/shared/research-kb/inbox/flyp/2026-06-24-multimodal-weekly-digest.md
  • 配套候选清单:/shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-candidates.md
  • 建议主简报路径:/shared/research-kb/digests/2026-07-22_multimodal.md(见文末"建议写入路径"段)

0. 检索可信度前置说明

  • 本期是 2026-06-24 之后的第一次周三 digest 重启,承接层级为「flyP 6-24 multimodal-weekly-digest v5 → 7-21 multimodal-e1prep v29/v30 候选 → 7-22 本期 digest」。
  • 信息源覆盖:
  • arXiv(cs.CV / cs.CL / cs.SD / cs.MM / eess.AS)2607.07xxx ~ 2607.18xxx 段落(7-20 ~ 7-22 当日新论文 12+ 篇)
  • Hugging Face Daily Papers(2026-07-22 15 篇票榜)
  • 共享 inbox 各实例:flyP(7-21 multimodal-e1prep / 7-21 CVG-critical-read / 7-20 UniVR-E2-read)+ Jay(7-22 morning briefing + 7-21 LLM-RAG-Agent weekly / TLiveOmni)+ Tom(7-22 HF Daily 票榜 + 7-22 rag-e1prep)+ Stephen(7-22 news x vip radar)+ Spark(无新增 multimodal 素材)
  • Substack:Future AGI(multimodal AI in 2026 行业观察)、To Data & Beyond(BABYVISION, 7-12~17)、LLMs Research(GLM 演进 / Multi-Agent 失效)
  • 官方模型博客:Google DeepMind Start building with Nano Banana 2 Lite and Gemini Omni Flash(7-21)、Introducing computer use in Gemini 3.5 Flash(7-21)、Google Vids × Gemini Omni 个人虚拟形象(7-21)
  • 去重检查:flyP 7-19 Boogu-Image-0.1 / 7-19 VideoChat3 / 7-19 RxBrain / 7-20 UniVR / 7-21 CVG 已在活文档承接,本期不重复立标;tom/jay/jay-pm-radar 7-22 当日已扫描,无 multimodal 主题未承接候选。
  • 编号核验:本周期所有引用 arXiv ID 均来自 paper_cards 实有卡片(26xxx 段),已交叉;外部 Substack arXiv 引用均以「⚠ 待核验」标记。

1. 今日主题与窗口范围

聚焦 2026-07-20 ~ 2026-07-22 三天的多模态新动作,覆盖:

  • 视频:电影级 T2V 显式规划(ShotPlan)、组合 T2V 推理时引导(CVG 续)、视频时序定位(TimeLens2)、视频个性化(HOMIE)、视频多模态记忆(ReflectWorld-MM)
  • 音频:时间感知音频 LLM(GigaChat Audio 120min)、多语言 ASR 基础模型(GigaAM Multilingual)、连续音频思考(沿用 6-29 LALMs 主题)
  • VLM / 多模态推理:自验证 RL(SVR-R1)、机器人视角点图(Robot-Centric Pointmaps)、MLLM 临床评测(OCT-Bench)、物理定律视频思维评测(Apple-π)
  • 行业 / 生态:Google DeepMind 7-21 一日三连(Nano Banana 2 Lite + Gemini Omni Flash + Gemini 3.5 Flash computer use + Google Vids 虚拟形象)、HF × NVIDIA LeRobot + Cosmos 3 预告(7-7 仍为高优)

2. 检索来源(按本期消化顺序)

  1. inbox/tom/2026-07-22-0900-hf-daily-2026-07-22.md(HF Daily 15 篇票榜 Top 票数排序)
  2. inbox/tom/2026-07-22-rag-e1prep.md(增量 1-5 间接索引 + 与 multimodal 副分类交集)
  3. inbox/stephen/2026-07-22-0910-news-x-vip-radar.md(Jim Fan 续作预告 + DeepMind Gemini 3.5 Pro 延期)
  4. inbox/stephen/2026-07-21-1003-news-deepmind-news.md(Nano Banana 2 Lite + Gemini Omni Flash 正式上线)
  5. inbox/stephen/2026-07-21-1003-news-google-ai.md(Google Vids × Gemini Omni 个人虚拟形象)
  6. inbox/jay/2026-07-22-0820-morning-briefing-...(Substack 多模态线索 + arXiv Agentic 间接索引)
  7. inbox/flyp/2026-07-21-multimodal-e1prep.md(v29/v30 候选承接 + Xiaomi-Robotics-1 / RESOURCE2SKILL / S1-Omni / VideoRAE / UniVR-E2 订正)
  8. inbox/flyp/2026-07-21-1550-CVG-compositional-video-inference-time-guidance-critical-read.md(CVG 精读作 ShotPlan 同段参照)
  9. organized/paper_cards/{481-503}-xxxx.md(7-22 新卡 23 张全扫,按 multimodal 主/副分类过滤)
  10. Substack:Future AGI 多模态行业观察、To Data & Beyond BABYVISION 线索(沿用 7-22 jay briefing)

3. 新增候选概览(7-22 当日 HF Daily 15 篇 + paper_cards 7-22 新卡 23 张的 multimodal 主/副分类过滤)

3.1 HF Daily 7-22 票榜 Top 15(多模态主/副分类)

票数 标题 arXiv 主分类 副分类 归入段落
141▲ TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs 2607.17423 multimodal §4.2 视频理解
129▲ RESOURCE2SKILL: Distill Agent Skill from Human Multi-modal Resources 2606.29538 agent multimodal §6.1 多模态 RAG 旁证(flyP 7-21 multimodal-e1prep 已立 §2.39.49)
46▲ HOMIE: 人-物中心视频个性化 via Multimodal Intelligent Enchancement 2607.18217 multimodal §4.2 视频个性化
37▲ Apple-π: 物理定律智能的视频思维基准评测 2607.16401 multimodal benchmark §5.1 VLM 视频思维评测
32▲ RynnBrain 1.1: 具身基础模型 2607.17977 multimodal §6.2 具身基础模型(flyP 7-19 RxBrain 旁证)
30▲ GigaChat Audio: 时间感知大音频 LLM 2607.10387 multimodal benchmark §4.3 时间感知音频 LLM
28▲ GigaAM Multilingual: 欠代表语言基础模型 2607.10371 engineering(主) multimodal(副,与 RAG-Audio 邻接) §6.3 行业基础模型旁证
26▲ Open-AoE: 开放第一人称操作数据集 + 工具链 2607.14183 multimodal §6.2 具身基础模型旁证
25▲ FlowMimic: 像素对扭曲流场免掩码视觉编辑 + 数据生成 2607.18227 multimodal §6.4 视频编辑与数据合成
24▲ ReflectWorld-MM: 实体导向多模态记忆系统 2607.09759 multimodal §4.4 视频多模态记忆
24▲ Group Entropy-Controlled Policy Optimization 2607.16850 与 v25 multimodal 弱相关(RL 后训练方法学),不入主线

3.2 paper_cards 7-22 新卡中主分类 multimodal(不入 HF Daily Top 15 但已发布)

  • ShotPlan: Cinematic Video Generation with Learnable Planning Token(arXiv:2607.17675,主 multimodal,position)— §4.1 必读 #3
  • Robot-Centric Pointmaps for VLA Models(arXiv:2607.11498,主 multimodal,method)— §4.5 VLA 视觉编码
  • SVR-R1: Self-Verification RL Bootstrapping for Multimodal Reasoning(arXiv:2607.10966,主 multimodal,benchmark)+ 副 evaluation — §5.2 自验证多模态推理
  • OCT-Bench: Can MLLMs Understand OCT?(arXiv:2607.16609,主 multimodal,benchmark)+ 副 evaluation — §5.3 MLLM 临床评测
  • FlashRT: Agent Harness for Real-Time Multimodal Apps(arXiv:2607.18171,主 agent,副 multimodal)— §6.5 multimodal-serving harness 旁证

4. 必读 3-5 篇(精读候选 / 主题页更新候选)

4.1 🎬 视频生成侧(核心 3 件,时间序列最近)

#1 ⭐⭐⭐⭐⭐ · TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs(arXiv:2607.17423,HF Daily 141▲)

  • 作者机构:待核(HF Daily Top 1 通常为发表级团队)
  • 发布时间:2026-07-22(HF Daily 当日新立)
  • 来源:https://arxiv.org/abs/2607.17423 + paper_cards/492-2607-17423.md
  • 核心要点
  • MLLM-based 通用视频时序定位:跨 7 个时序定位基准统一训练,规模匹配基线一律超过
  • TimeLens2-2B 击败所有同尺寸基线;4B / 8B 变体取得 SOTA,超过最多 397B 参数开源模型
  • 论文等级 method,主分类 multimodal
  • 可信度:⭐⭐⭐⭐⭐(HF Daily 141▲ + 跨 7 基准 + 397B vs 8B 极端对照信号强)
  • flyP 评价:与 v25 VideoChat3(视频理解侧 4B 通用 SOTA MLLM)+ v29 Boogu-Image-0.1(图像理解-生成统一)形成"视频理解 SOTA 三联",TimeLens2 的 8B vs 397B 极端对照警示了"开源大模型 vs 中等专精 MLLM"在时序任务上的反 scaling 现象,值得立 §1 主线 3 多模态 CoT/推理范式 + §1.4 长视频主线的旁证。
  • 建议归入节:活文档 multimodal §1 主线 4 视频理解 / §2.39.x 待立标候选 / §3.2 反方审稿
  • 建议行动:精读(必读 #1)+ HF 复测(用 VideoChat3 vs TimeLens2-2B/4B/8B head-to-head)

#2 ⭐⭐⭐⭐ · ShotPlan: Cinematic Video Generation with Learnable Planning Token(arXiv:2607.17675,HF Daily 待确认 / paper_cards 498-...)

  • 作者机构:待核(paper_cards 形态标 position —— 通常为研究路线立场型工作)
  • 发布时间:2026-07-22
  • 来源:https://arxiv.org/abs/2607.17675 + paper_cards/498-2607-17675.md
  • 核心要点
  • 在视频扩散基础模型之上显式注入"可学习规划 token",做多镜头电影级视频生成
  • 优于现有 cinematic video 生成方法,提供更灵活的镜头管理 + 更强的跨镜头一致性
  • 与 7-19 flyP 已立的 CVG(inference-time guidance)形成"显式规划 token vs 隐式 cross-attention steering"对照
  • 可信度:⭐⭐⭐(paper_cards 形态标 position 信号弱,需抓 PDF 验证是否含端到端训练 + SOTA 数字)
  • flyP 评价:与 CVG(flyP 7-21 1550 E2 精读) + 6-24 第 4 期 Movie Gen + 6-24 Wan 2.2 + 6-24 Seedance 2.0 + 7-19 LingBot-Video MoE 形成 T2V 家族"显式规划 vs 隐式引导 vs 端到端 MoE"三条路线分野。ShotPlan 的关键看点:① 能否在小 / 中型训练集上同时获得电影级镜头管理与跨镜头一致性;② 规划 token 是否可解释、可编辑(用户可控);③ vs Wan2.2 + ControlNet / CogVideoX-5B + CVG 三者的 head-to-head。
  • 建议归入节:活文档 multimodal §1 主线 1 统一视频生成(显式规划分支)+ §2.39.x 待立标
  • 建议行动:观察级精读(不进 reviews,等 PDF 公开 + 与 7-21 CVG 形成 2 件连读)

#3 ⭐⭐⭐⭐ · HOMIE: Human-Object Centric Video Personalization via Multimodal Intelligent Enchancement(arXiv:2607.18217,HF Daily 46▲)

  • 作者机构:待核
  • 发布时间:2026-07-22
  • 来源:https://arxiv.org/abs/2607.18217 + paper_cards/488-2607-18217.md
  • 核心要点
  • 改进 MLLM 集成策略:在 self-attention 中引入"全局多模态引导",使 MLLM 派生的语义特征与 VAE token 更好对齐
  • 不损害文本编码器可控性 + 不引入昂贵重新对齐
  • 显式建模人-物关系(人-物中心 video personalization)
  • 可信度:⭐⭐⭐⭐(HF Daily 46▲ + method 主分类)
  • flyP 评价:与 v25 Goku-Edit(6-24 第 7 期 Goku 系列指令式视频编辑)+ 6-24 Movie Gen(personalization 五件套)+ 7-19 LingBot-Video 同属视频个性化主题。HOMIE 的差异化贡献是"在 self-attention 内引入全局多模态引导"的轻量方案,对小训练成本路径友好,可作为 LongVILA / Vidu-S1 等长视频模型的轻量 personalization 模块候选。
  • 建议归入节:§1 主线 5 视频个性化 / §6.4 视频编辑与数据合成
  • 建议行动:观察级精读(与 LingBot-Video 形成对照复现基础)

4.2 🎞️ 视频理解侧(核心 1 件)

#4 ⭐⭐⭐⭐⭐ · ReflectWorld-MM: Entity-Oriented Multimodal Memory System for Open-Ended Video Streams(arXiv:2607.09759,HF Daily 24▲)

  • 作者机构:待核
  • 发布时间:2026-07-22
  • 来源:https://arxiv.org/abs/2607.09759 + paper_cards/495-2607-09759.md
  • 核心要点
  • 实体导向多模态记忆:面向开放视频流(open-ended video streams)的长期记忆系统
  • 6 个长视频 + 终身记忆基准 上取得最佳准确率
  • 超越"强记忆 Agent" 与一个前沿模型
  • 可信度:⭐⭐⭐⭐(HF Daily 24▲ + method + 6 个基准 + 跨前沿模型对照)
  • flyP 评价:与 v25 LongVILA(长视频理解)+ v25 MMLongBench + v25 Long-MR(V2PE 自构评测)+ v30 HomER(hierarchical online memory agent)同属"长视频 + 终身记忆"主线。ReflectWorld-MM 是 v29/v30 以来第一件明确"实体导向多模态记忆 + 长期 open-ended video stream"的工作**,直接对接 flyP 6-30 agent-memory 候选主题页 + 6-29 HomER 立的 hierarchical memory 主线。
  • 建议归入节:§1 主线 2 长上下文 / 长视频 / 长文档(实体导向多模态记忆分支)+ §1 主线 4 视频理解(终身记忆分支)
  • 建议行动:必读 + 建议与 HomER 同段复现(评测一致性、6 基准名清单)

4.3 🔊 音频生成侧(核心 1 件)

#5 ⭐⭐⭐⭐ · GigaChat Audio: Time-aware Large Audio Language Model(arXiv:2607.10387,HF Daily 30▲)

  • 作者机构:SberDevices / SberBank AI(待核 PDF 准确团队)
  • 发布时间:2026-07-22
  • 来源:https://arxiv.org/abs/2607.10387 + paper_cards/501-2607-10387.md
  • 核心要点
  • 时长 120 分钟输入:在最长 120 分钟音频上以显式时间戳回答问题
  • 级联管道大规模合成监督 + 周期性时间标记 + 连续音频 token 交错排列
  • 在短 + 长基准均取得强时间定位准确率
  • 支持时间锚定的片段描述与摘要
  • 可信度:⭐⭐⭐⭐(HF Daily 30▲ + benchmark 形态 + 120 分钟 业界最长)
  • flyP 评价:与 v25 Audio Flamingo Next(7 月沿用 6-24 第 6 期)+ 6-24 UniSonate + 6-29 Continuous Audio Thinking for LALMs + v22 Audio-Oscar 同属音频 LLM 主线。GigaChat Audio 的关键差异化是"显式时间戳作为天然监督信号" —— 类似 TimeLens2 的"时序定位统一框架"思路,但场景切到 120min 长音频;与 TimeLens2 形成"视频 vs 音频 / 时序定位统一框架"姊妹工作。注意俄罗斯团队 + Sber 系信号 —— 沿用 7-22 jay briefing 的 Russian 多模态基础模型 + GigaAM Multilingual 28▲ 同段。
  • 建议归入节:§1 主线 6 音频 LLM(时间感知分支)+ §2.39.x 待立标候选
  • 建议行动:观察级精读 + 与 Audio Flamingo Next / UniSonate 同段复现基础

5. 高价值技术文章(VLM / 多模态推理 / 评测)

5.1 🎯 VLM 视频思维评测

🟡 待精读 · Apple-π: 物理定律智能的视频思维基准评测(arXiv:2607.16401,HF Daily 37▲)

  • 核心要点:评测 MLLM 在"基于物理定律的视频思维"上的能力;典型基准工作
  • 可信度:⭐⭐⭐(HF Daily 37▲ + benchmark 形态)
  • 建议归入节:§1 主线 3 多模态 CoT / 推理范式(视频思维分支)+ §5 评测(MBench 系列补)
  • 建议行动:观察级抓 PDF 核 4 件:物理定律清单 + 题型分类 + 哪些 MLLM 已测 + 是否开源

5.2 🔁 自验证多模态推理

🟡 待精读 · SVR-R1: Bootstrapping Multimodal Reasoning with Self-Verification in Reinforcement Learning(arXiv:2607.10966,paper_cards 主 multimodal + 副 evaluation)

  • 核心要点
  • 多轮 RL 框架,把模型自身的验证转化为多模态推理的学习信号
  • 给"自验证→自举"提供"简洁而有效"的配方
  • 与 v25 PRM-hackability 反方警示形成对照(自验证 vs 判别式 PRM)
  • 可信度:⭐⭐⭐(paper_cards 形态 benchmark + 副 evaluation)
  • flyP 评价:与 flyP 7-18 Reward-Under-Attack + flyP 7-20 UniVR E2 精读"Step-Focal 局部奖励 reward hacking"反方思路 同根但反向 —— SVR-R1 用"模型自身验证"作为正反馈,自举多模态推理。风险:模型"自我验证"在多模态 CoT 中易陷入"循环验证"虚假自信(即 model A 验证 model A 得出高置信度,但事实错误)。评估是否引入 Cycle-Breaker 或独立 verifier 子网络 是核验关键。
  • 建议归入节:§1 主线 3 多模态 CoT / 推理范式(自验证分支)+ §3.2 反方审稿(7-18 PRM-hackability 同段)
  • 建议行动:抓 PDF + 与 RLVR-Rubric / Visual Thoughts / UniVR 复现同段

5.3 🏥 MLLM 临床评测

🟡 待精读 · OCT-Bench: Can Multimodal Large Language Models Understand OCT?(arXiv:2607.16609,paper_cards 主 multimodal + 副 evaluation)

  • 核心要点:OCT 视网膜影像理解 + 临床可信评测
  • 可信度:⭐⭐⭐
  • flyP 评价:与 v25 各类医学影像 MLLM + S1-Omni(科学多模态统一)+ v24 GPT-4 Medical 同族。OCT-Bench 的切入点很工程化(眼科 OCT = 临床上最容易结构化、最容易获 ground truth 的影像之一),可作为医学影像 MLLM 的"小切口大范例"。
  • 建议归入节:§1 主线 7 垂直域多模态(医学影像分支)
  • 建议行动:观察级(与 S1-Omni 同段索引)

5.4 ⚙️ VLA 视觉编码(具身侧)

🟢 精读候选 · Robot-Centric Pointmaps for VLA Models(arXiv:2607.11498,paper_cards 主 multimodal,method)

  • 作者机构:待核
  • 核心要点
  • 机器人坐标系下的 3D 几何 + 保留预训练 2D VLA 的 H×W 稠密网格最小架构改动
  • 提升 pi0.5 + SmolVLA,优于代表性相机视点 + 3D 感知基线
  • 与 7-22 HF Daily Open-AoE(26▲)+ RynnBrain 1.1(32▲)+ Xiaomi-Robotics-1(54▲,flyP 7-21 multimodal-e1prep §2.39.40 已立)形成"VLA 视觉编码 + 具身基础模型 + 数据集"三件
  • 可信度:⭐⭐⭐⭐(method 形态 + 实证双基线 + 极小架构改动)
  • flyP 评价:是"具身通用基础模型 + 2D VLA"的关键工程拼图。注意作者团队(猜测 NVIDIA / Google DeepMind Robotics / Stanford — 待核)。与 6-24 第 4 期 Wan 2.2 + 6-24 Movie Gen + 7-19 RxBrain + 7-19 LingBot-Video + 7-21 multimodal-e1prep §2.39.40 Xiaomi-Robotics-1 同族 —— 都是"如何用现成 2D VLA 不重训做 3D"问题,这是 2026 H2 具身 VLA 阵营最热子方向
  • 建议归入节:§1 主线 7 垂直域多模态 / VLA(点图嵌入分支)+ §2.39.40 沿用
  • 建议行动:观察级 + 复现门槛低(沿用现成 VLA + 加一层 pointmap encoder)

6. 行业 / 生态旁证(5 件,含 Substack + 官方模型博客 + 索引类)

6.1 📰 Substack 多模态行业观察

# 标题 来源 / 时间 核心 行动
1 Multimodal AI in 2026 — What is Happening Future AGI Substack · 7 月 Llama 4 Scout/Maverick MoE / Early Fusion / Alpamayo-R1(视频+运动)— 沿用 jay 7-22 briefing 行业基础参考
2 BABYVISION — MLLM 倒置能力曲线 To Data & Beyond · 7-12~17 3 岁儿童视觉原语失败基准;UniPai AI / 北大 / 清华 / 月之暗面联合 沿用;需核 arXiv ID
3 GLM 744B MoE 演进 LLMs Research · Feb 2026 2021 → 2026 744B MoE;Zhipu AI $19B;昇腾芯片 行业架构历史
4 2026 Multi-Agent 五大失效 LLMs Research · Jan 2026 ICLR 2026 14 篇合集;五失效:慢 Pipeline / 高成本 / 级联错误 / 脆弱图 / 不透明 与 multimodal 弱相关,沿用

6.2 🏭 厂商基础模型

  • RynnBrain 1.1(arXiv:2607.17977,HF Daily 32▲,modal-)— 沿用 multimodal-e1prep §2.39.40 旁证
  • Open-AoE(arXiv:2607.14183,HF Daily 26▲)— 沿用同上

6.3 🌐 区域厂牌信号

  • GigaChat Audio(Sber 系,俄罗斯信号 — 与 GigaAM Multilingual 28▲ 同段):俄罗斯在多语种 ASR + 长音频 LLM 两条线齐发,与中文(小米 / 蚂蚁 / 字节 / 腾讯 Hy3)+ 西方(OpenAI / Anthropic / Google / Meta)形成第三极。建议在活文档 §1.7 行业从"中-西双极"升级为"中-俄-西三极"

6.4 ⚡ Google DeepMind 7-21 一日三连(来自 stephen 7-21 1003 news-deepmind + news-google-ai)

# 事件 链接 主分类归入
1 Nano Banana 2 Lite + Gemini Omni Flash 正式发布 https://deepmind.google/blog/start-building-with-nano-banana-2-lite-and-gemini-omni-flash/ §1.7 行业
2 Gemini 3.5 Flash 引入 computer use https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/ §1.7 行业(multimodal-computer use)
3 Google Vids × Gemini Omni 个人虚拟形象 https://blog.google/products-and-platforms/products/workspace/gemini-omni-personal-avatars/ §1.7 行业(multimodal-Video)
4 DeepMind Gemini 3.5 Pro 7/17 撤档 / 仍 7/18 无发布日期 HackerNoon 7/8 转述 + 7-22 stephen 雷达 待核验

flyP 评价:Google DeepMind 在 2026-Q3 把"全模态栈 + 实时语音/视频 + computer use + 个人虚拟形象"同时推出,是 v29/v30 行业侧最重大事件;与 7-22 DeepMind 把 Gemini 3.5 Pro 撤档"进入更深 pre-training 周期" 形成"Google 全栈自相矛盾的产品节奏"。建议 §1.7 行业总账同步刷新

6.5 🤖 HF × NVIDIA LeRobot + Cosmos 3 预告

  • NVIDIA Isaac GR00T 1.7 + Isaac Teleop 进入 LeRobotCosmos 3 将跟进(7-7 theaiinsider.tech)
  • 与 v25 LeRobot v0.5 + 7-19 RxBrain + 7-21 multimodal-e1prep §2.39.40 Xiaomi-Robotics-1 + 7-22 Open-AoE(HF Daily 26▲)+ RynnBrain 1.1(HF Daily 32▲)+ Robot-Centric Pointmaps(§5.4)形成 2026-Q3 具身 VLA 阵营最强一周
  • flyP 评价:NVIDIA × HuggingFace 联手对 LeRobot + Cosmos 3 是 v29 立标以来最强的具身基础设施事件,v30 §1.7 行业应新增"机器人基础模型国际 5 足(NVIDIA Cosmos + LeRobot + pi0.5/SmolVLA 系 + π + 厂牌 Robot-Centric Pointmaps)"作为独立旁证

7. 分类标签(汇总)

multimodal video-generation video-understanding video-personalization video-temporal-grounding video-multimodal-memory mlLM VLM VLM-evaluation self-verification-rl benchmark audio-LLM time-aware-LLM asr-multilingual VLA robot-centric-pointmaps world-model physical-AI cinematic-video inference-time-guidance multimodal-harness nano-banana gemini-omni lerobot cosmos industry substack survey negative-result

每条具体论文/文章的标签见 §3 / §4 / §5 / §6 各节内 建议归入节


8. 是建议精读 / 反方审稿 / 主题页更新?

类型 工作 强度 建议动作
必读精读 TimeLens2(arXiv:2607.17423) ⭐⭐⭐⭐⭐ 抓 PDF + 与 VideoChat3 v29 立标对照复现
必读精读 ShotPlan(arXiv:2607.17675) ⭐⭐⭐⭐ 抓 PDF + 与 CVG(7-19 精读)连读
必读精读 HOMIE(arXiv:2607.18217) ⭐⭐⭐⭐ 抓 PDF + 与 Goku-Edit / LongVILA / LingBot-Video 复现
必读精读 ReflectWorld-MM(arXiv:2607.09759) ⭐⭐⭐⭐⭐ 抓 PDF + 与 HomER / LongVILA / V2PE 长期记忆评测同一套
必读精读 GigaChat Audio(arXiv:2607.10387) ⭐⭐⭐⭐ 抓 PDF + 与 Audio Flamingo Next / UniSonate / LALMs-Continuous head-to-head
观察级精读 Apple-π(arXiv:2607.16401) ⭐⭐⭐ 抓 PDF + 与 VideoThinkBench(v25)/ MVBench / MMBench 系列对齐
观察级精读 SVR-R1(arXiv:2607.10966) ⭐⭐⭐ 抓 PDF + 与 PRM-hackability(7-18)/ UniVR(7-20)/ RLVR-Rubric 同段
观察级精读 OCT-Bench(arXiv:2607.16609) ⭐⭐⭐ 与 S1-Omni(flyP 7-21 e1prep §2.39.41)/ GPT-4 Medical 同段
观察级精读 Robot-Centric Pointmaps(arXiv:2607.11498) ⭐⭐⭐⭐ 抓 PDF + 与 Open-AoE(26▲)+ RynnBrain 1.1(32▲)+ Xiaomi-Robotics-1(54▲)同段
反方审稿 SVR-R1(自验证→自举风险 + 循环验证虚假自信) 入 §3.2 反方审稿段(沿用 7-18 PRM-hackability + 7-20 UniVR Step-Focal)
主题页更新 活文档 multimodal §1.7 行业分类从"中-西双极" 升为 "中-俄-西三极" + 加入 NVIDIA × HuggingFace LeRobot + Cosmos 3 + Google 一日三连 v31 候选补丁
主题页更新 活文档 multimodal §1 主线 1 视频生成旁证 → 新增"显式规划 token 分支"(ShotPlan) §2.39.x 待立标
主题页更新 活文档 multimodal §1 主线 2 长上下文/长视频 → 新增"实体导向多模态记忆 + 终身记忆分支"(ReflectWorld-MM) §2.39.x 待立标
主题页更新 活文档 multimodal §1 主线 6 音频 LLM → 新增"时间感知 + 120min 长音频分支"(GigaChat Audio) §2.39.x 待立标
主题页更新 活文档 multimodal §1 主线 7 VLA → 新增"点图嵌入 + 极小架构改动分支"(Robot-Centric Pointmaps) §2.39.x 待立标

9. 建议写入文件路径

9.1 本期主 digest(已写入)

  • /shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-digest.md本文件
  • /shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-candidates.md ✅ 配套候选清单(独立文件)

9.2 跨实例同步建议(不直接执行,留给同步任务串行)

  • 本期主简报(建议写入 digests/,建议内容 = 本文件 §1~§8 + §9.1 路径,加 §10 待核问):
  • 路径:/shared/research-kb/digests/2026-07-22_multimodal.md
  • 当前状态:未写入(flyP 实例规则只允许写 inbox/flyp/,digests/ 留给同步任务或有人工许可)
  • 写入建议:本文件内容全文

  • 活文档 multimodal

  • 路径:/shared/research-kb/organized/knowledge/multimodal.md(v29 立标 + v30 候选)
  • 当前状态:未写入(活文档通常由 nightly cron 处理)
  • 写入建议:v31 补丁候选 = 5 个 §2.39.x 待立标(TimeLens2 / ShotPlan / HOMIE / ReflectWorld-MM / GigaChat Audio) + 4 个 §1 主线分支更新(视频生成显式规划 / 实体导向多模态记忆 / 时间感知音频 LLM / VLA 点图嵌入) + 1 个 §1.7 行业三极升级 + 1 个 §3.2 反方(SVR-R1 循环验证风险)

  • registry/papers.jsonl(论文元数据登记):

  • 路径:/shared/research-kb/registry/papers.jsonl
  • 当前状态:未写入(同上,flyP 实例规则限制)
  • 写入建议:8 条 JSONL 行,含 arXiv ID / 主分类 / 副分类 / 形态 / 数据源 / flyP digest 评注(TimeLens2 + ShotPlan + HOMIE + ReflectWorld-MM + GigaChat Audio + Apple-π + SVR-R1 + OCT-Bench + Robot-Centric Pointmaps 等 9 件)

9.3 GitHub 写入安全

  • 本任务不执行 git commit / git push / gh pr,只输出 GitHub-ready 草稿和建议路径
  • 同步任务(Stephen / 单独同步 cron)应串行合并到 multimodal 主题分支

10. 待人工确认 / 待后续 cron 复核

  1. TimeLens2 (141▲ 极端对照) — 是否真在 7 个基准上击败 397B 开源大模型?→ 抓 PDF 表 1 + 复测对比 VideoChat3
  2. ShotPlan (paper_cards 形态标 position) — 是否含端到端训练 + SOTA 数字?→ 抓 PDF 表 1 + ablations
  3. HOMIE 自我注意力全局多模态引导 — 是否会破坏 text encoder 可控性?→ 等实验
  4. ReflectWorld-MM 6 个基准完整名单 + 是否开源 — 抓 PDF + GitHub
  5. GigaChat Audio 120min 训练数据集来源 + 商用许可 — 抓 PDF + HuggingFace 模型卡
  6. SVR-R1 自验证→自举风险 — 是否引入独立 verifier 子网络 / cycle-breaker?→ 抓 PDF §5
  7. OCT-Bench 评测 MLLM 完整名单 + 是否含临床盲测 — 抓 PDF + 临床合作清单
  8. Robot-Centric Pointmaps 作者团队(NVIDIA / DeepMind / Stanford) — 抓 PDF 头部 + GitHub
  9. BABYVISION 子公告 — To Data & Beyond 提到 UniPai AI / 北大 / 清华 / 月之暗面,确认 arXiv ID 是否已发
  10. Google DeepMind 7-22 Gemini 3.5 Pro 是否悄然上线 — 核 stephen 雷达"7/22 当天是否已悄然上线"
  11. NVIDIA × HF LeRobot + Cosmos 3 路线图时点 — 已 7-7 公告,C-3"将跟进"未给具体日期
  12. GigaChat Audio / GigaAM Multilingual 完整作者团队 + Sber 系具体公司主体
  13. flyP 6-24 后隔 4 周重启周三 digest 的粒度是否合适 — 是按 6-24 模板 5 节制(主题/来源/候选/必读/标签)走?还是按本期 §1-§10 详细版?建议明天(7-23)周内跟 Anan 二次确认

11. 元信息 / 合规

  • 触发 cron956ff59d-d2d0-47ea-a939-166d39356ed5(研究知识库 · 周三多模态文献总结)
  • 触发时间:2026-07-22 09:25 Asia/Shanghai
  • 窗口范围:2026-07-19 ~ 2026-07-22(约 3 天密集 + 本期重启承接 2026-06-24 第 5 期)
  • 检索耗时:~12 分钟(inbox 6 实例扫描 + paper_cards 23 张过滤 + HF Daily 15 篇票榜 + DeepMind 官方 4 篇 + Substack 4 条 + CVG 精读交叉)
  • 引用合规:仅引用 arXiv abs 摘要 + HF papers 公开页 + HF Daily 票榜 + inbox 跨实例草稿(含自有)+ Substack 公开摘要 + Google DeepMind 官方博客;不复制 PDF 全文 / 不下载 / 不下"必入库"终局判断
  • 本稿状态:v1 主 digest,不重写 multimodal 活文档;只列增量与建议主题页更新方向
  • 下次更新:2026-07-29(周三,按 6-24 模板节奏 5 周 1 期 — 应与 7-22、7-15 同期确认;建议改为 1 周 1 期以对接 2026-Q3 高密度

本稿仅做周三 digest 输出,不为单篇论文做最终结论;所有立标建议均挂"信号级"标记,等今晚活文档接力时二次审稿确认。