flyP 精读与批判 · 2026-08-26(轻量精读 1/3)

本次主题

多模态空间智能与可解释 MoE 路由:审稿两篇顶会接收论文,并补充一条 Substack 思想线索。

检索范围

  • arXiv(cs.CV / cs.LG):空间智能、多模态 MoE、长上下文多模态
  • CVPR 2026 / ICLR 2026 接收论文列表
  • Substack:AI 研究者专栏(Fei-Fei Li、Packy McCormick、Future AGI)
  • 跳过 Substack 多轮扩展搜索(按规则)

候选条目(按 hit score 排序后筛选)

论文 / 链接 出处 备注
arXiv:2511.13719 Scaling Spatial Intelligence with Multimodal Foundation Models (SenseNova-SI) CVPR 2026,已是 v4 空间智能,多基准 SOTA
arXiv:2509.25678 Massively Multimodal Foundation Models (MERGE) ICLR 2026 conference paper 时延感知的 MoE 路由
arXiv:2512.14474 Model-First Reasoning LLM Agents arXiv 2025-12 备选,未深入
Fei-Fei Li, From Words to Worlds: Spatial Intelligence is AI's Next Frontier Substack (drfeifei.substack.com) 思想补充线索

高价值条目 1:SenseNova-SI(arXiv:2511.13719)

核心贡献

  • 提出 SenseNova-SI 家族,在 Qwen3-VL、InternVL3(理解)与 Bagel(理解+生成统一)之上做空间智能后训练。
  • 公开 SenseNova-SI-8M 数据集与分类法,覆盖 8M 样本,按空间能力维度严格分层。
  • 报告横跨 8 个空间智能基准的成绩:VSI-Bench 68.8 / MMSI 43.3 / MindCube 85.7 / ViewSpatial 54.7 / SITE 47.7 / BLINK 63.9 / 3DSR 55.5 / EmbSpatial 72.0,并在通用多模态理解上不退化。
  • 资源:代码 + 模型权重全部开源(SenseTime)。

方法拆解(基于摘要判断)

  • "Principled scaling on spatial intelligence":训练语料按能力 taxonomy 切片,验证 scaling law 在空间维度同样成立。
  • 基座三选一(Qwen3-VL / InternVL3 / Bagel)显示结论不依赖单一 backbone,可推广性较好。
  • 同时挂 CVPR 2026 + 模型 v1.1,意味着已经历一轮审稿与模型迭代,可信度较高。

主要问题与风险

  • 8 个基准中 6 个仍 <70%,说明"空间智能"远未饱和;MMSI 43.3 暗示多模态多视角推理仍是最大瓶颈。
  • 是否依赖 SenseTime 内部视频/3D 私有数据?摘要未交代 8M 数据来源构成,需在 v4 全文中确认。
  • 与同期 SpaceLLaVA、SceneGPT 等工作相比,差异化贡献主要在"系统化数据 + 多基座",理论新颖性中等。
  • CVPR 2026 接收本身不构成复现保证;8M 数据 + 多 backbone 训练对学术团队成本极高。

可信度

  • 中高:CVPR 2026 接收 + 模型权重 + 数据集全开源,作者团队(含 Ziwei Liu、Dahua Lin 等)声誉稳定。
  • 待补查:① 8M 数据的具体来源比例;② 推理时是否使用额外 tool(CoT、3D 渲染);③ 与 RoboMamba、3D-LLM 等工作的 head-to-head。

复现难度

  • 高:8M 样本 + 多 backbone 微调,单卡成本至少 256×H100 量级。
  • 学术团队可行路径:仅用 Qwen3-VL 基座 + 公开子集复现 VSI-Bench 子任务。

建议入库路径

  • 写入 notes/multimodal/spatial-intelligence-survey.md 的一节,与 SenseTime / SpaceLLaVA / Embodied-Scan 并列。
  • 是否独立成 reviews/2026-08-SenseNova-SI.md:建议待补查三项后由专人撰写。

高价值条目 2:MERGE(arXiv:2509.25678, ICLR 2026)

核心贡献

  • 提出 "Massively Multimodal" 设定:每个传感器/数据源视为独立模态,强调模态间的时延交互(delayed physiological cascades 等)。
  • 显式量化模态对之间在多个离散时间区间上的时延依赖,作为 MoE 路由的先验。
  • 路由机制:从"相似度路由"升级为"交互感知路由",token 被分发到专门处理某类时延模式的 expert。
  • 实验:医疗、行为识别、情感计算三类基准,报道可观性能增益并展示可解释路由模式与领域知识对齐。

方法拆解

  • 引入 "temporal RUS"(Recurrent Unit Sequence)作为时延建模中介,先离线估计两两模态在不同 lag 上的关联,再用其结果约束 router。
  • Router 输出仍是离散 expert 选择,但权重/掩码受时延交互矩阵调节。
  • 强调 "interaction-processing skill" 的可迁移性——expert 学的是跨任务的处理技能,而非任务特定表征。

主要问题与风险

  • 论文定位介于多模态 MoE 与时间序列建模之间,对纯 LLM/MLLM 社区吸引力有限。
  • 医疗基准常用 MIMIC / PhysioNet 等"经典老数据集",对新方法的真实难度需要拆 ablation。
  • "可解释路由"是论文卖点之一,但 routing pattern 与领域知识对齐≠因果正确,需审稿关注。
  • 28 页 / 16 图 / 10 表,密度大;公开代码与权重未在摘要确认,需补查。

可信度

  • 中高:ICLR 2026 conference paper + v4 版本 + 论文长度充实。
  • 待补查:① 是否有官方代码仓库;② 与同期 MM-MoE、TimeMixer 等多模态时序方法的对比;③ 模态数变化时路由成本曲线。

复现难度

  • 中:相比 LLM 大模型训练,硬件需求低一个数量级;但医疗数据访问受限,需合作。

建议入库路径

  • 写入 notes/agents-llm/multimodal-routing-survey.md 作为"时延感知路由"代表案例。
  • 若补查到代码链接,可单独写 reviews/2026-08-MERGE-ICLR.md

Substack 思想线索(不复制原文,只做记录)

  • 来源:Fei-Fei Li, From Words to Worlds: Spatial Intelligence is AI's Next Frontier — https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence
  • 发布时间:2026(具体月份需打开确认;本轮未做二次抓取以避免超时)
  • 核心观点:空间智能是 AI 下一前沿;世界模型天然多模态;以"感知-学习-思考-行动"为核心闭环。
  • 可信度判断:高——作者本人即为空间智能推动者(World Labs / Fei-Fei Li)。
  • 与本次审稿的呼应:直接为 SenseNova-SI 提供"为什么空间智能值得 scale"的纲领性论证;与 MERGE 形成"宏观路线图(Fei-Fei)vs 中观方法(MERGE)"对照。
  • 后续行动:待精读日单独抓取全文,做主题页 "spatial-intelligence-roadmap" 的引子。

本次任务结论

判断
核心贡献 SenseNova-SI 给"空间智能可被规模化"提供首批系统性证据;MERGE 把 MoE 路由从"相似度"推进到"时延交互"。
主要问题 两者都缺与同期工作的 head-to-head;SenseNova-SI 数据来源未明;MERGE 代码未确认。
可信度 中高,均为顶会接收 + 多版本迭代。
是否建议入库 建议两篇都进 notes/,暂不进 reviews/(等补查)。
后续验证动作 ① 拉取 SenseNova-SI v4 全文确认数据构成;② 检索 MERGE GitHub 代码;③ 下次精读日补一篇空间智能主题页。

建议写入路径

  • /shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md(本文件,已写入)
  • 后续待补查后写入:/shared/research-kb/review/2026-08-SenseNova-SI.md/shared/research-kb/review/2026-08-MERGE.md(由同步任务执行,本实例不直接写)

是否需要精读 / 审稿 / 主题页更新

  • 是:建议下一次精读日做"空间智能主题页 v1",把 SenseNova-SI + Fei-Fei Substack + SpaceLLaVA 等串成一篇主题综述。