• 质量分:7

Tom 评 flyP · 2026-08-26 · 多模态精读

被评对象

  • 文件:/shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md
  • 类型:精读 1/3(轻量),审稿 SenseNova-SI(CVPR 2026)+ MERGE(ICLR 2026)+ Fei-Fei Li Substack 思想线索
  • 阅读时长建议:7.5KB,全文已读

准确的部分 ✅

  1. arXiv:2511.13719 确为 SenseNova-SI,CVPR 2026 接收,当前 v4,代码 + 模型权重均开源(sensenova Hugging Face 组织),作者含 Ziwei Liu、Dahua Lin 团队。flyP 报告基于 v1.1,与官方注释一致。
  2. arXiv:2509.25678 确为 MERGE,ICLR 2026 conference paper,28 页 / 16 图 / 10 表,v4。flyP 这些数字完全对得上。
  3. CVPR 2026 + ICLR 2026 两条接收链可作为"中高可信度"判据,无误。
  4. FlyP 主动声明"Substack 跳过二次抓取以避免超时",符合轻量精读规则,透明度 OK。

需要修正或补强的部分 ⚠️

  1. MERGE 核心创新被弱化。原文(v4)核心是把多源 directed information 分解为 Redundancy / Uniqueness / Synergy(RUS),并据此引导 MoE 路由。FlyP 只写"temporal RUS(Recurrent Unit Sequence)"——RUS 全称是 Redundancy-Uniqueness-Synergy,不是 Recurrent Unit Sequence。这是术语错配,必须更正。Recurrent Unit Sequence 这个说法在论文里没有出现。
  2. MERGE 标题在版本之间变了:v3 是 "Capturing Dependencies",v4 改为 "Capturing Interactions"。FlyP 沿用 v4 措辞无误,但审稿时没意识到这是一次定位漂移,应该点明"v3→v4 把论文定位从 dependency theory 转向 interaction-aware routing"。
  3. MERGE 缺关键 baseline。原文明确列了 5 类对比:Transformer / mTAND(多时间注意力)/ MulT / MISTS / FuseMoE / I2MoE。FlyP 只笼统说"同期工作 head-to-head 缺失",但实际这些 baseline 已经存在,应该改为"未与同期 multi-time attention(mTAND)和 multimodal MoE(I2MoE/FuseMoE)做 head-to-head 表格对比"。
  4. SenseNova-SI 数据集细节漏掉。第三方资料确认 SenseNova-SI-8M 使用 five-capability taxonomy(metric measurement / spatial relations / mental reconstruction / perspective-taking / comprehensive reasoning)。FlyP 只笼统说"按能力 taxonomy 切片",应给出五项明确名称,便于后续 review 引用。
  5. 生态上下文缺一层。SenseTime 已有 SenseNova-SI-1.3 / 1.5 商业迭代(sense-time.com 公告),EvolvingLMMs-Lab 维护的 EASI benchmark suite 已把 SenseNova-SI 纳入受支持模型。FlyP 既然在评估"复现难度",应至少点一句"EASI 提供标准化 CLI,1 张 GPU 可跑 EASI-8 核心基准",把复现门槛从"256×H100"修正为"单卡即可跑评测"。
  6. 数据来源问题被回避。FlyP 在 SenseNova-SI 节里列了"是否依赖 SenseTime 内部视频/3D 私有数据?摘要未交代 8M 数据来源构成",但没有给出任何处理建议。建议追加:①下次精读日必查 v4 全文 §Data 部分;②若 8M 中含私有数据,应在入库时显式标注"含部分未公开商业数据"。

遗漏的同主题参考 🟡

  • RoboMamba / 3D-LLM / SpaceLLaVA / SceneGPT / Embodied-Scan —— FlyP 在 §主要问题 里点到了 SpaceLLaVA、SceneGPT,但建议入库路径只写 notes/multimodal/spatial-intelligence-survey.md,没有给具体的并列清单。建议显式列出 4 个并列项,避免下次精读时漏写。
  • MERGE 同主题工作:multi-time attention 家族的 SeFT / GRU-D / Transformer-F 等时序建模代表,FlyP 完全没有提。

深度评估

  • 整体结构清晰(候选表 → 两条目深读 → Substack 线索 → 结论表 → 入库建议),可读性 8/10。
  • 批判维度基本到位:可信度、复现难度、风险都覆盖了。
  • 深度不足的两点:①对 MERGE 的方法拆解太浅,只看到路由升级,没看到 RUS 分解这个真正的方法论贡献;②对 SenseNova-SI 的"与同期工作 head-to-head"批评流于泛泛,没有把"为什么 SenseNova-SI 比 SpaceLLaVA 更系统"讲清楚。
  • 写作语气克制、无营销腔,符合精读稿规范。

误导风险

  • "temporal RUS(Recurrent Unit Sequence)" 是事实性错误而非误导,但读者若据此向团队复述会传错术语;建议立即更正。
  • 复现难度"256×H100 量级"略夸张——EASI 已经支持单卡跑 SenseNova-SI-1.5-InternVL3-8B 评测,应在文末补一句"评测侧门槛已被 EASI 拉低"。

与最新进展的差距

  • FlyP 精读日(2026-08-26)相对论文最新版本:SenseNova-SI v4 + 模型 1.5;MERGE v4。版本对齐 OK。
  • 缺一篇"空间智能主题页 v1"作为串联——FlyP 自己也在文末建议了"下一次精读日做主题页",应排入日程。

可执行修改建议(按优先级)

  1. [P0] 修正 RUS 术语:把 "temporal RUS(Recurrent Unit Sequence)" 改为 "temporal RUS 分解(Redundancy / Uniqueness / Synergy)",并在 §方法拆解 加一句"这是 MERGE 相对 FuseMoE/I2MoE 的真正新颖点"。
  2. [P0] 补 MERGE 5 类 baseline:Transformer / mTAND / MulT / MISTS / FuseMoE / I2MoE,至少在表格中作为"已有对比,未覆盖到的对照"列出。
  3. [P1] SenseNova-SI-8M taxonomy 显式化:列出 5 项能力分类。
  4. [P1] 修正复现难度描述:区分"训练成本(H100 量级)"和"评测成本(EASI 单卡即可)"。
  5. [P1] 在 SenseNova-SI §主要问题 增加对 EASI / SenseTime-SI-1.3/1.5 的引用,把社区生态写出来。
  6. [P2] 标题漂移点注:在 MERGE §核心贡献 末尾加一句"v3 用 dependencies,v4 改为 interactions,反映论文从信息论 dependency theory 向 interaction-aware routing 的定位调整"。
  7. [P2] 把 5 个并列主题词写进建议入库路径:SpaceLLaVA、SceneGPT、RoboMamba、3D-LLM、Embodied-Scan,避免下游 review 漏写。
  8. [P3] 下次精读日排程:主题页 "spatial-intelligence-roadmap" v1,把 SenseNova-SI + Fei-Fei Substack + SpaceLLaVA + EASI benchmark 串起来。

总结

  • 质量分:7/10——结构好、态度克制、批判点到位,但在 MERGE 方法核心(RUS 分解)和生态上下文(EASI、模型 1.3/1.5)上存在事实性术语错配与覆盖盲区。
  • 修正后预计可达 8.5/10
  • 建议:P0/P1 三处必改后再考虑入库 notes/;当前可暂存 inbox,不建议直接进 reviews/