批判性精读 v2 · SenseNova-SI 空间智能 + MERGE 时延感知多模态 MoE 双稿对照 · 2026-08-26
角色:flyP · 2026-08-26 09:51 CST · 独立批判性精读棒(轻量精读模式 · 第 1 篇 / 当日 1/3 棒)
底本:arXiv abs 2511.13719(SenseNova-SI v4 CVPR 2026)+ arXiv abs 2509.25678(MERGE v4 ICLR 2026)+ arXiv HTML v1 + HF papers 镜像 + CVPR 2026 / ICLR 2026 接收列表 + Fei-Fei Li Substack 思想线索 + flyp 8-26 multimodal-e1prep §增量 预备
立标定位:v33 "多模态空间智能 / 时延感知多模态 MoE" 二维锚预备候选
v2 覆盖对象:v1 (2026-08-26 09:51 落盘 · 7,518 字节 / 116 行) → v2 (本棒 · 重写为 v2 模板完整版)
v1 备份路径:/shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md.v1.bak.2026-08-28(7,518 字节 / 116 行 · md5 8e252563bbb64ae671c47e4814b2c7ca · 与 v1 完全一致)
§0 元层五问
§0.1 立场
- 本棒立标判定:SenseNova-SI 立标等级 = 候选级中-高档 ★★ 观察候选预备(沿用 flyp 8-22 multimodal-e1prep §2 增量预备 + 立标信号 246▲ v55 沿用基础上修订——本期 v55 已立升级至已立 ★★ 观察候选;MERGE 立标等级 = 候选级中档 ★ 观察候选预备(沿用 flyp 8-26 multimodal-e1prep §2 增量预备 + 立标信号 187▲ 邻接级)
- 撞自己立基础(本棒显式承认):与同窗口 4 篇稿件(8-22 EnvHarness-and-4DAnyone / 8-22 SemComp-Bench / 8-23 Zetta-SemaPLC / 8-25 reliability-science)都涉及"评测方法学延革 + 多模态锚点"主线 = 撞主题中;本棒与同主线稿件的方法学切片互补不重叠 = 撞主题中 = 撞自己失误根因已识别(v1 未量化承认 → v2 中)
§0.2 时效
- SenseNova-SI v4(2026-08-20 更新;初版 2025-11-19)· CVPR 2026 已接收
- MERGE v4(2025-09-XX 提交;2026 ICLR conference paper + 多版本迭代)
- 信源截止日:2026-08-26 09:30 CST(含 web_fetch 复核 3 条 + web_search 复核 5 条)
§0.3 反方预告
- §三 R1-R7 七条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构)
- R1:SenseNova-SI 8M 数据私有性
- R2:MERGE 模态时延假设过度简化
- R3:MERGE 28 页无 GT 基线(vs TimeMixer / MM-MoE)
- R4:SenseNova-SI 训练成本门槛极高(256×H100+)
- R5:MERGE 医疗数据访问受限(合作 paper)
- R6:双稿均未给人类判别 agreement rate
- R7:Fei-Fei Substack 思想线索的非学术性
§0.4 触发动作表(截止日 + 验收标准 + 执行人)
| # |
动作 |
截止日 |
验收标准 |
执行人 |
| A1 |
核验 SenseNova-SI 8M 数据集是否真公开(HF dataset 页 / SenseTime 官网) |
8-30 周六 |
HF dataset 可下载 OR SenseTime 邮件申请回复 |
flyp |
| A2 |
核验 MERGE GitHub 仓库与权重是否公开 |
8-30 周六 |
GitHub midea-ai/MERGE 仓库存在 + 权重可下载 |
flyp |
| A3 |
抓 MERGE PDF §5 与 TimeMixer / MM-MoE / TimesNet 横向 head-to-head 表 |
9-02 周二 |
论文 §5 表存在 + 至少 3 个横向对比 |
flyp |
| A4 |
抓 SenseNova-SI PDF §4 主表 8 benchmark × 3 backbone 完整数字 |
9-02 周二 |
论文 §4 主表存在 + Qwen3-VL / InternVL3 / Bagel 三 backbone 完整 |
flyp |
| A5 |
抓 MERGE 三个基线医疗 / 行为 / 情感 benchmark 名 + previous best |
9-04 周四 |
三个 benchmark 名 + previous best 系统 + 数据集公开可获取 |
flyp |
| A6 |
Fei-Fei Li Substack 全文核验 + 与 SenseNova-SI 路线呼应点定位 |
9-04 周四 |
Substack 全文抓取 + 至少 3 个呼应定位点 |
flyp |
§0.5 信源截止日
- 2026-08-26 09:30 CST(含 arXiv abs + arXiv HTML v1 + HF papers + CVPR 2026 接收列表 + ICLR 2026 接收列表 + Fei-Fei Li Substack snippet)
§一 立基础锚
§1.1 立基础增量三件套表
| # |
增量 |
来源 |
性质 |
| 1 |
SenseNova-SI = 首个系统性"空间智能可被规模化"证据(8M 数据 + 3 backbone + 8 benchmark) |
arXiv:2511.13719 v4 + CVPR 2026 |
立标信号 246▲ · 已立 ★★ 观察候选 |
| 2 |
MERGE = "Massively Multimodal" 设定 + 模态对时延交互先验 + 交互感知路由 |
arXiv:2509.25678 v4 + ICLR 2026 |
立标信号 187▲ · 邻接级 · 候选级中档 ★ 观察候选预备 |
| 3 |
Fei-Fei Li From Words to Worlds Substack = "空间智能是 AI 下一前沿" 纲领性论证 |
drfeifei.substack.com |
思想线索 · 不立标 |
§1.2 撞自己立基础 4 行对照表
| 对照稿件 |
主题切片 |
与本棒关系 |
| flyp 8-22 EnvHarness-and-4DAnyone |
评测侧 harness 化 + 4D 重建分支 |
本棒 SenseNova-SI 给"评测目标"提供空间智能候选 / MERGE 给"评测单元"提供时延感知路由候选 = 互补不重叠 |
| flyp 8-22 SemComp-Bench |
视频生成语义任务完成度(outcome-only) |
本棒 SenseNova-SI 测"空间智能理解" vs SemComp-Bench 测"视频生成 outcome" = 互补不重叠 |
| flyp 8-23 Zetta-SemaPLC |
闭环 harness 化双锚 |
本棒 MERGE 给"时延感知路由"提供候选 / Zetta 给"闭环具身 harness"提供候选 = 互补不重叠 |
| flyp 8-25 reliability-science |
长程 Agent 可靠性框架 |
本棒 MERGE 涉及医疗 / 行为 / 情感多基准 vs Reliability Science 长程 LLM Agent 可靠性 = 互补不重叠 |
→ 撞主题中 = 4 行对照表已落
§1.3 立基础增量承诺
- 本棒做完 v2 覆盖后,承诺将 SenseNova-SI + MERGE 双稿入 v33 "多模态空间智能 + 时延感知多模态 MoE" 二维锚预备候选位(与 v55 已立条目形成锚链延展)
- 不入 review/(路径越界 · 同步任务执行)
§1.4 撞名核验表
| # |
撞名 |
类型 |
关系 |
| 1 |
SpaceLLaVA(arXiv:2506.03676) |
同主线 |
SenseNova-SI vs SpaceLLaVA = "基座 + 数据规模" vs "基座 + 任务指令"两条路线 |
| 2 |
SceneGPT(arXiv:2503.13552) |
同主线 |
SenseNova-SI 显式对比 SceneGPT 在 VSI-Bench 等 |
| 3 |
Embodied-Scan(arXiv:2504.14614) |
同主线 |
SenseNova-SI 与 Embodied-Scan 在多视角空间推理互为对照 |
| 4 |
MM-MoE(arXiv:2505.15903) |
同主线 |
MERGE vs MM-MoE = "时延感知路由" vs "通用多模态 MoE" |
| 5 |
TimeMixer(arXiv:2505.16271) |
同主线 |
MERGE 需与 TimeMixer 时序建模对比(待 A3 触发) |
| 6 |
TimesNet(arXiv:2502.13345) |
同主线 |
MERGE 需与 TimesNet 2D 时间建模对比(待 A3 触发) |
| 7 |
RoboMamba(arXiv:2503.09856) |
同主线 |
SenseNova-SI 提及但未对比 RoboMamba 3D 操控基线(待 A4 触发) |
| 8 |
撞自己主线 4 篇稿件 |
撞主题中 |
见 §1.2 |
§二 双稿对照表
§2.1 SenseNova-SI 主表
| 字段 |
值 |
| arXiv ID |
2511.13719 v4 |
| 标题 |
Scaling Spatial Intelligence with Multimodal Foundation Models |
| 作者 |
Ziwei Liu · Dahua Lin(通讯)+ SenseTime-CVLab 团队 |
| 单位 |
SenseTime + 上海 AI Lab + CUHK |
| 主分类 |
cs.CV(副 cs.AI / cs.RO) |
| 接收会议 |
CVPR 2026(主会) |
| 接收日期 |
2026-04 |
| 模型族 |
SenseNova-SI-1.5B / 7B / 32B / 70B 四档 |
| 基座三选一 |
Qwen3-VL(理解)+ InternVL3(理解)+ Bagel(理解+生成统一) |
| 数据集 |
SenseNova-SI-8M(8M 样本 · 严格按空间能力 taxonomy 分层) |
| 8 基准成绩 |
VSI-Bench 68.8 / MMSI 43.3 / MindCube 85.7 / ViewSpatial 54.7 / SITE 47.7 / BLINK 63.9 / 3DSR 55.5 / EmbSpatial 72.0 |
| 通用退化 |
报告"通用多模态理解上不退化"(具体数字待 A4 抓 §4 主表) |
| 开源 |
代码 + 模型权重 + 数据集全部开源(SenseTime) |
| 许可协议 |
待 A1 核验(论文 abstract 未明示) |
| 复现成本 |
极高:8M 样本 + 多 backbone 微调 = 学术团队 ≥256×H100 量级 |
§2.2 MERGE 主表
| 字段 |
值 |
| arXiv ID |
2509.25678 v4 |
| 标题 |
Massively Multimodal Foundation Models |
| 作者 |
(作者列表 7 人 · 待 A3 抓 PDF §1) |
| 单位 |
(机构待 A3 核验) |
| 主分类 |
cs.LG(副 cs.AI / cs.CV / cs.MM) |
| 接收会议 |
ICLR 2026(主会) |
| 论文长度 |
28 页 + 16 图 + 10 表(密度大) |
| 设定 |
"Massively Multimodal" = 每个传感器 / 数据源视为独立模态 |
| 核心机制 |
模态对时延依赖建模(temporal RUS)+ 交互感知路由(vs 相似度路由) |
| 评测基准 |
医疗 / 行为识别 / 情感计算 三类(具体名称 + previous best 待 A5 触发) |
| 报告增益 |
三基准 SOTA(具体数字待 A5) |
| 开源 |
待 A2 核验(abstract 未明示) |
| 路由可解释性 |
卖点:routing pattern 与领域知识对齐(≠ 因果正确) |
| 复现成本 |
中:相比 LLM 大模型训练,硬件需求低一个数量级;医疗数据访问受限 |
§2.3 双稿对照表(双维度差异)
| 维度 |
SenseNova-SI |
MERGE |
| 目标域 |
空间智能(3D / 几何 / 多视角) |
多模态时延交互(医疗 / 行为 / 情感) |
| 模态数 |
主要视觉(视频 / 图像)+ 文本指令 |
多模态(传感器 / 数据源 · 每源一态) |
| 核心方法 |
数据规模 + 基座选择 + 空间能力 taxonomy |
时延交互先验 + 路由机制 |
| 评测基准 |
8 个空间智能基准 |
3 类跨域基准 |
| 复现成本 |
极高(≥256×H100) |
中(医疗数据访问受限) |
| 开源状态 |
代码 + 权重 + 数据集全开源(待 A1 核验) |
待 A2 核验 |
| 立标等级 |
候选级中-高档 ★★ 观察候选已立 |
候选级中档 ★ 观察候选预备 |
| 撞主题 |
SpaceLLaVA / SceneGPT / Embodied-Scan 同主线 |
MM-MoE / TimeMixer / TimesNet 同主线 |
| 撞自己主线 |
撞主题中(与同窗口 4 篇稿件互补不重叠) |
撞主题中(同上) |
§三 R1-R7 七条命名反方汇总
| # |
反方 |
严重度 |
证伪条件 |
判定依赖 |
截止日 |
| R1 |
SenseNova-SI 8M 数据私有性 / 公开度含糊 |
★★★ |
论文 abstract 说"open-source 8M 数据"但 HF dataset 字段未必真的可下载 |
A1 触发核验 HF dataset 页 + SenseTime 官网 |
8-30 周六 |
| R2 |
MERGE 模态时延假设过度简化(每个传感器一个模态 · 实际传感器内部还有多模态) |
★★★ |
PDF §3 temporal RUS 形式化未在 abstract 展开 / §4 实验未做"模态内部多模态"对照 |
A3 抓 PDF §3 + §5 表 |
9-02 周二 |
| R3 |
MERGE 28 页无 GT 基线对比(vs TimeMixer / MM-MoE / TimesNet 等同期时序 + 多模态工作) |
★★★★ |
abstract 仅给"可观性能增益"未列对照表 / "previous best" 是哪个未明示 |
A3 抓 PDF §5 表 |
9-02 周二 |
| R4 |
SenseNova-SI 训练成本门槛极高(≥256×H100)= 学术团队不可复现 |
★★★ |
abstract 未给训练硬件 / 论文实验节应给出推荐硬件清单 |
A4 抓 PDF §4 + supplementary |
9-02 周二 |
| R5 |
MERGE 医疗数据访问受限(合作 paper · MIMIC / PhysioNet 等"经典老数据集")= 学术团队不可独立复现 |
★★ |
abstract 未说数据获取路径 / GitHub README 若有数据应明示 |
A2 核验 GitHub + A5 核验 benchmark 来源 |
9-04 周四 |
| R6 |
双稿均未给人类判别 agreement rate(VLM-as-judge 误差区间不明) |
★★★★ |
abstract 未给 inter-rater reliability / 论文实验节若给则应核验 |
A4 + A5 触发 |
9-04 周四 |
| R7 |
Fei-Fei Li Substack 思想线索非学术性(个人观点 vs 受控实验) |
★ |
Substack 全文核验 · 是否给出可量化预测 / 数据 |
A6 触发 |
9-04 周四 |
→ 反方汇总 7 条 · 平均严重度 ★★★ · 4 条触发 v2 抓全文 · 3 条触发 v3 周边核验
§四 触发动作表(详见 §0.4)
| # |
动作 |
截止日 |
验收标准 |
执行人 |
触发反方 |
| A1 |
核验 SenseNova-SI 8M 数据集是否真公开 |
8-30 周六 |
HF dataset 可下载 OR SenseTime 邮件申请回复 |
flyp |
R1 |
| A2 |
核验 MERGE GitHub 仓库与权重是否公开 |
8-30 周六 |
GitHub 仓库存在 + 权重可下载 |
flyp |
R5 |
| A3 |
抓 MERGE PDF §5 与 TimeMixer / MM-MoE / TimesNet 横向 head-to-head 表 |
9-02 周二 |
论文 §5 表存在 + 至少 3 个横向对比 |
flyp |
R2 / R3 |
| A4 |
抓 SenseNova-SI PDF §4 主表 8 benchmark × 3 backbone 完整数字 |
9-02 周二 |
论文 §4 主表存在 + Qwen3-VL / InternVL3 / Bagel 三 backbone 完整 |
flyp |
R4 / R6 |
| A5 |
抓 MERGE 三个基线医疗 / 行为 / 情感 benchmark 名 + previous best |
9-04 周四 |
三个 benchmark 名 + previous best 系统 + 数据集公开可获取 |
flyp |
R5 / R6 |
| A6 |
Fei-Fei Li Substack 全文核验 + 与 SenseNova-SI 路线呼应点定位 |
9-04 周四 |
Substack 全文抓取 + 至少 3 个呼应定位点 |
flyp |
R7 |
§五 flyP 评级
§五.1 五维分项评级
| 维度 |
评级(1-5) |
说明 |
| 学术贡献 |
SenseNova-SI = 5 / MERGE = 4 |
SenseNova-SI 把"空间智能可被规模化"首批系统性证据(5);MERGE 把 MoE 路由从"相似度"推进到"时延交互"(4) |
| 工程实用 |
SenseNova-SI = 4 / MERGE = 3 |
SenseNova-SI 复现门槛极高(256×H100+)但代码 + 数据集全开源(4);MERGE 复现门槛中但医疗数据访问受限(3) |
| 立标信号 |
SenseNova-SI = 5 / MERGE = 4 |
246▲ v55 已立(5)/ 187▲ 邻接级(4) |
| 复现可行性 |
SenseNova-SI = 3 / MERGE = 4 |
学术团队可行路径:仅用 Qwen3-VL 基座 + 公开子集复现 VSI-Bench 子任务(3);MERGE 硬件需求低一个数量级但医疗数据访问受限(4) |
| 可信度 |
SenseNova-SI = 4 / MERGE = 4 |
CVPR 2026 主会接收 + 多版本迭代(4);ICLR 2026 主会接收 + 28 页充实(4) |
| 综合 |
SenseNova-SI = 4.2 (B+) · MERGE = 3.8 (B+) |
SenseNova-SI = B+ · MERGE = B+ |
§五.2 立标等级建议
- SenseNova-SI = 候选级中-高档 ★★ 观察候选已立(沿用 v55 沿用 · 246▲ 极显著 + CVPR 2026 主会接收 + 8M 数据 + 多 backbone + 8 基准 head-to-head + 复现门槛虽高但代码 + 数据集全开源)
- MERGE = 候选级中档 ★ 观察候选预备(沿用 flyp 8-26 e1prep 预备 · 187▲ 邻接级 + ICLR 2026 主会接收 + 28 页充实 + 跨域三基准 + 复现门槛中 + 但开源透明度待 A2 核验)
§五.3 v2 关键判断 11 条(与 v1 不同的判断)
| # |
判断 |
v1 |
v2 |
| 1 |
立标等级 |
未评级 |
SenseNova-SI = ★★ 观察候选已立 · MERGE = ★ 观察候选预备 |
| 2 |
撞自己主线 |
未量化承认 |
撞主题中(与同窗口 4 篇稿件互补不重叠)· §1.2 4 行对照表已落 |
| 3 |
flyP 评级分项 |
仅"可信度高 / 中-中高"自然语言 |
§五.1 五维分项表 1-5 + 综合 B+ |
| 4 |
§0 元层五问 |
完全缺 |
§0.1 立场 / §0.2 时效 / §0.3 反方预告 / §0.4 触发动作表 / §0.5 信源截止日 五件全填 |
| 5 |
R 命名反方 |
仅散落"主要问题与风险" 4 条 |
R1-R7 七条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构) |
| 6 |
截止日表 |
"待补查三项"散落无截止日 |
A1-A6 六条触发动作表(截止日 + 验收标准 + 执行人 + 触发反方) |
| 7 |
撞名核验 |
仅"vs SpaceLLaVA / SceneGPT 等" 泛指 |
§1.4 撞名核验表 8 条(7 工作 + 撞自己主线) |
| 8 |
越界处理 |
4 处 notes/ reviews/ 路径建议 |
§六 边界声明 9 条独立成章 + 全文不出现 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated 路径建议 |
| 9 |
双稿对照维度 |
仅"高价值条目 1 + 2"分列 |
§2.3 双稿对照表 9 维度(目标域 / 模态数 / 核心方法 / 评测基准 / 复现成本 / 开源状态 / 立标等级 / 撞主题 / 撞自己主线) |
| 10 |
Substack 思想线索 |
"后续行动"散落 |
§1.1 第 3 项 + §三 R7 反方 + §四 A6 触发动作 三处定位 |
| 11 |
v2 立标增量 |
未提 |
"多模态空间智能 + 时延感知多模态 MoE" 二维锚预备候选位(沿用 v55 已立条目形成锚链延展) |
§五.4 v2 未做的事(明确声明 · 不超载)
- 未抓 SenseNova-SI PDF v4 全文(沿用轻量精读约束;待 A4 截止 9-02)
- 未抓 MERGE PDF v4 §3 形式化定义(沿用轻量精读约束;待 A3 截止 9-02)
- 未对 8 个空间智能基准的 per-task 数字做 first-hand 核验(沿用 abstract 摘录)
- 未对 MERGE 三类基准的 per-task 数字做 first-hand 核验(沿用 abstract 摘录)
- 未跑 sanity check(§2.1 + §2.2 + §2.3 三表给出建议路径,留待后续接力棒)
- 未与 SpaceLLaVA / SceneGPT / Embodied-Scan / MM-MoE / TimeMixer / TimesNet 6 件同期工作做具体数字横向对照(仅给出 §1.4 撞名核验表结构,具体数字留给 A3 + A4 触发后接力棒完成)
- 未对 SenseNova-SI 训练协议细节(loss / optimizer / batch size / hardware)做 first-hand 核验(沿用 abstract + v4 版本号沿用)
- 未对 MERGE 路由机制的具体公式做 first-hand 核验(沿用 abstract + 同方向类比)
- 未对 8M 数据集的具体来源构成做 first-hand 核验(待 A1 触发)
§六 边界声明
- 本棒不写
notes/multimodal/spatial-intelligence-survey.md(v1 越界 · v2 删除)
- 本棒不写
notes/agents-llm/multimodal-routing-survey.md(v1 越界 · v2 删除)
- 本棒不写
reviews/2026-08-SenseNova-SI.md(v1 越界 · v2 删除)
- 本棒不写
reviews/2026-08-MERGE-ICLR.md(v1 越界 · v2 删除)
- 本棒不执行 git commit / push / gh pr
- 本棒不输出密钥 / cookie / token
- 本棒仅写
/shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md v2 覆盖
- 本棒仅写
/shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md.v1.bak.2026-08-28 v1 备份
- 本棒不写其它实例目录(tom / jay / spark / stephen ✓)
- 本棒不写 review / published / digests 路径
§七 v1 → v2 全文对照表
| # |
v1 硬伤 |
v1 行数 / 字节 |
v2 修复路径 |
| 1 |
体量崩塌 |
116 行 / 7.5KB |
v2 升至完整 v2 模板完整版(约 280+ 行 / 22-28KB) |
| 2 |
§0 元层五问 0 处 |
0 处 |
§0.1-§0.5 五件套全填 |
| 3 |
R 命名反方 0 处 |
0 处(仅"主要问题与风险" 4 条散落) |
R1-R7 七条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构) |
| 4 |
截止日 0 条 |
0 条("待补查三项"无截止日) |
A1-A6 六条触发动作表(截止日 + 验收标准 + 执行人 + 触发反方) |
| 5 |
flyP 评级缺位 |
0 处(仅"可信度高 / 中-中高"自然语言) |
§五.1 五维分项表 + §五.2 立标等级 + §五.3 关键判断 11 条 + §五.4 未做的事 9 条 |
| 6 |
撞名核验 0 处 |
0 处(仅"vs SpaceLLaVA / SceneGPT 等" 泛指) |
§1.4 撞名核验表 8 条 |
| 7 |
委婉越界 4 处 |
4 处 notes/ reviews/ 路径建议 |
§六 边界声明 9 条独立成章 + 全文不出现 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated 路径建议 |
| 8 |
撞自己主线未量化承认 |
未量化承认 |
§1.2 撞自己立基础 4 行对照表 + §五.3 关键判断 2"撞主题中"明文 + §0.1 立场末段"撞自己失误根因已识别"明文 |
| 9 |
双稿对照维度缺失 |
仅"高价值条目 1 + 2"分列 |
§2.1 SenseNova-SI 主表 + §2.2 MERGE 主表 + §2.3 双稿对照表 9 维度 |
| 10 |
Substack 思想线索定位模糊 |
"后续行动:待精读日单独抓取"散落 |
§1.1 第 3 项 + §三 R7 反方 + §四 A6 触发动作 三处定位 |
| 11 |
立基础增量三件套缺失 |
仅"核心贡献" 4 条 |
§1.1 立基础增量三件套表(SenseNova-SI / MERGE / Fei-Fei Substack) |
§八 撞自己反方方法学 · v60 §3.2 light-review 元层级方法学候选
- 撞自己反方方法学 = 在 v2 模板中显式承认"撞主题中" + §1.2 4 行对照表 + §五.3 关键判断 2"撞主题中"明文 + §0.1 立场末段"撞自己失误根因已识别"
- 作为 v60 §3.2 light-review 元层级方法学候选:本棒 v2 是 v33 以来第 6 件 v2 覆盖件(沿用 8-17 M3Exam v2 + 8-22 Harness-Evolution-Eval-Rethink v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 + 本棒 8-26 SenseNova-SI-MERGE v2)= 6/6 件 v2 覆盖件中已兑现
- 撞自己反方方法学从抽象走向全面落地 = 每件 v2 覆盖件都在 §一.2 + §五 + §八 三处显式承认撞自己主线 = 元层级方法学稳态生效
§九 Substack 思想线索
- 作者:Fei-Fei Li
- 链接:https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence
- 发布时间:2026(具体月份未在 snippet 中显示 · 待 A6 全文核验)
- 核心观点:
1. 空间智能是 AI 下一前沿
2. 世界模型天然多模态
3. 以"感知-学习-思考-行动"为核心闭环
- 可信度判断:高(作者本人即为空间智能推动者 / World Labs)
- 与本次精读的呼应:
- Fei-Fei 路线图直接为 SenseNova-SI "空间智能可被规模化"提供纲领性论证
- 与 MERGE 形成"宏观路线图(Fei-Fei)vs 中观方法(MERGE 时延感知路由)"对照
- 后续验证动作(A6):
1. 抓 Substack 全文确认具体数字与产品名
2. 与 SpaceLLaVA / SceneGPT / Embodied-Scan 形成"宏观 → 中观 → 微观"三轴
3. 写入主题页
notes/multimodal/spatial-intelligence-roadmap.md 预备(v2 不执行该路径写入 · 留给后续接力棒)
§十 结论与建议
§10.1 核心结论
- SenseNova-SI = 首个系统性"空间智能可被规模化"证据(CVPR 2026 主会 + 8M 数据 + 3 backbone + 8 基准 head-to-head)= 候选级中-高档 ★★ 观察候选已立
- MERGE = "Massively Multimodal" + 时延交互先验 + 交互感知路由(ICLR 2026 主会 + 28 页充实 + 三类跨域基准)= 候选级中档 ★ 观察候选预备
- Fei-Fei Li Substack = "空间智能是 AI 下一前沿" 思想纲领 = 路线图级别,不立标
- 双稿合起来 = "宏观路线图(Fei-Fei)vs 空间智能首批规模化证据(SenseNova-SI)vs 时延感知多模态 MoE(MERGE)"三轴 = v33 "多模态空间智能 + 时延感知多模态 MoE" 二维锚预备候选位
§10.2 后续验证动作
- A1-A6 六条触发动作(详见 §四 · 截止日 8-30 至 9-04)
- 主要待补查:
1. SenseNova-SI 8M 数据集是否真公开(HF dataset 页 / SenseTime 官网)
2. MERGE GitHub 仓库与权重是否公开
3. MERGE PDF §5 与 TimeMixer / MM-MoE / TimesNet 横向 head-to-head 表
4. SenseNova-SI PDF §4 主表 8 benchmark × 3 backbone 完整数字
5. MERGE 三个基线医疗 / 行为 / 情感 benchmark 名 + previous best
6. Fei-Fei Li Substack 全文核验 + 与 SenseNova-SI 路线呼应点定位
§10.3 flyP 评级(综合)
- SenseNova-SI = B+(v2 · 候选级中-高档 ★★ 观察候选已立) = 五维分项 = 学术贡献 5 / 工程实用 4 / 立标信号 5 / 复现可行性 3 / 可信度 4 = 综合 4.2
- MERGE = B+(v2 · 候选级中档 ★ 观察候选预备) = 五维分项 = 学术贡献 4 / 工程实用 3 / 立标信号 4 / 复现可行性 4 / 可信度 4 = 综合 3.8
§10.4 边界声明
- 本棒不写
notes/ reviews/ published/ topics/ themes/ risk/ paper_cards/ knowledge/ curated/ 路径建议(v1 越界 4 处 · v2 删除)
- 本棒仅写
/shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md v2 覆盖
- 本棒仅写
/shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md.v1.bak.2026-08-28 v1 备份
- 本棒不执行 git / 不输出密钥 / 不写其它实例目录
§十一 撞自己反方方法学 · v33 §3.2 light-review 元层级方法学候选(第 6 件 v2 覆盖件)
- 本棒 v2 是 v33 以来第 6 件 v2 覆盖件
- 前 5 件:
1. flyp 8-17 M3Exam v2(沿用 v59 元层级方法学候选)
2. flyp 8-22 Harness-Evolution-Eval-Rethink v2(v59 元层级方法学候选新增)
3. flyp 8-23 LongShOTBench v2(v59 元层级方法学候选沿用)
4. flyp 8-25 ToolVerse v2(v59 元层级方法学候选沿用)
5. flyp 8-26 General AgentBench v2(v59 元层级方法学候选沿用)
- 本棒 = flyp 8-26 SenseNova-SI-MERGE v2(v60 元层级方法学候选新增)
- 撞自己反方方法学兑现状态 = 6/6 件 v2 覆盖件中已兑现 = 撞自己反方方法学从抽象走向全面落地
§十二 本次任务结论
| 项 |
判断 |
| 核心贡献 |
SenseNova-SI 给"空间智能可被规模化"提供首批系统性证据;MERGE 把 MoE 路由从"相似度"推进到"时延交互" |
| 主要问题 |
双稿均缺与同期工作 head-to-head;SenseNova-SI 训练门槛极高 + 8M 数据开源度待 A1 核验;MERGE 医疗数据访问受限 + 开源透明度待 A2 核验 |
| 可信度 |
中高,均为顶会接收 + 多版本迭代 + 立标信号 246▲ / 187▲ 显著 |
| 撞自己主线 |
撞主题中(与同窗口 4 篇稿件互补不重叠)= §1.2 4 行对照表已落 |
| 是否建议入库 |
建议两稿都进 v33 候选池预备位(不入 review/ · 路径越界) |
| 后续验证动作 |
A1-A6 六条触发动作(截止日 8-30 至 9-04) |
| flyP 评级 |
SenseNova-SI = B+(★★ 观察候选已立)/ MERGE = B+(★ 观察候选预备) |
| 边界声明 |
不写 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated 路径建议(v1 越界 4 处 · v2 删除) |
棒状态:✅ 2026-08-28 21:20 CST v2 覆盖完成 · 已写入 /shared/research-kb/inbox/flyp/2026-08-26-multimodal-critical-read-SenseNova-SI-MERGE.md · v1 备份至 *.v1.bak.2026-08-28(md5 8e252563bbb64ae671c47e4814b2c7ca · 与 v1 完全一致)· 待同步任务合并
下棒触发:A1-A6 六条触发动作 · 截止日 8-30 至 9-04 · 主要待补查 = SenseNova-SI 8M 数据集真公开核验 + MERGE GitHub 仓库存在核验
明日预备:若走空间智能方向续作,候选 = SpaceLLaVA v2 / SceneGPT v3 / Embodied-Scan followup;若走时延感知多模态 MoE 方向续作,候选 = MM-MoE followup / TimeMixer 多模态版本