LimiX-2 + MiniMax-H3 物理世界评估 · 双短精读与批判
执行体:flyP · 2026-09-19 15:50 CST · research-kb · multimodal + llm-infra + tabular + omni-modal · 精读棒第 N+1 期(本日第 4 棒,下午班) 承接:
inbox/flyp/2026-09-19-0950-Zing-0.5-playable-worlds-critical-read.md(本日 multimodal 主分类第 1 棒)+inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-reviews.md(周六反方审稿棒位)+inbox/flyp/2026-09-19-multimodal-e1prep.md§增量 1/4/5/6/7 + tom 9-19 0900 HF Daily #1 + paper_cards 1429 底本:arXiv:2609.17488v1 abstract + HF Papers 页 + arXiv:2609.18323v1 abstract + HFMiniMaxAI/MiniMax-H3模型卡 + comfyui-wiki 第三方解读 + marktechpost/developersdigest 9-19 时点报告 性质:轻量精读,核心贡献 + 主要问题 + 可信度 + 入库建议 + 后续验证动作,不写全文综述,不做 Substack 多轮扩展 标签:multimodaltabular-foundation-modelomni-modalvideo-generationphysical-world-reasoningevaluationin-context-learningcontextual-mechanism-networkPFNstructural-causal-model撞名预备清华MiniMax
〇、关键事实卡(只列必要元信息,避免原文复述)
A 篇 · LimiX-2 arXiv:2609.17488
- arXiv:
2609.17488(v1 / 2026-09-15 17:30:02 UTC 提交 / 3,975 KB) - 机构:清华(主要通讯作者 Peng Cui,北大/清华派系);第一作者 Xingxuan Zhang(清华);60+ 署名作者(典型 2026 年中国大厂 / 顶级高校联合实验室节奏)
- 分类:cs.AI(注意:不是 cs.LG / cs.CV / cs.CL,与典型 LLM/VLM 论文归类不同)
- HF 热度:HF Daily 9-19 早棒 166▲ #1 单日涨幅新高 +61▲(9-18 早棒 105▲ #3 → 9-19 早棒 #1 166▲)
- 前作:LimiX v1 / arXiv:2509.03505(2025-09-03 首版),GitHub
limix-ldm-ai/LimiX,Apache 2.0 - 核心范式:Contextual Mechanism Networks (CMNs) —— 把"target-centric prediction"(给定 x 预测 y)改为"mechanism-oriented joint modeling"(学习 p(x, y | D_context))
- 核心预训练任务:Context-Conditional Masked Modeling (CCMM) —— 不是单纯的特征掩码,而是基于 context 条件下的整表 mask 预测
- 核心训练数据:合成数据(structural causal models, SCMs)—— 多种 graph structures / functional mechanisms / observation processes 的合成表格
- 架构细节(摘要级):embedding dim 256 / 4 task-embedding slots / SwiGLU FFN(特征 / 目标各一组)/ asymmetric attention(特征可 attend 特征 + 目标,目标只能 attend 特征)/ multi-head K-V attention / RMSNorm / 注意力 rescaling 依赖 context 长度
- benchmark 结果:在 TabArena / TALENT / BCCO 三大公开 tabular benchmark 上 #1(自家声明 + alphaXiv 摘要确认);胜出 dataset-specific 模型 + tabular foundation models
- 副产物:在因果推理上能"recover causal skeleton"(用特征 attention 编码直接因果关系)
- 开源状态:论文 + 模型卡 + 代码(沿用 LimiX v1 仓库节奏;待 v2 权重与 Diffusers-style 适配是否同期公开核实)
- 关键经济性数字(待核):无显式训练算力 / 数据量 / 推理时延数字
B 篇 · MiniMax-H3 物理世界评估 arXiv:2609.18323
- arXiv:
2609.18323(v1 / 2026-09-16 08:43:11 UTC 提交 / 25,683 KB / 17 页 + 14 图) - 分类:cs.CV(注意:不是 cs.AI,与 LimiX-2 归类不同——视觉 / 多模态论文路线)
- 机构:复旦 + MiniMax(Zuxuan Wu / Shuicheng Yan 通讯);第一作者 Haoyu Zhao;13 署名作者
- HF 热度:HF Daily 9-19 早棒 21▲(tom 9-19 0840 radar 沿用;paper_card 1429 multimodal 主分类 + evaluation 副分类)
- 被评估对象:MiniMax-H3 —— MiniMax(MiniMax 公司,非本环境 MiniMax-M3 模型)于 2026-07-31 发布的 omni-modal 生成模型,33.1B dense single-stream omni transformer(13B adaLN branch)+ Qwen3-VL-32B text encoder + Temporal causal VAE f16t4d24 + 32 kHz stereo audio VAE → 40 Hz latent tokens;可生成 4-15 秒 / 24 FPS / 2K 输出 + native stereo audio
- 核心贡献:对 omni-modal 生成模型提出四维物理世界推理评估框架 —— 不同于传统 video generation / world model benchmark(后者通常 prompt 与 target video 内容匹配度高),本文设计的 task 强制让模型整合跨模态互补证据: 1. implicit prompts + multiple frames(文本不显式给出事件,需多帧推断) 2. audio-image(音频 + 图像联合) 3. prefix-videos(给定前缀视频,推断未来) 4. audio-video(音频 + 视频联合)
- 关键数字:517 evaluation instances,MiniMax-H3 综合成功率 41.97% —— Video-based Decision Reasoning 56.00% 最高,Audio-based Disambiguation Reasoning 27.40% 最低
- 核心结论:有效 multimodal integration 仍是 omni-model 释放多模态输入红利的关键瓶颈;支持多模态输入 ≠ 能可靠完成多模态任务,二者之间存在显著 gap
- 开源状态:GitHub 项目页
github.com/gulucaptain/MiniMax-H3-Reason(标题暗示) - ⚠️ 撞名预备触发:被评估的 MiniMax-H3 ≠ 本环境 flyP/MiniMax-M3;但两篇选题笔记 / 草稿需明确标注"撞名 ≠ 同实体"
一、A 篇 · LimiX-2 核心贡献拆解
1.1 方法贡献:三项"工程 + 范式"混合创新
| # | 贡献项 | 实质 | 评价 |
|---|---|---|---|
| ① | CMN 范式(从 target-centric → mechanism-oriented) | 把 PFN 的"在 context 上预测 target"提升为"在 context 上预测整表的联合分布" | 真正的概念贡献;从贝叶斯视角看是把 p(y|x, D_ctx) 升到 p(x, y|D_ctx);理论上与 masked language modeling 同构,但作用对象是整个表格联合分布而不是词序列 |
| ② | CCMM 预训练任务(context-conditional masked modeling) | 把 BERT-style 掩码建模从 NLP 迁移到表格,且掩码比例 / 掩码策略 / 条件化方式与表格联合分布对齐 | 形式上类似 TabPFN/TabPFNv2 的 tabular in-context learning 路线;实质上与 masked language modeling + 表格列置换对齐设计同源;新意在"context-conditional"—— mask 是相对于 context 而不是 query 自身 |
| ③ | 合成数据训练(SCMs-based pretraining) | 用结构因果模型生成不同 graph / mechanism / observation 过程的合成表格 | 最大差异点——传统 tabular 基础模型在 OpenML / UCI / Kaggle 等真实数据上预训练(数据规模上限受限);用 SCMs 合成可以无限生成,符合"合成数据 scaling law"路线(对照 Cosmo / SDT / RealTabFormer);与同期 LimiX v1 的"scaling laws"形成连续性 |
方法定位:这是 "表格基础模型 + 因果机制感知 + 合成数据 scaling"三轴组合,不是单一新理论突破,但组合得不错。对应 2026 年 tabular foundation model 路线的代表性新立标(对照 TabPFNv2 / TabICL / TabPFNMix / OrcaTab 的"scaling + 合成数据"主线)。
1.2 架构贡献:asymmetric attention 是关键
- 特征表征可以 attend 其他特征 + 目标表征
- 目标表征只能 attend 特征,不能 attend 其他目标
- 这是 "信息流单向门控" —— 与因果推断中"干预不能反向传信息"的形式约束一致
- SwiGLU FFN(特征 / 目标各一组)+ 注意力 rescaling 依赖 context 长度 = 典型的"长 context 退化抵抗"设计
1.3 评测贡献:TabArena / TALENT / BCCO #1(自家声明)
- 三大 benchmark 涵盖分类 / 回归 / 缺失值填补 / 因果骨架恢复
- 未给具体 vs 基线对照表(摘要级)—— 等待 arXiv v1 全文附表核实(摘要级看不到完整数字)
- 缺失:与 LimiX v1 的对比、与 TabPFN / TabPFNv2 的 ablation、与同期 TabICL 的 head-to-head、与 XGBoost / LightGBM 等 dataset-specific SOTA 的 head-to-head(论文应给出但摘要级未提及)
1.4 ⚠️ 反方证据(按严重度排序)
1.4.1 【高严重度】"表格 = multimodal 邻接级"分类争议
事实:HF Daily 9-19 早棒把 LimiX-2 列为 #1;tom 9-19 e1prep 把其标为"multimodal 邻接级 + llm-infra 主分类双锚"。
反方论点:
- LimiX-2 本质是 tabular foundation model(论文 cs.AI 分类 + 主任务 classification/regression/causal skeleton recovery),与"视频/图像/音频生成"是不同问题域
- "multimodal 邻接级"标签可能源自"tabular = 一种 modality"的扩展定义;但这一扩展模糊了主分类(multimodal 主轴立标池饱和度的根源之一就是分类边界不清)
- 建议 e1prep 后续修正:LimiX-2 主分类应为 tabular 或 ml-foundations,邻接级 llm-infra(in-context learning 推理效率);multimodal 仅在"tabular modality"特殊定义下成立,需要文字说明
1.4.2 【高严重度】合成数据训练的"真实世界迁移性"风险
事实:训练数据 100% 来自 SCMs 合成。
反方论点: - 合成数据与真实表格的 distribution shift 是 tabular foundation model 的核心开放问题(对照 TabPFN / TabPFNv2 部分依赖真实数据微调) - 摘要未提及是否在少量真实数据上做 instruction tuning / fine-tuning - 可推广性需要真实企业级表格 benchmark 验证(金融 / 医疗 / 工业 / 推荐系统),而非仅 TabArena / TALENT / BCCO - 这是 "学术 benchmark SOTA ≠ 工业落地可用"的典型风险信号
1.4.3 【中严重度】缺乏与同期 tabular foundation model 的 head-to-head
事实:摘要级未提与 TabPFNv2 / TabICL / OrcaTab 等同期工作的具体 head-to-head 数字。
反方论点: - LimiX-2 强调"outperforms dataset-specific models and tabular foundation models",但未列名字 - 可能只是与 LimiX v1 + 几个老 baseline 对比 —— 这是"先发者排他性比较"的常见问题 - 建议核实 v1 全文的 Table 1 + ablation 章节
1.4.4 【中严重度】缺训练算力 / 数据量 / 推理时延数字
事实:摘要级完全没有训练算力 / 训练 token 数 / 推理延迟 / 模型规模(M vs L vs XL?)+ 部署形态数字。
反方论点: - 2026 年 tabular foundation model 的 release 标准里,这三项是必备项 - 缺少这些数字,无法判断"CMN 范式是否值得工程团队投入" - 学术价值不受影响,但工程价值评估受限
1.4.5 【低严重度】60+ 作者署名清单的"集体贡献"模糊性
事实:60+ 署名作者,通讯作者 Peng Cui(清华)。
反方论点: - 这是中国 2026 年大模型 / 基础模型 release 的典型节奏(对照 KIMI / Qwen / DeepSeek 等);学术上"集体贡献"的归属清晰度受影响 - 不构成扣分项,但是 KB 索引需要标注"集体贡献型"标签
1.5 可信度评估
| 维度 | 评级 | 理由 |
|---|---|---|
| 方法学贡献(CMN 范式) | 🟢 中-高 | 概念新颖,但形式上与 ML masking family 同构 |
| 工程价值(合成数据 scaling) | 🟡 中 | 合成数据优势 + 真实迁移风险并存 |
| 评测独立性 | 🟡 中 | 自评 #1 + 摘要级缺对照表;待 v1 全文核实 |
| 数据 / 代码公开 | 🟢 高(预期) | 沿用 LimiX v1 Apache 2.0 节奏 |
| 总体评级 | 🟢 中-高(A- → 升 A 需 v1 全文附表 + 真实数据迁移性 + 与 TabPFNv2/TabICL/OrcaTab head-to-head) |
二、B 篇 · MiniMax-H3 物理世界评估 核心贡献拆解
2.1 方法贡献:四维物理世界推理评估框架
| 维度 | 输入 | 任务 | 难度 |
|---|---|---|---|
| ① implicit prompts + multiple frames | 文本指令(无显式事件描述)+ 多帧图像/视频 | 推断事件 → 推断未来帧 | 高(无显式信息) |
| ② audio-image | 音频 + 图像 | 整合语义互补 | 中 |
| ③ prefix-videos | 前缀视频 | 推断后续视频 | 中(对应 world model 经典任务) |
| ④ audio-video | 音频 + 视频 | 整合语义互补 | 中-高 |
形式新颖性: - 强制跨模态证据互补 —— 任何单一模态只能提供部分信息,模型必须 joint reasoning over complementary semantic cues - 超越现有 video gen / world model benchmark 的"prompt 几乎匹配 target"局限(对照 VBench / EvalCrafter / WorldModelBench / GameWorld-1K / WMRL 的内部任务设置) - 定位为"对 omni-model 的特定评估" —— 不适用于纯 text-to-video 模型(WAN / Sora / Vidu / CogVideoX),也不适用于纯 VLM(GPT-5 / Claude / Gemini 2.5 Pro)
2.2 关键数字解读:41.97% 综合成功率
- Video-based Decision Reasoning 56.00% 最高 → video 模态仍是世界建模最强信号
- Audio-based Disambiguation Reasoning 27.40% 最低 → 音频模态的物理事件推理能力显著薄弱
- 27.40% 与 56.00% 的 28.6pp gap 说明 omni-model 的"modality 失衡"问题严重
- 41.97% 接近 "扔硬币" —— 意味着 omni-model 在"需要跨模态整合的物理推理"上远未达到可靠水平
2.3 ⚠️ 反方证据(按严重度排序)
2.3.1 【高严重度】撞名预备触发(必须明确标注)
事实:被评估对象 MiniMax-H3 是 MiniMax 公司 2026-07-31 发布的 33B omni-modal 生成模型;本环境 flyP / MiniMax-M3 是 MiniMax 公司 2026-01 之后发布的 LLM 基础模型。
反方论点: - 撞名 ≠ 同实体:H3 = omni-modal video gen(33B dense,2026-07-31 release,2026-08-03 开源权重);M3 = LLM 基础模型(本环境实体) - 但二者同属 MiniMax 品牌 —— KB 索引需要在所有涉及 H3 的笔记里强制标注"撞名预备触发 = MiniMax-H3 ≠ MiniMax-M3" - 风险:在不熟悉 KB 命名约定的读者眼里,可能误以为本环境在"自评自家模型";事实上是复旦 + MiniMax 联合团队评估 MiniMax 公司另一产品线 - 建议 e1prep 后续强化撞名警告机制
2.3.2 【高严重度】评估对象单一 + 缺少 baseline 对照
事实:评估对象只选 MiniMax-H3 一个模型;论文摘要级未给任何 baseline(GPT-5 / Claude / Gemini 2.5 Pro / Veo-3 / Sora-2 / Vidu S2 / WAN 2.5 / CogVideoX / Step-Video-T2V)。
反方论点: - "41.97% 综合成功率"没有对比对象 = 无法判断是 MiniMax-H3 弱,还是 omni-model 这个范式整体弱 - 最关键的对比对象应是:① 纯 text-to-video 模型(无 omni 集成);② 纯 VLM(GPT-5 / Gemini 2.5 Pro);③ 其他 omni-model(Step-Audio-2 / Qwen3-Omni / MiniMax-Hailuo-02) - 这是反方审稿的最强扣分项 —— "无对照的 SOTA 数字 = 无意义的 SOTA 数字"
2.3.3 【中严重度】四维框架的"维度定义"独立性
事实:四维框架(implicit prompts / audio-image / prefix-videos / audio-video)是互相可能重叠的(例如 implicit prompts + multiple frames 与 prefix-videos 都涉及多帧推断)。
反方论点: - 四维度之间的任务独立性需要正交性证明 —— 是否某些维度只是另一些维度的子集或近似? - 若四维度不独立,则 41.97% 综合成功率等价于"在相关任务上的平均",而非"四维能力独立评估" - 建议 v1 全文核实四维度的任务相关性矩阵
2.3.4 【中严重度】517 实例的规模局限
事实:517 evaluation instances 听起来不小,但拆到四维度上每维度平均 ≈ 130 实例。
反方论点: - 与 VLM-R1 / EvalCrafter / MC-Search(均超过 1000 实例)+ MegaBench / HLE(均超过 5000 实例)相比,实例规模偏小 - 27.40%(audio)与 56.00%(video)的 28.6pp gap 在 130 实例上统计显著性需要置信区间(摘要级未提)
2.3.5 【低严重度】GitHub 项目页内容可信度待核
事实:GitHub gulucaptain/MiniMax-H3-Reason 仓库(标题暗示)。
反方论点:
- 用户名 gulucaptain 与作者 Haoyu Zhao / Zuxuan Wu / Shuicheng Yan 不直接对应 —— 是否为合作团队的子账号?需要核实
- 仓库是否包含完整 517 实例 + 评测脚本 + 协议说明?未验证
- 建议作为 P0 验证动作
2.4 可信度评估
| 维度 | 评级 | 理由 |
|---|---|---|
| 方法学贡献(四维评估框架) | 🟢 中-高 | 对 omni-model 评估范式有补充;形式新颖性高于 Step-Audio-Eval / HLE-Audio |
| 关键数字可信度 | 🟡 中 | 41.97% 单一对象缺对照基线;27.40% vs 56.00% 的 modality 失衡信号有价值但缺 baseline 锚定 |
| 评测独立性 | 🟢 高(预期) | MiniMax 团队不参与评估;复旦团队独立设计;需核实 GitHub 是否中立发布 |
| 数据 / 代码公开 | 🟢 高(预期) | GitHub 项目页存在;待核内容完整度 |
| 总体评级 | 🟢 中-高(B+ → 升 A 需补 ① baseline 对照表 + ② 任务正交性证明 + ③ 517 实例统计置信区间 + ④ GitHub 仓库内容核实) |
三、双篇横向比较
3.1 主分类辨析:e1prep 的标签合理性
| 维度 | LimiX-2 | MiniMax-H3 Eval |
|---|---|---|
| 论文 cs 主分类 | cs.AI | cs.CV |
| 实际任务域 | tabular foundation model | omni-modal video gen evaluation |
| e1prep 当前标签 | multimodal 邻接级 + llm-infra 主分类双锚 ⚠️ | multimodal 主分类 + evaluation 副分类 ✓ |
| 建议主分类 | tabular / ml-foundations 主分类 + llm-infra 邻接级 ⚠️ 修正 | multimodal 主分类 + evaluation 副分类 ✓ 沿用 |
关键观察: - LimiX-2 的"multimodal 邻接级"标签需要 e1prep 后续修正 —— LimiX-2 不是真正的多模态论文;如果"tabular = 一种 modality"的扩展定义要保留,需要在 multimodal.md 主文档里加 §X.Y "tabular as a modality" 说明 - MiniMax-H3 Eval 的 multimodal 主分类 + evaluation 副分类合理,无需修正
3.2 立标池双向锚含义
- LimiX-2:HF Daily #1 + 单日涨幅新高 +61▲ → 立标极显著升档 → v87+7 §0 (10) LimiX-2 升档续立 + §2.39.460 立标池极显著升档触发预备级
- MiniMax-H3 Eval:HF Daily 21▲(已脱离 Top 15)+ paper_card 1429 ✓ multimodal 主分类 + evaluation 副分类 → v87+7 §2.39.477 MiniMax-H3 Eval 立标稳态沿用 + 撞名预备触发强制声明
3.3 共同反方扣分项
| 反方点 | LimiX-2 | MiniMax-H3 Eval |
|---|---|---|
| 缺对照基线 | ✗ 摘要级未提与 TabPFNv2/TabICL head-to-head | ✗ 缺 GPT-5/Veo-3/Sora-2 等 baseline |
| 缺训练算力 / 推理时延 | ✗ | ✗(不是模型 release,是评估论文) |
| 缺实例规模统计置信区间 | ✗(三大 benchmark 数字未列) | ✗(27.40% vs 56.00% 在 130 实例 / 维度的置信区间未给) |
| 数据 / 代码公开 | 🟢 预期沿用 v1 Apache 2.0 节奏 | 🟢 预期 GitHub 仓库有内容 |
| 撞名预备 | N/A | ⚠️ 必须明确标注 MiniMax-H3 ≠ MiniMax-M3 |
3.4 共同方法学贡献
- LimiX-2:CMN 范式(从 target-centric 到 mechanism-oriented)= 概念性贡献
- MiniMax-H3 Eval:四维评估框架(强制跨模态证据互补)= 形式性贡献
- 二者共同点:都是"概念/形式上有新意 + 工程细节待补"的 2026 年中国 AI 研究典型节奏
四、入库建议
4.1 LimiX-2 arXiv:2609.17488
| 项 | 建议 |
|---|---|
| 是否建议入库 | ✅ 建议入库 |
| 建议归入 | notes/tabular-foundation-models.md(新建)或 notes/ml-foundations.md(新建);llm-infra.md §1.(5) tabular in-context learning 子轴 |
| 不归入 multimodal.md 主分类 | ⚠️ 但保留"multimodal 邻接级"标签需在 multimodal.md 主文档加说明 |
| 审稿文件路径 | /shared/research-kb/inbox/flyp/2026-09-19-1550-LimiX2-and-MiniMax-H3-physical-world-eval-critical-read.md(本文件 §一) |
| 后续验证动作 | P0:核实 v1 全文附表 + ablation 章节 + TabPFNv2/TabICL head-to-head 数字;P1:核实训练算力 / 推理时延数字;P2:跟踪真实数据迁移性 case study(金融 / 医疗 / 工业表格) |
4.2 MiniMax-H3 物理世界评估 arXiv:2609.18323
| 项 | 建议 |
|---|---|
| 是否建议入库 | ✅ 建议入库 |
| 建议归入 | notes/multimodal-evaluation.md(新建)或 notes/omni-modal-eval.md(新建);multimodal.md §3.X omni-model 评估范式 + notes/physical-world-reasoning.md(新建) |
| 审稿文件路径 | /shared/research-kb/inbox/flyp/2026-09-19-1550-LimiX2-and-MiniMax-H3-physical-world-eval-critical-read.md(本文件 §二) |
| 撞名预备触发 | ⚠️ v87+7 §0 R28 必须明确标注"MiniMax-H3 ≠ MiniMax-M3,撞名 ≠ 同实体" |
| 后续验证动作 | P0:核实 GitHub gulucaptain/MiniMax-H3-Reason 仓库内容完整度 + 517 实例是否公开 + 评估协议文档化;P0:核实是否补充 baseline 对照(GPT-5 / Veo-3 / Sora-2 / Vidu S2 / WAN 2.5);P1:核实四维度任务正交性证明;P1:跟踪 27.40% vs 56.00% modality 失衡在后续 omni-model release 是否改善;P2:与 v87+6 baseline multimodal 主轴立标 13 件跌出 + LimiX-2 #1 升档的"立标池极显著重整"信号交叉验证 |
五、本棒(本日 15:50)flyP 精读结论
✅ 核心结论
- LimiX-2
arXiv:2609.17488= tabular foundation model 路线(中国 2026 年 9 月新立标),方法学上 CMN 范式 + CCMM + SCMs 合成数据三轴组合有价值,反方最大扣分项是分类争议(multimodal 邻接级是否合理)+ 合成数据真实世界迁移性风险。建议入库notes/tabular-foundation-models.md(新建) + 主分类修正建议 ⚠️。 - MiniMax-H3 物理世界评估
arXiv:2609.18323= omni-model 评估范式补充(复旦 + MiniMax 联合出品,撞名预备触发),方法学上四维评估框架 + 强制跨模态证据互补有形式新颖性,反方最大扣分项是单一评估对象 + 缺 baseline 对照 + 517 实例规模局限 + 任务正交性未证。建议入库notes/multimodal-evaluation.md(新建) + 撞名警告强制声明 ⚠️。 - 双篇共同模式:都是 2026 年中国 AI 研究的"概念/形式有创新 + 工程细节待补 + 数据 / 代码预期公开"典型节奏;与本日 09:50 Zing-0.5 + 10:30 周六大精读反方审稿的"扣分模式"高度一致 —— 2026 年 release 通病。
⚠️ 待补查(本棒不展开,留作后续精读棒位 P0 任务)
- LimiX-2 v1 全文附表 + ablation 章节 + TabPFNv2/TabICL head-to-head
- LimiX-2 训练算力 / 推理时延 / 模型规模(M/L/XL)
- LimiX-2 与同期真实企业表格 benchmark 迁移性 case study
- MiniMax-H3 物理世界评估 baseline 对照(GPT-5 / Veo-3 / Sora-2 / Vidu S2 / WAN 2.5)
- MiniMax-H3 物理世界评估 GitHub 仓库
gulucaptain/MiniMax-H3-Reason内容完整度 - MiniMax-H3 物理世界评估 27.40% vs 56.00% modality 失衡在后续 omni-model release 的演变
- MiniMax-H3 物理世界评估与 v87+6 baseline multimodal 主轴立标池极显著重整信号的交叉验证
🎯 后续验证动作优先级
| 优先级 | 动作 | 关联论文 |
|---|---|---|
| P0 | 核实 LimiX-2 v1 全文附表 + ablation + TabPFNv2 head-to-head | LimiX-2 |
| P0 | 核实 GitHub gulucaptain/MiniMax-H3-Reason 仓库内容 + 评估协议 + 517 实例 |
MiniMax-H3 Eval |
| P0 | 核实 MiniMax-H3 Eval 是否补 baseline(GPT-5/Veo-3/Sora-2 等) | MiniMax-H3 Eval |
| P1 | 启动 9-20 ~ 9-26 下周精读棒位预备:tabular foundation model 主轴新候选 | 通用 |
| P1 | 启动 9-20 ~ 9-26 下周精读棒位预备:omni-model 评估范式新候选 | 通用 |
| P2 | 跟踪 MiniMax-H3 Eval 后续修订 / v2 是否补 baseline | MiniMax-H3 Eval |
| P2 | 跟踪 LimiX-2 v2 权重公开 + Diffusers-style 适配 | LimiX-2 |
六、给后续同步任务的具体建议
review_file:
- "/shared/research-kb/inbox/flyp/2026-09-19-1550-LimiX2-and-MiniMax-H3-physical-world-eval-critical-read.md"(本文件)
下游主题页更新建议(待 sync 任务处理):
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-tabular-foundation-models-section-LimiX2-draft.md"(新建 tabular-foundation-models.md 主文档,§A LimiX-2 + 本 review §一)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal-evaluation-section-MiniMax-H3-Eval-draft.md"(新建 multimodal-evaluation.md 主文档,§A MiniMax-H3 物理世界评估 + 本 review §二)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal-md-classification-correction-LimiX2-draft.md"(multimodal.md 修正 LimiX-2 从"邻接级"改为"主分类建议修正为 tabular/ml-foundations",保留 multimodal 邻接级标签但加 §X.Y "tabular as a modality" 说明)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal-md-R28-collision-name-warning-MiniMax-H3.md"(multimodal.md §0 R28 撞名预备触发强制声明)
不在本任务范围:
- 不写 /shared/research-kb/review/ 或 /shared/research-kb/published/
- 不执行 git commit / git push / gh pr
- 不直接修改 knowledge/ 或 organized/(由后续 sync 任务串行合并)
待人工确认的问题
- LimiX-2 multimodal 邻接级标签是否合理保留 —— 若保留,需在 multimodal.md 主文档加"tabular as a modality"说明;若不保留,主分类应改为 tabular/ml-foundations
- LimiX-2 v2 权重是否随论文 v1 同期公开 —— 决定 KB 索引是否给"代码 + 权重 ✓"标签
- MiniMax-H3 物理世界评估 GitHub 仓库
gulucaptain/MiniMax-H3-Reason是否完整公开 517 实例 + 评估协议 —— 决定可复现性等级 - MiniMax-H3 物理世界评估是否补充 baseline 对照 —— 决定关键数字可信度等级
- MiniMax-H3 物理世界评估 27.40% vs 56.00% modality 失衡信号 —— 是否在后续 omni-model release 演变为关键议题
- 下周(9-20 起)精读棒位 P0 优先级确认:tabular foundation model 主轴新候选 vs omni-model 评估范式新候选
- MiniMax-H3 ≠ MiniMax-M3 撞名警告机制 —— 是在 multimodal.md §0 R28 单点声明,还是在所有引用 MiniMax-H3 的笔记里强制标注
flyP · 2026-09-19 15:50 CST · 精读棒第 N+1 期 · 本日第 4 棒(下午班) · 双短精读与批判 · 共享知识库 flyP 实例 · 不执行 GitHub 写入