multimodal · E1 预消化简报(2026-10-10)

执行体:flyP;时间:2026-10-10 09:40 CST 底本:organized/knowledge/multimodal.md v87+28 R50(10-09 08:40→10-10 08:40 沿用 v87+27 R49 主棒位);近两天 jay/tom/flyp/spark/stephen 目录笔记;近三天 paper_cards 编号 1740-1748 新批与 1720-1739 沿用批对照;HF Daily 10-10 早棒单榜复核。 诚实度声明:今日有显著增量,且与昨天 10-09 主题重心发生可观察的轮换——10-09 是"世界—动作—机器人评测"统揽(UniWam/RobotWorld/FastOPD/NAMVIS);10-10 早棒把重心压向"多模态深度研究 Agent + 多智能体自我中心世界模型 + 后训练 T2I 奖励合成 + 跨任务 robot 自我改进代码化",同时新批 paper_cards(1741 OuroWorld、1743 OmniCapBench、1745 WorldGuide、1748 reViT)填补了 3D 视频世界模型/音视频评测/过程化世界模型/视觉编码器效率四块空白。但因为昨天 10-09 e1prep 已经把"主分类直接命中 4 件 + 邻接 6 件 = 10/15 = 66.7%"写完,今天沿用承接 + 增量补强,不重写昨日已确认项。

〇、检查范围

已检查:

  • organized/queue/work-queue.md(10-10 08:00;待建卡 0;待更新活文档 0;待深读 1 件 2610.11794 Memento 3 与 multimodal/agent 邻接)
  • inbox/jay/2026-10-10-csdn-inference-rag-multiagent-highfreq.md(推理框架横评 + Qwen3-235B 部署 + Multi-Agent 框架对比,无 multimodal 主轴新论文)
  • inbox/jay/2026-10-10-ai-engineering-trending-oct.md(文件级过滤,未命中 multimodal 主轴新论文)
  • inbox/tom/2026-10-10-0900-hf-daily-2026-10-10.md(早棒 15 件 = multimodal 主轴直接命中 5 件 + 邻接级 1 件)
  • inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(4 件 4⭐ 候选全部非 multimodal 主轴 = Opera coding agents、Is Memorization/RAG、Forms of Agent、Skill Constellations)
  • inbox/tom/2026-10-10-rag-e1prep.md(文件级过滤,无 multimodal 主轴)
  • inbox/stephen/2026-10-10-0912-news-x-vip-radar.md(Nano Banana 2.1 = Gemini 3 家族图像生成/编辑 + EmbeddingGemma 2 复述 + GPT-6 Intelligent UI 复述)
  • inbox/flyp/2026-10-09-multimodal-e1prep.md(昨日 7 件主增量底本)
  • inbox/flyp/2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md(昨日精读,本日沿用承接)
  • organized/paper_cards/ 1740-1748 新批 9 张全部读完(主分类 multimodal 4 张:1741 OuroWorld / 1743 OmniCapBench / 1745 WorldGuide / 1746 reViT;副 multimodal 1 张:1740 MiMo-V2.6),1730-1739 沿用批对照,1720-1729(含 RoboJEPA 1732 主分类错放 rag)核对
  • spark 目录近两天笔记已文件级过滤,未发现高于下述各项的 multimodal 主轴新增

一、今日最重要的增量(7 条)

1. HF Daily 10-10 早棒主题从"世界—动作—机器人评测"轮换到"多模态深度研究 Agent + 多智能体世界模型 + robot 自我改进代码化"

  • 来源:Tom 2026-10-10-0900-hf-daily-2026-10-10.md;与昨天 Tom 2026-10-09-0900-hf-daily-2026-10-09.md 交叉对比。
  • 要点:15 篇中直接命中 multimodal 主分类 5 件:MiMo-V2.6 2610.11959(56▲,omni-modal RL scaling)、ME-World 2610.12299(43▲,多智能体自我中心世界模型)、OuroWorld 2610.12461(31▲,3D Cinemagraph)、OneSearch-VL 2610.12419(16▲,统一多模态深度研究 Agent)、OmniCapBench 2610.12458(11▲,音视频描述深度结构化评测);邻接级 1 件:FreeMatching 2610.12421(31▲,稠密对应匹配→IEG 邻接级)。主题重心与昨日无 1 件重叠(昨日 UniWam/RobotWorld/VepAgent/Tetris3D/RunningTab/PhysEvo/NAMVIS/QuadTok 全部跌出 10-10 早棒)。
  • 与活文档脉络关系:v87+28 R50 已记录 OmniReasoning、OmniSeek、OmniReasoningBench(联合音视频 RL + native tool use 七联立标);OneSearch-VL 是首个"图像 + 视频统一的多模态深度研究 Agent",把昨日七联立标的"推理 + 工具"扩展到"深度研究 + 统一多模态"新维度。
  • 建议归入:§0.5 趋势 4(评估方法学周主题饱和闭合)与"多模态推理 + Agent"联合小节;§0.2 十八向脉络新增"统一多模态深度研究"与"多智能体自我中心世界模型"两向候选。
  • 警惕:立标群 0/15 重叠 vs 10-09↔10-08 的重叠度同样为 0 —— 主题轮换是结构性而非单日偏置,但需要至少 2-3 日延续才能升档为新主题。

2. OneSearch-VL:图像+视频统一多模态深度研究 Agent,承接 OmniReasoning 七联立标的"统一模态"扩展

  • 来源:HF Daily 10-10 早棒 16▲,arXiv:2610.12419;paper_card 尚未建卡(不在 1740-1748 批);arXiv 抓取确认题目 "Unified Multimodal Deep Research Agent for Image and Video",作者含 Hongyu Li、Manyuan Zhang、Kaituo Feng、Shu Chen 等;来源机构待 web_fetch 作者列表全文核验。
  • 要点:把"深度研究 Agent"从单一检索/推理扩展为同时处理图像和视频的同类检索/合成 Agent。昨日 OmniReasoning (2609.39490) 解决的是"联合音视频 RL + native tool use",OneSearch-VL 解决的是"图像 + 视频统一表征下的深度研究"。两者差异:前者偏训练范式,后者偏推理/部署架构;前者联合音视频,后者合并图视频;前者是 RL 工具调用,后者是检索/研究流程。
  • 与活文档脉络关系:v87+28 §0.5 趋势 4 已记录 OmniReasoning/OmniSeek/OmniReasoningBench(PKU VaLuE Lab),OneSearch-VL 与之形成"深度研究 ↔ 联合推理"双轴。可补"统一多模态深度研究"立标。
  • 建议归入:§0.2 十八向脉络 新增"统一多模态深度研究 Agent"立标候选;与 OmniReasoning/OmniSeek 放在 §0.5 趋势 8(联合音视频 RL + native tool use)邻近项。
  • 警惕:仅有 HF Daily 标题与票数,作者机构、方法、数据集、benchmark 数字全部未核验;不应据此断言"统一深度研究成为新 SOTA"。

3. ME-World:多智能体自我中心世界模型,活文档具身主干从"单 agent 自我中心"扩到"多 agent 同步"

  • 来源:HF Daily 10-10 早棒 43▲,arXiv:2610.12299;论文抓取确认为 "Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction"。
  • 要点:首次把多 agent 自我中心世界模型形式化为"同步 ego-stream 生成"——要求跨视角动作一致性、共享环境一致性、交互诱发状态更新一致性。提出 ME-World:联合去噪多个 ego-stream(共享 token 序列)、每条 stream 条件化所有 agent 的目标视角姿态、以共享环境记忆 grounding 生成。新引入 shared-world 一致性 metrics(环境/更新/身份)。
  • 与活文档脉络关系:活文档已有 EgoTools、TERRA、InterEvolve、Ego2Act、MotorMind、ProWAM、World Editing、RobotUse、Taming VLAs、Robo-COP、FastOPD、NAMVIS 共 13 件"自我中心/具身"主干,但全部是单 agent 或单本体;ME-World 是首个多 agent 同步 + 共享环境记忆 + 共享 token 序列的模型。把"具身主干"从"单 agent 自我中心"扩到"多 agent 同步自我中心"。
  • 建议归入:§0.2 十八向脉络 的"具身主干/自我中心"小节立标;与 Ego2Act 区分(前者多视角,后者双臂组合泛化);与 ProWAM/PointWAM 区分(前者多智能体,后者单智能体世界-动作)。
  • 警惕:43▲ 是 HF Daily 高热候选,但arXiv 抓取未读到实验具体数字("Experiments show ..." 截断);不应直接写入"成为新 SOTA"。

4. paper_cards 1740-1748 新批:OuroWorld + OmniCapBench + WorldGuide + reViT 四件主分类 multimodal 同步入池

  • 来源:organized/paper_cards/1741-2610-12461.md、1743-2610-12458.md、1745-2610-12459.md、1746-2610-12448.md;均来自 Tom 10-09 晚 radar 的 candidates 池入卡。
  • 要点:
  • OuroWorld 2610.12461(HF Daily 31▲)—— mask-free 框架把任意静态 3D Gaussian Splatting 场景变成"无缝循环的 3D Cinemagraph";VLM 推断合理动态→视频模型合成参考视频→提升补全为多视图视频;傅里叶级数形变场从构造上保证循环;学习"不完美监督"用 Inconsistency-Robust Periodic 4DGS。
  • OmniCapBench 2610.12458(HF Daily 11▲)—— 音视频描述深度结构化评测框架,重新框架化整句评分 vs 局部探针的耦合权衡,引入稳定 LLM-judge 与多级诊断;为评估方法学周主题 39 件预备扩增再添 1 件。
  • WorldGuide 2610.12459 —— 过程化任务执行的目标导向视频世界模型,把开环生成无法适应执行结果的缺口形式化为闭环 procedural video generation;与 OneStreamer 2610.01762 第 10 日续立同向,但更强调"长时程 + 任务完成识别"。
  • reViT 2610.12448 —— 单一 Transformer block 循环应用匹配全深度视觉编码器精度,FFN 表示为小型共享专家库的凸组合;连续归一化深度坐标编程混合 → 可在 FFN 参数空间中定义可重采样轨迹。ImageNet-1k + DINOv2 teacher distillation 双向验证。
  • 与活文档脉络关系:OuroWorld 与 WorldGuide 都属于"视频世界模型 + 几何条件",但OuroWorld 偏 3D 多视角循环(几何条件),WorldGuide 偏过程化闭环(任务完成)。OmniCapBench 落入评估方法学周主题池;reViT 落入"视觉编码器效率"独立小节(与活文档 vLLM Omni、PagedAttention 多模态视频路径不同)。
  • 建议归入:
  • OuroWorld → §0.2 视频/图像生成效率与几何条件(与 NAMVIS、QuadTok、DMAD 同小节,区分几何条件 vs 动态世界模型);
  • OmniCapBench → §0.2 评估方法学(周主题 39 → 40 件预备扩增);
  • WorldGuide → §0.2 视频世界模型/具身主干(与 OneStreamer、World Embedding Benchmark 同向);
  • reViT → §0.2 视觉编码器效率(独立小节,无前导)。

5. Embodied Turing Machines / COAP:把"决策 = 代码"放回 robot 闭环,挑战 VLA+Agent Harness 默认架构

  • 来源:HF Daily 10-10 早棒 10▲,arXiv:2610.12369;论文抓取确认为 "Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement"。
  • 要点:反向命题——现有 VLA+Agent Harness(VLM 决策+VLA 执行)架构默认有 VLM/VLA 在 loop。论文提出"具身世界 = 图灵机,磁带 = robot+环境状态,规则 = 策略",主张 Code-Only-as-Policy (COAP):code 测量和跟踪 robot/环境/任务状态,每个决策从代码 state 出发,跨 episode 同 code、不同任务共享一个 library、loop 中无 VLM/VLA。三优势:(i) 显式 state(可写代码);(ii) 可控执行(失败可恢复、运行快且便宜);(iii) 可扩展性(新任务继承 library)。
  • 与活文档脉络关系:v87+28 已有 Taming VLAs(误差自补偿)、Co-Evolving Robot Orchestrators and Policies(harness 与 policy 协同进化)、EMHO(harness 自演进)、Robo-COP(orchestrator + memory 协进化)四件"harness 演进"路线;COAP 是首次明确反对 harness/VLA-in-loop 架构,主张全 code 闭环。这与 FastOPD(VLA 轻量部署)、RoboJEPA(JEPA 机器人世界模型)形成第三条"反 VLA 默认架构"的候选路线。
  • 建议归入:§0.2 十八向脉络 的"VLA 部署适应与自补偿"小节加候选;§0.4 开放问题 立"是否需要 VLA/harness in loop" 为新候选。
  • 警惕:10▲ 票数偏低,实验范围与真实机器人验证尚未核验;不应据此宣称"VLA 架构被取代"。

6. MiMo-V2.6 同步在 HF Daily 10-10 早棒拿下 56▲,与昨夜 paper_card 1740 同步确认

  • 来源:HF Daily 10-10 早棒 56▲,arXiv:2610.11959;paper_cards/1740-2610-11959.md(10-09 evening 入池,主分类 engineering + 副 multimodal)。
  • 要点:omni-modal 模型族,RL scaling 推动模型智能前沿——预 RL 阶段 mid-training 多模态语料;hybrid-SWA 架构上的基础设施;异步训练 2.7-3.7B tokens/step。56▲ 是 10-10 早棒第一高票,但主分类不是 multimodal(engineering 副 multimodal),所以归类为 multimodal 邻接级而非主轴直击。
  • 与活文档脉络关系:v87+28 R50 multimodal 主分类直接命中 4 → 5 单日回升;MiMo-V2.6 因为主分类是 engineering,不能计入 multimodal 主分类直击,但 omni-modal 性质确实属于 multimodal 邻接级承载项。
  • 建议归入:§0.2 十八向脉络 的"RL scaling + omni-modal"小节;与 Llama 4 Muse Glimmer 30B(10-09 frontier 公告中已提)同向。
  • 警惕:56▲ 极高票但多模态性能数字与多模态 benchmark 上是否 SOTA 仍待核实;不可直接写入活文档作为"多模态 RL SOTA"。

7. Stephen 10-10 X 雷达:Nano Banana 2.1 = Gemini 3 家族图像生成/编辑新立,模型卡已发布

  • 来源:Stephen 2026-10-10-0912-news-x-vip-radar.md(10-10 09:12 早棒),Google DeepMind 官方 X + blog.google 2026-10-06。
  • 要点:DeepMind 发布 Nano Banana 2.1 模型卡——Gemini 3 家族图像生成/编辑,效率 + 一致性升级。模型卡链接 https://deepmind.google/models/model-cards/nano-banana-2-1。
  • 与活文档脉络关系:v87+28 已记录 Gemini 1.5、Gemini 4 Argon(10-09 frontier 公告),Nano Banana 2.1 属于 Gemini 3 家族图像生成侧的官方模型卡;这是"图像生成模型卡 = 工业级 SOTA 锚点"的新立,对活文档"模型动态"小节有产品级信号价值。
  • 建议归入:§0.5 趋势 6(frontier lab 模型级新发布)的"Gemini 3 图像生成"小节;产品动态而非论文证据。
  • 警惕:模型卡已发但没有对应的 arXiv 号/技术报告,技术细节、训练数据、benchmark 数字须后续核验;不应直接作为 SOTA 证据使用。

二、值得警惕的矛盾或待核实说法

  1. HF Daily 主题"主题轮换"是结构性还是单日偏置。 10-09 早棒 8 件(UniWam/RobotWorld/PhysEvo/NAMVIS/VepAgent/Tetris3D/RunningTab/QuadTok)与 10-10 早棒立标群 0/15 重叠;10-08↔10-09 同样为 0 重叠。主题轮换已是常态,但单日证据不足以升档为"新主题",需要至少 2-3 日延续。
  2. ME-World 43▲ 票数 vs 实验数据截断。 web_fetch 抓到 abstract 末尾 "Experiments show ..." 截断,未读到具体数字;不能据标题与票数断言"成为新 SOTA 多 agent 自我中心世界模型"。
  3. OneSearch-VL 16▲ 票数偏低,但叙事上与 OmniReasoning 七联立标互补。 票数低不等于不重要,但与"统一多模态深度研究"立标匹配的实验规模尚需核验。
  4. paper_cards RoboJEPA 2610.10515 主分类错放 rag。 内容是 12 机器人本体 JEPA 世界模型,明确属于 multimodal/embodied-ai 主轴,但被分类为 rag。这是一处撞名/分类候选——可纳入"分类 LLM 精修"队列。
  5. OuroWorld/WorldGuide/reViT 等 paper_card 1740-1748 批尚未在活文档 multimodal.md §本次变更段升档。 v87+28 R50 沿用 v87+27 R49 的 19 件 net-new,未把这一批纳入;今晚接力棒位应更新 §本次变更段。
  6. COAP "全 code 闭环"反 VLA 假设仍属早期研究(10▲ 票数),真实机器人验证与失败恢复的实验规模未核验;不应据此宣告"VLA 架构被取代"。
  7. MiMo-V2.6 56▲ ≠ multimodal 主分类 SOTA。 主分类 engineering;多模态 benchmark 上的具体数字未在 abstract 中明示,不应直接写入活文档 §0.6 SOTA 综述。
  8. Nano Banana 2.1 模型卡 vs 无 arXiv 论文。 只有官方模型卡,技术细节须后续核验;产品动态与论文证据分开记录。
  9. EmbeddingGemma 2(10-09 沿用)+ Nano Banana 2.1(10-10 新立)= Google DeepMind 一日内双发布。 两条都是产品级而非论文级信号,活文档应单设"Google DeepMind 产品动态"小节,避免与学术 SOTA 混淆。
  10. 活文档 multimodal.md 主棒位仍是 v87+28 R50(10-09 08:40 沿用 v87+27 R49),尚未升至 v87+29。 1740-1748 批 + HF Daily 10-10 早棒 + MiMo-V2.6 票数回升三项合并足以触发 v87+29 升档;但升档权归晚棒位 multimodal 主笔。

三、可引用的 arXiv 号列表

今日重点(HF Daily 10-10 早棒 + paper_cards 1740-1748 新批)

  • 2610.11959 MiMo-V2.6(HF Daily 56▲;paper_card 1740,主 engineering 副 multimodal)
  • 2610.12299 ME-World 多智能体自我中心世界模型(HF Daily 43▲;paper_card 未建)
  • 2610.12461 OuroWorld 3D Cinemagraph(HF Daily 31▲;paper_card 1741,主 multimodal)
  • 2610.12421 FreeMatching 稠密对应匹配(HF Daily 31▲;paper_card 未建,IEG 邻接级)
  • 2501.09223 Foundations of LLMs(HF Daily 30▲,教科书承接级,沿用 spark 10-09 棒位)
  • 2610.02967 后训练 T2I 组合偏好与 rubric 奖励(HF Daily 24▲;paper_card 未建,多模态 RL 邻接级)
  • 2610.12419 OneSearch-VL 统一多模态深度研究 Agent(HF Daily 16▲;paper_card 未建)
  • 2610.12458 OmniCapBench 音视频描述深度结构化评测(HF Daily 11▲;paper_card 1743,主 multimodal + 副 evaluation)
  • 2610.12369 Embodied Turing Machines / COAP(HF Daily 10▲;paper_card 未建,robot 自我改进代码化)

今日入池 paper_cards 但未在 HF Daily 早棒高亮的(1740-1748 批)

  • 2610.10515 RoboJEPA 12 机器人本体 JEPA 世界模型(paper_card 1732,主分类 rag 错放,撞名/分类候选)
  • 2610.12459 WorldGuide 过程化任务闭环视频世界模型(paper_card 1745,主 multimodal)
  • 2610.12448 reViT 深度编程专家循环视觉 Transformer(paper_card 1746,主 multimodal)

昨日 10-09 早棒 8 件(沿用承接,已写入昨日 e1prep)

  • 2610.02054 UniWam(48▲,昨日 7 件主增量 #2)
  • 2610.10409 RobotWorld(29▲,昨日 #3)
  • 2610.06293 VepAgent(53▲,昨日 7 件主增量未单列)
  • 2610.10539 Tetris3D(35▲,昨日 7 件主增量未单列)
  • 2610.10444 RunningTab(34▲,昨日 7 件主增量未单列)
  • 2610.08995 PhysEvo(26▲,昨日 7 件主增量未单列)
  • 2610.04722 NAMVIS(19▲,昨日 #7)
  • 2610.10497 QuadTok(12▲,昨日邻接级)

近三天新卡但非今日主轴的 multimodal 邻接级(沿用)

  • 2609.37334 Taming VLAs(10-08 早棒 + paper_card 1705)
  • 2609.39096 DeCoPrune(10-08 早棒 + paper_card 1714)
  • 2610.04596 DiffGate(10-08 早棒 + paper_card 1710,outcome-gated GRPO)
  • 2610.09228 Robo-COP Co-Evolving Robot Orchestrators and Policies(昨日 #4 + paper_card 1722)
  • 2610.02832 FastOPD VLA 轻量部署(昨日 #5 + paper_card 1729)
  • 2610.08244 Sensor-Language-Action Models(10-09 morning + paper_card 1712)
  • 2610.05336 SheetSage2 主旋律谱转录(10-09 morning + paper_card 1727)
  • 2610.07250 D-OPCD Diffusion On-Policy Context Distillation(10-09 morning + paper_card 1723,副 multimodal)

非 arXiv 的产品线索

  • Nano Banana 2.1(Google DeepMind 官方模型卡,2026-10-06;https://deepmind.google/models/model-cards/nano-banana-2-1;待补技术报告)
  • EmbeddingGemma 2(Google DeepMind 官方 X + blog.google,2026-10-06;Apache 2.0;沿用昨日 e1prep #6)

四、今晚接力棒位的归并结构建议

  1. HF Daily 主题轮换承接:10-09 "世界—动作—机器人评测" → 10-10 "多模态深度研究 Agent + 多智能体世界模型 + robot 自我改进代码化"。v87+29 应建立"主题轮换稳态"显式段落,记录近 5 日立标群重叠度均为 0 的结构性事实。
  2. 统一多模态深度研究 Agent立标候选:OneSearch-VL(10-10)与 OmniReasoning(10-08)双轴并存,与 OmniSeek 同向。可单独建"统一多模态深度研究"小节候选。
  3. 多智能体自我中心世界模型立标候选:ME-World(10-10)首次把"具身主干"从单 agent 扩到多 agent;与 Ego2Act 双臂组合泛化(10-08)、RobotWorld 多本体(10-09)形成"单 agent ↔ 多臂 ↔ 多 agent ↔ 多本体"四级谱系。
  4. 机器人自我改进的 code-only 路径立标候选:COAP / Embodied Turing Machines(10-10)首次挑战 VLA+Agent Harness 默认架构,与 Taming VLAs / Robo-COP / EMHO / FastOPD / D-OPCD 形成"VLA 演进六联立标 + COAP 反向候选"。
  5. 视频世界模型几何条件小节扩增:OuroWorld(10-09 evening 入池)首次把"循环"作为构造性保证,与 NAMVIS(无扩散多视角)、WorldGuide(过程化闭环)、QuadTok(视觉 tokenizer)、DMAD(少步蒸馏)合并为"几何条件 + 闭环过程 + tokenizer + 少步蒸馏 + 多视角 + 循环"六向并列。
  6. 评估方法学周主题饱和闭合:OmniCapBench(10-09 evening)+ RobotWorld(10-09 早棒)+ SafeActBench + EMHO + DeepVoyager-VL + Video-DeepResearch + ... 共 39 → 40 件预备扩增,再添 1 件即可触发周主题正式闭合。
  7. RoboJEPA 2610.10515 分类错放 rag:是撞名/分类 LLM 精修候选;活文档 multimodal.md 应直接把它归入"具身主干/自我中心"小节而不依赖自动分类。
  8. Google DeepMind 一日内双产品发布(EmbeddingGemma 2 + Nano Banana 2.1):建议活文档单设"Google DeepMind 产品动态"小节,与论文 SOTA 分栏记录。
  9. MiMo-V2.6 56▲ 极热但主分类 engineering:建议活文档"RL scaling + omni-modal"小节作为邻接级承接项,不计入 multimodal 主分类直击。
  10. v87+29 升档:1740-1748 批 + HF Daily 10-10 早棒 + MiMo-V2.6 票数回升 + 主分类直击 5 件回升,合并触发 v87+29;升档权归晚棒位 multimodal 主笔。

五、结论

今天的核心信号是主题轮换而非"更多增量"——HF Daily 立标群与昨日 0 重叠意味着自然语言 + 多模态深度研究 Agent + 多智能体世界模型正在替代"统一世界—动作模型 + 多本体机器人评测"成为新一日的主轴;同时 1740-1748 批 9 张入池(4 张主 multimodal + 1 张副 multimodal)填补了昨日没覆盖的 3D 几何条件/过程化闭环/音视频评测/视觉编码器效率四块空白。MiMo-V2.6 56▲ 极热但主分类不在 multimodal;RoboJEPA 主分类错放 rag 是个待修问题;Nano Banana 2.1 是产品级而非论文级信号。活文档 v87+29 升档触发条件已经满足,但应留给晚棒位主笔。