multimodal · E1 预消化简报(2026-07-21)
角色:flyP · multimodal 主题 E1 日间预消化(multimodal) 锚定版本:v29 知识库
organized/knowledge/multimodal.md(2026-07-16 11:10 CST 立标)+ 7-20 flyP e1prep 提案的 v30 立标候选(RxBrain + VideoChat3 + Boogu v2 + UniVR 旁证) 窗口范围:2026-07-20 09:40 → 2026-07-21 09:40(Asia/Shanghai,约 24 小时) 覆盖材料: + inbox/flyp 7-20 0950 UniVR-VR-GRPO E2 精读(订正昨日 v29 旁证档归位 + MetaView ECCV 2026 升级)+ 7-20 1000~1003 RSS ×3 + 7-20 2127 LoCoBench-Agent v2(agent 主分类,不进 multimodal 增量) + inbox/jay 7-20 1105 substack-github-trending-multimodal-supplement(腾讯 Hy3 + Top 6 多模态模型 + xAI Grok 4.5 / Kimi K3)+ 7-20 1506 evening briefing + 7-20 1735 hf-daily-simonwillison(VideoChat3 / Vidu S1 / UniVR / Xiaomi-Robotics-1 关注)+ 7-20 2105 evening-research-briefing + inbox/tom 7-20 2040 radar(S1-Omni / VideoRAE / RESOURCE2SKILL 候选)+ 7-20 2149 rag-lite v2 + 7-21 0840 radar(⚡ Lucid + ⚡ RESOURCE2SKILL + SVR-R1 + Robot-Centric Pointmaps)+ 7-21 0900 HF Daily(Xiaomi-Robotics-1 新上 + 54▲) + inbox/stephen 7-20 1245 协调棒 noon + 7-20 2245 协调棒 evening(Jay-on-Stephen 3.2 P0 标记 MetaView 客观性删)+ 7-20 0910 news x vip radar(Google DeepMind Gemini Omni + HuggingFace x Thinking Machines Inkling 1T + Jim Fan MACHINA 2026 Physical Turing Test)+ 7-21 0910 news x vip radar + inbox/spark 7-20 1001~1003 RSS ×3 + 7-15 1002 gradient-flow v2(multimodal 间接) + organized/paper_cards 7-20 新卡 415~468 区间所有主分类 multimodal 与副分类 multimodal 的卡 今日目标:为今晚 v30 活文档接力预读备料,3-8 条增量,每条挂"来源/要点/脉络关系/建议归入节" 本稿状态:v1 预消化,不重写 multimodal 活文档;只列增量与待活文档消化的方向
0. 综述判断(给今晚活文档接手时一眼看到)
- 昨日 v29/v30 候选承接:昨日 flyP e1prep 提出 v30 立标候选 4 件 —— §2.39.40 RxBrain(具身双通路)+ §2.39.41 VideoChat3(全开源视频 MLLM)+ §2.39.42 Boogu-Image-0.1 v2 重写确认(图像侧统一)+ §2.39.43 UniVR 旁证(视觉空间内推理)。
- 今日(7-20 09:40 → 7-21 09:40)窗口实际新增:无新"单一旗舰"立标,但 flyP 7-20 0950 UniVR E2 精读对昨日 v29 旁证档做了两处关键订正 + 一处升级:
- 订正 ①:UniVR 不应归入 §1 主线 3 "多模态 CoT / 推理范式"或 §2.39.43 "视觉推理统一框架支撑" — UniVR 实质是"无语言监督的视觉空间 RL 训练范式 + VR-X 评测套件",与 SenseNova-Vision / VideoChat3 VLM-based 路线完全分野;
- 订正 ②:UniVR 真正增量是 Step-Focal 局部奖励 而非 GRPO 本身 — 与 7-18 Reward-Under-Attack 同根,Step-Level Reward Hacking 风险适用;
- 升级 MetaView (arXiv:2607.12000):从"旁证档"升级为"已发表基准工作"(ECCV 2026 accepted)。
- 窗口 HF Daily 票榜增量(对比 7-20 → 7-21):
- 新立 Xiaomi-Robotics-1(arXiv:2607.15330 · 54▲ · 主分类 engineering · 副分类 multimodal)+ RESOURCE2SKILL(arXiv:2606.29538 · 113▲ · 主分类 agent · 副分类 multimodal);
- 同篇上行 VideoChat3(146▲→155▲)+ UniVR(28▲→30▲)+ KeyFrame-Compass(36▲→38▲)+ MultiRef-Compass(31▲→33▲)+ From Pixels to States(29▲→33▲)+ 并发图像理解与生成(29▲→31▲);
- 不入 multimodal 增量 LongStraw(182▲,agent/longcontext)+ Ring-Zero(91▲,RL)+ SEED(86▲,Agentic RL)+ SearchOS-V1(63▲,IR Agent)+ BadWAM(50▲,agent)+ xHC(47▲,arch)+ Cura 1T(43▲,agent medical)+ Chat2Scenic(rag)+ AgentCompass(agent)+ PolicyShiftGuard(risk)+ VaseMuseum(rag)+ Agentic RAG with LangGraph(rag)。
- 今日明确属 multimodal 主线的 2 件新立:Xiaomi-Robotics-1(主分类 engineering,副 multimodal,真实 100K+ 小时轨迹 VLA scale)+ RESOURCE2SKILL(主分类 agent,副 multimodal,多模态资源 → Agent Skill Wiki)。
- 今日主分类纯 multimodal 新卡(7-20 paper_cards 区间):
- 458 S1-Omni(arXiv:2607.15686 · 主分类 multimodal · 统一科学理解/预测/生成多模态推理模型 · Tom T2040 候选 #7);
- 462 On-Policy Delta Distillation(arXiv:2607.15161 · 主分类 multimodal · Stephen 2118 §1.8 候选);
- 463 VideoRAE(arXiv:2607.14088 · 主分类 multimodal · VFM 冻表征 → 生成友好视频潜码 · Tom T2040 候选 #6)。
- 建议 v30 立标/旁证增补:
- §2.39.40 v30 立标:沿用昨日 RxBrain(主)+ 7-20 E2 精读新发现的 Xiaomi-Robotics-1(arXiv:2607.15330) 作为"中国具身 VLA scale 阵营 v30 第二次立标候选"(Xiaomi Robotics 系 38B AR 世界基础模型 U0 → 7-21 VLA-1 100K hours scale 同族);
- §2.39.41 v30 辅助立标:沿用 VideoChat3(146→155▲)+ 新增 S1-Omni(arXiv:2607.15686,纯 multimodal 主分类,统一科学理解/预测/生成);
- §2.39.42 v30 辅助立标:沿用 Boogu-Image-0.1 v2 重写 + 新增 VideoRAE(arXiv:2607.14088,VFM 表征 → 生成友好视频潜码,补 v25 LingBot-Video MoE "视频生成侧"主线);
- §2.39.43 v30 旁证:UniVR 重新归位到 §1 主线 7 垂直域多模态 / VLA / 领域 LLM(同 RxBrain / ABot-N1 / DeepPlanning 同段)而非 §1 主线 3 多模态 CoT;
- §2.39.43.5 v30 旁证:MetaView 升级 —— 从"旁证档"升为"已发表基准工作(ECCV 2026 accepted)";
- §2.39.49 v30 旁证:新增 RESOURCE2SKILL(arXiv:2606.29538,多模态资源 → Agent Skill Wiki,与 v30 §1 主线 6 多模态 RAG / Agentic Retrieval 横向);
- §2.39.50 v30 旁证:新增 On-Policy Delta Distillation(arXiv:2607.15161,与 v30 §1.2 主线 ⑤ Application-layer Reliability / Agent RL 训练方法学三联 SEED + Delta + Demystifying 横向);
- §2.39.51 v30 行业旁证:新增 腾讯 Hy3 开源多模态模型(7-20 jay supplement · ~1 周前发布 · 沿用"中国多模态通用 8 足候选"行业分类);
- §2.39.52 v30 行业旁证:新增 Jim Fan MACHINA 2026 Physical Turing Test(7-20 stephen 0910 news x vip · RAISE 大会 7/10-12 演讲 · 把 Physical AGI 路线图对齐 LLM 范式预训练 + 后训练 + 推理时 scaling);
- §2.39.53 v30 行业旁证:新增 HuggingFace x Thinking Machines Inkling(1T 参数 MoE 多模态模型 · 256 专家 · 1M 上下文 · 45T tokens 训练 · BF16/NVFP4/1-bit GGUF · 7/16 上架)。
1. 增量条目(5 条主线 + 5 条旁证,按"建议归入节"分组)
增量 1 · Xiaomi-Robotics-1 VLA scale(100K+ 小时真实轨迹)— v30 §2.39.40 第二次立标候选
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/organized/paper_cards/460-2607-15330.md(主分类 engineering,副分类 multimodal,method)+ arXiv:2607.15330(HF Daily 54▲,7-21 新立)+ 7-21 0900 Tom HF Daily + 7-20 1735 Jay hf-daily-simonwillison(关注级 · ⭐⭐⭐ 工程价值)+ 7-20 T2040 Tom radar(候选) |
| 作者单位 | Xiaomi Robotics(待核 PDF 完整列表) |
| 一句话 | Xiaomi-Robotics-1(7-21 HF Daily 54▲ 新立)= 100K+ 小时真实机器人轨迹规模化训练的 VLA 基础模型,在多个仿真 benchmark 超越 SOTA,可作为复杂灵巧任务的高数据效率微调基座(卡片 TLDR 原话);与 v27 Xiaomi-Robotics-U0(38B AR 世界基础模型)同族但分工:U0 = 端到端 AR 全程生成的世界基础模型;VLA-1 = 真实轨迹规模化 VLA 训练。 |
| v29 脉络关系 | 与 v27 Xiaomi-Robotics-U0(38B AR 世界基础模型)+ v29 RxBrain(具身双通路 MoT)+ v22 LingBot-Video MoE(视频生成具身)+ v25 From Pixels to States(交互式 World Model 重新定位)+ v26 ABot-N1(通用 VLN foundation)+ v22 DeepPlanning(长程受限规划)同属"具身 agent / 世界模型 / VLA"主线 — Xiaomi Robotics 7-20 → 7-21 连续两次上 HF Daily(U0 在 v27 已立标 + VLA-1 在 v30 第二次立标候选),小米机器人系是 2026-Q3 中国具身 VLA family 中"真实数据 scale"唯一反复上 HF Daily 的玩家,与"蚂蚁 Robbyant(LingBot-Video MoE)+ 腾讯 Hunyuan(RxBrain)"形成中国具身三足。 |
| 反方 / 风险 | (A) 主分类 engineering 而非 multimodal — 跨主题交叉需要双向同步(与 risk 同步 flyp 7-20 risk-e1prep 同策略);(B) abstract "outperforms state-of-the-art methods"未给具体 benchmark 名 + 数字;(C) 100K hours 数据许可 / 来源合规 / PII 扫描未披露;(D) 仿真 benchmark vs 真实部署 gap 风险 — 与 RxBrain-Bench self-benchmark 同根;(E) "high data efficiency"无消融;(F) 复现需 100K hours 真实轨迹数据 + VLA 训练栈 — 复现门槛极高 |
| 建议归入节 | §2.39.40 v30 立标(第二次立标候选,与 RxBrain 同段)+ §1 主线 7 垂直域多模态 / VLA / 领域 LLM(沿用)+ §1.7 行业"中国具身 5 足"(Xiaomi Robotics + Tencent Hunyuan + 蚂蚁 Robbyant + 智元 + 灵汐等)+ §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + engineering 主分类 + agent 副分类 + ai-industry 4 主题) |
| 重要边界 | 不要与 v27 Xiaomi-Robotics-U0 混为同一件工作:U0 = 38B AR 世界基础模型;VLA-1 = 真实轨迹规模化 VLA。两件工作同属 Xiaomi Robotics 但训练目标、模态调度、动作空间不同(世界模型生成 vs VLA 策略学习)。避免与 LingBot-Video MoE 蚂蚁 + RxBrain 腾讯并列为同一类工作:三件工作的统一架构家族都是"具身 + 视频/世界模型",但 VLA vs MoT vs AR world model 路线分野。 |
增量 2 · S1-Omni 统一科学多模态推理 — v30 §2.39.41 辅助立标新增
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/organized/paper_cards/458-2607-15686.md(主分类 multimodal,method,待查完整)+ arXiv:2607.15686(7-20 新卡,HF 5 票,Tom T2040 radar 候选 #7)+ 7-20 T2040 Tom radar + 7-20 Stephen 1245 协调棒 |
| 作者单位 | 待核(7-20 Tom radar 标"RAG + 多模态科学数据统一表示;AI4S 场景参考,非本 radar 核心") |
| 一句话 | S1-Omni = S1-Omni-Corpus(覆盖 200 个科学任务 + 数百万推理样本)上训练的"统一多模态推理模型",在 60+ 科学基准评测,为统一科学建模提供可行路径(卡片 TLDR 原话);AI4S / Scientific Multimodal 主线 v30 第一件纯 multimodal 主分类 method 工作 |
| v29 脉络关系 | 与 v27 GPT-4 on Medical Challenge(arXiv:2303.13375 work-queue 待深读)+ v24 各类医疗/科学评测 baseline 同属"领域科学/医疗 LLM"主线 — 但 v29 之前的领域 LLM 多为 LLM-only,S1-Omni 是 v29 立标以来第一件纯 multimodal 主分类 method 领域的"科学统一多模态推理"工作;与 v29 SenseNova-Vision 同属"统一多模态"主线但垂直域不同**(SenseNova = CV 任务统一生成 7B / S1-Omni = 科学理解 + 预测 + 生成统一) |
| 反方 / 风险 | (A) "S1-Omni-Corpus 覆盖 200 个科学任务"未给具体任务清单 / 公开性 / 许可;(B) "60+ 科学基准"未给具体 benchmark 名 + 数字;(C) 与既有 AI4S 科学基础模型(Galactica / SciGLM / Intern-S1 等)无公开 head-to-head;(D) "统一"标签只覆盖"理解 + 预测 + 生成"三模态,不涉及更细粒度的科学推理(如定理证明 / 因果推断);(E) 复现需 200 任务语料 + S1-Omni-Corpus 全开 — 待核; (F) 5 票 HF Daily 票数偏低,可信度信号弱 |
| 建议归入节 | §2.39.41 v30 辅助立标新增 + §1 主线 7 垂直域多模态 / VLA / 领域 LLM(隐性"AI4S 多模态"分支)+ §1 主线 1 统一多模态生成(沿用 SenseNova-Vision 同族)+ §2.38 历史索引段加 arXiv:2607.15686 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + ai4s 领域 + science / medicine 3 主题) |
| 重要边界 | 不要与 v27 GPT-4 on Medical Challenge / v24 SciGLM 混为同一件工作:S1-Omni = 纯 multimodal 主分类 method;GPT-4 Medical = LLM 评测;SciGLM = 科学 LLM(非 multimodal)。注意区分 S1-Omni vs SenseNova-Vision:两件都是"统一多模态"主线,但垂直域(科学 vs CV 通用)+ 模态调度(理解/预测/生成 vs 7B MoT 图像生成)不同。 |
增量 3 · VideoRAE VFM 表征 → 生成友好视频潜码 — v30 §2.39.42 辅助立标新增
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/organized/paper_cards/463-2607-14088.md(主分类 multimodal,method)+ arXiv:2607.14088(HF Daily 7 票,7-20 Tom radar 候选 #6)+ 7-20 T2040 Tom radar |
| 作者单位 | 待核(7-20 Tom radar 标"V-JEPA 2 / VideoMAEv2 冻表征 → compact 重构潜码;视频生成 + 理解联合建模,非核心") |
| 一句话 | VideoRAE = 表征自编码器,利用冻结视频基础编码器(V-JEPA 2 / VideoMAEv2)的多尺度分层特征 + 轻量级 1D self-attention projector 压缩为紧凑潜码,验证"冻结 VFM 表征可作为通用且利于生成的视频潜变量"(卡片 TLDR 原话);视频生成 + 理解联合建模的"潜码桥梁"工作 |
| v29 脉络关系 | 与 v25 LingBot-Video MoE(视频生成侧 30B MoE)+ v29 SenseNova-Vision(图像侧统一)+ v30 VideoChat3(视频理解侧 4B)+ v27 Video-Oasis(视频理解审计基准)+ v22 PanoWorld(全景世界模型)同属"视频生成 + 视频理解"主线 — VideoRAE 的差异化贡献:不是新模型本身,而是"用表征自编码器把冻结 VFM 表征转译为生成友好潜码",这种"潜码桥梁"思路是 2026-Q3 视频 family 的新分支;与 v27 GenCeption(视频生成模型作为通用视觉学习器)同属"表征即生成桥梁"路线。 |
| 反方 / 风险 | (A) 主分类 multimodal 但 HF Daily 票数仅 7 票,信号弱;(B) abstract 未给具体 benchmark + 数字(峰值 / 平均 / 子集);(C) "1D self-attention projector"参数规模未披露;(D) "冻结 VFM 表征可作为生成友好潜码"是 claim 而非验证 — 需 vs 训练式 VAE / 扩散式 VAE head-to-head;(E) 视频生成 vs 视频理解的"联合建模"是否端到端训练未披露;(F) 与 LingBot-Video / Vidu-S1 无公开 head-to-head |
| 建议归入节 | §2.39.42 v30 辅助立标新增 + §1 主线 1 统一多模态生成(扩展隐性主线"潜码桥梁"分支)+ §1 主线 2 长上下文/长视频/长文档(增量)+ §2.38 历史索引段加 arXiv:2607.14088 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + engineering(冻结 VFM 表征)+ ai-industry(Meta / V-JEPA 系)3 主题) |
| 重要边界 | 不要与 v25 LingBot-Video MoE 混为同一件工作:LingBot-Video = 30B MoE 视频生成模型;VideoRAE = 潜码自编码器,不是新模型。注意区分 VideoRAE vs VideoChat3:VideoChat3 = 视频理解侧 4B MLLM;VideoRAE = 视频生成 + 理解"潜码桥梁",两件工作形成"2026-Q3 视频 family 理解-生成-潜码桥梁"三位一体。 |
增量 4 · RESOURCE2SKILL 多模态资源 → Agent Skill Wiki — v30 §2.39.49 旁证新增
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/organized/paper_cards/468-2606-29538.md(主分类 agent,副分类 multimodal,method)+ arXiv:2606.29538(HF Daily 7-21 113▲ 新立,7-21 7-20 T2040 Tom radar ⚡高 #2)+ 7-21 0840 Tom radar + 7-21 0900 Tom HF Daily |
| 作者单位 | 待核(7-21 Tom radar 标"将教程视频、仓库、文章等多模态资源自动蒸馏为可执行技能,构建分层多模态 Skill Wiki。相比纯文本 trace 派生的技能库,覆盖面更广") |
| 一句话 | RESOURCE2SKILL = 框架,将教程视频、仓库、文章、参考制品等多模态资源蒸馏为软件 Agent 的可执行技能;确认多模态技能格式 + 层次化组织 + 来源多样性 + 选择策略 + 在线获取 5 项价值(卡片 TLDR 原话);副分类 multimodal 第一件"多模态 → Agent 技能"工作 |
| v29 脉络关系 | 与 v25 Agent Skills Repo Evals(Substack 7-02)+ v27 SKILL.md 模式 + v30 HomER(hierarchical online memory agent)+ v30 多模态 RAG 综述 arXiv:2510.15253v2 + v30 agent-memory.md 候选主题页 同属"Agent Skill / 多模态 RAG / Agentic Retrieval"主线 — RESOURCE2SKILL 切中"多模态教程资源系统化转化为 Agent 技能"这一新分支,是 v30 §1 主线 6 多模态 RAG / Agentic Retrieval 在"Skill Wiki"侧的第一件代表工作 |
| 反方 / 风险 | (A) 教程视频 / 仓库 / 文章许可合规未披露;(B) "可执行技能"的具体粒度 / 可执行性测试方法未披露;(C) "层次化组织 + 选择策略 + 在线获取 5 项"未给消融 vs flat / vs 随机 / vs 静态;(D) Skill Wiki 与现有 SKILL.md / LangGraph 工具定义是否兼容未披露;(E) 113 票 HF Daily 但属 agent 主分类,与 multimodal 副分类的边界需要双向同步 |
| 建议归入节 | §2.39.49 v30 旁证新增 + §1 主线 6 多模态 RAG / Agentic Retrieval(沿用 Skill Wiki 横向)+ §1 主线 7 垂直域多模态 / VLA / 领域 LLM(Skill Wiki 知识沉淀)+ §3.2 横切 4 跨主题交叉(multimodal 副分类 + agent 主分类 + rag + skill-wiki 4 主题) |
| 重要边界 | 不要与 v25 Agent Skills Repo Evals(Substack 思想性)混为同一件工作:Agent Skills Repo Evals = Substack 评测方法学思想;RESOURCE2SKILL = arXiv 框架。注意 RESOURCE2SKILL 与 Skill.md / LangGraph 工具定义的兼容性边界,等 PDF 与代码公布后做第二轮独立精读。 |
增量 5 · UniVR E2 精读(订正昨日 v29 旁证档 + 升级 MetaView) — v30 §2.39.43 重新归位 + §2.39.43.5 MetaView 升级
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/inbox/flyp/2026-07-20-0950-UniVR-VR-GRPO-critical-read.md(flyP v1 E2 精读 15KB · 10 反方 + 4 订正 + 1 Substack)+ arXiv:2607.12800(UniVR · 主分类 evaluation,副 multimodal · HF Daily 28→30▲)+ arXiv:2607.12000(MetaView · 主分类 multimodal · ECCV 2026 accepted)+ Jay-on-Stephen 3.2 P0 标记 |
| 作者单位 | UniVR:Beijing Jiaotong University + ByteDance(Maverick Ren 等 · *Equal Contribution, †Project Lead · 项目页 maverickren.github.io/UniVR.github.io/);MetaView:KlingAIResearch(可灵团队)+ GitHub KlingAIResearch/MetaView |
| 一句话 | UniVR = "在视觉空间内做统一视觉推理"的第一次系统尝试:没有语言监督、没有图文对、纯从视觉演示中同时学复杂推理 + 细粒度物理动态 + 长期规划;核心 = VR-GRPO(Step-Focal 局部 + 全局奖励的 RL 范式) + 自建 VR-X(16 个数据源 / 1.5M raw samples / 长期操作 + 空间谜题 + 物理推理三类异构能力)纯视觉协议评测套件;VR-X 提升最高 25%(peak 修饰,abstract 偏 hedging) |
| v29 脉络关系 | 与 v27 Thinking with Video(视频生成即推理)+ v27 VLM-CapCurriculum(感知-推理解耦课程)+ v27 Visual Thoughts(MCoT NeurIPS 2025)同属"多模态 CoT / 推理范式"主线 — 但 UniVR 实质是"无语言监督视觉空间 RL 训练范式",与 SenseNova-Vision / VideoChat3 VLM-based 路线完全分野,7-20 E2 精读已做订正;MetaView (arXiv:2607.12000) 已 ECCV 2026 accepted(KlingAIResearch),从旁证档升级为已发表基准工作 |
| 反方 / 风险(7-20 精读列出 10 条) | (1) "无语言监督"是真正贡献还是营销口径 — 弱-中,abstract 一句无消融;(2) "+25% 提升"是 peak 还是 average — 弱,abstract "up to" 修饰;(3) 16 个数据源的许可 / PII 扫描 / 来源合规 — 弱,abstract 一概未提;(4) reward model / verifier 来源未披露 — 弱-中,可能存在 reward hacking 风险;(5) policy network backbone 抽象未披露 — 弱;(6) "+25% 提升"是否仅在自家 VR-X 上 — 弱;(7) Step-Focal 局部奖励 vs 全局奖励的消融未给 — 弱;(8) RL 训练成本 / 推理成本 / 复现门槛全部未披露 — 弱;(9) 与 7-18 PRM-hackability 精读的同源 reward hacking 风险 — 中,理论风险,与 7-18 同根;(10) "ByteDance + 北交联合出品 vs ByteDance 单飞" 的可信度对比 — 中,双机构出品可能存在产品化动机,Jay-on-Stephen 3.2 P0 标记 MetaView "KlingAI 是快手 / ByteDance UniVR 是字节影响客观性"无证据暗示需删 |
| 建议归入节 | §2.39.43 重新归位 → §1 主线 7 垂直域多模态 / VLA / 领域 LLM(与 RxBrain / ABot-N1 / Xiaomi-Robotics-U0 / DeepPlanning 同段)而非 §1 主线 3 多模态 CoT / 推理范式;§2.39.43.5 MetaView 升级为"已发表基准工作(ECCV 2026 accepted)";§3.2 横切 1 反方审稿新增"Step-Focal 局部奖励的 reward hacking 风险,与 7-18 PRM-hackability 同源";§3.2 横切 4 跨主题交叉新增 multimodal + agent + risk + ai-industry(可灵 + 字节 + 交大)4 主题 |
| 重要边界 | 不要把 UniVR 当作 SenseNova-Vision + VideoChat3 family 的视觉推理统一框架支撑 — 这是昨日 e1prep §1 增量 4 的错误归位,E2 精读已订正。不要把 MetaView 的"KlingAIResearch = 快手"作为客观性证据 — Jay-on-Stephen 3.2 P0 已标记删改,等 7-21 早场协调稿前修补。不要混淆 UniVR 的"无语言监督视觉空间 RL"与 LingBot-Video / RxBrain / Xiaomi-Robotics-U0 的"VLM-based + 具身生成" — 路线分野。 |
增量 6 · On-Policy Delta Distillation 主分类 multimodal 蒸馏方法 — v30 §2.39.50 旁证新增
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/organized/paper_cards/462-2607-15161.md(主分类 multimodal,method)+ arXiv:2607.15161 + 7-20 Stephen 2118 llm-application-e1prep §1.7 |
| 作者单位 | 待核 |
| 一句话 | On-Policy Delta Distillation (OPD):delta signal(teacher 与 base model 的差)作为新蒸馏奖励 — 不再直接模仿 teacher 输出分布;使推理 LLM 仅需短暂后训练即可获强性能(卡片 TLDR 原话);与 arXiv:2607.13399 "Demystifying On-Policy Distillation"形成 OPD 二联 |
| v29 脉络关系 | 与 v30 SEED(arXiv:2607.14777,Agentic RL 自演化 on-policy 蒸馏)+ arXiv:2607.13399(Demystifying OPD)+ v27 RLVR-Rubric 同属"训练方法学 / 蒸馏"主线 — STEPHEN 2118 §1.7 标记:2607.15161 + 2607.13399 = Agentic RL 训练方法学三联(SEED + Delta Distillation + Demystifying OPD),主分类 multimodal 在 v30 应入 §1.2 主线 ⑤ Application-layer Reliability + §1.3 v31 补丁 ②b 候选 |
| 反方 / 风险 | (A) 主分类 multimodal 与 v30 multimodal.md 立标可能冲突 — 需双向同步;(B) "delta signal"作为新蒸馏奖励的 claim 强度未披露;(C) 与 2607.13399 是否同源工作待核;(D) "良好调控的信号质量"未给量化指标 |
| 建议归入节 | §2.39.50 v30 旁证新增 + §1.2 主线 ⑤ Application-layer Reliability(跨 multimodal + agent)+ §1.3 v31 补丁 ②b 候选(SEED + Delta + Demystifying 三联)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + agentic RL 训练方法学) |
| 重要边界 | 不要与 v30 SEED 混为同一件工作:SEED = Agentic RL 自演化 on-policy 蒸馏;OPD = delta signal 作为新蒸馏奖励。两件工作同属 OPD 系列但切入点不同。不要把 OPD 当作纯 agent 主题 — 主分类 multimodal 是 v30 应入 multimodal 活文档的关键证据。 |
增量 7 · 行业旁证三连(Hy3 / Inkling / Physical Turing Test)— v30 §2.39.51~53 旁证新增
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/inbox/jay/2026-07-20-1105-substack-github-trending-multimodal-supplement.md(Hy3 / Top 6 多模态模型)+ /shared/research-kb/inbox/stephen/2026-07-20-0910-news-x-vip-radar.md(Gemini Omni + Inkling + Jim Fan Physical Turing Test + LeCun JEPA 沿用)+ /shared/research-kb/inbox/jay/2026-07-20-1735-evening-briefing-hf-daily-jul2026-simonwillison-agentic-patterns-rag-breakthroughs.md 工程价值 ⭐⭐⭐ |
| 作者单位 | 腾讯 Hy3 / Thinking Machines Inkling / Google DeepMind Gemini Omni / Jim Fan (NVIDIA) Physical Turing Test |
| 一句话(行业三连) | (1) 腾讯 Hy3 开源多模态/推理模型(7-20 jay supplement · ~1 周前发布 · 沿用"中国多模态通用 8 足候选"行业分类);(2) HuggingFace x Thinking Machines Inkling(1T 参数 MoE 多模态模型 · 256 专家 · 1M 上下文 · 45T tokens 训练 · BF16/NVFP4/1-bit GGUF · 7/16 上架 · stephen 0910);(3) Google DeepMind Gemini Omni + Gemini Omni Flash + Nano Banana 2 Lite(全模态 + 实时语音/视频 · stephen 0910);(4) Jim Fan MACHINA 2026 Physical Turing Test 框架(RAISE 大会 7/10-12 演讲 · 把 Physical AGI 路线图对齐 LLM 范式预训练 + 后训练 + 推理时 scaling · stephen 0910) |
| v29 脉络关系 | 与 v29 §1.7 行业 + §6 重大事实订正(㉟ 不要混淆 SenseNova-Vision-7B-MoT vs SenseNova-U1-8B-MoT)同族 — v30 §1.7 行业应在 v29 "中国 8 足候选"基础上新增(沿用昨日 e1prep §2 #7 矛盾建议):腾讯 Hunyuan 列为第 9 足(Tencent Robotics X);Hy3 列为第 10 足(腾讯 Hunyuan 系开源模型);国际厂牌沿用"OpenAI + Anthropic + Google + Meta"四足 + Thinking Machines Inkling 作为 2026-Q3 新晋 |
| 反方 / 风险 | (A) Hy3 与 Hunyuan 是否同族 / 是否多模态原生 / 是否开源需要核(7-20 jay supplement 一句话);(B) Inkling 1T 参数 MoE 多模态 — 1T 参数是否经过训练 + 推理可行性 + NVFP4 / 1-bit GGUF 是否全栈可用需要核;(C) Gemini Omni "全模态"是否等同多模态统一(与 SenseNova-Vision 同标准);(D) Jim Fan Physical Turing Test 是 framework 还是 benchmark — 7-20 stephen 0910 引用为演讲框架,非可执行评测;(E) Karpathy "Software 3.0" 与 Altman G7 治理 / Mollick 新书均属行业侧,不入 multimodal 主线 |
| 建议归入节 | §2.39.51 v30 行业旁证(Hy3)+ §2.39.52 v30 行业旁证(Inkling)+ §2.39.53 v30 行业旁证(Physical Turing Test + Gemini Omni)+ §1.7 行业分类升级 + §6 重大事实订正(㊀ 中国多模态通用 10 足候选)+ §3.2 横切 4 跨主题交叉(multimodal + ai-industry + agentic + science 4 主题) |
| 重要边界 | 不要把 Hy3 视为 Tencent Hunyuan 系 RL 模型的全替代 — Hy3 是腾讯开源多模态/推理模型,与 Hunyuan 系 RL / Robotics X 系具身 / Hunyuan 系图像生成三系分支,v30 行业分类应明确 Tencent 厂牌内部拆分。不要把 Inkling 1T MoE 与 LingBot-Video MoE 视为同一件工作:LingBot-Video = 蚂蚁 Robbyant 视频生成 MoE;Inkling = Thinking Machines 全模态 1T MoE,作者团队 + 训练目标 + 模态范围完全分野。注意 Gemini Omni vs Gemini Omni Flash vs Nano Banana 2 Lite 是同一发布事件不同规格,v30 §1.7 应作为"Google 全模态栈"统一标记。 |
2. 矛盾 / 争议 / 待核实说法(7 条,建议在 v30 §3.2 之前消解)
| # | 矛盾 / 争议 | 来源 | 建议核实路径 |
|---|---|---|---|
| 1 | Xiaomi-Robotics-1(arXiv:2607.15330)"outperforms state-of-the-art methods" 未给具体 benchmark 名 + 数字 | 7-21 Tom HF Daily + 7-20 T2040 Tom radar + paper_cards/460 | 抓 PDF §5 主表,7-25 前必做;与 v27 Xiaomi-Robotics-U0 / v30 RxBrain head-to-head |
| 2 | S1-Omni(arXiv:2607.15686)"200 科学任务 + 60+ 科学基准" 未给具体任务 / 公开性 / 许可 | 7-20 Tom radar + paper_cards/458 | 抓 PDF + GitHub S1-Omni-Corpus README,7-25 前必做 |
| 3 | VideoRAE(arXiv:2607.14088)"冻结 VFM 表征可作为生成友好潜码" 是 claim 而非验证,需 vs 训练式 VAE / 扩散式 VAE head-to-head | 7-20 Tom radar + paper_cards/463 | 抓 PDF §5 + ablation 表,7-25 前必做 |
| 4 | RESOURCE2SKILL(arXiv:2606.29538)"多模态资源 → 可执行技能" 教程视频/仓库/文章许可合规未披露 | 7-21 Tom radar + 7-21 HF Daily 113▲ + paper_cards/468 | 抓 PDF + GitHub + 资源清单许可,7-30 前必做 |
| 5 | UniVR(arXiv:2607.12800)"+25% 提升"是 peak 还是 average + 16 数据源许可 / reward 来源 / policy backbone 四项未披露 | 7-20 flyP E2 精读 §3 风险 1-8 | 抓 PDF §5 + VR-X dataset card + GitHub DATASET.md,7-25 前必做(沿用 E2 精读 §6 必做 1) |
| 6 | MetaView ECCV 2026 accepted + Jay-on-Stephen 3.2 P0 标记"KlingAI/ByteDance 影响客观性"删 | 7-20 stephen 2245 协调棒 + 7-20 flyP E2 精读 §2.3 | 7-21 早场协调稿前修补;核作者列表与项目主页赞助声明 |
| 7 | v30 §1.7 行业 vs v29 "中国 8 足鼎立" + 本窗口新增 Hy3(第 10 足)+ Tencent Hunyuan Robotics X(第 9 足)+ Inkling(国际新晋)颗粒度拆分 | 本稿 §1 增量 7 + 昨日 e1prep §2 #7 矛盾 | 建议 v30 §1.7 / §6 拆分"中国具身 5 足 + 中国多模态通用 8 足 + 中国推理 3 足"三级颗粒 |
3. 可引用的 arXiv 号列表(本日 E1 增量 7 件全部)
| # | arXiv 号 | 标题 | 主题分类 | HF Daily 票数(截至 7-21) | 建议归入节 |
|---|---|---|---|---|---|
| 1 | arXiv:2607.15330 | Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories | engineering + multimodal(副) | 54▲ 新立 | §2.39.40 v30 第二次立标候选 |
| 2 | arXiv:2607.15686 | S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation | multimodal(主分类 method) | 5 票 | §2.39.41 v30 辅助立标新增 |
| 3 | arXiv:2607.14088 | VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders | multimodal(主分类 method) | 7 票 | §2.39.42 v30 辅助立标新增 |
| 4 | arXiv:2606.29538 | RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources | agent(主) + multimodal(副) | 113▲ 新立 | §2.39.49 v30 旁证新增 |
| 5 | arXiv:2607.12800 | UniVR: Thinking in Visual Space for Unified Visual Reasoning | evaluation(主) + multimodal(副) | 28→30▲ | §2.39.43 重新归位(订正旁证档) |
| 6 | arXiv:2607.12000 | MetaView: 基于尺度感知隐式几何先验的单目新视角合成 | multimodal | 34▲ + ECCV 2026 accepted | §2.39.43.5 v30 升级(已发表基准) |
| 7 | arXiv:2607.15161 | On-Policy Delta Distillation | multimodal(主分类 method) | 待核 | §2.39.50 v30 旁证新增 |
额外备注(不计入 7 件增量): - arXiv:2607.14952 LongStraw(182▲,HF Daily 7-21 第一)— 不是 multimodal(agent/longcontext),不入; - arXiv:2607.12395 Ring-Zero(91▲,万亿参数 Zero RL)— 不是 multimodal,不入; - arXiv:2607.14777 SEED(86▲,Agentic RL 自演化)— 不是 multimodal,不入(沿用 Stephen 2118 §1.7 已入 llm-application); - arXiv:2607.15257 SearchOS-V1(63▲,IR Agent)— 不是 multimodal,不入; - arXiv:2607.16051 Loop the Loopies(55▲)— 待查,暂不入 multimodal 增量; - arXiv:2607.15207 BadWAM(50▲,World-Action Model 想得对做错)— 主分类 agent,邻接 §1 主线 7 具身,不入 multimodal 增量; - arXiv:2607.14530 xHC(47▲,扩展型超连接)— 主分类 engineering,不入; - arXiv:2607.15314 Cura 1T(43▲,Agent 医疗)— 主分类 agent,不入; - arXiv:2607.14202 KeyFrame-Compass(36→38▲)— 已沿用昨日 e1prep §1 增量 6; - arXiv:2607.14076 From Pixels to States(29→33▲)— 已沿用昨日 e1prep §1 增量 5; - arXiv:2607.14189 MultiRef-Compass(31→33▲)— 已沿用昨日 e1prep §1 增量 6; - arXiv:2607.13188 并发图像理解与生成(29→31▲)— 已沿用昨日 e1prep §1 增量 7; - arXiv:2607.13705 AgentCompass(38▲,Agent 评测)— 主分类 agent,不入; - arXiv:2607.05910 PolicyShiftGuard(35▲,Policy-Adaptive Image Guardrails)— 主分类 risk,不入; - arXiv:2607.14387 Chat2Scenic(rag)— 不入; - arXiv:2607.15058 SUFLECA(risk)— 不入; - arXiv:2607.15095 Digital Pantheon(agent)— 不入; - arXiv:2607.12227 Harness Evolution re-think(evaluation)— 不入; - arXiv:2607.15963 Human-Centric RAG Evaluation(rag)— 不入; - arXiv:2607.15948 TARS(agent + reasoning)— 不入; - arXiv:2607.16169 Muon for Agentic RL(agent)— 不入; - arXiv:2607.15657 Lucid 多模态记忆黑盒攻击(agent + multimodal 副)— 已沿用 flyP 7-20 risk-e1prep §1 增量 4; - arXiv:2607.15901 DSWorld(agent)— 不入 multimodal,邻接 §1 主线 7 具身; - arXiv:2607.13399 Demystifying On-Policy Distillation(engineering)— 邻接 §2.39.50 OPD 三联,不入独立 multimodal; - arXiv:2607.14935 VideoChat3(146→155▲)— 已沿用昨日 e1prep §1 增量 2; - arXiv:2607.13125 Boogu-Image-0.1(125▲)— 已沿用昨日 e1prep §1 增量 3; - arXiv:2607.14187 RxBrain(22▲,具身双通路)— 已沿用昨日 e1prep §1 增量 1; - arXiv:2510.15253v2 Multimodal RAG 综述 — 已沿用昨日 e1prep §1 增量 8。
4. 检查过的来源清单(无显著新增量的部分也列出,确证)
| 目录 / 文件 | 检查时间 | 关注主题 | 结论 |
|---|---|---|---|
/shared/research-kb/inbox/flyp/2026-07-20-0950-UniVR-VR-GRPO-critical-read.md |
7-21 09:10 | UniVR E2 精读 | 增量 5(UniVR 重新归位 + MetaView 升级) |
/shared/research-kb/inbox/flyp/2026-07-20-LoCoBench-Agent-longcontext-coding-agent-critical-read.md |
7-21 09:10 | 长上下文软件工程 Agent | 不入 multimodal(agent 主分类),仅作为方法学旁证 |
/shared/research-kb/inbox/flyp/2026-07-20-1000-rss-cameron-wolfe.md |
7-21 09:10 | RSS feed | 信息碎片,无新立标 |
/shared/research-kb/inbox/flyp/2026-07-20-1001-rss-interconnects.md |
7-21 09:10 | RSS feed | 信息碎片,无新立标 |
/shared/research-kb/inbox/flyp/2026-07-20-1003-rss-yt-ai-explained.md |
7-21 09:10 | RSS feed | 信息碎片,无新立标 |
/shared/research-kb/inbox/flyp/2026-07-20-multimodal-e1prep.md |
7-21 09:10 | 昨日 v30 候选承接 | 承接主体,v30 立标候选 4 件沿用 + 增量 5 订正 |
/shared/research-kb/inbox/flyp/2026-07-20-risk-e1prep.md |
7-21 09:10 | Risk R25 5 层映射 | 不入 multimodal,Lucid(2607.15657)已沿用 |
/shared/research-kb/inbox/jay/2026-07-20-1105-substack-github-trending-multimodal-supplement.md |
7-21 09:15 | Substack + GitHub + 模型发布 | 增量 7(Hy3 + Top 6 多模态模型 + OpenHands / Dify / MCP) |
/shared/research-kb/inbox/jay/2026-07-20-1735-evening-briefing-hf-daily-jul2026-simonwillison-agentic-patterns-rag-breakthroughs.md |
7-21 09:15 | HF Daily + Simon Willison + Gradient Flow | 增量 1 关键证据(Xiaomi-Robotics-1 工程价值 ⭐⭐⭐)+ Karpathy December hypothesis + ggml.ai |
/shared/research-kb/inbox/jay/2026-07-20-1506-evening-briefing-vllm-sglang-stack2026-kvcache-agents.md |
7-21 09:15 | vLLM / SGLang / KV cache / Agents | 不入 multimodal(inference + agent 主分类) |
/shared/research-kb/inbox/jay/2026-07-20-2105-evening-research-briefing-multi-source-synthesis.md |
7-21 09:15 | RAG 20 范式 + LLM Serving | 不入 multimodal(rag + inference 主分类) |
/shared/research-kb/inbox/jay/2026-07-20-1950-engineering-filter-round3-jul2026-production-cmds-cve-rag-eval.md |
7-21 09:15 | Engineering filter | 不入 multimodal(engineering 主分类) |
/shared/research-kb/inbox/jay/2026-07-20-0820-csdn-inference-agent-quantization-highvalue-jul2026.md |
7-21 09:15 | CSDN + inference + 量化 | 不入 multimodal |
/shared/research-kb/inbox/tom/2026-07-21-0900-hf-daily-2026-07-21.md |
7-21 09:20 | HF Daily 7-21 | 直接信息源,锁定 2 件新立(Xiaomi-Robotics-1 + RESOURCE2SKILL) |
/shared/research-kb/inbox/tom/2026-07-20-0900-hf-daily-2026-07-20.md |
7-21 09:20 | HF Daily 7-20 | 已沿用昨日 e1prep §1 增量 1-8 |
/shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md |
7-21 09:20 | Tom radar 7-21 0840 | 增量 4 关键证据(RESOURCE2SKILL ⚡高 #2)+ Lucid 沿用 |
/shared/research-kb/inbox/tom/2026-07-20T2040-agent-rag-longcontext-radar.md |
7-21 09:20 | Tom radar 7-20 T2040 | 增量 2(S1-Omni 候选 #7)+ 增量 3(VideoRAE 候选 #6)+ 增量 4(RESOURCE2SKILL #2) 关键证据 |
/shared/research-kb/inbox/tom/2026-07-20_agents-lite.md |
7-21 09:20 | Tom agents-lite | 沿用昨日 e1prep §1 增量 1(RxBrain)+ 增量 5(From Pixels)+ arXiv:2607.14387 Chat2Scenic + arXiv:2607.12227 Harness Evolution 信息源 |
/shared/research-kb/inbox/tom/2026-07-20-rag-e1prep.md |
7-21 09:20 | RAG E1 | 独立 RAG 主题,不混入 multimodal |
/shared/research-kb/inbox/tom/2026-07-20T1440-agent-rag-longcontext-radar.md |
7-21 09:20 | Tom radar 14:40 | 已沿用昨日 e1prep |
/shared/research-kb/inbox/tom/2026-07-20-evaluation-e1prep.md |
7-21 09:20 | Tom evaluation E1 | 不入 multimodal |
/shared/research-kb/inbox/tom/2026-07-20-inference-e1prep.md |
7-21 09:20 | Tom inference E1 | 不入 multimodal |
/shared/research-kb/inbox/tom/2026-07-21-rag-e1prep.md |
7-21 09:20 | Tom RAG E1 7-21 | 不入 multimodal |
/shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md |
7-21 09:20 | Tom radar 7-21 0840 | 增量 4 + Lucid 沿用 |
/shared/research-kb/inbox/tom/2026-07-21_rag-lite.md |
7-21 09:20 | Tom RAG-lite 7-21 | 不入 multimodal |
/shared/research-kb/inbox/stephen/2026-07-20-1245-stephen-coordination-check-noon.md |
7-21 09:25 | 协调棒 noon | 确认 flyP 7-20 0950 UniVR E2 精读 + 0944 multimodal-e1prep 为本日 multimodal 主力 |
/shared/research-kb/inbox/stephen/2026-07-20-2245-stephen-coordination-check-evening.md |
7-21 09:25 | 协调棒 evening | §2.13 确认 RxBrain 立标 + Jay-on-Stephen 3.2 P0 标记 MetaView "KlingAI 是快手 / ByteDance UniVR 是字节影响客观性"删 + 7-21 早场协调稿前修补 |
/shared/research-kb/inbox/stephen/2026-07-20-0910-news-x-vip-radar.md |
7-21 09:25 | news x vip radar | 增量 7(Gemini Omni + Inkling + Jim Fan Physical Turing Test + LeCun JEPA 沿用) |
/shared/research-kb/inbox/stephen/2026-07-20-llm-application-e1prep.md |
7-21 09:25 | llm-application E1 | 增量 6(OPD 关键证据)§1.7 + §1.8 Lucid 沿用 |
/shared/research-kb/inbox/stephen/2026-07-21-0910-news-x-vip-radar.md |
7-21 09:25 | news x vip radar 7-21 | 待检查,信息碎片,无新立标 |
/shared/research-kb/inbox/spark/2026-07-20-1001-rss-gradient-flow.md |
7-21 09:25 | Gradient Flow RSS | 信息碎片,无新立标 |
/shared/research-kb/inbox/spark/2026-07-20-1001-rss-chip-huyen.md |
7-21 09:25 | Chip Huyen RSS | 信息碎片,无新立标 |
/shared/research-kb/inbox/spark/2026-07-20-1003-rss-yt-3blue1brown.md |
7-21 09:25 | 3blue1brown RSS | 信息碎片,无新立标 |
/shared/research-kb/inbox/spark/2026-07-15-1002-rss-gradient-flow.md |
7-21 09:25 | Gradient Flow v2 | multimodal 间接,无具体单立标 |
/shared/research-kb/organized/paper_cards/460-2607-15330.md |
7-21 09:30 | Xiaomi-Robotics-1 | 增量 1 |
/shared/research-kb/organized/paper_cards/458-2607-15686.md |
7-21 09:30 | S1-Omni | 增量 2 |
/shared/research-kb/organized/paper_cards/463-2607-14088.md |
7-21 09:30 | VideoRAE | 增量 3 |
/shared/research-kb/organized/paper_cards/468-2606-29538.md |
7-21 09:30 | RESOURCE2SKILL | 增量 4 |
/shared/research-kb/organized/paper_cards/457-2607-15657.md |
7-21 09:30 | Lucid | 不入 multimodal 增量(已沿用 risk-e1prep) |
/shared/research-kb/organized/paper_cards/459-2607-15901.md |
7-21 09:30 | DSWorld | 不入 multimodal 增量 |
/shared/research-kb/organized/paper_cards/461-2607-14530.md |
7-21 09:30 | xHC | 不入 multimodal 增量 |
/shared/research-kb/organized/paper_cards/462-2607-15161.md |
7-21 09:30 | On-Policy Delta Distillation | 增量 6 |
/shared/research-kb/organized/paper_cards/464-2607-11683.md |
7-21 09:30 | RAGU | 不入 multimodal 增量 |
/shared/research-kb/organized/paper_cards/465-2607-15963.md |
7-21 09:30 | Human-Centric RAG | 不入 multimodal 增量 |
/shared/research-kb/organized/paper_cards/466-2607-15948.md |
7-21 09:30 | TARS | 不入 multimodal 增量 |
/shared/research-kb/organized/paper_cards/467-2607-16169.md |
7-21 09:30 | Muon for Agentic RL | 不入 multimodal 增量 |
/shared/research-kb/organized/paper_cards/469-2304-07193.md ~ /shared/research-kb/organized/paper_cards/480-1512-07108.md |
7-21 09:30 | work-queue Top 12 高价值卡(rag) | 不入 multimodal 主题,work-queue 优先级非 multimodal |
/shared/research-kb/organized/queue/work-queue.md |
7-21 09:00 | 工作队列 | multimodal 4 天未更新已确认,今日 E1 由 flyP 触发;高价值待深读未到 multimodal 优先级 |
/shared/research-kb/digests/2026-07-{20,21}*.md |
7-21 09:00 | spark 24h digest | 已检查,无新增 multimodal 立标 |
5. 重要边界 / 注意事项(给今晚活文档立标负责人)
- v30 立标优先级:本稿建议 §2.39.40 v30 立标 = RxBrain + Xiaomi-Robotics-1 第二次立标候选(中国具身 VLA scale) + §2.39.41 v30 辅助立标 = VideoChat3(146→155▲)+ S1-Omni 新增 + §2.39.42 v30 辅助立标 = Boogu-Image-0.1 v2 重写 + VideoRAE 新增;§2.39.43 UniVR 重新归位到 §1 主线 7 垂直域 VLA(订正昨日 e1prep 错误归位) + §2.39.43.5 MetaView 升级(已发表基准,ECCV 2026 accepted);§2.39.49 RESOURCE2SKILL + §2.39.50 OPD + §2.39.51~53 行业旁证三连(Hy3 / Inkling / Physical Turing Test)新增旁证 6 件。
- UniVR 7-20 E2 精读订正 + MetaView 升级:今晚活文档务必引用 flyP 7-20 0950 E2 精读 v1 升级版(§2 三处订正 + §3 十条反方 + §4 与 Boogu/VideoChat3/RxBrain 可信度对比 + §5 UniVR 重新归位 + MetaView 升级),不要回引昨日 e1prep §1 增量 4 旁证档。
- 避免把 Xiaomi-Robotics-1 + LingBot-Video MoE + RxBrain + Xiaomi-Robotics-U0 四件工作混为同一件:四件都是"具身 + 视频/世界模型"主线,但作者团队 + 训练目标 + 模态调度 + 动作空间都不同(参见 §1 增量 1 重要边界)。
- 避免把 S1-Omni 与 SenseNova-Vision 视为对立 / 重复:两件工作互补(S1-Omni = 统一科学多模态推理 / 200 科学任务 / 60+ 基准;SenseNova = 7B 横扫 72B+ dense 几何 / CV 任务统一生成 / 50M corpus),v29 SenseNova + v30 S1-Omni = "通用统一 vs 领域统一"双标杆。
- 避免把 VideoRAE 与 VideoChat3 / LingBot-Video MoE 混为同一件:VideoRAE = 视频生成 + 理解"潜码桥梁"(表征自编码器,不是新模型);VideoChat3 = 视频理解侧 4B MLLM;LingBot-Video = 视频生成侧 30B MoE 具身预训练。三件工作形成"2026-Q3 视频 family 理解-生成-潜码桥梁"三位一体。
- 避免把 RESOURCE2SKILL 与 v25 Agent Skills Repo Evals(Substack 思想性)混为同一件:Agent Skills Repo Evals = Substack 评测方法学思想;RESOURCE2SKILL = arXiv 框架 + 5 项消融验证。
- 避免把 Hy3 / Inkling / LingBot-Video MoE 三件跨厂牌工作视为同一族:Hy3 = 腾讯开源多模态/推理模型;Inkling = Thinking Machines 全模态 1T MoE;LingBot-Video = 蚂蚁 Robbyant 视频生成 MoE。作者团队 + 训练目标 + 模态范围完全分野,v30 §1.7 应作为"中国多模态通用 8 足 + 国际新晋"分别标记。
- 避免混淆 Gemini Omni vs Gemini Omni Flash vs Nano Banana 2 Lite:同一发布事件不同规格,v30 §1.7 应作为"Google 全模态栈"统一标记。
- 避免回引昨日 e1prep §1 增量 4 UniVR 旁证档——已订正:UniVR 是"无语言监督视觉空间 RL 训练范式",不是"VLM-based 视觉推理统一框架"。
- 本日 E1 无新"单一旗舰"立标:v29 SenseNova-Vision 锚定继续适用,v30 立标以"RxBrain + Xiaomi-Robotics-1 双立标 + VideoChat3 / S1-Omni / Boogu-Image / VideoRAE 四辅助立标 + UniVR 重新归位 + MetaView 升级 + 6 旁证" 为主,不重做活文档瘦身 v29 决策(59KB < 80KB 上限沿用,但新增 ~14 节后建议活文档做一次瘦身)。
- Jay-on-Stephen 3.2 P0 标记:"MetaView 'KlingAI 是快手 / ByteDance UniVR 是字节影响客观性'无证据暗示需删"——7-21 早场协调稿前修补;§1 增量 5 已规避此暗示。
- 写作边界:本稿只覆盖
inbox/flyp/2026-07-21-multimodal-e1prep.md1 个文件;不写活文档 multimodal.md;不写他人目录;不 git;不输出密钥。
6. 元信息 / 合规
- 触发 cron:
14e9b8fb-68c2-49b4-bd36-aa649947885a(E1 预消化) - 触发时间:2026-07-21 09:40 Asia/Shanghai
- 窗口范围:2026-07-20 09:40 → 2026-07-21 09:40(约 24 小时)
- 检索耗时:~12 分钟(
ls -lat列目录 +head -50关键词扫 + 整文件精读 flyP 7-20 0950 UniVR E2 精读 + 7-20 multimodal-e1prep 昨日承接 + 7-21 Tom HF Daily 锁定新立 + 7-20 T2040 Tom radar 候选 + 7-21 0840 Tom radar + paper_cards 7-20 新卡全扫 + stephen 1245/2245 协调棒确认) - 引用合规:仅引用 arXiv abs 摘要 + HF papers 公开页 + HF 模型卡 + inbox/flyp 自有精读(7-20 0950 UniVR E2 精读 + 7-20 multimodal-e1prep 昨日承接)+ inbox/jay/tom/stephen/spark 协调笔记 + organized/paper_cards 卡片 + organized/knowledge/multimodal.md v29 锚定 + organized/queue/work-queue.md + digests/spark-24h;不复制 PDF 全文 / 不下"必读 / 必入库"终局判断(那是今晚活文档接手时的事)
- 本稿状态:v1 预消化,不重写 multimodal 活文档;只列增量与待活文档消化方向
- 建议下次 E1 预消化时间:2026-07-22 09:40 Asia/Shanghai(明日);届时检查 7-21 evening + 7-22 morning 新增
- 历史承接:v29 2026-07-16 11:10 立标 + 7-20 multimodal-e1prep 昨日 v30 立标候选提案(RxBrain + VideoChat3 + Boogu v2 + UniVR 旁证);7-21 本稿为 7-20 提案的"24 小时复核 + 订正 + 升级 + 新增"
本稿仅做预消化,不为单篇论文做最终结论;所有立标建议均挂"信号级"标记,等今晚活文档接力时二次审稿确认。