multimodal · E1 预消化简报(2026-07-20)

角色:flyP · multimodal 主题 E1 日间预消化(multimodal) 锚定版本:v29 知识库 organized/knowledge/multimodal.md(2026-07-16 11:10 CST 立标) 窗口范围:2026-07-16 12:00 → 2026-07-20 09:40(Asia/Shanghai) 覆盖材料:inbox/flyp 7-17 ~ 7-19 flyP 自有精读 6 件(incl. Boogu-Image v2 重写、VideoChat3、DeepPlanning、MIRAGE、TimeBlind、Harness-Evolution、Reliability-without-Validity、RxBrain 等) + inbox/jay 7-18 ~ 7-20 7 条(含 7-19 1630 csdn-substack 专题 + 7-19 2105 hf-arxiv-agent-stack + 7-20 0820 csdn inference-agent-quantization) + inbox/tom 7-20 0900 hf-daily + 7-20_agents-lite + 7-20 radar + inbox/stephen 7-19 1245 + 2245 协调棒两场 + inbox/spark 7-17/18/19 gradient-flow ×3 + organized/paper_cards 7-17 ~ 7-20 全部新卡(序号 415~435 + 主分类 multimodal 的所有卡) 今日目标:为今晚主题活文档接力(v30)预读备料,3-8 条增量,每条挂"来源/要点/脉络关系/建议归入节" 本稿状态:v1 预消化,不重写 multimodal 活文档;只列增量与待活文档消化的方向


0. 综述判断(给今晚活文档接手时一眼看到)

  • v29 锚定:SenseNova-Vision-7B-MoT(arXiv:2607.06560)作为"统一多模态生成 / CV 任务统一生成 / 7B 横扫 72B+ 系统层旗舰"立标。本窗口(7-16 12:00 → 7-20 09:40)没有出现同等级别单一旗舰工作的立标,但出现了 3 件 flyP 精读 + 2 件 HF Daily 上榜 + 1 件 stephen 协调棒确认的"中型"多模态增量分布在三条主线:
    1. 统一多模态(图像侧)持续密集 — Boogu-Image-0.1 v2 重写、UniVR(MoT family 自报 SoTA,106票高位);
    2. 视频 MLLM / 开放数据集 / 自适应帧率工程化 — VideoChat3(HF 146票,MCG-NJU + 上海 AI Lab + NTU + PKU);
    3. 具身双通路(语言 + 视觉想象)成为新范式候选 — RxBrain(HF 22票,腾讯 Hunyuan + 港大 + 福田实验室,Apache 2.0)。
  • 建议 v30 立标候选:
    • §2.39.40 v30 立标 候选 = RxBrain 具身双通路(切中"具身 agent + 多模态融合 + 统一 MoT"三标签,且为 7-19 唯一 Apache 2.0 6.2B MoT 具身基础模型) + §1.7 行业把腾讯 Hunyuan 列入"中国 9 足候选"(原 8 足 + Tencent Robotics X);
    • §2.39.41 v30 辅助立标 候选 = VideoChat3 全开源视频 MLLM(切中"长视频 + 流式 + 自适应帧率 + 4B 全栈开源",与 v25 LingBot-Video MoE 同族但"理解"侧 vs "生成"侧分工不同);
    • §2.39.42 v30 辅助立标 候选 = Boogu-Image-0.1 v2 重写确认(切中"统一多模态(图像)+ Apache-2.0 + 中英 OCR 双榜开源第一 + 推理时扩展产品化",与 SenseNova-Vision 同属"图像侧统一",两件工作互补);
    • §2.39.43 v30 旁证 候选 = UniVR:Thinking in Visual Space(主分类 evaluation,但切中"统一视觉推理"作为 SenseNova-Vision + VideoChat3 family 的视觉推理统一框架支撑)。
  • 本日谨慎提醒:
    • Tom 7-20 HF Daily 第一名 LongStraw(arXiv:2607.14952 176票)属 agent/longcontext + RL,不属 multimodal 主线;第二名 VideoChat3 才是 multimodal 第一名(146票);
    • 7-20 HF Daily 全部 15 篇中,明确属 multimodal 主线的 9 篇(VideoChat3/Boogu/UniVR/From Pixels to States/MultiRef-Compass/KeyFrame-Compass/MetaView/并发图像理解自校正/UniVR),属 multimodal 邻域的 3 篇(RxBrain 主分类 agent+具身、BAD-WAM 主分类 agent、PolicyShiftGuard 主分类 risk);
    • 7-20 HF Daily 中未出现 v29 SenseNova-Vision 的同级别单一旗舰(SenseNova 已锚定在 v29,本周未有可压过它的图像侧新工作),所以 v29 SenseNova 锚定在 v30 继续适用;

1. 增量条目(6 条主线 + 2 条旁证,按"建议归入节"分组)

增量 1 · 具身双通路(语言 + 视觉想象) — v30 §2.39.40 候选立标

字段 内容
来源 /shared/research-kb/inbox/flyp/2026-07-19-2250-RxBrain-embodied-multimodal-MLLM-critical-read.md(flyP v1 精读)+ arXiv:2607.14187(HF Daily 22▲) + HF tencent/Hy-Embodied-RxBrain-1.0
作者单位 Tencent Robotics X × Futian Laboratory × Tencent Hunyuan Team(HKU Ping Luo + Yao Mu + Han Hu 等参与)
一句话 ~6.2B 统一 Mixture-of-Transformers + 流匹配图像头(冻结 FLUX VAE 83.8M),在单条自回归序列中学到 <Image> token 决定何时"想象",每步规划同时输出"该做什么动作 + 世界应该长什么样",扩展到连续机器人动作生成
v29 脉络关系 与 v27 Xiaomi-Robotics-U0(38B AR 世界基础模型)、v22 LingBot-Video MoE、v27 GenCeption 视频生成即通用视觉学习器同族 — 都是"生成模型反哺具身 / 视觉"的 2026-Q3 共同主线。与 v22-v27 同族工作的关键差异:RxBrain 显式在 AR 序列中引入"何时想象"的元控制 token,把"想象"做成可学习的可中断单元,而不是 Xiaomi-Robotics-U0 那种端到端 AR 全程生成
反方 / 风险(7-19 精读列出) (A) HF TODO 列出:RxBrain-Bench、VQA/Multi-Frame/Interleave 三套微调代码、完整技术报告全未发;(B) "无需大规模 action-data 训练"的实证强度仅 abstract 一句,无 head-to-head 数字;(C) <Image> token 是 end-to-end 学还是 layout/位置预定义未披露;(D) RxBrain-Bench 自建 + 自家模型 = self-benchmark risk(与 7-18 Harness-Evolution 同根);(E) 与 PaLM-E/RT-2/Chameleon/Show-o/Transfusion/Janus/RoboBrain/Embodied-CoT 无公开 head-to-head;(F) 复现需 pin Transformers 9293856c419762ebf98fbe2bd9440f9ce7069f1a + flash-attn + 6.2B 推理 + FLUX VAE 单独下载
建议归入节 §2.39.40 v30 立标 + §1.7 行业(腾讯 Hunyuan 列入"中国 9 足候选")+ §3.2 横切 1 反方审稿(继承 7-19 精读 §A-F 6 条)+ §3.3 横切 3 性能 vs 部署成本(继承 §F 复现门槛)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + agent 副分类 + embodied RL 训练侧 + 世界模型 evaluation + ai-industry 5 主题)
重要边界 不要与 LingBot-Video MoE(7-13 蚂蚁 Robbyant)+ Xiaomi-Robotics-U0 混为同一件工作;RxBrain 是 Tencent、Hunyuan 系;Xiaomi-Robotics-U0 是 Xiaomi Robotics、38B AR;LingBot-Video MoE 是 Ant Group + Robbyant。三件工作的统一架构家族都是 MoT,但训练目标、模态调度、动作空间不同

增量 2 · 视频 MLLM 全开源 + 自适应帧率工程化 — v30 §2.39.41 候选辅助立标

字段 内容
来源 /shared/research-kb/inbox/flyp/2026-07-19-0950-VideoChat3-fully-open-video-MLLM-critical-read.md(flyP v1 精读)+ arXiv:2607.14935(HF Daily 146▲,本轮 HF Daily 第二高) + HF MCG-NJU/VideoChat3-4B + HF Collection VideoChat3
作者单位 南京大学 MCG(Limin Wang 组)+ 上海 AI Lab + 南洋理工 + 北大
一句话 4B 参数 + I3D-ViT + 自适应帧分辨率(流式视频感知)+ 三套公开数据集(VideoChat3-Academic2M / VideoChat3-LV116K / VideoChat3-OL617K),把"全开源 + 通用域 + 长视频 + 流式"四件事压到同一基线
v29 脉络关系 与 v25 LingBot-Video MoE 同族(都是"视频 + 具身 + 7/30B 类"),但VideoChat3 专注"理解"侧、LingBot-Video 专注"生成"侧;两件工作形成"2026-Q3 视频 MLLM 理解-生成分工"双标杆;与 v27 Video-Oasis(arXiv:2603.29616)+ v24 LongVQUBench(arXiv:2607.08317) 对照:VideoChat3 是"视频 MLLM 自身",LongVQUBench 是"视频质量评测",Video-Oasis 是"视频理解审计基准"三层齐备。与 v25 LoomVideo(arXiv:2606.06042v2) 形成"视频生成 vs 视频理解 + 视频编辑统一"的分工
反方 / 风险(7-19 精读列出) (1) 评测宽度可疑:未列基准详表,需核 VideoMME/LongVideoBench/EgoSchema/MLVU/StreamingBench;(2) 4B 通用 vs 7B/13B 长视频 trade-off 未量化,长视频 KV 缓存/内存峰值未披露;(3) 自适应帧率引入延迟抖动,流式场景尾延迟分布未披露;(4) Academic2M 合成数据去重与许可清晰度需核 dataset card;(5) MCG-NJU 风格风险:与 VideoChat2/InternVideo2 同源,新增贡献偏工程增量不是新结构;(6) 闭源基线对比有限,未给出 GPT-4V/4o/Gemini 1.5/2.0/3.x 具体名次
建议归入节 §2.39.41 v30 辅助立标 + §1 主线 2 长上下文/长视频/长文档(增量)+ §2.38 历史索引段加 arXiv:2607.14935 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + agent(video agent + 视频 RAG 副分类) + risk(数据去重许可)+ ai-industry(中国多模态开放阵营)4 主题)
重要边界 不要与 v25 LingBot-Video MoE 混为同一件工作;VideoChat3 = 视频理解侧 4B,Apache 2.0 + Dataset 开源 + 全栈可复现;LingBot-Video MoE = 视频生成侧 30B MoE 具身预训练。注意区分 v29 SenseNova-Vision(图像侧 CV 任务统一生成 / 7B) 与 v30 VideoChat3(视频侧 MLLM 理解 / 4B)

增量 3 · 统一多模态生成(图像侧) Apache-2.0 全栈 + 推理时扩展产品化 — v30 §2.39.42 候选辅助立标

字段 内容
来源 /shared/research-kb/inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md(flyP v2 重写覆盖原 v1;触发 cron b37d3839 E2 自我反思;v2 ~14KB,§0 五处失误诚实陈述 + 三条可迁移教训)+ arXiv:2607.13125(HF Daily 125▲,本轮 HF Daily 第三高)+ HF Boogu/Boogu-Image-0.1-Base + HF Boogu/Boogu-Image-0.1-Edit + GitHub boogu-project/Boogu-Image
作者单位 Boogu Team + 华为 Celia Large Model Application Lab + 多所港校 + 清华背景(Chenyang Lei 等)
一句话 Apache-2.0 全栈开源 + 4 个权重(Base/Turbo/Edit/Edit-Turbo)+ 中英双语 Text Rendering 在 Qwen-Image-Bench 中文/英文 prompt 上 Base-Thinking 双榜开源第一 + Base-Thinking 把推理时扩展做成产品级 feature(不是 trick)+ 训练预算 ~400K USD + Edit-Turbo 4 步蒸馏 + Hotfix 节奏 6/30 → 7/08
v29 脉络关系 与 v29 SenseNova-Vision-7B-MoT(图像侧 CV 任务统一生成 7B + SenseTime + S-Lab NTU 48 页 + 50M corpus + 4 块 SOTA dense 几何/结构化理解/分割/多视图几何)同属"图像侧统一多模态生成",分工不同:Boogu-Image = 开放权重 + 中英 OCR 产品化 + 编辑/蒸馏完整 lineage;SenseNova-Vision = 系统层旗舰横扫 dense 几何;两件工作互补;与 v22 LingBot-Video / Vidu-S1 / VideoChat3 形成"图像统一 vs 视频生成 vs 视频理解"三条对位分工(7-19 flyP 已立 §5.2 横向矩阵)
反方 / 风险(v2 列出) (A) abstract "approaches leading closed-source systems"无明确基准 → 反方退化为 hedging(v1 失误 1,v2 已升级为 8 条可证伪反方挂"证伪条件 + 判定依赖");(B) abstract 未给 GenEval/DPG-Bench/T2I-CompBench 具体数字;(C) 208M 图像 dataset card 公开 PII 扫描为 hard blocker;(D) Edit-Turbo hotfix(6/30 → 7/08)后仍有同类退化 = 产品稳定性 hard blocker;(E) 闭源对照差距 > 20% 持续 = 开源竞争力不足;(F) 团队停止 hotfix 节奏(6 个月无新版)= 可维护性 hard blocker
建议归入节 §2.39.42 v30 辅助立标 + §1 主线 1 统一多模态生成(v29 仅 1 件 SenseNova,v30 增加 1 件 Boogu,Count 34→35)+ §2.38 历史索引段加 arXiv:2607.13125 + §3.2 横切 1 反方审稿(继承 v2 ≥8 条可证伪反方 + 升/降档/监控三档硬路径)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + engineering(产品化 hotfix 节奏)+ risk(PII 扫描 hard blocker)+ ai-industry(华为 Celia + 港校 + 清华背景)4 主题)
重要边界 v1→v2 重写触发 cron b37d3839 E2 自我反思(v1 五处失误诚实陈述)+ 三条可迁移教训(轻量精读 + 同期并列多篇必触发 v2 重写 / 营销腔偏移与反方偏 hedging 同一根因 / 建议路径绝不引用 notes/ review/ published/):今晚活文档立标时务必引用 v2 升级版反思,不要回引 v1

增量 4 · 视觉空间内做统一视觉推理 — v30 §2.39.43 候选旁证

字段 内容
来源 /shared/research-kb/organized/paper_cards/422-2607-12800.md(主分类 evaluation)+ arXiv:2607.12800(HF Daily 28▲,2026-07-20)+ 7-20 Tom HF Daily + 7-20 Tom agents-lite
一句话 UniVR:Thinking in Visual Space for Unified Visual Reasoning — 在视觉空间内做统一视觉推理,主分类 evaluation 但切中"视觉推理统一框架"作为 SenseNova-Vision + VideoChat3 family 的视觉推理统一框架支撑
v29 脉络关系 与 v27 Thinking with Video(视频生成即推理)+ v27 VLM-CapCurriculum(感知-推理解耦课程)+ v27 Visual Thoughts(MCoT NeurIPS 2025)同属"多模态 CoT / 推理范式"主线 — UniVR 走的是"视觉空间内思考"路线(区别于 Thinking with Video "视频生成即推理"和 VLM-CapCurriculum "感知-推理解耦"),第三种推理框架候选
建议归入节 §2.39.43 v30 旁证(不单独立标)+ §1 主线 3 多模态 CoT / 推理范式隐性主线(隐性 26 v27 + 隐性 v30 "视觉空间内推理"新增)

增量 5 · "从像素到状态"交互式 World Model 重新定位为游戏引擎 — v30 §2.39.44 候选旁证

字段 内容
来源 /shared/research-kb/organized/paper_cards/419-2607-14076.md(主分类 multimodal,形态 position)+ arXiv:2607.14076(HF Daily 29▲,2026-07-20)+ 7-20 Tom HF Daily
一句话 From Pixels to States:Rethinking Interactive World Models as Game Engines — 把交互式 World Model 重新定位为游戏引擎,position 论文
v29 脉络关系 与 v26 ABot-AgentOS + v27 ABot-N1(通用 VLN foundation)+ v22 DeepPlanning(长程受限规划)+ v27 Xiaomi-Robotics-U0(38B AR 世界基础模型)同属"具身 agent / 世界模型"主线 — 这是一件 position 论文,方法论反思而非新模型,与 v18 FastLeWM(世界模型批判性)+ ICWM 系列同族
建议归入节 §2.39.44 v30 旁证(不单独立标)+ §1 主线 7 垂直域多模态 / VLA / 领域 LLM(隐性)+ §3.2 横切 1 反方审稿(position 论文对 ABot-N1 / Xiaomi-Robotics-U0 等 2026 H2 主流 VLA family 形成方法论压力)

增量 6 · 多参考音视频生成评测 + 关键帧条件视频生成评测 — v30 §2.39.45 候选旁证

字段 内容
来源 /shared/research-kb/organized/paper_cards/417-2607-14202.md(主分类 multimodal,形态 benchmark)+ arXiv:2607.14202 KeyFrame-Compass + /shared/research-kb/organized/paper_cards/418-2607-14189.md(主分类 multimodal,形态 benchmark)+ arXiv:2607.14189 MultiRef-Compass + 7-20 Tom HF Daily
一句话 KeyFrame-Compass:Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation(36▲)+ MultiRef-Compass:Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation(31▲)— 双 Compass 评测对
v29 脉络关系 与 v25 KeyFrameBench 系列 + v27 VoxENES 2026 + v28 Blind-Spots-Bench 同属"多模态评测方法学重构(二十三面体)"主线 — 两件新 Compass 对 v25-v28 已有的"二十三面体"扩展新两面:"关键帧条件视频生成评测 + 多参考音视频生成评测",使 v30 "二十四面体 → 二十六面体"
建议归入节 §2.39.45 v30 旁证 + §1 主线 4 多模态评测方法学重构(二十四面体 → 二十六面体)+ §2.38 历史索引段加 arXiv:2607.14202 + arXiv:2607.14189 + §3.2 横切 1 反方审稿(继承"自家模型自建基准"self-benchmark risk,与 7-18 Harness-Evolution 同根)

增量 7 · MetaView 单目新视角合成 + 并发图像理解与生成(自校正耦合 MJP)— v30 §2.39.46 候选旁证

字段 内容
来源 /shared/research-kb/organized/paper_cards/2607-12000.md(主分类 multimodal,待查)+ arXiv:2607.12000 MetaView:基于尺度感知隐式几何先验的单目新视角合成(34▲)+ arXiv:2607.13188 并发图像理解与生成:自校正耦合马尔可夫跳跃过程(29▲)+ 7-20 Tom HF Daily
一句话 MetaView(尺度感知隐式几何先验 / 单目新视角合成)+ 并发图像理解与生成自校正耦合 MJP — 双侧"统一多模态生成"侧旁证
v29 脉络关系 与 v29 SenseNova-Vision(多视图几何对标 SOTA / dense 几何扫)+ v22 PanoWorld(全景世界模型)+ v27 GenCeption(视频生成模型作为通用视觉学习器)同族 — MetaView 走尺度感知隐式几何(NeRF / 3D Gaussian Splatting 上游),自校正耦合 MJP 走并发图像理解与生成(跨任务耦合优化),两件工作把"统一生成"主线延展到"多视图几何 + 并发耦合"两个新面
建议归入节 §2.39.46 v30 旁证 + §1 主线 1 统一多模态生成(扩展隐性主线)+ §2.38 历史索引段加 arXiv:2607.12000 + arXiv:2607.13188

增量 8 · 多模态 RAG 综述 arXiv:2510.15253v2 在 7-19 Jay 简报中的可信度复核 — v30 §2.39.47 候选旁证

字段 内容
来源 /shared/research-kb/inbox/jay/2026-07-19-1630-csdn-substack-agentic-rag-multimodal-mlops-jul2026.md §A4(7-19 csdn-substack 1630 简报)+ arXiv:2510.15253v2
作者单位 arXiv survey 类(2026 持续更新)
一句话 Scaling Beyond Context:A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding — Jay 标 ⭐⭐⭐⭐⭐;三种多模态 RAG 架构(纯多模态 Embedding/图文转换/混合)/ 图结构多模态 RAG(节点=页面/文本/图片/表格/布局块;边=语义/空间/逻辑关系;检索=选相关子图)/ Agent-based 多模态 RAG(LLM Agent 控制查询改写/检索/生成)
v29 脉络关系 与 v25 V-RAGBench(arXiv:2606.13141v1)+ v25 多模态 RAG 综述 2504.08748(v17 立标)+ v28 E-VQA(arXiv:2607.11862)同属"多模态 RAG / Agentic Retrieval"主线 — 这是 v25 2504.08748 + v28 E-VQA 的 2026-07 持续更新版本,值得 v30 重新索引作为综述旁证
建议归入节 §2.39.47 v30 旁证 + §1 主线 5 多模态 RAG / Agentic Retrieval(综述旁证,不自成一节)+ §2.38 历史索引段加 arXiv:2510.15253v2(标明"综述类 v30 索引版,与 v17 2504.08748 + v25 V-RAGBench + v28 E-VQA 形成四件综述 / 评测 / 视频 RAG 一体化")+ §3.2 横切 4 跨主题交叉(rag 主分类 + multimodal 副分类 + agentic RAG 3 主题)

2. 矛盾 / 争议 / 待核实说法(7 条,建议在 v30 §3.2 之前消解)

# 矛盾 / 争议 来源 建议核实路径
1 Boogu-Image-0.1 数据集 card 未公开 PII 扫描(flyP v2 §6.3 降档触发) flyP 7-19 v2 精读 §6.3 HF Boogu/Boogu-Image-0.1-Corpus + GitHub DATASET.md 即将发布,7-25 前为必做硬约束(v2 §8 必做 3)
2 RxBrain-Bench 自建 + 自家模型 = self-benchmark risk flyP 7-19 RxBrain 精读 §D 等腾讯完整技术报告 + RxBrain-Bench 开源(目前 TODO),届时做第二轮独立精读
3 VideoChat3 评测宽度可疑(未列基准详表,需核 VideoMME/LongVideoBench/EgoSchema/MLVU/StreamingBench) flyP 7-19 VideoChat3 精读 §1 抓 arXiv PDF 正文 Table 1~3,7-25 前必做(v2 §8 必做 1)
4 Boogu-Image-0.1 vs Qwen-Image-2512 / HunyuanImage-3.0 中英 OCR 双榜"开源第一" 自我定位但 abstract 未给具体数字 flyP 7-19 v2 §1 §8 必做 4 抓 PDF §5 + GitHub README;核对 GenEval / DPG-Bench / T2I-CompBench / Qwen-Image-Bench 中文 / 英文四基准具体数字
5 Boogu-Image-0.1 vs 闭源(arXiv:2607.13125 abstract 中"approaches leading closed-source systems") 未列 GPT-Image-1 / Imagen 4 / Seedream 4 head-to-head flyP 7-19 v2 §8 必做 5 PDF §6 + ImageReward / HPSv2 公开 benchmark,7-30 前必做
6 RxBrain <Image> token 是 end-to-end 学还是 layout / 位置预定义 flyP 7-19 RxBrain 精读 §C 等完整技术报告
7 v30 §1.7 行业"中国 9 足"vs v29"十三足鼎立" 把腾讯 Hunyuan 列为 v30 第 9 足,是否过度细分?或合并入"中国 8 足候选" 本稿 §0 / §3 增量 1 / v29 §6 行业 建议 v30 区分"中国具身 5 足"(Tencent Hunyuan + LingBot-VA 2.0 蚂蚁 + Xiaomi Robotics U0 + 智元/灵汐等)vs"中国多模态通用 8 足"(Alibaba + StepFun + ByteDance Seed + DeepSeek + Xiaomi + 智谱 GLM + 商汤 SenseNova + 阶跃 Step + 小红书 PIPO 等),避免 v29 行业分类颗粒度混淆

3. 可引用的 arXiv 号列表(本日 E1 增量 8 件全部)

# arXiv 号 标题 主题分类 HF Daily 票数(截至 7-20) 建议归入节
1 arXiv:2607.14187 RxBrain: Embodied Cognition Foundation Model with Joint Language–Visual Reasoning and Imagination(Hy-Embodied-RxBrain-1.0) agent + multimodal(具身双通路) 22▲ §2.39.40 v30 立标
2 arXiv:2607.14935 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding multimodal(视频 MLLM 理解) 146▲ §2.39.41 v30 辅助立标
3 arXiv:2607.13125 Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation multimodal(图像侧统一生成) 125▲ §2.39.42 v30 辅助立标
4 arXiv:2607.12800 UniVR: Thinking in Visual Space for Unified Visual Reasoning evaluation + multimodal 28▲ §2.39.43 v30 旁证
5 arXiv:2607.14076 From Pixels to States: Rethinking Interactive World Models as Game Engines multimodal(position 论文) 29▲ §2.39.44 v30 旁证
6 arXiv:2607.14202 KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation multimodal(benchmark) 36▲ §2.39.45 v30 旁证
7 arXiv:2607.14189 MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation multimodal(benchmark) 31▲ §2.39.45 v30 旁证
8 arXiv:2607.12000 MetaView: 基于尺度感知隐式几何先验的单目新视角合成 multimodal(3D / NeRF upstream) 34▲ §2.39.46 v30 旁证
9 arXiv:2607.13188 并发图像理解与生成:自校正耦合马尔可夫跳跃过程 multimodal(并发耦合) 29▲ §2.39.46 v30 旁证
10 arXiv:2510.15253v2 Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding rag(综述类) (Jay 标 ⭐⭐⭐⭐⭐) §2.39.47 v30 旁证

额外备注(不计入 10 件增量): - arXiv:2607.14952 LongStraw(176▲,HF Daily 7-20 第一)—— 不是 multimodal,但与 §2.39.18 + §3.3 长上下文扩展隐性主线相邻,今晚可作为 §3.2 横切 4 跨主题的"近邻"提示,不入 multimodal 增量表; - arXiv:2607.12395 Ring-Zero(91▲,万亿参数 Zero RL)— 不是 multimodal,不入; - arXiv:2607.14777 SEED(86▲,Agentic RL)— 不是 multimodal,不入; - arXiv:2607.15257 SearchOS-V1(60▲,IR Agent)— 不是 multimodal,不入; - arXiv:2607.15207 BadWAM(46▲,World-Action Model 想得对做错)— 主分类 agent,邻接 §1 主线 7 具身 agent / VLA,不入 multimodal 增量表,但可在 §2.39.44 From Pixels to States 同段引用; - arXiv:2607.13705 AgentCompass(38▲,Agent 评测)— 主分类 agent,邻接 §1 主线 4 评测方法学,不入 multimodal 增量表; - arXiv:2607.05910 PolicyShiftGuard(35▲,Policy-Adaptive Image Guardrails)— 主分类 risk,邻接 §3.2 横切 1 反方审稿与 §1 主线 4 评测,不入 multimodal 增量表; - arXiv:2607.14387 Chat2Scenic(7-20 Tom radar #3)— 主分类 rag,不入 multimodal 增量表; - arXiv:2607.15058 SUFLECA(主分类 risk,CAD-to-image alignment)— 不入 multimodal 增量表,但 §1 主线 4 评测方法学可顺带引用; - arXiv:2607.15095 Digital Pantheon(主分类 agent)— 不入 multimodal 增量表; - arXiv:2607.12227 Rethinking the Evaluation of Harness Evolution for Agents(7-20 Tom radar #2)— 主分类 evaluation,与 7-18 Harness-Evolution 精读同根,7-19 E2 精读已覆盖,不入 multimodal 增量表;


4. 检查过的来源清单(无显著新增量的部分也列出,确证)

目录 / 文件 检查时间 关注主题 结论
/shared/research-kb/inbox/flyp/2026-07-19-2250-RxBrain-embodied-multimodal-MLLM-critical-read.md 7-20 09:42 具身认知双通路 增量 1 立标
/shared/research-kb/inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md 7-20 09:38 统一多模态(图像) 增量 3 辅助立标
/shared/research-kb/inbox/flyp/2026-07-19-0950-VideoChat3-fully-open-video-MLLM-critical-read.md 7-20 09:39 视频 MLLM 理解 增量 2 辅助立标
/shared/research-kb/inbox/flyp/2026-07-19-1550-DeepPlanning-long-horizon-agent-constraints-critical-read.md 7-20 09:43 长程受限规划 已锚定 v22 沿用,不计入增量
/shared/research-kb/inbox/flyp/2026-07-19-1003-rss-yt-ai-explained.md 7-20 09:41 RSS feed 信息碎片,无新立标
/shared/research-kb/inbox/flyp/2026-07-19-1002-rss-yt-two-minute-papers.md 7-20 09:41 RSS feed 信息碎片,无新立标
/shared/research-kb/inbox/flyp/2026-07-19-1001-rss-interconnects.md 7-20 09:41 RSS feed 信息碎片,无新立标
/shared/research-kb/inbox/flyp/2026-07-19-1000-rss-cameron-wolfe.md 7-20 09:41 RSS feed 信息碎片,无新立标
/shared/research-kb/inbox/flyp/2026-07-18-2250-Agent-STAR-RL-Recipe-Tool-Use-critical-read.md 7-20 09:43 Agent RL 邻接 agent 主分类,不入 multimodal 增量
/shared/research-kb/inbox/flyp/2026-07-18-1550-Harness-Evolution-Eval-Cheating-critical-read.md 7-20 09:43 评测方法学 已锚定 7-18 沿用,与 RxBrain self-benchmark 风险同根
/shared/research-kb/inbox/flyp/2026-07-18-weekly-deep-read-notes.md 7-20 09:43 综合 无新立标
/shared/research-kb/inbox/flyp/2026-07-18-weekly-deep-read-reviews.md 7-20 09:43 综合 无新立标
/shared/research-kb/inbox/jay/2026-07-19-1630-csdn-substack-agentic-rag-multimodal-mlops-jul2026.md 7-20 09:44 RAG / 多模态 RAG 增量 8 旁证(2510.15253v2)
/shared/research-kb/inbox/jay/2026-07-19-2105-evening-hf-arxiv-agent-stack-jul2026.md 7-20 09:44 Agent Stack 无新立标(主要 RL / Agent 训练)
/shared/research-kb/inbox/jay/2026-07-19-evening-briefing.md 7-20 09:44 综合 无新立标(主要 ICLR 2026 系统类)
/shared/research-kb/inbox/jay/2026-07-19-1500-engineering-filter-inference-backend-reproducibility-silent-errors.md 7-20 09:44 工程 / inference 无新立标(inference / silent errors)
/shared/research-kb/inbox/jay/2026-07-19-1735-evening-hf-security-agentic-attack-langchain-state-2026.md 7-20 09:44 安全 / Agent 无新立标(主分类 security)
/shared/research-kb/inbox/jay/2026-07-19-2350-evening-inference-agentic-production-engineering.md 7-20 09:44 inference 无新立标
/shared/research-kb/inbox/jay/2026-07-19-2340-news-x-tech-radar.md 7-20 09:44 tech radar 无新立标
/shared/research-kb/inbox/jay/2026-07-19-1337-agent-security-vecdb-trending.md 7-20 09:44 vec.db 无新立标
/shared/research-kb/inbox/jay/2026-07-19-1140-news-x-tech-radar.md 7-20 09:44 tech radar 无新立标
/shared/research-kb/inbox/jay/2026-07-20-0820-csdn-inference-agent-quantization-highvalue-jul2026.md 7-20 09:44 inference + 量化 无新立标
/shared/research-kb/inbox/tom/2026-07-20-0900-hf-daily-2026-07-20.md 7-20 09:40 HF Daily 7-20 直接信息源,锁定 9 件 multimodal 候选
/shared/research-kb/inbox/tom/2026-07-20_agents-lite.md 7-20 09:40 Agent 文献候选 增量 1(RxBrain)+ 增量 5(From Pixels)+ arXiv:2607.14387 Chat2Scenic + arXiv:2607.12227 Harness Evolution 信息源
/shared/research-kb/inbox/tom/2026-07-20-rag-e1prep.md 7-20 09:40 RAG E1 独立 RAG 主题,不混入 multimodal
/shared/research-kb/inbox/tom/2026-07-20-agent-rag-longcontext-radar.md 7-20 09:40 Agent radar 无新立标
/shared/research-kb/inbox/stephen/2026-07-19-1245-stephen-coordination-check-noon.md 7-20 09:45 协调棒 noon 确认 flyP 7-19 15:51 DeepPlanning + 09:50 Boogu + 09:50 VideoChat3 为本日 multimodal 增量主力
/shared/research-kb/inbox/stephen/2026-07-19-2245-stephen-coordination-check-evening.md 7-20 09:45 协调棒 evening §2.6 确认 RxBrain 立标 + §2.9 确认 Boogu 作者归属 + 主分类 multimodal 25→30 增量 5(RxBrain / Boogu / VideoChat3 / HDR / Locality & Length)的协调统计
/shared/research-kb/inbox/stephen/2026-07-20-0910-news-x-vip-radar.md 7-20 09:45 news x vip radar 无新立标
/shared/research-kb/inbox/spark/2026-07-19-1000-rss-gradient-flow.md 7-20 09:45 Gradient Flow RSS 综述类,无具体单立标
/shared/research-kb/inbox/spark/2026-07-19-1001-rss-chip-huyen.md 7-20 09:45 Chip Huyen RSS 信息碎片,无新立标
/shared/research-kb/inbox/spark/2026-07-19-1003-rss-yt-3blue1brown.md 7-20 09:45 3blue1brown RSS 信息碎片,无新立标
/shared/research-kb/inbox/spark/2026-07-18-1000-rss-gradient-flow.md 7-20 09:45 Gradient Flow RSS 综述类,无具体单立标
/shared/research-kb/inbox/spark/2026-07-17-1001-rss-gradient-flow.md 7-20 09:45 Gradient Flow RSS 综述类,无具体单立标
/shared/research-kb/organized/paper_cards/415-2607-14935.md 7-20 09:42 VideoChat3 增量 2
/shared/research-kb/organized/paper_cards/400-2607-13125.md 7-20 09:42 Boogu-Image-0.1 增量 3
/shared/research-kb/organized/paper_cards/432-2607-14187.md 7-20 09:42 RxBrain 增量 1
/shared/research-kb/organized/paper_cards/422-2607-12800.md 7-20 09:42 UniVR 增量 4
/shared/research-kb/organized/paper_cards/419-2607-14076.md 7-20 09:42 From Pixels to States 增量 5
/shared/research-kb/organized/paper_cards/417-2607-14202.md 7-20 09:42 KeyFrame-Compass 增量 6
/shared/research-kb/organized/paper_cards/418-2607-14189.md 7-20 09:42 MultiRef-Compass 增量 6
/shared/research-kb/organized/paper_cards/2607-12000.md 7-20 09:42 MetaView 增量 7
/shared/research-kb/organized/paper_cards/433-2607-14387.md 7-20 09:42 Chat2Scenic 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/403-2607-05910.md 7-20 09:42 PolicyShiftGuard 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/434-2607-12227.md 7-20 09:42 Harness Evolution re-think 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/430-2607-15058.md 7-20 09:42 SUFLECA 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/424-2607-15095.md 7-20 09:42 Digital Pantheon 不入 multimodal 增量
/shared/research-kb/organized/queue/work-queue.md 7-20 09:00 工作队列 multimodal 3 天未更新已确认,今日 E1 由 flyP 触发;高价值待深度解读未到 multimodal 优先级
/shared/research-kb/digests/2026-07-{18,19}*.md 7-20 09:00 spark 24h digest 已检查,无新增 multimodal 立标

5. 重要边界 / 注意事项(给今晚活文档立标负责人)

  1. v30 立标优先级:本稿建议 §2.39.40 RxBrain 立标 + §2.39.41 VideoChat3 辅助立标 + §2.39.42 Boogu-Image v2 重写确认;§2.39.43~47 旁证 5 件不单独立标。
  2. Boogu-Image-0.1 v1 → v2 重写 cron b37d3839 E2 自我反思:今晚活文档立标务必引用 v2 升级版(§0 五处失误诚实陈述 + 三条可迁移教训 + ≥8 条可证伪反方 + 三档硬路径评级 + 跨页引用对齐),不要回引 v1
  3. 避免把 RxBrain + LingBot-Video MoE + Xiaomi-Robotics-U0 三件工作混为同一件:三件都是 MoT 架构但作者团队、训练目标、模态调度、动作空间都不同(参见 §1 增量 1 重要边界)。
  4. 避免把 Boogu-Image-0.1 与 SenseNova-Vision-7B-MoT 视为对立 / 重复:两件工作互补(Boogu = 开放权重 + 中英 OCR + Edit/Turbo lineage + 推理时扩展产品化;SenseNova = 7B 横扫 72B+ dense 几何 + 系统层旗舰 + 50M corpus + 4 块 SOTA),v29 SenseNova + v30 Boogu = 图像侧统一双标杆
  5. 避免把 SenseNova-Vision-7B-MoT 与 SenseNova-U1-8B-MoT / SenseNova-U1-A3B-MoT 混用为同一件工作(沿用 v29 重大事实订正 ㉟):v29 已明示,不要混淆
  6. 本日 E1 无新"单一旗舰"立标:v29 SenseNova-Vision 锚定继续适用,v30 立标以"中型多模态增量 6 件 + 旁证 5 件"为主,不重做活文档瘦身 v29 决策(59KB < 80KB 上限沿用)。
  7. 建议 v30 行业分类在 §1.7 / §6 上做"中国具身 5 足 + 中国多模态通用 8 足"二级颗粒拆分(见 §2 #7 矛盾),避免 v29 "中国 8 足候选"颗粒度混淆。
  8. 写作边界:本稿只覆盖 inbox/flyp/2026-07-20-multimodal-e1prep.md 1 个文件;不写活文档 multimodal.md;不写他人目录;不 git;不输出密钥。

6. 元信息 / 合规

  • 触发 cron:14e9b8fb-68c2-49b4-bd36-aa649947885a(E1 预消化)
  • 触发时间:2026-07-20 09:40 Asia/Shanghai
  • 窗口范围:2026-07-16 12:00 → 2026-07-20 09:40(约 4 天)
  • 检索耗时:~7 分钟(ls -lat 列目录 + head -50 / grep -B1 -A3 关键词扫 + 整文件精读关键增量 3 件)
  • 引用合规:仅引用 arXiv abs 摘要 + HF papers 公开页 + HF 模型卡 + inbox/flyp 自有精读 + inbox/jay/tom/stephen/spark 协调笔记 + organized/paper_cards 卡片 + organized/knowledge/multimodal.md v29 锚定 + organized/queue/work-queue.md + digests/spark-24h;不复制 PDF 全文 / 不下"必读 / 必入库"终局判断(那是今晚活文档接手时的事)
  • 本稿状态:v1 预消化,不重写 multimodal 活文档;只列增量与待活文档消化方向
  • 建议下次 E1 预消化时间:2026-07-21 09:40 Asia/Shanghai(明日);届时检查 7-20 evening + 7-21 morning 新增
  • 历史承接:v29 2026-07-16 11:10 立标 + v28 2026-07-15 立标 + v27 2026-07-09 立标;7-17 ~ 7-19 期间未独立 E1 简报(直接由 7-16 v29 立标承接至 7-20 本日)

本稿仅做预消化,不为单篇论文做最终结论;所有立标建议均挂"信号级"标记,等今晚活文档接力时二次审稿确认。