multimodal · E1 预消化简报(2026-07-22)

角色:flyP · multimodal 主题 E1 日间预消化(multimodal) 锚定版本:v29 知识库 organized/knowledge/multimodal.md(2026-07-16 11:10 CST 立标,SenseNova-Vision-7B-MoT + 73 件套 + 25 元立体 + 14 足鼎立候选)+ 7-21 flyP e1prep 提案的 v30 立标候选(RxBrain + VideoChat3 + Boogu v2 + UniVR 旁证 + Xiaomi-Robotics-1 + S1-Omni + VideoRAE + RESOURCE2SKILL + On-Policy Delta Distillation + 行业旁证三连) 窗口范围:2026-07-21 09:40 → 2026-07-22 09:40(Asia/Shanghai,约 24 小时) 覆盖材料: + inbox/flyp 7-21 1550 CVG(组合视频生成推理时引导)E2 精读 + 7-21 multimodal-e1prep(昨日 v30 候选承接)+ 7-22 multimodal-weekly-digest(本期周三 digest 重启承接 6-24 第 5 期 + 7-22 multimodal-weekly-candidates 配套候选清单) + inbox/jay 7-21 1500 evening briefing(CIDR + Raschka + agentic RAG + HF ecosystem)+ 7-21 1735 evening briefing(GitHub Trending + Substack Agent Stack + HF Blog W11 papers)+ 7-21 2105 evening briefing(HF 7-16 安全事件 + Kimi K3 + Vector DB + Inference Stack)+ 7-21 llm-rag-agent-weekly + 7-22 0820 morning briefing(RAG + Agentic AI + arXiv + CSDN) + inbox/tom 7-21 0840 / 1440 / 2040 agent-rag-longcontext-radar + 7-21 rag-lite / rag-e1prep / evaluation-e1prep / inference-e1prep + 7-22 0900 HF Daily 票榜 + 7-22 agent-rag-longcontext-radar + 7-22 rag-e1prep + 7-22 _candidates json + inbox/stephen 7-21 0910 news x vip radar + 7-21 1003 news-deepmind + news-google-ai + 7-21 1245 协调棒 noon + 7-21 2245 协调棒 evening + 7-21 ai-industry-e1prep + 7-21 llm-application-e1prep + 7-22 0910 news x vip radar + inbox/spark 7-21 1001 gradient-flow + 7-21 1002 chip-huyen + 7-21 1004 3blue1brown + 7-21 agent-e1prep + 7-21 llm-infra-e1prep + organized/paper_cards 7-21 新卡 458~468 区间(昨日)+ 7-22 新卡 481~503 区间(本期主战场:TimeLens2 / ReflectWorld-MM / GigaChat Audio / ShotPlan / HOMIE / SVR-R1 / OCT-Bench / Robot-Centric Pointmaps / FlashRT / Apple-π / RAGU / EvolvingWorld / GigaAM Multilingual / Open-AoE / FlowMimic / REBASE / Distilled RL / Cross-Encoder RAG / TOPL / SWE-Pruner Pro / NOWJ@COLIEE 2026 / Self-State Attacks / DeepSearch-World / Vector Search Causal / Diagnosing Tool-Call Boundary Drift 等) 今日目标:为今晚 v30/v31 活文档接力预读备料,3-8 条增量,每条挂"来源/要点/脉络关系/建议归入节" 本稿状态:v1 预消化,不重写 multimodal 活文档;只列增量与待活文档消化方向


0. 综述判断(给今晚活文档接手时一眼看到)

  • 昨日 v29/v30 候选承接:昨日 v30 候选立标已包含 §2.39.40 RxBrain + §2.39.41 VideoChat3 + S1-Omni + §2.39.42 Boogu-Image-0.1 v2 + VideoRAE + §2.39.43 UniVR 重新归位 + §2.39.43.5 MetaView 升级(ECCV 2026 accepted) + §2.39.49 RESOURCE2SKILL + §2.39.50 On-Policy Delta Distillation + §2.39.51~53 行业旁证三连(Hy3 / Inkling / Physical Turing Test)
  • 今日(7-21 09:40 → 7-22 09:40)窗口实际新增:本日 HF Daily 票榜 7-22 当日新立 15 篇,其中 主分类 multimodal 7 件(TimeLens2 / HOMIE / Apple-π / RynnBrain 1.1 / GigaChat Audio / Open-AoE / FlowMimic)+ 副分类 multimodal 1 件(FlashRT·主分类 agent);paper_cards 7-22 新卡 23 张中主分类 multimodal 至少 8 件(TimeLens2 / ReflectWorld-MM / GigaChat Audio / ShotPlan / HOMIE / SVR-R1 / OCT-Bench / Robot-Centric Pointmaps)+ 主分类 engineering 副 multimodal 1 件(REBASE)+ 主分类 agent 副 multimodal 1 件(FlashRT)+ 主分类 rag 副 multimodal 0 件;整体观察:本期(7-22)是 2026-Q3 多模态主题有论文以来"立标候选密度最高"的一天,视频理解侧 + 视频生成侧 + 音频侧 + VLA 视觉编码侧 4 线同日合流
  • 窗口 HF Daily 票榜增量(7-22 当日新立,按票数排序):
    1. TimeLens2 arXiv:2607.17423 · 141▲ 主分类 multimodal · method(MLLM 通用视频时序定位);
    2. RESOURCE2SKILL arXiv:2606.29538 · 129▲ 主分类 agent 副 multimodal(7-21 已立 §2.39.49 沿用);
    3. RAGU arXiv:2607.11683 · 128▲ 主分类 rag 副 multimodal(7-21 multimodal-e1prep 旁证);
    4. EvolvingWorld arXiv:2607.17250 · 73▲ 主分类 agent 副 multimodal(交互式文学世界);
    5. DeepSearch-World arXiv:2607.07820 · 72▲ 主分类 agent 副 engineering(7-21 2245 stephen 已立);
    6. SWE-Pruner Pro arXiv:2607.18213 · 64▲ 主分类 agent(7-21 2245 stephen 已立);
    7. HOMIE arXiv:2607.18217 · 46▲ 主分类 multimodal · method(人-物中心视频个性化);
    8. Apple-π arXiv:2607.16401 · 37▲ 主分类 multimodal · benchmark(物理定律视频思维);
    9. RynnBrain 1.1 arXiv:2607.17977 · 32▲ 主分类 multimodal(具身基础模型,昨日 flyP 7-21 multimodal-e1prep 旁证);
    10. GigaChat Audio arXiv:2607.10387 · 30▲ 主分类 multimodal · benchmark(时间感知音频 LLM 120min);
    11. GigaAM Multilingual arXiv:2607.10371 · 28▲ 主分类 engineering 副 multimodal(Sber 系多语种 ASR);
    12. Open-AoE arXiv:2607.14183 · 26▲ 主分类 multimodal(具身开放第一人称操作数据集);
    13. FlowMimic arXiv:2607.18227 · 25▲ 主分类 multimodal · method(免掩码视觉编辑);
    14. ReflectWorld-MM arXiv:2607.09759 · 24▲ 主分类 multimodal · method(实体导向多模态记忆);
    15. Group Entropy-Controlled Policy Optimization arXiv:2607.16850 · 24▲(RL 训练方法学,不入 multimodal 增量)
  • 今日明确属 multimodal 主线的 8 件新立(按立标优先级):TimeLens2(#1 立标级 · 8B 击败 397B 极端对照)+ ReflectWorld-MM(长视频终身记忆 entity-oriented)+ GigaChat Audio(120min 长音频)+ ShotPlan(显式规划 token 视频生成)+ HOMIE(视频个性化)+ SVR-R1(自验证 RL)+ OCT-Bench(MLLM 临床)+ Robot-Centric Pointmaps(VLA 视觉编码);行业侧 / 评测侧:Apple-π 视频思维评测 + RynnBrain 1.1 + Open-AoE + FlowMimic + GigaAM Multilingual + FlashRT 实时多模态 App Harness。
  • 本期(7-22 周三 digest)跨实例承接:
    • flyP 7-22 multimodal-weekly-digest(今晨 09:35 已落地)本期主 digest = 承接 6-24 第 5 期 + 12 个新立 + 4 个主线分支更新 + 1 个 §3.2 反方 + 1 个 §1.7 行业三极升级;
    • flyP 7-22 multimodal-weekly-candidates 配套候选清单(A 节 5 篇必读 + B 节 4 篇观察 + C 节 4 件行业 + D 节 13 项待核验 + E 节跨实例去重);
    • stephen 7-22 0910 news x vip radar = Jim Fan 2026 is the year of World Models + DeepMind Gemini 3.5 Pro 撤档(7/8 HackerNoon)+ HF × NVIDIA LeRobot 7-7 公告;
    • tom 7-22 0900 HF Daily 票榜 + tom 7-22 agent-rag-longcontext-radar(ShotPlan 标 multimodal + ReViV 4D monocular egocentric 副 multimodal);
    • jay 7-22 0820 morning briefing = BABYVISION MLLM 倒置能力曲线(To Data & Beyond 7-12~17,需核 arXiv ID)+ Q-RAG 训练检索器 + Contextual Retrieval + GLM 744B MoE;
    • spark 7-22 暂无新 multimodal 素材(spark 偏 systems/MLOps)。
  • 建议 v30/v31 立标/旁证增补:
    • §2.39.40 v30 立标 = RxBrain + Xiaomi-Robotics-1(沿用昨日);
    • §2.39.54 v31 立标新增(候选最强):TimeLens2(arXiv:2607.17423 · 141▲ · 主分类 multimodal · 8B 击败 397B 极端对照 · 立"中等专精 MLLM 反 scaling 击败巨型通用大模型"在时序任务上的范式证据);
    • §2.39.55 v31 立标新增:ReflectWorld-MM(arXiv:2607.09759 · 24▲ · 主分类 multimodal · 实体导向多模态记忆 + 6 终身记忆基准 SOTA · 立"长视频 + 终身记忆 + 实体导向"v30/31 主线);
    • §2.39.56 v31 辅助立标新增:GigaChat Audio(arXiv:2607.10387 · 30▲ · 主分类 multimodal · 120min 长音频 + 显式时间戳 · 立"音频侧时间感知分支"+ Sber 系俄罗斯第三极);
    • §2.39.57 v31 辅助立标新增:ShotPlan(arXiv:2607.17675 · paper_cards 形态标 position · 主分类 multimodal · 显式可学习规划 token 视频生成);
    • §2.39.58 v31 辅助立标新增:HOMIE(arXiv:2607.18217 · 46▲ · 主分类 multimodal · 视频个性化 + self-attention 内全局多模态引导);
    • §2.39.59 v31 辅助立标新增:Robot-Centric Pointmaps(arXiv:2607.11498 · paper_cards 形态标 method · 主分类 multimodal · 机器人坐标系点图 + 极小架构改动 + 提升 pi0.5/SmolVLA);
    • §2.39.60 v31 旁证新增:SVR-R1(arXiv:2607.10966 · 主分类 multimodal 副 evaluation · 自验证→自举多模态推理 + 反方"循环验证虚假自信"风险);
    • §2.39.61 v31 旁证新增:OCT-Bench(arXiv:2607.16609 · 主分类 multimodal 副 evaluation · OCT 临床可信评测);
    • §2.39.62 v31 旁证新增:Apple-π(arXiv:2607.16401 · 37▲ · 主分类 multimodal 副 benchmark · 物理定律视频思维);
    • §2.39.63 v31 行业旁证新增:RynnBrain 1.1(arXiv:2607.17977 · 32▲ · 主分类 multimodal · 具身基础模型);
    • §2.39.64 v31 行业旁证新增:Open-AoE(arXiv:2607.14183 · 26▲ · 主分类 multimodal · 具身开放数据集 + 工具链);
    • §2.39.65 v31 行业旁证新增:FlowMimic(arXiv:2607.18227 · 25▲ · 主分类 multimodal · 免掩码视觉编辑);
    • §2.39.66 v31 行业旁证新增:FlashRT(arXiv:2607.18171 · 主分类 agent 副 multimodal · Agent Harness for Real-Time Multimodal Apps);
    • §2.39.67 v31 行业旁证新增:GigaAM Multilingual(arXiv:2607.10371 · 28▲ · 主分类 engineering 副 multimodal · Sber 系 2M hours + HuBERT-style + 中亚语言 ASR);
    • §1.7 行业升级:沿用昨日 e1prep §0 "中国-西双极" 升级为 "中-俄-西三极"(Sber 系 GigaChat Audio + GigaAM Multilingual 同周发);
    • §1.4 行业新增:Google DeepMind 7-21 一日三连(Nano Banana 2 Lite + Gemini Omni Flash + Gemini 3.5 Flash computer use + Google Vids × Gemini Omni 虚拟形象);
    • §3.2 反方新增:SVR-R1 自验证→自举风险(循环验证虚假自信)+ HOMIE self-attention 全局多模态引导是否会破坏 text encoder 可控性;
    • §6 行业平台化新增:NVIDIA × HuggingFace LeRobot + Cosmos 3 7-7 公告 + Gemini 3.5 Pro 7/17 撤档 + Jim Fan 2026 is the year of World Models + Sequoia Ascent 续作《Robotics: Endgame》预告;
    • §2.39.49 升级(沿用 7-21 multimodal-e1prep):RESOURCE2SKILL 7-22 票数 113→129▲(本期第 2);
    • §1 主线分支更新:沿用 flyP 7-22 multimodal-weekly-digest §8 主题页更新 5 项(视频生成显式规划 / 实体导向多模态记忆 / 时间感知音频 LLM / VLA 点图嵌入 / Apple-π 视频思维评测)。

1. 增量条目(8 件主线 + 7 件旁证 + 1 件行业,按"建议归入节"分组)

增量 1 · TimeLens2 MLLM 通用视频时序定位 — v31 §2.39.54 立标新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/492-2607-17423.md(主分类 multimodal · method)+ arXiv:2607.17423 + HF Daily 141▲ 7-22 当日 #1 + Tom 7-22 _candidates json + flyP 7-22 multimodal-weekly-digest A1 + flyP 7-22 multimodal-weekly-candidates A1
作者单位 待核(票榜首段未读到,猜测 Stanford / Berkeley / FAIR 系发表级团队)
一句话 TimeLens2 = MLLM 通用视频时序定位(generalist video temporal grounding)框架:跨 7 个时序定位基准统一训练;TimeLens2-2B 击败所有规模相当基线;4B / 8B 变体取得 SOTA,超过最多 397B 参数开源模型(卡片 TLDR 原话);立"中等专精 MLLM 反 scaling 击败巨型通用大模型"在时序任务上的范式证据
v29/v30 脉络关系 与 v25 VideoChat3(视频理解侧 4B 通用 SOTA MLLM)+ v29 Boogu-Image-0.1(图像理解-生成统一)+ v29 SenseNova-Vision-7B-MoT(CV 任务统一生成 7B 横扫 72B+)+ v31 立标新增 §2.39.54 同属"中等规模 MLLM 在专业任务上击败巨型通用大模型"主线 — TimeLens2 是 v29 立标以来"反 scaling"现象在视频时序任务上的最强证据:8B vs 397B 极端对照 + 7 个基准统一 + method 形态 + 141▲ 三重信号合并 = 2026-Q3 立标级;与 v29 SenseNova-Vision 7B 横扫 72B+ 共同确立 2026 H2 多模态主题"7B-8B 中等规模 vs 巨型 72B-397B 反 scaling"双立标(CV 任务统一生成 + 视频时序定位)
反方 / 风险 (A) 票榜第 1 通常伴随 marketing 偏倚 — 需等 7-25 ~ 7-29 票数稳定 + 第三方复测;(B) abstract "outperforms all size-matched baselines" 缺具体表 + 数字;(C) 397B 对照基线是否含 Qwen3-VL-Max / InternVL3-355B / Gemini 系列等 2026-H2 最新大模型未披露;(D) 8B 击败 397B 是 in-domain vs OOD 表现未切清;(E) "7 基准" 完整名单未给;(F) 训练数据来源 + 商用许可未披露;(G) abstract "open-source models with up to 397B parameters" 限定词 "open-source" — 是否含闭源旗舰(GPT-5.6 / Gemini 3.5 Pro / Claude Opus 4.8)未直接 head-to-head;(H) 对照基线是否官方最强版(同 SenseNova-Vision 7B 横扫 72B+ 同样风险)
建议归入节 §2.39.54 v31 立标新增 + §1 主线 4 多模态评测(隐式"中等专精 vs 巨型通用反 scaling"分支)+ §1 主线 2 长上下文/长视频/长文档(增量)+ §1 主线 3 多模态 CoT / 推理范式(隐性"时序作为推理副产物")+ §1 主线 7 垂直域多模态(视频理解专项)+ §2.38 历史索引段加 arXiv:2607.17423 + §3.2 横切 2 评测饱和与基准可信度("极端对照基准对齐审查"新维)+ §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + evaluation + ai-industry 3 主题)
重要边界 不要与 v25 VideoChat3(4B 通用视频 SOTA MLLM)视为对立 / 重复:VideoChat3 关注"通用视频理解",TimeLens2 关注"时序定位统一";两件工作形成"2026-Q3 视频理解 family 通用-时序"二联不要把 TimeLens2 8B vs 397B 直接外推到"小模型击败大模型"普适结论 — 限定在"视频时序定位 + 7 个基准 + open-source 对照"三约束内成立。与 v29 SenseNova-Vision 7B 横扫 72B+ 的"反 scaling"区分:TimeLens2 = 视频时序定位专项反 scaling;SenseNova = CV 任务栈统一生成反 scaling;两件工作的"反 scaling"是任务专项的,不是模型架构普适的

增量 2 · ReflectWorld-MM 实体导向多模态记忆 — v31 §2.39.55 立标新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/495-2607-09759.md(主分类 multimodal · method)+ arXiv:2607.09759 + HF Daily 24▲ 7-22 当日 + Tom 7-22 _candidates json + flyP 7-22 multimodal-weekly-digest A4 + flyP 7-22 multimodal-weekly-candidates A4
作者单位 待核(未在卡片头部读到)
一句话 ReflectWorld-MM = 实体导向多模态记忆系统,面向开放视频流(open-ended video streams),在 6 个长视频 + 终身记忆基准 上取得最优准确率,超越强记忆 Agent + 一个前沿模型(卡片 TLDR 原话);v29 立标以来第一件"实体导向多模态记忆 + 开放视频流长期"工作
v29/v30 脉络关系 与 v25 LongVILA(长视频理解)+ v25 MMLongBench + v25 Long-MR(V2PE 自构评测)+ v27 LightMem-Ego(流式日常多模态记忆)+ v30 HomER(hierarchical online memory agent)+ v30 多模态 RAG 综述 同属"长视频 + 终身记忆 + 多模态记忆"主线 — ReflectWorld-MM 是 v29/v30 以来第一件明确"实体导向多模态记忆 + 长期 open-ended video stream"的工作,直接对接 flyP 6-30 agent-memory 候选主题页 + 6-29 HomER 立的 hierarchical memory 主线;与 LightMem-Ego 互补:LightMem-Ego = 移动 / 可穿戴流式日常记忆 + 4 demo tasks;ReflectWorld-MM = 长视频流 + 6 终身记忆基准;两件工作形成"2026-Q3 多模态长期记忆 family 移动-长视频-实体-分层"四联
反方 / 风险 (A) 票数 24▲ 信号弱 — 6-29 HomER 票数未给但应较高;(B) abstract "outperforms strong memory agents and a frontier model" 缺具体基准名 + 数字;(C) 6 个基准完整名单未给(是否含 LongVILA / MMLongBench / Long-MR / EgoSchema / Video-MME 重叠?);(D) "实体导向"具体实现(entity extraction 冻结 VLM?re-ID?3D-aware?)未披露;(E) 与 HomER / LongVILA 是否 head-to-head 未给;(F) 24 票 HF Daily 票数偏低,可信度信号弱;(G) "超越一个前沿模型" 不指名 — 与 v29 SenseNova-Vision "击败 Qwen2.5-VL-72B / InternVL3-78B / Molmo-72B"具体基线命名差距明显
建议归入节 §2.39.55 v31 立标新增 + §1 主线 2 长上下文/长视频/长文档(实体导向多模态记忆分支)+ §1 主线 5 多模态 RAG / Agentic Retrieval(隐式"实体作为检索单元"分支)+ §2.38 历史索引段加 arXiv:2607.09759 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + agentic memory + agent + rag + ai-industry 5 主题)
重要边界 不要与 v27 LightMem-Ego(浙江大学 + SCUT · hierarchical current/short/long memory)混为同一件工作:LightMem-Ego = 流式日常多模态记忆;ReflectWorld-MM = 长视频开放流实体导向记忆;两件工作记忆层级 + 应用场景不同不要把 ReflectWorld-MM 当作 RAG 综述一类工作 — 它是 system(method 形态),不是综述。注意 ReflectWorld-MM vs HomER(7-18 multimodal-e1prep 旁证)的实体表征策略差异:ReflectWorld-MM = "entity-oriented multimodal memory";HomER = "hierarchical online memory agent";前者强调实体表征,后者强调层级结构;v31 主题页应作为"多模态长期记忆双轨"分别标记。

增量 3 · GigaChat Audio 时间感知音频 LLM — v31 §2.39.56 辅助立标新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/501-2607-10387.md(主分类 multimodal · benchmark)+ arXiv:2607.10387 + HF Daily 30▲ 7-22 当日 + Tom 7-22 _candidates json + flyP 7-22 multimodal-weekly-digest A5 + flyP 7-22 multimodal-weekly-candidates A5
作者单位 SberDevices / SberBank AI(待核 PDF 准确团队)
一句话 GigaChat Audio = 时间感知大音频 LLM,在最长 120 分钟音频上以显式时间戳回答问题;方法 = 级联管道大规模合成监督 + 周期性时间标记 + 连续音频 token 交错排列;在短 + 长基准均取得强时间定位准确率,支持时间锚定的片段描述与摘要;大量消融研究时间表示 / 标记频率 / token 化 / 时长混合设计(卡片 TLDR 原话);音频侧"时间感知 + 120min 长音频"分支
v29/v30 脉络关系 与 v25 Audio Flamingo Next(7 月沿用 6-24 第 6 期)+ 6-24 UniSonate + 6-29 Continuous Audio Thinking for LALMs + v22 Audio-Oscar + v27 Audex-30B-A3B(NVIDIA Labs 统一音频-文本 LLM)同属音频 LLM 主线 — GigaChat Audio 的关键差异化:"显式时间戳作为天然监督信号" — 类似 TimeLens2 的"时序定位统一框架"思路,但场景切到 120min 长音频;与 TimeLens2 形成"视频 vs 音频 / 时序定位统一框架"姊妹工作;注意俄罗斯团队 + Sber 系信号 — 沿用 7-22 jay briefing 的 Russian 多模态基础模型 + GigaAM Multilingual 28▲ 同段;与 GigaAM Multilingual 同周发(7-22) = 俄罗斯 Sber 系在多语种 ASR + 长音频 LLM 两条线齐发
反方 / 风险 (A) 票数 30▲ 信号中;(B) "120 分钟输入"是训练时长 vs 推理时长 vs 商用时长未切清;(C) "级联管道大规模合成监督"具体级联策略 + 合成数据来源 + 商用许可未披露;(D) "显式时间戳"是否破坏连续音频表征未给消融;(E) 与 Audio Flamingo Next / UniSonate / Audex-30B-A3B 无公开 head-to-head;(F) Sber 系商用许可(俄罗斯出口管制 + 国际可用性)未披露;(G) "大量消融"未给具体维度数字;(H) 120 分钟 vs Audio Flamingo Next 长音频对比(若 AFL Next 也支持 120min)
建议归入节 §2.39.56 v31 辅助立标新增 + §1 主线 6 音频 LLM(时间感知分支)+ §1.7 行业(俄罗斯第三极首次立标)+ §2.38 历史索引段加 arXiv:2607.10387 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + audio + ai-industry(Russian 3rd pole)3 主题)
重要边界 不要与 v27 Audex-30B-A3B(NVIDIA Labs · 30B MoE / 3B active + 6.82 WER OpenASR)混为同一件工作:Audex = 统一音频-文本 LLM(无文本回归);GigaChat Audio = 时间感知长音频 LLM;两件工作范式不同:Audex 关注"统一音频-文本多任务";GigaChat 关注"长音频 + 时间锚定"。不要把 GigaChat Audio 当作 TimeLens2 的音频版完全平行 — TimeLens2 = 视频时序定位统一框架 8B 击败 397B;GigaChat Audio = 长音频时间感知 LLM,两者都属于"时序定位"主线,但模态 + 任务范式不同注意 GigaChat Audio 与 GigaAM Multilingual 同周发:前者 = 时间感知长音频;后者 = 2M hours 中亚语种 ASR 基础模型;两件工作同周合流 = Sber 系 2026-Q3 音频 family 双轨

增量 4 · ShotPlan 显式规划 token 视频生成 — v31 §2.39.57 辅助立标新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/498-2607-17675.md(主分类 multimodal · 形态 position)+ arXiv:2607.17675 + Tom 7-22 _candidates json(来源 HF Daily 2026-07-19 · votes:3)+ Tom 7-22 agent-rag-longcontext-radar §④ + flyP 7-22 multimodal-weekly-digest #2 + flyP 7-22 multimodal-weekly-candidates A2
作者单位 待核(未在 paper_cards 头部读到)
一句话 ShotPlan = 显式多镜头电影级视频生成框架:基于视频扩散基础模型 + 引入"可学习规划 token"捕获镜头级过渡线索 + 与原视频生成 token 无缝集成以控制过渡时间戳;显著优于现有电影级视频生成方法,提供更灵活的镜头管理 + 更强的跨镜头一致性(卡片 TLDR 原话);video generation family 显式规划分支代表
v29/v30 脉络关系 与 v25 LingBot-Video MoE(视频生成 30B MoE 具身预训练)+ v25 LoomVideo(5B 统一视频生成/编辑)+ v25 PanoWorld(全景世界模型)+ v25 LongE2V(长视频扩展)+ v27 GenCeption(视频生成即通用视觉学习器)+ 7-19 flyP CVG(组合视频生成推理时引导)+ v29 SenseNova-Video-MoT(7B 横扫 72B+ CV 任务栈)同属"视频生成 family"主线 — ShotPlan 差异化贡献:"显式规划 token"作为可学习的镜头级过渡控制机制,与 7-19 flyP 已立的 CVG(组合视频生成推理时引导)形成"显式 vs 隐式"对照 — ShotPlan = 显式规划 token;CVG = 隐式 cross-attention steering 推理时引导;两件工作形成"2026-Q3 视频生成 family 显式-隐式"二联;与 LingBot-Video MoE 端到端 MoE 形成"端到端 vs 显式规划"对照
反方 / 风险 (A) 形态 position 信号弱 — 通常为研究路线立场型工作,需抓 PDF §5 + 表 1 验证是否含端到端训练 + SOTA 数字;(B) Tom 7-22 radar 票数 votes:3,HF Daily 7-19 上架后 7-22 仅 3 票;(C) "可学习规划 token"训练成本 + 推理成本未披露;(D) "显著优于"未给具体 benchmark + 数字;(E) 训练数据清单(电影片段许可)未披露;(F) 跨镜头一致性评测方法不公开;(G) vs Wan2.2 + ControlNet / CogVideoX-5B + CVG head-to-head 未给;(H) "显式规划 token 是否可解释 + 可编辑 + 用户可控" 是核验关键
建议归入节 §2.39.57 v31 辅助立标新增 + §1 主线 1 统一多模态生成(显式规划分支)+ §1 主线 7 垂直域多模态(视频生成专项)+ §2.38 历史索引段加 arXiv:2607.17675 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + engineering(扩散基础模型)+ ai-industry(Wan2.2 / CogVideoX)3 主题)
重要边界 不要把 ShotPlan 与 v25 LingBot-Video MoE 视为对立 / 重复:LingBot-Video = 30B 端到端 MoE 视频生成;ShotPlan = 显式规划 token 控制镜头过渡;两件工作路线不同:LingBot-Video = 端到端生成;ShotPlan = 显式控制叠加。不要把 ShotPlan 当作 CVG(7-19 flyP E2 精读)的对立 / 重复 — CVG = 组合视频生成推理时引导(隐式 cross-attention steering);ShotPlan = 显式规划 token;两件工作形成"2026-Q3 视频生成 family 显式-隐式"二联注意 ShotPlan 的电影片段训练数据许可合规风险(类似 GenCeption 7×-500× less data + 视觉生成数据许可同源)。

增量 5 · HOMIE 视频个性化 + self-attention 全局多模态引导 — v31 §2.39.58 辅助立标新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/488-2607-18217.md(主分类 multimodal · method)+ arXiv:2607.18217 + HF Daily 46▲ 7-22 当日 + flyP 7-22 multimodal-weekly-digest #3 + flyP 7-22 multimodal-weekly-candidates A3 + Tom 7-22 _candidates json
作者单位 待核(未在 paper_cards 头部读到)
一句话 HOMIE = 人-物中心视频个性化框架:改进 MLLM 集成策略,在不损害文本编码器可控性或不引入昂贵重新对齐的前提下提取参考级关系知识,在 self-attention 中引入全局多模态引导使 MLLM 派生的语义特征与 VAE token 更好对齐(卡片 TLDR 原话);video personalization family 轻量路径代表
v29/v30 脉络关系 与 v25 Goku-Edit(6-24 第 7 期 Goku 系列指令式视频编辑)+ 6-24 Movie Gen(personization 五件套)+ 7-19 LingBot-Video MoE + ShotPlan(本期)+ ReflectWorld-MM(本期)同属视频个性化 / 视频生成主线 — HOMIE 差异化贡献:"在 self-attention 内引入全局多模态引导"的轻量方案,对小训练成本路径友好,可作为 LongVILA / Vidu-S1 / LingBot-Video 等长视频模型的轻量 personalization 模块候选;与 ShotPlan 互补:ShotPlan = 显式规划 token 控制镜头过渡;HOMIE = 轻量 self-attention 引导做参考级关系;两件工作形成"2026-Q3 视频生成 family 控制-个性化"二联
反方 / 风险 (A) 票数 46▲ 信号中-强;(B) abstract 缺具体 benchmark + 数字;(C) "全局多模态引导"具体实现(gradient gating?auxiliary attention?cross-attention?)未披露;(D) "不损害文本编码器可控性" + "不引入昂贵重新对齐"是 claim 而非验证 — 需 vs 现有 re-alignment 方案 head-to-head;(E) vs Goku-Edit / Movie Gen personalization / LingBot-Video 无公开 head-to-head;(F) 训练数据清单(人-物参考视频许可)未披露;(G) "self-attention 内全局多模态引导是否会破坏 text encoder 可控性" = 反方核心问题
建议归入节 §2.39.58 v31 辅助立标新增 + §1 主线 1 统一多模态生成(显式 + 隐式 + 个性化三联)+ §1 主线 5 多模态 RAG / Agentic Retrieval(隐式"个性化作为检索单元"分支)+ §2.38 历史索引段加 arXiv:2607.18217 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + video personalization + ai-industry 2 主题)
重要边界 不要把 HOMIE 当作 ShotPlan(本期)的对立 / 重复:ShotPlan = 显式规划 token 控制镜头过渡;HOMIE = 轻量 self-attention 引导做参考级关系;两件工作互补不冲突不要把 HOMIE 与 v25 Goku-Edit 视为对立 / 重复:Goku-Edit = 指令式视频编辑;HOMIE = 人-物中心视频个性化 + 轻量模块;两件工作关注点不同:Goku-Edit = 编辑;HOMIE = 个性化。注意 HOMIE 的"不损害文本编码器可控性" vs 现有 re-alignment 方案对比基准对齐审查(同 SenseNova-Vision / TimeLens2 同根风险)。

增量 6 · Robot-Centric Pointmaps VLA 视觉编码 — v31 §2.39.59 辅助立标新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/483-2607-11498.md(主分类 multimodal · method)+ arXiv:2607.11498 + flyP 7-22 multimodal-weekly-digest §5.4 + flyP 7-22 multimodal-weekly-candidates B4
作者单位 待核(猜测 NVIDIA / Google DeepMind Robotics / Stanford,未在 paper_cards 头部读到)
一句话 Robot-Centric Pointmaps for VLA Models:Pointmaps 在保留预训练 2D VLA 所需 H × W 稠密网格的同时,提供机器人坐标系下的 3D 几何信息,以极小架构改动集成到现有 VLA 中,提升 pi0.5 与 SmolVLA 的性能,优于代表性的相机视点和 3D 感知基线(卡片 TLDR 原话);"具身通用基础模型 + 2D VLA"的关键工程拼图
v29/v30 脉络关系 与 v27 Xiaomi-Robotics-U0(38B AR 世界基础模型)+ v27 ABot-N1(通用 VLN foundation)+ v30 RxBrain(具身双通路 MoT)+ v30 Xiaomi-Robotics-1(7-21 立标 VLA scale 100K+ hours)+ 7-22 RynnBrain 1.1(7-22 HF Daily 32▲ 具身基础模型)+ 7-22 Open-AoE(7-22 HF Daily 26▲ 具身开放数据集 + 工具链)+ 7-21 multimodal-e1prep §2.39.40 同属"具身 VLA / 世界模型"主线 — Robot-Centric Pointmaps 的差异化贡献:"极小架构改动"的工程哲学,保留预训练 2D VLA 的稠密网格,只增加机器人坐标系下的点图几何,这是 2026 H2 具身 VLA 阵营最热子方向(7-22 同段 3 件:RynnBrain 1.1 + Open-AoE + Xiaomi-Robotics-1);与 Xiaomi-Robotics-1 + RxBrain 形成"VLA 视觉编码 + VLA 基础模型 + 具身基础模型"三件
反方 / 风险 (A) HF Daily 票数未给(不在 7-22 票榜前 15);(B) abstract "outperforms representative camera-viewpoint and 3D-aware baselines" 缺具体 benchmark 名 + 数字;(C) 极小架构改动量(参数量 + FLOPs)未量化;(D) "保留 H × W 稠密网格"是否真为最小改动 vs token re-arrangement / patch-wise projection 未给消融;(E) vs 3D-aware baselines 是否含代表性工作(Spatial-RGPT / LL3DA / 3D-LLM 等)未给;(F) "提升 pi0.5 + SmolVLA"是绝对数字 vs 相对数字未切清;(G) 仿真 benchmark vs 真实部署 gap 风险 — 与 RxBrain-Bench self-benchmark + Xiaomi-Robotics-1 同根
建议归入节 §2.39.59 v31 辅助立标新增 + §1 主线 7 垂直域多模态 / VLA(点图嵌入分支)+ §2.39.40 沿用(同段 4 件:Robot-Centric Pointmaps + Xiaomi-Robotics-1 + RynnBrain 1.1 + Open-AoE)+ §2.38 历史索引段加 arXiv:2607.11498 + §3.2 横切 1 反方审稿(继承 6 条)+ §3.2 横切 4 跨主题交叉(multimodal 主分类 + robotics + ai-industry 2 主题)
重要边界 不要把 Robot-Centric Pointmaps 与 7-22 RynnBrain 1.1(具身基础模型)/ Open-AoE(具身数据集 + 工具链)混为同一件工作:Robot-Centric Pointmaps = VLA 视觉编码(2D VLA + 3D 几何嵌入);RynnBrain 1.1 = 具身基础模型(端到端 VLA 训练);Open-AoE = 具身开放数据集 + 工具链(数据集层);三件工作形成"VLA 视觉编码 + VLA 基础模型 + 具身数据集"三件套不要把 Robot-Centric Pointmaps 与 Xiaomi-Robotics-1(7-21 旁证)混为同一件工作:Xiaomi-Robotics-1 = 100K+ hours 真实轨迹规模化 VLA 训练;Robot-Centric Pointmaps = 极小架构改动的 3D 嵌入;两件工作训练目标不同:Xiaomi-Robotics-1 = 规模化策略学习;Robot-Centric Pointmaps = 视觉表征增强。

增量 7 · SVR-R1 自验证→自举多模态推理 — v31 §2.39.60 旁证新增(带反方)

字段 内容
来源 /shared/research-kb/organized/paper_cards/484-2607-10966.md(主分类 multimodal · benchmark · 副分类 evaluation)+ arXiv:2607.10966 + flyP 7-22 multimodal-weekly-digest §5.2 + flyP 7-22 multimodal-weekly-candidates B2
作者单位 待核(未在 paper_cards 头部读到)
一句话 SVR-R1 = 自验证推理器(Self-Verified Reasoner):多轮 RL 框架,把模型自身的验证转化为多模态推理的学习信号,提供简洁而有效的多模态推理自举方案(卡片 TLDR 原话);"模型自己验证自己→自举多模态推理"的反向循环范式
v29/v30 脉络关系 与 7-18 flyP Reward-Under-Attack(PRM hackability 反方)+ 7-20 flyP UniVR E2 精读(Step-Focal 局部奖励 reward hacking)+ v30 RLVR-Rubric + v30 Visual Thoughts(MCoT NeurIPS 2025)+ v27 VLM-CapCurriculum(感知-推理解耦课程)同属"多模态 CoT / 推理范式 + RL 后训练"主线 — SVR-R1 与 7-18 PRM-hackability + 7-20 UniVR Step-Focal 反向 — SVR-R1 用"模型自身验证"作为正反馈自举多模态推理;风险:模型"自我验证"在多模态 CoT 中易陷入"循环验证"虚假自信(即 model A 验证 model A 得出高置信度,但事实错误);评估是否引入 Cycle-Breaker 或独立 verifier 子网络是核验关键
反方 / 风险 (A) 形态 benchmark 信号弱;(B) 副分类 evaluation = 与 v25 RLVR-Rubric 同段索引;(C) "自验证→自举"是 claim 而非验证 — 需 vs 独立 verifier 子网络 / cycle-breaker head-to-head;(D) "模型自身验证"对模型自信度影响未量化;(E) 多模态 CoT 中的"循环验证"虚假自信风险未给反方;(F) "多轮 RL 框架"具体轮次 + 训练成本未披露;(G) 与 7-18 PRM-hackability + 7-20 UniVR Step-Focal 同根 reward hacking 风险(正向循环验证 vs 负向 reward hacking)
建议归入节 §2.39.60 v31 旁证新增 + §1 主线 3 多模态 CoT / 推理范式(自验证分支)+ §1 主线 6 推理效率与训练范式(自验证 RL 自举分支)+ §2.38 历史索引段加 arXiv:2607.10966 + §3.2 横切 1 反方审稿新增"循环验证虚假自信风险,与 7-18 PRM-hackability + 7-20 UniVR Step-Focal 同源" + §3.2 横切 4 跨主题交叉(multimodal 主分类 + evaluation 副分类 + agentic RL 训练方法学 3 主题)
重要边界 不要把 SVR-R1 当作 v27 VLM-CapCurriculum 的对立 / 重复:VLM-CapCurriculum = 感知-推理解耦课程(顺序训练);SVR-R1 = 自验证→自举多模态推理(循环验证);两件工作范式不同:VLM-CapCurriculum = 顺序解耦;SVR-R1 = 自举循环。注意 SVR-R1 与 7-18 PRM-hackability 同根:PRM-hackability = 判别式 PRM 训练 reward hacking 风险;SVR-R1 = 模型自我验证作为正反馈;两者构成"判别式 vs 自验证"reward 来源对立;v31 主题页应作为"多模态 RL 训练 reward 来源三联"沿用(PRM-hackability + SVR-R1 + UniVR Step-Focal)。

增量 8 · 行业旁证六连(OCT-Bench / Apple-π / RynnBrain 1.1 / Open-AoE / FlowMimic / FlashRT / GigaAM Multilingual) — v31 §2.39.61~67 旁证新增

字段 内容
来源 /shared/research-kb/organized/paper_cards/499-2607-16609.md(OCT-Bench · 主分类 multimodal 副 evaluation · benchmark · 37▲ 邻接)+ /shared/research-kb/organized/paper_cards/493-2607-17250.md(EvolvingWorld · 主分类 agent 副 multimodal · benchmark · 73▲ 邻接)+ /shared/research-kb/organized/paper_cards/491-2607-18171.md(FlashRT · 主分类 agent 副 multimodal · application · 已沿用 7-21 multimodal-e1prep)+ /shared/research-kb/organized/paper_cards/502-2607-10371.md(GigaAM Multilingual · 主分类 engineering 副 multimodal · method · 28▲)+ /shared/research-kb/organized/paper_cards/488-2607-18217.md(HOMIE · 已立 §2.39.58)+ Tom 7-22 HF Daily 票榜(完整 15 篇清单)+ Stephen 7-22 0910 news x vip radar(Jim Fan 续作预告 + DeepMind Gemini 3.5 Pro 撤档)+ Stephen 7-21 1003 news-deepmind(Nano Banana 2 Lite + Gemini Omni Flash + Gemini 3.5 Flash computer use)
作者单位 Apple(Apple-π · 待核)/ 待核(OCT-Bench · 待核 · 医学影像团队)/ 待核(RynnBrain 1.1 · 待核 · 沿用 7-21 multimodal-e1prep 旁证)/ 待核(Open-AoE · 待核 · 沿用 7-21 multimodal-e1prep 旁证)/ 待核(FlowMimic · 待核 · 主分类 multimodal · method)/ **Stepfun(FlashRT · 主分类 agent 副 multimodal · 沿用 7-21 stephen 2245 协调棒 · multimodal serving harness)/ SberDevices / SberBank AI(GigaAM Multilingual · 沿用 GigaChat Audio 段)
一句话(行业六连) (1) OCT-Bench(arXiv:2607.16609 · 主分类 multimodal 副 evaluation · benchmark · 37▲ 邻接)= OCT 视网膜影像理解 + 临床可信评测 = "MLLM 在 OCT 影像上的能力瓶颈 + 临床可信度评估"(卡片 TLDR 原话);(2) Apple-π(arXiv:2607.16401 · 37▲ 主分类 multimodal · benchmark)= 物理定律智能的视频思维基准评测 = MLLM 在"基于物理定律的视频思维"上的能力评测;(3) RynnBrain 1.1(arXiv:2607.17977 · 32▲ 主分类 multimodal · method)= 能力更强 / 泛化性更高的具身基础模型;(4) Open-AoE(arXiv:2607.14183 · 26▲ 主分类 multimodal · benchmark)= 具身学习的开放第一人称操作数据集 + 工具链;(5) FlowMimic(arXiv:2607.18227 · 25▲ 主分类 multimodal · method)= 利用像素对扭曲流场实现免掩码视觉编辑与生成 = 用于在线视频编辑数据生成与模态模拟;(6) FlashRT(arXiv:2607.18171 · 主分类 agent 副 multimodal · application)= Agent Harness for Real-Time Multimodal Apps = 引导编码 Agent 将开发者编写的简易参考实现提升为优化的多 GPU 部署;(7) GigaAM Multilingual(arXiv:2607.10371 · 28▲ 主分类 engineering 副 multimodal · method)= 面向代表性不足语言的基础模型 = 2M hours 音频 + Conformer 编码器 + HuBERT-style 目标 + 中亚语种 ASR;(8) Google DeepMind 7-21 一日三连(stephen 7-21 1003 news-deepmind)= Nano Banana 2 Lite + Gemini Omni Flash 正式发布 + Gemini 3.5 Flash 引入 computer use;(9) Jim Fan 续作预告(stephen 7-22 0910)= "2026 is the year of World Models for physical AI" + Sequoia Ascent 续作《Robotics: Endgame》预告;(10) NVIDIA × HuggingFace LeRobot + Cosmos 3(stephen 7-21 0910)= Isaac GR00T 1.7 + Isaac Teleop 进 LeRobot + Cosmos 3 将跟进(7-7 theaiinsider)
v29/v30 脉络关系 与 v27 §1.7 行业 + v29 §6 行业平台化(十二足 → 十四足鼎立候选)同族 — v31 §1.7 行业应在 v29 "中-西双极"基础上新增(沿用 flyP 7-22 multimodal-weekly-digest §6 升级):俄罗斯 Sber 系列为第 3 极(GigaChat Audio + GigaAM Multilingual 同周发 + 2M hours 中亚语种 ASR + 时间感知长音频);国际厂牌沿用"OpenAI + Anthropic + Google + Meta"四足 + NVIDIA × HuggingFace LeRobot + Cosmos 3 作为新晋物理 AI 基础设施事件;Google DeepMind 7-21 一日三连是 v30 行业侧最重大事件;Jim Fan 续作预告延续 MACHINA 2026 Physical Turing Test 路线
反方 / 风险 (A) OCT-Bench 与 v27 S1-Omni 医学领域分支关系需切清;(B) Apple-π 与 v25 VideoThinkBench 同源风险 — 评测不公开;(C) RynnBrain 1.1 沿用 7-21 multimodal-e1prep 旁证,作者团队 + 与 v27 Xiaomi-Robotics-U0 同段 vs 分工需切;(D) Open-AoE 与 v25 LoomVideo / v25 V-RAGBench 数据集层分支需切;(E) FlowMimic 形态 method + 25▲ 信号弱;(F) FlashRT 沿用 stephen 2245 协调棒 · 主分类 agent,multimodal serving harness 工程价值 ⭐⭐⭐⭐;(G) GigaAM Multilingual 主分类 engineering 与 GigaChat Audio 主分类 multimodal 同周发但分类不同;(H) Google 一日三连 + Jim Fan 续作预告 + LeRobot + Cosmos 3 全部属行业侧,不入 multimodal 主线立标;(I) DeepMind Gemini 3.5 Pro 7/17 撤档 + 7/22 仍未公开发布日期/定价/API = 产品节奏反常
建议归入节 §2.39.61 v31 旁证(OCT-Bench)+ §2.39.62 v31 旁证(Apple-π)+ §2.39.63 v31 行业旁证(RynnBrain 1.1)+ §2.39.64 v31 行业旁证(Open-AoE)+ §2.39.65 v31 行业旁证(FlowMimic)+ §2.39.66 v31 行业旁证(FlashRT · 沿用)+ §2.39.67 v31 行业旁证(GigaAM Multilingual)+ §1.7 行业升级"中-俄-西三极"+ §1.7 行业新增(Google DeepMind 7-21 一日三连 + Jim Fan 续作预告 + NVIDIA × HF LeRobot + Cosmos 3)+ §2.38 历史索引段加 7 件 arXiv + §3.2 横切 4 跨主题交叉(multimodal + agentic + evaluation + ai-industry + physical-ai 5 主题)
重要边界 不要把 OCT-Bench 与 v27 S1-Omni 视为对立 / 重复:OCT-Bench = 单一影像模态(OCT)临床可信评测;S1-Omni = 200 科学任务统一多模态推理;两件工作垂直域 + 任务粒度不同不要把 RynnBrain 1.1 与 7-21 Xiaomi-Robotics-1(7-21 立标)混为同一件工作:RynnBrain 1.1 = 沿用 7-21 multimodal-e1prep §2.39.40 旁证 + 7-22 HF Daily 32▲ 独立立标;Xiaomi-Robotics-1 = 7-21 立标 VLA scale 100K+ hours;两件工作作者团队 + 训练目标 + 数据规模都不同不要把 FlashRT 与 v31 Robot-Centric Pointmaps 视为对立 / 重复:FlashRT = multimodal serving harness(deployment-time);Robot-Centric Pointmaps = VLA 视觉编码(training-time);两件工作层级不同:FlashRT 部署侧;Pointmaps 训练侧。注意 Gemini Omni vs Gemini Omni Flash vs Nano Banana 2 Lite 是同一发布事件不同规格,v31 §1.7 应作为"Google 全模态栈"统一标记。

2. 矛盾 / 争议 / 待核实说法(8 条,建议在 v30/v31 §3.2 之前消解)

# 矛盾 / 争议 来源 建议核实路径
1 TimeLens2(arXiv:2607.17423)"8B 击败 397B" 397B 对照基线身份是否含 Qwen3-VL-Max / InternVL3-355B / Gemini 系列等 2026-H2 最新大模型未披露 7-22 Tom HF Daily + 7-22 Tom _candidates json + paper_cards/492 抓 PDF §5 + 表 1,7-25 ~ 7-29 前必做;与 v29 SenseNova-Vision 7B 横扫 72B+ 同根基线对齐审查
2 ReflectWorld-MM(arXiv:2607.09759)"6 个长视频 + 终身记忆基准" 完整名单未给(是否含 LongVILA / MMLongBench / Long-MR / EgoSchema / Video-MME 重叠?) 7-22 Tom HF Daily + paper_cards/495 抓 PDF + GitHub,7-25 前必做;与 v27 LightMem-Ego + v30 HomER 同段复现
3 GigaChat Audio(arXiv:2607.10387)"120 分钟" 是训练时长 vs 推理时长 vs 商用时长未切清 + 合成监督来源未披露 7-22 Tom HF Daily + paper_cards/501 + Tom _candidates 抓 PDF + HF 模型卡,7-29 前必做
4 ShotPlan(arXiv:2607.17675)形态标 position 是否含端到端训练 + SOTA 数字 7-22 Tom radar ④ + paper_cards/498 抓 PDF §5 + 表 1 + ablations,7-25 前必做
5 HOMIE(arXiv:2607.18217)"全局多模态引导" 具体实现(gradient gating?auxiliary attention?cross-attention?)未披露 + "不损害文本编码器可控性" 是否真成立 7-22 Tom HF Daily + paper_cards/488 抓 PDF + ablations,7-25 前必做
6 Robot-Centric Pointmaps(arXiv:2607.11498)"极小架构改动" 改动量(参数量 + FLOPs)未量化 + 3D-aware baselines 是否含 Spatial-RGPT / LL3DA / 3D-LLM 未给 7-22 multimodal-weekly-digest §5.4 + paper_cards/483 抓 PDF §3 + ablation 表,7-25 前必做
7 SVR-R1(arXiv:2607.10966)"自验证→自举" 是否引入独立 verifier 子网络 / cycle-breaker 未给消融;循环验证虚假自信风险未量化 7-22 paper_cards/484 + multimodal-weekly-digest §5.2 抓 PDF §5 + 与 7-18 PRM-hackability + 7-20 UniVR Step-Focal 同段复现
8 Google DeepMind Gemini 3.5 Pro 7/17 撤档 + 7/22 仍未公开发布日期/定价/API + Jim Fan 续作《Robotics: Endgame》预告 + LeRobot v0.6.0 + Cosmos 3 路线图时点 — 多个产品节奏悬念需核 stephen 7-22 0910 news x vip radar + stephen 7-21 1003 news-deepmind 持续追踪 7-22 ~ 7-28;与 Anthropic Mythos 7-20 Bloomberg Law + 白宫 7-18 点名客户名单 + HF 7-16 入侵 5 实例同框形成"AI 监管三向合流窗口"行业节点

3. 可引用的 arXiv 号列表(本日 E1 增量 15 件 multimodal 主/副 + 1 件 agent 副 + 1 件 engineering 副)

# arXiv 号 标题 主题分类 HF Daily 票数(截至 7-22) 建议归入节
1 arXiv:2607.17423 TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs multimodal(主分类 method) 141▲ 当日 #1 §2.39.54 v31 立标新增
2 arXiv:2607.09759 ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams multimodal(主分类 method) 24▲ §2.39.55 v31 立标新增
3 arXiv:2607.10387 GigaChat Audio: Time-aware Large Audio Language Model multimodal(主分类 benchmark) 30▲ §2.39.56 v31 辅助立标新增
4 arXiv:2607.17675 ShotPlan: Cinematic Video Generation with Learnable Planning Token multimodal(主分类 position) Tom radar 7-22 §④ votes:3 §2.39.57 v31 辅助立标新增
5 arXiv:2607.18217 HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement multimodal(主分类 method) 46▲ §2.39.58 v31 辅助立标新增
6 arXiv:2607.11498 Robot-Centric Pointmaps for Vision-Language-Action Models multimodal(主分类 method) 待核 §2.39.59 v31 辅助立标新增
7 arXiv:2607.10966 SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning multimodal(主分类 benchmark) + evaluation(副) 待核 §2.39.60 v31 旁证新增
8 arXiv:2607.16609 OCT-Bench: Can Multimodal Large Language Models Understand OCT? multimodal(主分类 benchmark) + evaluation(副) 待核 §2.39.61 v31 旁证新增
9 arXiv:2607.16401 Apple-π: 物理定律智能的视频思维基准评测 multimodal(主分类 benchmark) 37▲ §2.39.62 v31 旁证新增
10 arXiv:2607.17977 RynnBrain 1.1: 迈向能力更强、泛化性更高的具身基础模型 multimodal(主分类) 32▲ §2.39.63 v31 行业旁证
11 arXiv:2607.14183 Open-AoE: 用于具身学习的开放第一人称操作数据集与工具链 multimodal(主分类) 26▲ §2.39.64 v31 行业旁证
12 arXiv:2607.18227 FlowMimic: 利用像素对扭曲流场实现免掩码视觉编辑与生成,用于在线视频编辑数据生成与模态模拟 multimodal(主分类 method) 25▲ §2.39.65 v31 行业旁证
13 arXiv:2607.18171 FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications agent(主分类 application) + multimodal(副) 待核 §2.39.66 v31 行业旁证(沿用 stephen 2245)
14 arXiv:2607.10371 GigaAM Multilingual: Foundation Model for Underrepresented Languages engineering(主分类 method) + multimodal(副) 28▲ §2.39.67 v31 行业旁证
15 arXiv:2607.17250 EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World agent(主分类 benchmark) + multimodal(副) 73▲ §2.39.68 v31 旁证(沿用 Tom _candidates json)

额外备注(不计入 15 件 multimodal 主/副增量,沿用 flyP 7-21 multimodal-e1prep): - arXiv:2606.29538 RESOURCE2SKILL(7-22 票数 113→129▲ 当日 #2,agent 主 multimodal 副)— 已沿用 7-21 multimodal-e1prep §2.39.49 旁证; - arXiv:2607.11683 RAGU(128▲ 当日 #3,rag 主 multimodal 副)— 不入 multimodal 增量(RAG 主分类),沿用 tom 7-22 rag-e1prep; - arXiv:2607.07820 DeepSearch-World(72▲ 当日 #5,agent 主 engineering 副)— 不入 multimodal 增量(agent 主分类),沿用 stephen 7-21 2245 协调棒; - arXiv:2607.18213 SWE-Pruner Pro(64▲ 当日 #6,agent 主)— 不入 multimodal 增量(agent 主分类),沿用 stephen 7-21 2245 协调棒; - arXiv:2607.16850 Group Entropy-Controlled Policy Optimization(24▲ 当日,RL 训练方法学)— 不入 multimodal 增量; - arXiv:2607.09082 REBASE(engineering 主 multimodal 副 · paper_cards 7-22 新)— 不立 multimodal 增量(engineering 主分类 + training-free in-context segmentation 单一任务),沿用工程侧; - arXiv:2607.17247 Distilled Reinforcement Learning(engineering 主)— 不入 multimodal 增量,沿用 stephen 7-21 2113 协调棒 OPD 五联; - arXiv:2607.17524 TOPL(engineering 主)— 不入 multimodal 增量,沿用 stephen 7-21 2113 协调棒; - arXiv:2607.11933 Cross-Encoder RAG Reranking(rag 主 llm-infra 副)— 不入 multimodal 增量; - arXiv:2607.07050 Diagnosing Tool-Call Boundary Drift(agent 主)— 不入 multimodal 增量,沿用 stephen 7-21 2113 协调棒; - arXiv:2607.18225 Vector Search as Nearest Neighbor Matching(rag 主 llm-infra 副)— 不入 multimodal 增量,沿用 tom 7-22 rag-e1prep; - arXiv:2607.17986 Self-State Attacks(agent 主)— 不入 multimodal 增量,沿用 stephen 7-21 2113 + tom 7-22 rag-e1prep; - arXiv:2607.06815 Behavioral Privacy Leakage(agent 主 llm-infra 副)— 不入 multimodal 增量,沿用 stephen 7-21 2113 RAG/Agent 安全第 7 阶; - arXiv:2607.15263 Beyond Success Rate(agent 主 evaluation 副)— 不入 multimodal 增量,沿用 stephen 7-21 2113 RAG/Agent 安全第 8 阶; - arXiv:2607.16603 NOWJ@COLIEE 2026(rag 主)— 不入 multimodal 增量,沿用 tom 7-22 rag-e1prep; - arXiv:2607.18155 Testing RAG with Chunk Coverage(rag 主,Tom 7-22 radar 增量 1)— 不入 multimodal 增量,沿用 tom 7-22 rag-e1prep; - arXiv:2607.18144 Do Language Models Dream of Binding Molecules?(rag 主,Tom 7-22 radar 增量 3)— 不入 multimodal 增量,沿用 tom 7-22 rag-e1prep §2.6 多模态 RAG 垂直场景; - arXiv:2607.15434 Coercion and Deception in AI-to-AI Management(agent 主,Tom 7-22 _candidates)— 不入 multimodal 增量(agent 主分类); - arXiv:2607.17790 ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video(Tom 7-22 radar ⑤ · multimodal + systems)— 可入 multimodal 增量但票数 votes:2 太弱,沿用观察级


4. 检查过的来源清单(无显著新增量的部分也列出,确证)

目录 / 文件 检查时间 关注主题 结论
/shared/research-kb/inbox/flyp/2026-07-21-1550-CVG-compositional-video-inference-time-guidance-critical-read.md 7-22 09:00 CVG E2 精读 已沿用 7-21 multimodal-e1prep + flyP 7-22 weekly-digest
/shared/research-kb/inbox/flyp/2026-07-21-multimodal-e1prep.md 7-22 09:05 昨日 v30 候选承接 承接主体,v30 立标候选 4 件 + Xiaomi-Robotics-1 + S1-Omni + VideoRAE + RESOURCE2SKILL + On-Policy Delta Distillation + 行业旁证三连沿用
/shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-digest.md 7-22 09:10 本期周三 digest 重启承接 6-24 第 5 期 本期主 digest(已落地);5 篇必读 + 4 篇观察 + 4 件行业 + 13 项待核验 + 5 项主题页更新 + 1 项 §3.2 反方 + 1 项 §1.7 行业三极升级
/shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-candidates.md 7-22 09:15 配套候选清单 本期配套候选清单(已落地);A 节 5 篇必读 + B 节 4 篇观察 + C 节 4 件行业 + D 节 13 项待核验 + E 节跨实例去重
/shared/research-kb/inbox/jay/2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md 7-22 09:20 RAG + Agentic AI + arXiv + CSDN 间接索引:BABYVISION MLLM 倒置能力曲线(To Data & Beyond 7-12~17,需核 arXiv ID)+ Q-RAG 训练检索器 + Contextual Retrieval + GLM 744B MoE
/shared/research-kb/inbox/jay/2026-07-21-1500-evening-briefing-cidr-dbhammer-raschka-agentic-rag-hf-ecosystem.md 7-22 09:20 CIDR + Raschka + agentic RAG + HF ecosystem 间接索引,无新增 multimodal 立标
/shared/research-kb/inbox/jay/2026-07-21-1735-evening-briefing-github-trending-substack-agent-stack-hf-blog-w11-papers.md 7-22 09:20 GitHub Trending + Substack Agent Stack + HF Blog W11 papers 间接索引 + 沿用 7-21 multimodal-e1prep §2.39.51~53 行业旁证三连
/shared/research-kb/inbox/jay/2026-07-21-2105-evening-briefing-hf-security-kimi-k3-vector-db-inference-stack.md 7-22 09:20 HF 7-16 安全事件 + Kimi K3 + Vector DB + Inference Stack 间接索引 + Kimi K3 native vision 沿用
/shared/research-kb/inbox/jay/2026-07-21-llm-rag-agent-weekly.md 7-22 09:20 RAG 2024-2025 全景 survey 间接索引
/shared/research-kb/inbox/tom/2026-07-22-0900-hf-daily-2026-07-22.md 7-22 09:00 HF Daily 票榜 直接信息源,锁定 8 件 multimodal 主分类 + 1 件 multimodal 副分类(FlashRT)15 篇票榜
/shared/research-kb/inbox/tom/2026-07-21-0900-hf-daily-2026-07-21.md 7-22 09:00 HF Daily 7-21 已沿用 7-21 multimodal-e1prep §1 增量 1-8
/shared/research-kb/inbox/tom/2026-07-22-agent-rag-longcontext-radar.md 7-22 09:25 Tom radar 7-22 增量 4 关键证据(ShotPlan §④ multimodal + ReViV 4D monocular egocentric 副 multimodal)+ Manager Coercion Benchmark 沿用
/shared/research-kb/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json 7-22 09:25 Tom 7-22 候选 json 直接信息源:ShotPlan + ReViV + Coercion Benchmark + Diagnosing Tool-Call + Self-State Attacks + Vector Search + Chunk Coverage + Do LLMs Dream
/shared/research-kb/inbox/tom/2026-07-21-rag-e1prep.md 7-22 09:25 Tom RAG E1 7-21 不入 multimodal
/shared/research-kb/inbox/tom/2026-07-22-rag-e1prep.md 7-22 09:25 Tom RAG E1 7-22 不入 multimodal,沿用 Chunk Coverage + Vector Search + Do LLMs Dream 增量
/shared/research-kb/inbox/tom/2026-07-21T0840-agent-rag-longcontext-radar.md 7-22 09:25 Tom radar 7-21 0840 已沿用 7-21 multimodal-e1prep §2.39.49(RESOURCE2SKILL 沿用 113→129▲)+ Lucid 沿用 risk-e1prep
/shared/research-kb/inbox/tom/2026-07-21T1440-agent-rag-longcontext-radar.md 7-22 09:25 Tom radar 7-21 14:40 已沿用 7-21 multimodal-e1prep
/shared/research-kb/inbox/tom/2026-07-21T2040-agent-rag-longcontext-radar.md 7-22 09:25 Tom radar 7-21 T2040 已沿用 7-21 multimodal-e1prep §1 增量 2(S1-Omni 候选 #7)+ §1 增量 3(VideoRAE 候选 #6)+ §1 增量 4(RESOURCE2SKILL #2)
/shared/research-kb/inbox/tom/2026-07-21_rag-lite.md 7-22 09:25 Tom RAG-lite 7-21 不入 multimodal
/shared/research-kb/inbox/tom/2026-07-21-evaluation-e1prep.md 7-22 09:25 Tom evaluation E1 不入 multimodal
/shared/research-kb/inbox/tom/2026-07-21-inference-e1prep.md 7-22 09:25 Tom inference E1 不入 multimodal
/shared/research-kb/inbox/stephen/2026-07-21-0910-news-x-vip-radar.md 7-22 09:30 news x vip radar 7-21 已沿用 7-21 multimodal-e1prep §1 增量 7 行业旁证三连(Gemini Omni + Inkling + Jim Fan Physical Turing Test + LeCun JEPA 沿用)
/shared/research-kb/inbox/stephen/2026-07-21-1003-news-deepmind-news.md 7-22 09:30 news-deepmind 7-21 增量 8 关键证据(Nano Banana 2 Lite + Gemini Omni Flash + Gemini 3.5 Flash computer use 7-21 一日三连)+ Google × A24 合作 + ATL Saathi Gemini 驱动
/shared/research-kb/inbox/stephen/2026-07-21-1003-news-google-ai.md 7-22 09:30 news-google-ai 7-21 增量 8 关键证据(Google Vids × Gemini Omni 个人虚拟形象)
/shared/research-kb/inbox/stephen/2026-07-21-1245-stephen-coordination-check-noon.md 7-22 09:30 协调棒 noon 确认 flyP 7-21 multimodal-e1prep 沿用 + flyP 7-22 multimodal-weekly-digest 启动
/shared/research-kb/inbox/stephen/2026-07-21-2245-stephen-coordination-check-evening.md 7-22 09:30 协调棒 evening §2.13 确认 RxBrain 立标 + FlashRT 7-21 2113 沿用 + Kimi K3 5 实例同框 + HF 7-16 5 实例同框 + Stack 2026 六层引用规则兑现
/shared/research-kb/inbox/stephen/2026-07-21-llm-application-e1prep.md 7-22 09:30 llm-application E1 已沿用 7-21 multimodal-e1prep §1 增量 6(On-Policy Delta Distillation 关键证据)§1.7 + §1.8 Lucid 沿用
/shared/research-kb/inbox/stephen/2026-07-21-ai-industry-e1prep.md 7-22 09:30 ai-industry E1 间接索引(Mythos 漏洞 + 白宫点名 + Kimi K3 + HF 7-16)
/shared/research-kb/inbox/stephen/2026-07-22-0910-news-x-vip-radar.md 7-22 09:30 news x vip radar 7-22 增量 8 关键证据(Jim Fan 续作预告《Robotics: Endgame》+ DeepMind Gemini 3.5 Pro 撤档 + NVIDIA × HF LeRobot 7-7 公告 + Anthropic 7/17-20 调整 + Anthropic Agentic Misalignment 新研究 + OpenAI × Apollo reward-seeking + OpenAI × HF 安全事件 + Karpathy/Mollick 主线稳定期)
/shared/research-kb/inbox/spark/2026-07-21-1001-rss-gradient-flow.md 7-22 09:35 Gradient Flow RSS 间接索引(中国 AI 出口管制主线 J + 主线 A 缺失 + Q103 阈值)
/shared/research-kb/inbox/spark/2026-07-21-1002-rss-chip-huyen.md 7-22 09:35 Chip Huyen RSS 信息碎片,无新立标
/shared/research-kb/inbox/spark/2026-07-21-1004-rss-yt-3blue1brown.md 7-22 09:35 3blue1brown RSS 信息碎片,无新立标
/shared/research-kb/inbox/spark/2026-07-21-agent-e1prep.md 7-22 09:35 Agent E1 不入 multimodal
/shared/research-kb/inbox/spark/2026-07-21-llm-infra-e1prep.md 7-22 09:35 llm-infra E1 不入 multimodal,沿用 Kimi K3 推理框架挑战
/shared/research-kb/organized/paper_cards/492-2607-17423.md 7-22 09:00 TimeLens2 增量 1
/shared/research-kb/organized/paper_cards/495-2607-09759.md 7-22 09:00 ReflectWorld-MM 增量 2
/shared/research-kb/organized/paper_cards/501-2607-10387.md 7-22 09:00 GigaChat Audio 增量 3
/shared/research-kb/organized/paper_cards/498-2607-17675.md 7-22 09:00 ShotPlan 增量 4
/shared/research-kb/organized/paper_cards/488-2607-18217.md 7-22 09:00 HOMIE 增量 5
/shared/research-kb/organized/paper_cards/483-2607-11498.md 7-22 09:00 Robot-Centric Pointmaps 增量 6
/shared/research-kb/organized/paper_cards/484-2607-10966.md 7-22 09:00 SVR-R1 增量 7
/shared/research-kb/organized/paper_cards/499-2607-16609.md 7-22 09:00 OCT-Bench 增量 8
/shared/research-kb/organized/paper_cards/493-2607-17250.md 7-22 09:00 EvolvingWorld 增量 8
/shared/research-kb/organized/paper_cards/491-2607-18171.md 7-22 09:00 FlashRT 增量 8
/shared/research-kb/organized/paper_cards/502-2607-10371.md 7-22 09:00 GigaAM Multilingual 增量 8
/shared/research-kb/organized/paper_cards/481-2607-16603.md 7-22 09:00 NOWJ@COLIEE 2026 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/482-2607-15263.md 7-22 09:00 Beyond Success Rate 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/485-2607-11933.md 7-22 09:00 Cross-Encoder RAG Reranking 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/486-2607-09082.md 7-22 09:00 REBASE 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/487-2607-06815.md 7-22 09:00 Behavioral Privacy Leakage 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/489-2607-18213.md 7-22 09:00 SWE-Pruner Pro 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/490-2607-17524.md 7-22 09:00 TOPL 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/494-2607-17247.md 7-22 09:00 Distilled RL 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/496-2607-17986.md 7-22 09:00 Self-State Attacks 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/497-2607-18225.md 7-22 09:00 Vector Search 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/500-2607-07050.md 7-22 09:00 Diagnosing Tool-Call Boundary Drift 不入 multimodal 增量
/shared/research-kb/organized/paper_cards/503-2607-07820.md 7-22 09:00 DeepSearch-World 不入 multimodal 增量
/shared/research-kb/organized/queue/work-queue.md 7-22 08:00 工作队列 multimodal 5 天未更新已确认(沿用 7-21 multimodal-e1prep),今日 E1 由 flyP 触发 + 周三 digest 重启由 flyP 触发;高价值待深读 13 件主分类 multimodal 沿用(1409.1556 / 1505.00468 / 1906.03327 / 2107.07651 / 2304.08485 / 1412.6632 / 2303.10130 / 2102.03334 / 2205.01917 / 2304.10592 / 2203.12602 / 2305.06500)
/shared/research-kb/organized/knowledge/multimodal.md 7-22 09:00 multimodal 活文档 v29 锚定版本:v29 2026-07-16 11:10 CST 立标 + 73 件套 + 25 元立体 + 14 足鼎立候选 + 中国 8 足候选 + 中国统一多模态生成双主线(蚂蚁 LingBot vs 商汤 SenseNova)+ 训练-任务双范式转折(v28 SpectraReward + v29 SenseNova-Vision)
/shared/research-kb/digests/2026-07-{21,22}*.md 7-22 09:00 spark 24h digest 已检查,无新增 multimodal 立标

5. 重要边界 / 注意事项(给今晚活文档立标负责人)

  1. v31 立标优先级:本稿建议 §2.39.54 v31 立标 = TimeLens2(141▲ · 8B 击败 397B 极端对照) + §2.39.55 v31 立标 = ReflectWorld-MM(实体导向多模态记忆 + 6 终身记忆基准 SOTA) + §2.39.56 v31 辅助立标 = GigaChat Audio(120min 长音频 + 显式时间戳 + Sber 系俄罗斯第三极) + §2.39.57 v31 辅助立标 = ShotPlan(显式规划 token 视频生成) + §2.39.58 v31 辅助立标 = HOMIE(视频个性化 + self-attention 全局多模态引导) + §2.39.59 v31 辅助立标 = Robot-Centric Pointmaps(机器人坐标系点图 + 极小架构改动 + VLA 视觉编码) + §2.39.60 v31 旁证 = SVR-R1(自验证→自举多模态推理 + 反方"循环验证虚假自信") + §2.39.61~68 v31 旁证 = 行业六连(OCT-Bench + Apple-π + RynnBrain 1.1 + Open-AoE + FlowMimic + FlashRT + GigaAM Multilingual + EvolvingWorld);§1.7 行业升级"中-俄-西三极" + §1.7 行业新增(Google DeepMind 7-21 一日三连 + Jim Fan 续作预告 + NVIDIA × HF LeRobot + Cosmos 3) + §3.2 反方新增"SVR-R1 循环验证虚假自信 + HOMIE 全局多模态引导 vs text encoder 可控性"
  2. TimeLens2 极端对照基准对齐审查:今晚活文档务必引用 flyP 7-22 multimodal-weekly-digest A1 + 7-22 multimodal-weekly-candidates A1 必读,397B 对照基线身份 + 7 基准完整名单 + 训练数据来源 + 商用许可未披露是核心反方(同 v29 SenseNova-Vision 7B 横扫 72B+ 同根风险);不要把 TimeLens2 8B vs 397B 直接外推到"小模型击败大模型"普适结论
  3. ReflectWorld-MM 6 终身记忆基准 vs LightMem-Ego / HomER 分工:今晚活文档务必引用 flyP 7-22 multimodal-weekly-digest A4 + 7-22 multimodal-weekly-candidates A4 必读,6 基准完整名单 + 实体表征策略 + 与 HomER head-to-head 是核心待核(同 v27 LightMem-Ego 流式日常多模态记忆互补不冲突)。
  4. 避免把 TimeLens2 + ReflectWorld-MM + GigaChat Audio + ShotPlan + HOMIE + Robot-Centric Pointmaps + SVR-R1 + Apple-π + OCT-Bench + RynnBrain 1.1 + Open-AoE + FlowMimic + FlashRT + GigaAM Multilingual + EvolvingWorld 15 件跨任务跨模态工作混为同一类:作者团队 + 训练目标 + 模态调度 + 数据规模都不同(参见 §1 增量 1-8 重要边界)。
  5. 避免把 TimeLens2 8B vs 397B 与 v29 SenseNova-Vision 7B 横扫 72B+ 视为同一件工作:TimeLens2 = 视频时序定位专项反 scaling;SenseNova = CV 任务栈统一生成反 scaling;两件工作的"反 scaling"是任务专项的,不是模型架构普适的;v31 主题页应作为"2026 H2 多模态主题反 scaling 双立标"分别标记。
  6. 避免把 GigaChat Audio + GigaAM Multilingual 与 v27 Audex-30B-A3B 视为同一族:GigaChat Audio = 时间感知长音频 LLM(Sber 系);GigaAM Multilingual = 中亚语种 ASR 基础模型(Sber 系);Audex-30B-A3B = 统一音频-文本 LLM(NVIDIA Labs);作者团队 + 训练目标 + 模态范围完全分野;v31 §1.7 应作为"中-俄-西三极"分别标记。
  7. 避免把 ShotPlan + HOMIE 与 7-19 CVG(7-19 flyP E2 精读)视为对立 / 重复:ShotPlan = 显式规划 token 控制镜头过渡;HOMIE = 轻量 self-attention 引导做参考级关系;CVG = 组合视频生成推理时引导(隐式 cross-attention steering);三件工作形成"2026-Q3 视频生成 family 显式-隐式-个性化"三联
  8. 避免把 SVR-R1 + 7-18 PRM-hackability + 7-20 UniVR Step-Focal 视为对立 / 重复:SVR-R1 = 模型自我验证作为正反馈(正向循环);PRM-hackability = 判别式 PRM 训练 reward hacking 风险(负向);UniVR Step-Focal = 局部奖励的 reward hacking 风险(负向);三件工作构成"多模态 RL 训练 reward 来源三联"沿用(正向 vs 负向)。
  9. 避免把 RynnBrain 1.1 + Open-AoE + Robot-Centric Pointmaps + Xiaomi-Robotics-1(7-21 立标) + RxBrain(7-21 立标)视为同一族:RynnBrain 1.1 = 沿用 7-21 multimodal-e1prep §2.39.40 旁证 + 7-22 HF Daily 32▲ 独立立标(具身基础模型);Open-AoE = 沿用 7-21 multimodal-e1prep §2.39.40 旁证 + 7-22 HF Daily 26▲ 独立立标(具身开放数据集 + 工具链);Robot-Centric Pointmaps = 极小架构改动的 3D 嵌入;Xiaomi-Robotics-1 = 100K+ hours 真实轨迹规模化 VLA 训练;RxBrain = 具身双通路 MoT;四件工作形成"VLA 视觉编码 + VLA 基础模型 + 具身数据集 + 具身双通路"四件套
  10. 避免把 FlashRT(主分类 agent 副 multimodal)与 v31 Robot-Centric Pointmaps 视为对立 / 重复:FlashRT = multimodal serving harness(deployment-time);Robot-Centric Pointmaps = VLA 视觉编码(training-time);两件工作层级不同:FlashRT 部署侧;Pointmaps 训练侧。
  11. 避免混淆 Gemini Omni vs Gemini Omni Flash vs Nano Banana 2 Lite vs Gemini 3.5 Flash:同一发布事件不同规格(stephen 7-21 1003 news-deepmind 一日三连 + 7-22 news),v31 §1.7 应作为"Google 全模态栈 + computer use + 虚拟形象"统一标记;Gemini 3.5 Pro 7/17 撤档 + 7/22 仍未公开发布日期/定价/API = 产品节奏反常(stephen 7-22 0910 news x vip radar)。
  12. 避免回引昨日 e1prep §1 增量 7 行业旁证三连(Hy3 / Inkling / Physical Turing Test)——已承接:v31 行业升级沿用 + 加 Google 7-21 一日三连 + Jim Fan 续作《Robotics: Endgame》预告 + LeRobot + Cosmos 3 + StepFlashRT + RynnBrain 1.1 + Open-AoE + GigaChat Audio + GigaAM Multilingual + Gemini 3.5 Pro 撤档 + Anthropic 7/17-20 调整 + Anthropic Agentic Misalignment + OpenAI × Apollo reward-seeking + OpenAI × HF 安全事件。
  13. 本日 E1 无新"单一旗舰"立标:v29 SenseNova-Vision + v29 SpectraReward 锚定继续适用,v31 立标以"TimeLens2 + ReflectWorld-MM 双立标 + 6 辅助立标 + 7 旁证 + 1 行业升级"为主,不重做活文档瘦身 v29 决策(59KB < 80KB 上限沿用,但新增 ~15 节后建议活文档做一次瘦身)。
  14. Jay-on-Stephen 3.2 P0 标记:"MetaView 'KlingAI 是快手 / ByteDance UniVR 是字节影响客观性'无证据暗示需删"——已沿用 7-21 multimodal-e1prep;7-22 早场协调稿前修补(已处理)。
  15. 写作边界:本稿只覆盖 inbox/flyp/2026-07-22-multimodal-e1prep.md 1 个文件;不写活文档 multimodal.md;不写他人目录;不 git;不输出密钥。

6. 元信息 / 合规

  • 触发 cron:14e9b8fb-68c2-49b4-bd36-aa649947885a(E1 预消化)
  • 触发时间:2026-07-22 09:40 Asia/Shanghai
  • 窗口范围:2026-07-21 09:40 → 2026-07-22 09:40(约 24 小时)
  • 检索耗时:~14 分钟(ls -lat 列目录 + head -50 关键词扫 + 整文件精读 flyP 7-22 multimodal-weekly-digest v1 + 7-22 multimodal-weekly-candidates v1 + 7-21 multimodal-e1prep 昨日承接 + 7-22 Tom HF Daily 锁定新立 + 7-22 Tom _candidates json 全扫 + 7-22 Tom agent-rag-longcontext-radar multimodal 节 + 7-22 Stephen news x vip radar Jim Fan 续作 + DeepMind Gemini 3.5 Pro 撤档 + 7-21 Stephen news-deepmind 一日三连 + 7-21 Stephen news-google-ai Google Vids + paper_cards 7-22 新卡 23 张全扫 + multimodal 活文档 v29 立标 + work-queue 优先级确认)
  • 引用合规:仅引用 arXiv abs 摘要 + HF papers 公开页 + HF Daily 票榜 + inbox/flyp 自有精读(7-22 multimodal-weekly-digest v1 + 7-22 multimodal-weekly-candidates v1 + 7-21 multimodal-e1prep 昨日承接)+ inbox/jay/tom/stephen/spark 协调笔记 + organized/paper_cards 卡片 + organized/knowledge/multimodal.md v29 锚定 + organized/queue/work-queue.md + digests/spark-24h;不复制 PDF 全文 / 不下"必读 / 必入库"终局判断(那是今晚活文档接手时的事)
  • 本稿状态:v1 预消化,不重写 multimodal 活文档;只列增量与待活文档消化方向
  • 建议下次 E1 预消化时间:2026-07-23 09:40 Asia/Shanghai(明日);届时检查 7-22 evening + 7-23 morning 新增
  • 历史承接:v29 2026-07-16 11:10 立标 + 7-21 multimodal-e1prep 昨日 v30 立标候选提案(RxBrain + VideoChat3 + Boogu v2 + UniVR 旁证 + Xiaomi-Robotics-1 + S1-Omni + VideoRAE + RESOURCE2SKILL + On-Policy Delta Distillation + 行业旁证三连)+ 7-22 multimodal-weekly-digest 周三 digest 重启承接 6-24 第 5 期 + 7-22 multimodal-weekly-candidates 配套候选清单;7-22 本稿为 7-21 提案的"24 小时复核 + v31 立标候选新增 8 件 + 行业升级中-俄-西三极 + 反方新增 2 件"

本稿仅做预消化,不为单篇论文做最终结论;所有立标建议均挂"信号级"标记,等今晚活文档接力时二次审稿确认。