flyP · 2026-07-22 多模态研究线索与待精读清单

本文件是 2026-07-22 周三多模态 digest 的配套 inbox 草稿,仅记录候选研究线索 / 待精读 / 待核验项。 主简报:/shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-digest.md 建议主简报路径:/shared/research-kb/digests/2026-07-22_multimodal.md(同步任务代写) 本文件不复制论文原文,仅作链接、评价、待办、标签。


A. 优先精读队列(5 篇)

A1. TimeLens2(arXiv:2607.17423, 2026-07-22)

  • 作者:未在票榜首段读到作者团队(HF Daily 141▲)
  • 链接:https://arxiv.org/abs/2607.17423 | paper_cards/492
  • 核心:MLLM 通用视频时序定位;2B 击败所有同尺寸;4B/8B 取得 SOTA、超过最多 397B 开源模型
  • 标签#video-temporal-grounding #mllm #video-understanding #scaling-curve #benchmark
  • 价值判断:极端对照(8B vs 397B)= 立标级;可作为"中等专精 MLLM 击败通用巨型大模型"在时序任务上的范式证据
  • 待精读补全:7 个基准完整名单;4B/8B 变体的训练数据配比;与 VideoChat3 v29 立标 head-to-head;397B 对照基线是否含 Qwen3-VL-Max / InternVL3-355B / Gemini 系列
  • 下游链接HF papers

A2. ShotPlan: Cinematic Video Generation with Learnable Planning Token(arXiv:2607.17675, 2026-07-22)

  • 作者:未在 paper_cards 498 头部读到(形态标 position —— 通常为研究路线立场)
  • 链接:https://arxiv.org/abs/2607.17675 | paper_cards/498
  • 核心:视频扩散 base + 显式"可学习规划 token" = 多镜头电影级生成;更灵活镜头管理 + 更强跨镜头一致性
  • 标签#cinematic-video #explicit-planning #multishot #video-generation #t2v
  • 价值判断:与 7-19 flyP 已立的 CVG(inference-time guidance / 隐式 cross-attention steering)形成"显式 vs 隐式"对照;可作为 v31 §1 主线 1 统一多模态生成的"显式规划分支"代表
  • 待精读补全:规划 token 的可解释性 / 可编辑性 / 用户可控性;与 Wan2.2 / CogVideoX-5B / ControlNet / CVG head-to-head;训练数据清单(电影片段许可)
  • 下游链接HF papers

A3. HOMIE: Human-Object Centric Video Personalization(arXiv:2607.18217, 2026-07-22)

  • 作者:未在 paper_cards 488 头部读到
  • 链接:https://arxiv.org/abs/2607.18217 | paper_cards/488
  • 核心:改进 MLLM 集成策略;self-attention 内全局多模态引导;不损害文本编码器可控性 + 不引入昂贵重新对齐
  • 标签#video-personalization #mllm #self-attention #human-object-centric #lightweight
  • 价值判断:轻量路径 video personalization,可作为 LongVILA / Vidu-S1 等长视频模型的轻量 personalization 模块候选
  • 待精读补全:作者团队;全局多模态引导的具体实现(gradient gating?auxiliary attention?);与 Goku-Edit / Movie Gen personalization / LingBot-Video head-to-head
  • 下游链接HF papers

A4. ReflectWorld-MM: Entity-Oriented Multimodal Memory System(arXiv:2607.09759, 2026-07-22)

  • 作者:未在 paper_cards 495 头部读到
  • 链接:https://arxiv.org/abs/2607.09759 | paper_cards/495
  • 核心:实体导向多模态记忆(agent + VLM 联动);6 个长视频 + 终身记忆 benchmark 上 SOTA;超越强记忆 Agent + 一前沿模型
  • 标签#multimodal-memory #entity-oriented #open-ended-video #lifelong-memory #agent
  • 价值判断:是 v29/v30 以来第一件"实体导向多模态记忆 + 开放视频流长期"工作;直接对接 flyP 6-30 agent-memory 候选主题页 + 6-29 HomER 立的 hierarchical memory 主线
  • 待精读补全:6 个基准完整名单(与 LongVILA / MMLongBench / Long-MR 重叠?);与 HomER head-to-head;实体表征是否 frozen VLM;代码 + 模型卡是否公布
  • 下游链接HF papers

A5. GigaChat Audio: Time-aware Large Audio Language Model(arXiv:2607.10387, 2026-07-22)

  • 作者:SberDevices / SberBank AI(待核 PDF 准确团队)
  • 链接:https://arxiv.org/abs/2607.10387 | paper_cards/501
  • 核心:120 分钟音频输入 + 显式时间戳;级联管道大规模合成监督 + 周期性时间标记 + 连续音频 token 交错
  • 标签#audio-llm #time-aware #long-audio #temporal-grounding #russian
  • 价值判断:与 6-24 Audio Flamingo Next + 6-24 UniSonate + 6-29 Continuous Audio Thinking for LALMs 同族;与 TimeLens2 形成"视频 vs 音频 时序定位统一框架"姊妹工作
  • 待精读补全:级联管道细节;120 分钟训练数据来源 + 商用许可;与 Audio Flamingo Next / UniSonate / LALMs-Continuous head-to-head
  • 下游链接HF papers

B. 次优先 / 待核验(4 篇)

B1. Apple-π: 物理定律智能的视频思维基准评测(arXiv:2607.16401, 2026-07-22)

  • 作者:待核
  • 链接:https://arxiv.org/abs/2607.16401 | HF Daily 37▲
  • 核心:评测 MLLM 在"基于物理定律的视频思维"上的能力
  • 标签#video-thinking #benchmark #physics #vlm-evaluation
  • 价值判断:典型 MVBench 序列补;与 VideoThinkBench v25 同源
  • 待精读补全:物理定律清单 + 题型分类 + 哪些 MLLM 已测 + 是否开源

B2. SVR-R1: Bootstrapping Multimodal Reasoning with Self-Verification in RL(arXiv:2607.10966, 2026-07-22)

  • 作者:待核
  • 链接:https://arxiv.org/abs/2607.10966 | paper_cards 主 multimodal + 副 evaluation
  • 核心:多轮 RL 框架;把模型自身验证转化为多模态推理学习信号
  • 标签#self-verification #rl #multimodal-reasoning #bootstrap
  • 价值判断:与 7-18 PRM-hackability 反方 + 7-20 UniVR Step-Focal 局部奖励反向;风险:自验证→循环验证虚假自信
  • 待精读补全:是否引入独立 verifier 子网络 / cycle-breaker;与 RLVR-Rubric / Visual Thoughts 同段复现

B3. OCT-Bench: Can MLLMs Understand OCT?(arXiv:2607.16609, 2026-07-22)

  • 作者:待核
  • 链接:https://arxiv.org/abs/2607.16609 | paper_cards 主 multimodal + 副 evaluation
  • 核心:OCT 视网膜影像理解 + 临床可信评测
  • 标签#mllm #medical-imaging #oct #benchmark #clinical
  • 价值判断:与 S1-Omni(flyP 7-21 e1prep §2.39.41)+ GPT-4 Medical 同族
  • 待精读补全:评测 MLLM 完整名单 + 是否含临床盲测 + 临床合作清单

B4. Robot-Centric Pointmaps for VLA Models(arXiv:2607.11498, 2026-07-22)

  • 作者:未在 paper_cards 头部读到(猜测 NVIDIA / Google DeepMind Robotics / Stanford)
  • 链接:https://arxiv.org/abs/2607.11498 | paper_cards 主 multimodal
  • 核心:机器人坐标系 3D 几何 + 保留 2D VLA 稠密网格;极小架构改动;提升 pi0.5 + SmolVLA;优于相机视点 + 3D 感知基线
  • 标签#vla #robot-centric #3d-geometry #2d-vla #pi0.5 #smolvla
  • 价值判断:是"具身通用基础模型 + 2D VLA"的关键工程拼图;2026 H2 具身 VLA 阵营最热子方向
  • 待精读补全:作者团队;具体架构改动量(参数量 + FLOPs);与 Open-AoE(26▲)+ RynnBrain 1.1(32▲)+ Xiaomi-Robotics-1(54▲)同段

C. 行业 / Substack / 官方模型博客旁证(4 件)

C1. Substack — Future AGI: Multimodal AI in 2026 — What's Happening

  • 链接:https://futureagi.substack.com/p/multimodal-ai-in-2026-whats-happening
  • 核心:Llama 4 Scout/Maverick MoE / Early Fusion / Alpamayo-R1(视频+运动)— 行业基础参考
  • 标签#industry #multimodal #llama-4 #alpamayo #early-fusion
  • 行动:沿用,活文档 §1.7 行业参考

C2. Substack — To Data & Beyond: BABYVISION MLLM 倒置能力曲线

  • 链接:https://todatabeyond.substack.com/p/important-llm-papers-for-the-week-504
  • 核心:3 岁儿童视觉原语失败基准;UniPai AI / 北大 / 清华 / 月之暗面联合
  • 标签#benchmark #vlm-evaluation #visual-primitive #babyvision
  • 行动:沿用,需核 arXiv ID + 数据集是否开源

C3. Google DeepMind — Nano Banana 2 Lite + Gemini Omni Flash 正式发布

  • 链接:https://deepmind.google/blog/start-building-with-nano-banana-2-lite-and-gemini-omni-flash/
  • 时间:2026-07-21
  • 核心:Google 全模态栈 + 实时语音视频
  • 标签#gemini-omni #nano-banana #full-modal #realtime
  • 行动:活文档 §1.7 行业 + Google 全模态栈段

C4. Google DeepMind — Gemini 3.5 Flash 引入 computer use

  • 链接:https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/
  • 时间:2026-07-21
  • 核心:Gemini 3.5 Flash computer use
  • 标签#gemini #computer-use #multimodal-agent
  • 行动:活文档 §1.7 行业 + multimodal-computer use 段

D. 待人工确认 / 待后续 cron 复核(13 项)

  1. TimeLens2 7 基准完整名单 + 397B 对照基线身份
  2. ShotPlan 是否含端到端训练 + SOTA 数字
  3. HOMIE 全局多模态引导具体实现
  4. ReflectWorld-MM 6 基准完整名单 + 是否开源
  5. GigaChat Audio 120min 数据集来源 + 商用许可
  6. SVR-R1 是否引入独立 verifier 子网络 / cycle-breaker
  7. OCT-Bench 评测 MLLM 完整名单 + 是否含临床盲测
  8. Robot-Centric Pointmaps 作者团队 + 架构改动量
  9. BABYVISION arXiv ID 是否已发
  10. Google DeepMind Gemini 3.5 Pro 是否悄然上线
  11. NVIDIA × HF LeRobot + Cosmos 3 路线图时点
  12. GigaChat Audio / GigaAM Multilingual 完整作者团队 + Sber 系具体公司主体
  13. flyP 6-24 后隔 4 周重启周三 digest 的粒度(5 节制 vs 详细版 §1-§10)

E. 跨实例去重 + 同步状态

  • 与 jay 7-22 morning briefing 互补,无重复(jay 偏 RAG/Agentic / multimodal 间接)
  • 与 tom 7-22 rag-e1prep 互补,无重复(tom 偏 RAG 检索评测 / multimodal 副分类少量)
  • 与 stephen 7-22 news x vip radar 互补,无重复(stephen 偏 AI industry news / multimodal 间接)
  • 与 spark 7-22 暂无新素材(sp 偏 systems/MLOps)
  • 与 flyP 7-19 Boogu-Image-0.1 / 7-19 VideoChat3 / 7-19 RxBrain / 7-20 UniVR / 7-21 CVG 已承接或立标 → 本期不重复立标
  • 上期 2026-06-24-multimodal-weekly-digest.md 已覆盖条目(Wan 2.2 / Seedance 2.0 / Movie Gen / UniSonate / Audio Flamingo Next / VS-Bench / Thinking with Video)→ 本期不重复

维护说明:本文件仅在 cron 触发日(周三)更新;下次更新 = 2026-07-29(周三),建议把周期改为 1 周 1 期(2026-Q3 高密度)。 若 A 节任意一项在两日内未被精读,应在下次 cron 时降级为 B 节或剔除。