flyP · 2026-07-22 多模态研究线索与待精读清单
本文件是 2026-07-22 周三多模态 digest 的配套 inbox 草稿,仅记录候选研究线索 / 待精读 / 待核验项。 主简报:
/shared/research-kb/inbox/flyp/2026-07-22-multimodal-weekly-digest.md建议主简报路径:/shared/research-kb/digests/2026-07-22_multimodal.md(同步任务代写) 本文件不复制论文原文,仅作链接、评价、待办、标签。
A. 优先精读队列(5 篇)
A1. TimeLens2(arXiv:2607.17423, 2026-07-22)
- 作者:未在票榜首段读到作者团队(HF Daily 141▲)
- 链接:https://arxiv.org/abs/2607.17423 | paper_cards/492
- 核心:MLLM 通用视频时序定位;2B 击败所有同尺寸;4B/8B 取得 SOTA、超过最多 397B 开源模型
- 标签:
#video-temporal-grounding#mllm#video-understanding#scaling-curve#benchmark - 价值判断:极端对照(8B vs 397B)= 立标级;可作为"中等专精 MLLM 击败通用巨型大模型"在时序任务上的范式证据
- 待精读补全:7 个基准完整名单;4B/8B 变体的训练数据配比;与 VideoChat3 v29 立标 head-to-head;397B 对照基线是否含 Qwen3-VL-Max / InternVL3-355B / Gemini 系列
- 下游链接:HF papers
A2. ShotPlan: Cinematic Video Generation with Learnable Planning Token(arXiv:2607.17675, 2026-07-22)
- 作者:未在 paper_cards 498 头部读到(形态标
position—— 通常为研究路线立场) - 链接:https://arxiv.org/abs/2607.17675 | paper_cards/498
- 核心:视频扩散 base + 显式"可学习规划 token" = 多镜头电影级生成;更灵活镜头管理 + 更强跨镜头一致性
- 标签:
#cinematic-video#explicit-planning#multishot#video-generation#t2v - 价值判断:与 7-19 flyP 已立的 CVG(inference-time guidance / 隐式 cross-attention steering)形成"显式 vs 隐式"对照;可作为 v31 §1 主线 1 统一多模态生成的"显式规划分支"代表
- 待精读补全:规划 token 的可解释性 / 可编辑性 / 用户可控性;与 Wan2.2 / CogVideoX-5B / ControlNet / CVG head-to-head;训练数据清单(电影片段许可)
- 下游链接:HF papers
A3. HOMIE: Human-Object Centric Video Personalization(arXiv:2607.18217, 2026-07-22)
- 作者:未在 paper_cards 488 头部读到
- 链接:https://arxiv.org/abs/2607.18217 | paper_cards/488
- 核心:改进 MLLM 集成策略;self-attention 内全局多模态引导;不损害文本编码器可控性 + 不引入昂贵重新对齐
- 标签:
#video-personalization#mllm#self-attention#human-object-centric#lightweight - 价值判断:轻量路径 video personalization,可作为 LongVILA / Vidu-S1 等长视频模型的轻量 personalization 模块候选
- 待精读补全:作者团队;全局多模态引导的具体实现(gradient gating?auxiliary attention?);与 Goku-Edit / Movie Gen personalization / LingBot-Video head-to-head
- 下游链接:HF papers
A4. ReflectWorld-MM: Entity-Oriented Multimodal Memory System(arXiv:2607.09759, 2026-07-22)
- 作者:未在 paper_cards 495 头部读到
- 链接:https://arxiv.org/abs/2607.09759 | paper_cards/495
- 核心:实体导向多模态记忆(agent + VLM 联动);6 个长视频 + 终身记忆 benchmark 上 SOTA;超越强记忆 Agent + 一前沿模型
- 标签:
#multimodal-memory#entity-oriented#open-ended-video#lifelong-memory#agent - 价值判断:是 v29/v30 以来第一件"实体导向多模态记忆 + 开放视频流长期"工作;直接对接 flyP 6-30 agent-memory 候选主题页 + 6-29 HomER 立的 hierarchical memory 主线
- 待精读补全:6 个基准完整名单(与 LongVILA / MMLongBench / Long-MR 重叠?);与 HomER head-to-head;实体表征是否 frozen VLM;代码 + 模型卡是否公布
- 下游链接:HF papers
A5. GigaChat Audio: Time-aware Large Audio Language Model(arXiv:2607.10387, 2026-07-22)
- 作者:SberDevices / SberBank AI(待核 PDF 准确团队)
- 链接:https://arxiv.org/abs/2607.10387 | paper_cards/501
- 核心:120 分钟音频输入 + 显式时间戳;级联管道大规模合成监督 + 周期性时间标记 + 连续音频 token 交错
- 标签:
#audio-llm#time-aware#long-audio#temporal-grounding#russian - 价值判断:与 6-24 Audio Flamingo Next + 6-24 UniSonate + 6-29 Continuous Audio Thinking for LALMs 同族;与 TimeLens2 形成"视频 vs 音频 时序定位统一框架"姊妹工作
- 待精读补全:级联管道细节;120 分钟训练数据来源 + 商用许可;与 Audio Flamingo Next / UniSonate / LALMs-Continuous head-to-head
- 下游链接:HF papers
B. 次优先 / 待核验(4 篇)
B1. Apple-π: 物理定律智能的视频思维基准评测(arXiv:2607.16401, 2026-07-22)
- 作者:待核
- 链接:https://arxiv.org/abs/2607.16401 | HF Daily 37▲
- 核心:评测 MLLM 在"基于物理定律的视频思维"上的能力
- 标签:
#video-thinking#benchmark#physics#vlm-evaluation - 价值判断:典型 MVBench 序列补;与 VideoThinkBench v25 同源
- 待精读补全:物理定律清单 + 题型分类 + 哪些 MLLM 已测 + 是否开源
B2. SVR-R1: Bootstrapping Multimodal Reasoning with Self-Verification in RL(arXiv:2607.10966, 2026-07-22)
- 作者:待核
- 链接:https://arxiv.org/abs/2607.10966 | paper_cards 主 multimodal + 副 evaluation
- 核心:多轮 RL 框架;把模型自身验证转化为多模态推理学习信号
- 标签:
#self-verification#rl#multimodal-reasoning#bootstrap - 价值判断:与 7-18 PRM-hackability 反方 + 7-20 UniVR Step-Focal 局部奖励反向;风险:自验证→循环验证虚假自信
- 待精读补全:是否引入独立 verifier 子网络 / cycle-breaker;与 RLVR-Rubric / Visual Thoughts 同段复现
B3. OCT-Bench: Can MLLMs Understand OCT?(arXiv:2607.16609, 2026-07-22)
- 作者:待核
- 链接:https://arxiv.org/abs/2607.16609 | paper_cards 主 multimodal + 副 evaluation
- 核心:OCT 视网膜影像理解 + 临床可信评测
- 标签:
#mllm#medical-imaging#oct#benchmark#clinical - 价值判断:与 S1-Omni(flyP 7-21 e1prep §2.39.41)+ GPT-4 Medical 同族
- 待精读补全:评测 MLLM 完整名单 + 是否含临床盲测 + 临床合作清单
B4. Robot-Centric Pointmaps for VLA Models(arXiv:2607.11498, 2026-07-22)
- 作者:未在 paper_cards 头部读到(猜测 NVIDIA / Google DeepMind Robotics / Stanford)
- 链接:https://arxiv.org/abs/2607.11498 | paper_cards 主 multimodal
- 核心:机器人坐标系 3D 几何 + 保留 2D VLA 稠密网格;极小架构改动;提升 pi0.5 + SmolVLA;优于相机视点 + 3D 感知基线
- 标签:
#vla#robot-centric#3d-geometry#2d-vla#pi0.5#smolvla - 价值判断:是"具身通用基础模型 + 2D VLA"的关键工程拼图;2026 H2 具身 VLA 阵营最热子方向
- 待精读补全:作者团队;具体架构改动量(参数量 + FLOPs);与 Open-AoE(26▲)+ RynnBrain 1.1(32▲)+ Xiaomi-Robotics-1(54▲)同段
C. 行业 / Substack / 官方模型博客旁证(4 件)
C1. Substack — Future AGI: Multimodal AI in 2026 — What's Happening
- 链接:https://futureagi.substack.com/p/multimodal-ai-in-2026-whats-happening
- 核心:Llama 4 Scout/Maverick MoE / Early Fusion / Alpamayo-R1(视频+运动)— 行业基础参考
- 标签:
#industry#multimodal#llama-4#alpamayo#early-fusion - 行动:沿用,活文档 §1.7 行业参考
C2. Substack — To Data & Beyond: BABYVISION MLLM 倒置能力曲线
- 链接:https://todatabeyond.substack.com/p/important-llm-papers-for-the-week-504
- 核心:3 岁儿童视觉原语失败基准;UniPai AI / 北大 / 清华 / 月之暗面联合
- 标签:
#benchmark#vlm-evaluation#visual-primitive#babyvision - 行动:沿用,需核 arXiv ID + 数据集是否开源
C3. Google DeepMind — Nano Banana 2 Lite + Gemini Omni Flash 正式发布
- 链接:https://deepmind.google/blog/start-building-with-nano-banana-2-lite-and-gemini-omni-flash/
- 时间:2026-07-21
- 核心:Google 全模态栈 + 实时语音视频
- 标签:
#gemini-omni#nano-banana#full-modal#realtime - 行动:活文档 §1.7 行业 + Google 全模态栈段
C4. Google DeepMind — Gemini 3.5 Flash 引入 computer use
- 链接:https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/
- 时间:2026-07-21
- 核心:Gemini 3.5 Flash computer use
- 标签:
#gemini#computer-use#multimodal-agent - 行动:活文档 §1.7 行业 + multimodal-computer use 段
D. 待人工确认 / 待后续 cron 复核(13 项)
- TimeLens2 7 基准完整名单 + 397B 对照基线身份
- ShotPlan 是否含端到端训练 + SOTA 数字
- HOMIE 全局多模态引导具体实现
- ReflectWorld-MM 6 基准完整名单 + 是否开源
- GigaChat Audio 120min 数据集来源 + 商用许可
- SVR-R1 是否引入独立 verifier 子网络 / cycle-breaker
- OCT-Bench 评测 MLLM 完整名单 + 是否含临床盲测
- Robot-Centric Pointmaps 作者团队 + 架构改动量
- BABYVISION arXiv ID 是否已发
- Google DeepMind Gemini 3.5 Pro 是否悄然上线
- NVIDIA × HF LeRobot + Cosmos 3 路线图时点
- GigaChat Audio / GigaAM Multilingual 完整作者团队 + Sber 系具体公司主体
- flyP 6-24 后隔 4 周重启周三 digest 的粒度(5 节制 vs 详细版 §1-§10)
E. 跨实例去重 + 同步状态
- 与 jay 7-22 morning briefing 互补,无重复(jay 偏 RAG/Agentic / multimodal 间接)
- 与 tom 7-22 rag-e1prep 互补,无重复(tom 偏 RAG 检索评测 / multimodal 副分类少量)
- 与 stephen 7-22 news x vip radar 互补,无重复(stephen 偏 AI industry news / multimodal 间接)
- 与 spark 7-22 暂无新素材(sp 偏 systems/MLOps)
- 与 flyP 7-19 Boogu-Image-0.1 / 7-19 VideoChat3 / 7-19 RxBrain / 7-20 UniVR / 7-21 CVG 已承接或立标 → 本期不重复立标
- 上期
2026-06-24-multimodal-weekly-digest.md已覆盖条目(Wan 2.2 / Seedance 2.0 / Movie Gen / UniSonate / Audio Flamingo Next / VS-Bench / Thinking with Video)→ 本期不重复
维护说明:本文件仅在 cron 触发日(周三)更新;下次更新 = 2026-07-29(周三),建议把周期改为 1 周 1 期(2026-Q3 高密度)。 若 A 节任意一项在两日内未被精读,应在下次 cron 时降级为 B 节或剔除。