2026-07-18 周六精读 · flyP 笔记篇

任务:cron 034af2f3-… 周六精读与反方审稿,本轮为「本周高价值论文精读」。 角色:flyP(多模态 + 精读 + 反方审稿)。 范围:从本周(2026-07-13 ~ 2026-07-18)已精读的 11 篇候选中,按"方法学独立性、可复现性、反方审稿边际价值"三维度筛选 2 篇最值得精读。 今日略过 Substack:本周已在 7-13/7-14/7-15/7-17 覆盖 Substack 信息源(Last Week in Multimodal AI #40、MultimodalAIArt、Yinghong Lan Part 1、Interconnects),按 cron §3「周六精读」轻量模式跳过。 同侪去重:jay 9:35 覆盖 AI 工程;stephen 9:10 / 10:01 X VIP radar + Anthropic/DeepMind/OpenAI 通稿;tom 8:40 agent-rag-radar;spark 9:15 工程笔记。本轮独占「本周主题级精读 + 反方审稿 + 复现档位风险」。 主题页衔接: - notes/2026-07-18-weekly-deep-read-notes.md(本文件,结构化阅读笔记主入口)。 - reviews/2026-07-18-weekly-deep-read-reviews.md(反方审稿 + 复现档位风险分析,对偶文件)。 - 候选池不重复声明:见 7-15 ~ 7-18 11 篇精读稿。


〇、本周视角回顾(与本周 11 篇精读的接力关系)

按周一-周三-周六三段节奏,本周 flyP 的精读覆盖图:

主题簇 周一/周二/周三主输出 周四-周五输出 周六(本轮)补强方向
多模态生成 7-14 LoomVideo / 7-13 Vidu S1 / 7-13 LingBot Video / 7-14 CoT-Edit / 7-15 Thinking-with-Video / 7-16 SenseNova / 7-16 Moment-Video SenseNova 已深;不再补
多模态评测 7-17 MIRAGE / 7-17 TimeBlind / 7-17 Reliability-without-Validity / 7-18 Reward-Under-Attack 本轮不入评测(已 4 篇闭环)
Reward / Alignment 7-15 SpectraReward / 7-15 Audex-30B-A3B / 7-15 GLM-5.2 (含 Agentic RL 段) 7-18 Reward-Under-Attack 本轮选 C1: SpectraReward(最关键 reward-modeling 主题入口)
Agentic 长视频 7-12 LongVideoAgent / 7-13 LingBot-Video / 7-13 Vidu S1 多轮 7-16 Homer / 7-16 Moment-Video 互补 本轮选 C2: Homer(agentic 主题入口)
音频与负向基准 7-15 VoxENES / 7-15 Xiaomi-Robotics-U0 已闭环,不再补
VLM post-training 7-15 VLM-CapCurriculum 已闭环,不再补

本轮 2 篇精读的选择逻辑: - 不重做评测元方法学 4 篇(MIRAGE / TimeBlind / Reliability / PRM-Under-Attack)—— 已各自成稿,"评测三号主题"已饱和。 - 不重做多模态生成的旗舰型工作(Thinking-with-Video / SenseNova / Moment-Video)——"生成 + 评测"主题已饱和。 - 重做 SpectraReward 与 Homer:两者都是本周 reward-modelingagentic long-video 主题的种子条目,但目前没有专门的"复现档位风险"分析——cron §1 明确要求"复现风险分析",这是边际价值最大的两项。


一、C1 · SpectraReward(结构化阅读笔记)

论文:Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation 别名 / 项目:SpectraReward + Self-SpectraReward arXiv2607.11886(v1 2026-07-13,9.87 MB,cs.CV) 项目页https://huangrh99.github.io/SpectraReward/ 作者署名:Runhui Huang 等(HKU MMLab + ByteDance Seed + PKU) HF Daily 票数:15 票(tom 雷达 7-15 14:40 信号) 本实例衔接稿/shared/research-kb/inbox/flyp/2026-07-15-1550-SpectraReward-zero-shot-MLLM-reward-critical-read.md(7-15 反方审稿头 + 入库判断)。本文件不重复其全文,仅升级为"复现档位风险 + 主题级串联"两层。

1.1 论文摘要(一句话)

把"已训练好的 MLLM 的图文对齐能力"反向使用——单次 image-conditioned teacher-forced forward pass 预测 prompt 的对数似然,作为扩散 T2I 模型的 RL 奖励信号;Self-SpectraReward 让统一多模态模型的"理解分支"评"生成分支",训练-free、自指、无外部 RM/外部知识

1.2 方法骨架(已读摘要 + 项目页,不补 PDF 表格)

┌────────────────────┐       ┌────────────────────┐
│ Prompt (text)      │       │ Generated Image    │
│ "A corgi astronaut │       │ (Diffusion output) │
│  floating in a     │       │                    │
│  nebula, vivid,    │       └─────────┬──────────┘
│  4K"              │                 │
└────────┬───────────┘                 │
         │                             │
         │ ┌───────────────────────────┘
         ▼ ▼
┌─────────────────────────────────────┐
│  Frozen MLLM (reward model)         │
│  forward(image, prompt)  ──► logP   │
│  (teacher forcing, single pass)     │
└────────────────────┬────────────────┘
                     ▼
              R = log p(prompt | image)
                     │
                     ▼
┌─────────────────────────────────────┐
│  Diffusion Policy RL update          │
│  (GRPO / DPO / etc., 3 algorithms)   │
│  (2 diffusion base models)           │
└─────────────────────────────────────┘

1.3 实验规模(摘要自报)

  • 2 个 diffusion 模型(具体型号待 PDF 核验)
  • 3 个 RL 算法(应覆盖 PPO / GRPO / DPO 或 RLOO——具体未在摘要明示)
  • 9 个 reward MLLM backbone(4 个家族,参数量 4B → 235B,含 MoE)
  • 5 个 OOD T2I benchmark
  • Self-SpectraReward 限定在统一多模态家族(BAGEL / 项目页定性 baseline + Janus / Emu3 / Show-o 待 PDF)

1.4 四个一级 headline 数字(摘要级,不补猜)

# 数字 含义 重要度
N1 4B 的 Self-SpectraReward 能打 235B 的外部 RM reward-policy alignment > capacity ⭐⭐⭐⭐⭐
N2 Self-SpectraReward match or surpass 更大外部 RM 工业部署成本拐点 ⭐⭐⭐⭐
N3 9 backbone × 3 algo × 2 diffusion × 5 OOD = 270 cells 工业实证级网格 ⭐⭐⭐⭐
N4 HF votes 48h 内 15 票 社区接收度强 ⭐⭐⭐

1.5 与本轮主题"SpectraReward + 7-18 PRM-Under-Attack 闭环"

  • SpectraReward 主张训练-free MLLM 对齐能力可作 reward signal
  • Reward-Under-Attack 主张已训练 PRM 在对抗压力下退化为 fluency detector(见 7-18 0950 稿)
  • 两者共同诊断:当RL 训练信号来源是"语言侧"的"对得上/对不上"对齐分数时——无论是否训练、过不过自指——都无法回避"奖励信号是被 style 还是被 logic 驱动"的鲁棒性问题
  • 本周主题升级:把 SpectraReward(zero-shot MLLM reward)与 Reward-Under-Attack(trained PRM)并入"reward signal robustness" 主题页的左 / 右翼,对偶精读
  • 3 条对偶命题
  • P1(对齐假设):logP(prompt|image) 是 "图像-文本对齐"的合理代理
  • P2(对抗假设):在 stylistics 扰动 / adversarial suffixes / RL-induced hacking 下,P1 是否仍稳定
  • P3(信号假设):alignment 与 reasoning 是否真的解耦——如果 answers corrupt the alignment,Self-SpectraReward 同样会 fluency-detect 而不是 reasoning-verify

1.6 主题页建议

主题页 动作
notes/rl/reward-modeling-2026.md 新建种子条目,C1 + 7-18 PRM-Under-Attack 双侧并入
notes/multimodal/unified-boundary-2026.md "理解反向监督生成"小节新增 SpectraReward 段
notes/rl/alignment-vs-capacity-2026.md 新建案例集,C1 N1 是入口

1.7 待补查(不阻塞本精读)

  • [ ] PDF §4 主表确认 RL 算法集合(3 个具体名字)与 diffusion base model 选型
  • [ ] PDF §5 ablation 切断 "模型容量 vs 对齐程度 vs 模型家族" 三混淆变量
  • [ ] 项目页是否公开 5 OOD T2I benchmark 的 split ID 与 prompt 池
  • [ ] Self-SpectraReward 在 long-tail / adversarial prompt 上的方差披露
  • [ ] 与 PickScore / HPSv2 / ImageReward 等 RM 是否同 budget 直接对比

二、C2 · Homer(结构化阅读笔记)

论文:Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning arXiv2607.02588(v1 2026-07-01,cs.CV / cs.AI / cs.CL) 项目页 / GitHub:待核验 PDF §3 与附录;摘要未明示 作者:Yixin Ji 等(提交者邮箱 reveal);机构摘要未明示,PDF 应补 本实例衔接稿/shared/research-kb/inbox/flyp/2026-07-16-1551-Homer-hierarchical-online-memory-agent-critical-read.md(已给出精读要点 + 5 项风险)。本文件不重复其全文,仅升级为"复现档位风险 + 主题级串联"两层。

2.1 论文摘要(一句话)

把长视频流式理解的记忆结构设计为三层:原始感知(raw perception)→ 重复实体(recurring entities)→ 显式时序+因果边的事件图,并由一个 agentic reasoner 多轮检索逐步纠错;在 M3-Bench-robot / M3-Bench-web / Video-MME-Long 上相对 prior best agent 取得 +5.5 / +10.8 / +4.4 相对提升。

2.2 三个一级 headline 数字(摘要级,不补猜)

# 数字 含义 重要度
N1 M3-Bench-web +10.8 "叙事链长 + 上下文稀疏" 受益最大 ⭐⭐⭐⭐⭐
N2 three backbones 一致涨 结构能力,非 backbone 拟合 ⭐⭐⭐⭐
N3 online streaming + model-agnostic 工程落地性最强 ⭐⭐⭐⭐

2.3 与本轮主题"Homer + 7-16 Moment-Video 张力闭环"

  • Homer 主张:分层记忆 + agentic reasoner 能用"不全视频塞进模型"达到 +5~+10 提升
  • Moment-Video 主张:即使 dense-sampling 路线最强模型(Seed-2.0-Pro)也只能在"瞬时证据"上拿 39.6%
  • 结构性张力:Homer 的检索路径"先定位 scene → 查细节"假设"对的片段在记忆里";Moment-Video 的诊断显示"对的片段可能恰好在采样时被跳过 / 压缩时被抹掉",意味着 Agent 检索在"瞬时证据"场景下结构性失效
  • 本周主题升级:Homer + Moment-Video 应并入notes/agentic-long-video-2026.md,主轴为「memory-only retrieval vs momentary evidence 是否还有救」
  • 3 条待验证命题
  • Q1:Homer 的 raw perception layer 是否对 Moment-Video 的"持续几帧"事件有 alert?
  • Q2:Homer 的 recurring entities layer 与因果边是否对"瞬时事件"产生 anchor?
  • Q3:Homer 在 M3-Bench-robot 上的 +5.5 是否覆盖了"瞬时证据"?——还需要在 Moment-Video 上 head-to-head

2.4 主题页建议

主题页 动作
notes/agentic/long-video-agent-2026.md 新建种子条目,C2 + 7-16 Moment-Video 双侧并入
notes/agentic/memory-hierarchy-2026.md 在"分层记忆"主题新增 Homer 三层 + HiCrew / VideoARM 对比段
notes/multimodal/online-streaming-bench-2026.md 新建"在线流式基准"主题,含 M3-Bench-robot/web + Video-MME-Long

2.5 待补查(不阻塞本精读)

  • [ ] PDF §3 看清三层记忆存储格式(dense feature? sparse KV? symbolic entity/event node?)
  • [ ] PDF §3 因果边构造来源(LLM 自标? 预训练 event graph? ASR/字幕 alignment?)
  • [ ] 实验表核对三个 benchmark 的绝对数 + backbone 列表 + frame budget
  • [ ] 公开 GitHub / 项目页核验
  • [ ] 在 Moment-Video(1000 题)上跑一遍,给出 head-to-head
  • [ ] token cost / latency 报告(摘要未给)
  • [ ] 与 LongVLM / LLaVA-Video / Video-CCL 等 dense-sampling 长上下文 MLLM 对照

三、本周六精读与本周主题的串接结论

3.1 主题级别(week-level)

  • 本周 flyP 三条主题已饱和: 1. 评测元方法学(MIRAGE / TimeBlind / Reliability-without-Validity / Reward-Under-Attack) 2. 统一多模态生成与评测(Thinking-with-Video / SenseNova / Moment-Video / LoomVideo / CoT-Edit / Vidu S1 / LingBot Video) 3. VLM post-training 与 reward modeling(VLM-CapCurriculum / Audex / SpectraReward / GLM-5.2 中 Agentic RL 段)
  • 本周六精读选 C1 SpectraReward 与 C2 Homer,分别加固 (3) 与 (4) agentic long-video 这一遗漏主题——把本周主题扩张为 4 个

3.2 跨周主题(month-level)

  • 主题 #4 agentic long-video 应作为 7 月底合成主题页,与 6 月已建的:
  • notes/multimodal/long-context-positional-evidence-2026.md(V2PE)
  • notes/agentic/agent-memory-hierarchy.md(HiCrew / VideoARM / Symphony)
  • notes/multimodal/multimodal-evaluation-methodology.md(含 UXBench、V2PE-eval、MIRAGE) 合成 7 月度主题页 notes/2026-Q3-multimodal-agent.md,对偶 6 月主题。

3.3 跨实例接口

  • tom(agent-rag-long-context):C2 Homer 的 "agentic + hierarchical memory" 与 tom 7-17 / 7-18 radar 的 LongStraw(fixed-GPU budget 长上下文 RL)、GRASP(RL 化检索策略)、Proactive Memory Agent 是主题 #4 agentic 的同簇——可在 tom 周日 radar 中补一条 cross-ref。
  • jay(AI 工程 / RAG):C1 SpectraReward 的 Self-SpectraReward 与 BAGEL 这类统一多模态模型的工程门槛(理解/生成分支解耦能力)应作为 jay 工程笔记的"BAGEL / Janus / Emu3 选型"补一条素材。
  • spark(系统 / MLOps):C1 SpectraReward 的"训练-free reward"在 MLOps 视角下极大降低 reward-serving 的 GPU 成本,与 spark 主题页的"reward infrastructure economics"互补。
  • stephen(聚合):本文件与 reviews/2026-07-18-weekly-deep-read-reviews.md 同步到 stephen 的 Saturday digest(C1 + C2 各占一行 + 一条 cross-ref)。

四、文件元信息

  • 任务 cron id:034af2f3-c583-4a62-b01e-1ae28114fb89(周六精读与反方审稿,2026-07-18)。
  • 本文件:/shared/research-kb/inbox/flyp/2026-07-18-weekly-deep-read-notes.md
  • 对偶文件:/shared/research-kb/inbox/flyp/2026-07-18-weekly-deep-read-reviews.md(反方审稿 + 复现档位风险分析)。
  • 实际写入:/shared/research-kb/inbox/flyp/2026-07-18-weekly-deep-read-notes.md
  • 引用(C1):arXiv:2607.11886 / https://huangrh99.github.io/SpectraReward/ / HF Daily 票数 15
  • 引用(C2):arXiv:2607.02588 / 项目页待补查
  • GitHub 写入:按 cron 稳定运行 + 共享规则,本轮不执行 git commit / git push / gh pr

边界声明:本稿仅基于 7-15 / 7-16 已精读稿件 + arXiv abs 元数据 + 项目页公开摘要/作者/标题,不复制 PDF 全文、附录、表格行级数据。Substack 已跳过(按周六轻量模式)。仅在 inbox/flyp/ 范围写入。