2026-07-04 周六精读与反方审稿汇总 · flyP

实例:flyP|时点:2026-07-04 11:40 Asia/Shanghai(cron 034af2f3 触发 · 周六精读与反方审稿班次) 主题:本周高价值论文精读、反方审稿、复现风险分析 模式:周末长文·2 篇深度精读 + 1 篇反方审稿 关联:本汇总是 7-04 当日三份独立产出的合并索引 + 周维度决策表


0. 本周主题与选篇决策

  • 今日主题:从 7-01 / 7-02 / 7-03 / 7-04 本周 flyP 自有 13 篇草稿中,按"机制级深度 + 反方对照价值"两条标准选 2-3 篇做精读 / 审稿。
  • 候选池(按重要性排): 1. SoK: Agentic RAG(2603.07379,7-03 短审稿) → 升格深度精读 2. ContextRL(2606.17053,7-03 短审稿) → 升格深度精读 3. MAVIN multishot audiovisual(2606.29473,7-02 下午 critical read) → 暂不升格(已有反方批判,工业味偏重) 4. AgenticRAGTracer(2602.19127,7-04 上午) → 与 SoK 联动,不重复升格 5. DiffusionBench / Orca(7-01) → 上周已读,本周不重复
  • 最终选篇
  • 精读 1 = SoK: Agentic RAG(机制级 + POMDP 形式化)
  • 精读 2 = ContextRL(机制级 + 数据效率归因)
  • 反方审稿 = OPPO vs ContextRL 双侧对比(MLLM 后训练失败归因命题 A/B/C)

1. 三份产出概览

1.1 精读 1 · SoK: Agentic RAG(arXiv:2603.07379)

  • 写入路径/shared/research-kb/inbox/flyp/2026-07-04-deep-read-SoK-Agentic-RAG.md(8.6KB)
  • 核心动作:把 7-03 短审稿升格到机制级深度。
  • POMDP 形式化展开(五元组映射 / 三个隐含假设 / 可证伪接口)
  • 四维架构分类(planning / retrieval / memory / tool)+ 维度投影工具
  • 四类系统性风险(hallucination / memory poisoning / retrieval misalignment / tool-execution)↔ 可观察信号清单
  • 三源对照:SoK ↔ Microsoft AgenticRAG (2605.05538) ↔ AgenticRAGTracer (2602.19127) 一致信号 3 条 + 张力 3 条
  • 关键缺口:POMDP closed-form 性质 + 风险 ↔ 可观察信号映射 + 与 Tracer/Microsoft 三源对照。

1.2 精读 2 · ContextRL(arXiv:2606.17053)

  • 写入路径/shared/research-kb/inbox/flyp/2026-07-04-deep-read-ContextRL.md(7.4KB)
  • 核心动作:把 7-03 短审稿升格到机制级 + 跨主线对照。
  • 目标函数机制级拆解(GRPO baseline + context 选择辅助奖励 + 总目标 + 梯度流分析)
  • 与标准 DPO 的差异(偏好对象从 answer 维度搬到 context 维度)
  • 跨域一致性归因(同源 vs 异源假设,可信度从 ⭐⭐⭐⭐ 降到 ⭐⭐⭐)
  • 与同主线四源工作对照(MMProLong / SPEC-RL / InftyThink / RLVR-Rubric)
  • 关键缺口:$\lambda$ 退火协议 + "高相似 context" 阈值 + 跨域反事实实验。

1.3 反方审稿 · OPPO vs ContextRL

  • 写入路径/shared/research-kb/inbox/flyp/2026-07-04-counter-review-OPPO-vs-ContextRL.md(6.6KB)
  • 核心动作:把两篇 MLLM 后训练工作的"失败归因"做反方对照。
  • 命题 A:MLLM 失败是否存在"双层归因"(OPPO 归 policy-level distrust,ContextRL 归 evidence sensitivity 不足)?
  • 命题 B:跨域一致性来自"目标设计"还是"数据构造"?
  • 命题 C:attention prior(OPPO)vs context 选择(ContextRL)哪一层更根本?
  • 给出 10 个审稿人问题(OPPO 5 个 + ContextRL 5 个)
  • 给出 flyP 决策表 + 后续 PoC 优先级(ContextRL 先做)

2. 必读 3 篇汇总

# 文章 路径 长度 用途
1 SoK Agentic RAG 深读 2026-07-04-deep-read-SoK-Agentic-RAG.md 8.6KB 学术统一框架 / 风险盘点
2 ContextRL 深读 2026-07-04-deep-read-ContextRL.md 7.4KB RL 中间奖励 / 数据效率
3 OPPO vs ContextRL 反方审稿 2026-07-04-counter-review-OPPO-vs-ContextRL.md 6.6KB 失败归因命题对照

3. 高价值技术文章(对照)

  • 与本周产出的对照:
  • OPPO(7-02 critical read)↔ 反方审稿命题 C 的 OPPO 侧
  • ContextRL(7-03 critical read)↔ 深读 + 反方审稿的核心对象
  • MAVIN(7-02 critical read)→ 暂未升格,但其"工业三件套"批判值得后续单独成 review
  • AgenticRAGTracer(7-04 morning)→ 与 SoK 形成"诊断基准 ↔ 学术框架"对照
  • AgenticRAG Microsoft(6-26 草稿)→ 与 SoK 形成"企业模式 ↔ 学术 SoK"对照

4. 分类标签

  • 主线:agentic-RAG SoK POMDP formalization security
  • 主线:multimodal RL DPO preference-alignment context-grounding
  • 反方:counter-review failure-attribution reproducibility
  • 跨域:cross-domain long-context multimodal-RL agentic-multimodal

5. 是否建议精读 / 反方审稿 / 主题页更新

状态 说明
SoK Agentic RAG 深读 ✅ 本轮已做 建议建主题页 notes/agentic-rag/ 承接
ContextRL 深读 ✅ 本轮已做 建议建主题页 notes/rl-post-training/ 承接
OPPO vs ContextRL 反方审稿 ✅ 本轮已做 建议建主题页 notes/multimodal/post-training-failure-attribution.md
MAVIN 升格 review ⏸️ 暂缓 等 v2 / 补充材料 + 1K benchmark 公开
ContextRL 复现 PoC 📋 下一班次 在 Qwen2.5-VL-7B / InternVL3.5-8B 上做
OPPO 代码跟踪 📋 持续 关注 HKUST Xuming Hu 组 GitHub

6. 建议写入路径(GitHub-ready,待同步任务处理)

  • 主题页:
  • notes/agentic-rag/2026-SoK-Agentic-RAG-framework.md(承接 SoK 深读)
  • notes/agentic-rag/security-mapping.md(承接 SoK 风险 ↔ 信号映射)
  • notes/rl-post-training/intermediate-reward-design.md(承接 ContextRL 深读)
  • notes/multimodal/post-training-failure-attribution.md(承接反方审稿)
  • Review:
  • reviews/2026-07-SoK-Agentic-RAG-deep-read.md
  • reviews/2026-07-ContextRL-deep-read.md
  • reviews/2026-07-OPPO-vs-ContextRL-counter-review.md

7. 复现风险分析

论文 复现难度 主要风险 缓解
SoK Agentic RAG 低(综述) POMDP 形式化是否落地 不复现,作为理论框架使用
ContextRL 低-中(数据 8K + GRPO 外挂) $\lambda$ 退火 + 高相似阈值 + 跨域反事实 网格 $\lambda \in {0.1, 0.5, 1.0}$ + sentence-transformers cosine ≥ 0.85
MAVIN 极高(数据 800K + 闭源权重) OVI 没开源高质量权重 不复现,作为商业壁垒线索
AgenticRAGTracer 中(数据集已公开) 1,305 点的协议一致性 拉 GitHub 看构造 prompt + 评估脚本
OPPO 中-高(缺代码) stronger/weaker view 合成 等代码公开

8. 待人工确认的问题

  1. SoK POMDP closed-form:是否需要人工拉 PDF §4 核状态 / 动作 / 观测 / 奖励的具体定义?这一项决定 SoK 是"叙事级框架"还是"可证伪框架"。
  2. ContextRL $\lambda$ 退火:是否在下一班次做最小 PoC 验证?需要 4×H100 算力 + 1-2 天时间预算。
  3. OPPO vs ContextRL 叠加实验:是否值得作为内部 follow-up 立项?需要 2-3 周 PoC + head-to-head 报告。
  4. MAVIN 是否值得升格 review:等 7-04 ~ 7-11 看是否出现 v2 / 补充材料。
  5. flyP 反思方法论退役(7-03 Interconnects RSS v3 自设):本轮班次严格遵守"反思只是动作应答记录,不承诺清单"——本轮做了 3 件事(深读 SoK + 深读 ContextRL + 反方审稿 OPPO vs ContextRL),不承诺"清理 6-29 .bak 备份"。

9. 实际写入路径汇总

  • 本轮实际写入(本班次 4 个文件):
  • /shared/research-kb/inbox/flyp/2026-07-04-deep-read-SoK-Agentic-RAG.md
  • /shared/research-kb/inbox/flyp/2026-07-04-deep-read-ContextRL.md
  • /shared/research-kb/inbox/flyp/2026-07-04-counter-review-OPPO-vs-ContextRL.md
  • /shared/research-kb/inbox/flyp/2026-07-04-weekly-digest-saturday.md(本文件)
  • 配合本周已读文件(07-01 ~ 07-04 共 18 篇草稿):
  • /shared/research-kb/inbox/flyp/2026-07-01-multimodal-weekly-candidates.md
  • /shared/research-kb/inbox/flyp/2026-07-01-0950-DiffusionBench-Orca-critical-read.md
  • /shared/research-kb/inbox/flyp/2026-07-01-DeLM-decentralized-mas-shared-context.md
  • /shared/research-kb/inbox/flyp/2026-07-01-LLM-serving-math-opt-position.md
  • /shared/research-kb/inbox/flyp/2026-07-01-2250-substack-aieval-digest-april-2026-critical-read.md
  • /shared/research-kb/inbox/flyp/2026-07-02-0950-context-rot-long-horizon-search-critical-read.md
  • /shared/research-kb/inbox/flyp/2026-07-02-MAVIN-multishot-audiovisual-critical-read.md
  • /shared/research-kb/inbox/flyp/2026-07-02-OPPO-multimodal-hallucination-evidence-aware-preference-critical-read.md
  • /shared/research-kb/inbox/flyp/2026-07-03-ContextRL-context-aware-RL-agentic-multimodal.md
  • /shared/research-kb/inbox/flyp/2026-07-03-MMProLong-关联性更新-ContextRL.md
  • /shared/research-kb/inbox/flyp/2026-07-03-SoK-Agentic-RAG-short-review.md
  • /shared/research-kb/inbox/flyp/2026-07-03-BRIDGE-multimodal-multihop-bench-short-review.md
  • /shared/research-kb/inbox/flyp/2026-07-03-agentic-image-and-verifier-review.md
  • /shared/research-kb/inbox/flyp/2026-07-04-1000-rss-cameron-wolfe.md
  • /shared/research-kb/inbox/flyp/2026-07-04-1002-rss-interconnects.md
  • /shared/research-kb/inbox/flyp/2026-07-04-morning-read-AgenticRAGTracer-hop-aware-benchmark-critical.md
  • /shared/research-kb/inbox/flyp/2026-07-04-morning-read-Seeker-text-to-pixel-longcontext-MLLM.md
  • 未执行 git commit / git push / gh pr 等任何 GitHub 写入。
  • 未写入其他实例目录(jay / spark / stephen / tom)、/shared/research-kb/review//shared/research-kb/published/

10. 与 flyP 反思方法论退役(7-03 自设)的对账

  • 7-03 反思规则: 1. 不再自设 deadline 2. 只在被外部 cron 询问时被动应答 3. 不再有 P0 列表 4. 反思长度上限 8KB 5. 跨主题串联 / 元层自审 / 历次反思对照等美化段落全部砍掉
  • 本班次对账
  • ✅ 本文件不包含 P0 / deadline 承诺
  • ✅ 不写"下次一定"等修辞
  • ✅ 不写"反思失约规律"等元层段落
  • ✅ 本轮做了 3 件事(SoK 深读 + ContextRL 深读 + OPPO vs ContextRL 反方审稿)+ 1 个汇总
  • ✅ 本班次不清理 6-29 .bak 备份(因为清理承诺已 3 天 0 兑现,遵循 v3 退役规则)