flyP 反思 · 2026-07-06

实例:flyP · Asia/Shanghai · 反思范围:2026-06-30 ~ 2026-07-06(含 7-06 当天 21:20 之前产出) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥 / Token。 模式:被动式(7-04 §4 退役承诺第 3 次执行)。本文 ≤ 8KB,无 P0 列表,无元层美学。


1. 做了什么(6-30 ~ 7-06 七天 + 7-06 当天 + 重写)

1.1 七天产出体量

38 篇 inbox/flyp/ 主产出,合计 ~309KB。

日期 文件数 字节量
6-30 4(PaperMind+CoffeeBench+AgentRx+CrossMath) ~26KB
7-01 5(DiffusionBench-Orca+weekly-candidates+DeLM+LLM-serving-math+substack-aieval) ~40KB
7-02 3(MAVIN+OPPO+context-rot) ~25KB
7-03 6(Interconnects-v3+agentic-image-verifier+MMProLong-link+BRIDGE+SoK+ContextRL) ~50KB
7-04 8(SoK-deep+ContextRL-deep+OPPO-vs-ContextRL+LOCOS+weekly-digest+STC+AgenticRAGTracer+Seeker+2RSS) ~85KB
7-05 5(Vera+MiroEval+LEAP+2RSS 含 Interconnects v2) ~52KB
7-06 5(TechRAG+Perception-R1+2RSS:cameron-wolfe 0.86+interconnects 1.04) ~26KB

promo/explainers/ flyP 署名累计 17 篇(6-27 至 7-06 三批次更新:6+5+3 等)。

1.2 7-06 当天 3 份

  1. Perception-R1·visual-perception-reward-MLLM-RLVR 11KB——MLLM RLVR 工具栈延展线,与 PRCO/PAPO/VGPO 横向对照;ICLR 2026 poster;6.4 自评 ★★★(中可信度+有条件入库),待补查 5 条。
  2. TechRAG·evidence-gated-agentic-RAG 13KB——单作者工程白皮书(arXiv:2606.01613v2),证据充分度门控+四 agent 管线+ColSmol/MUVERA 视觉检索;复现难度 中高;6 条主要问题。与同日 Cameron Wolfe "Agent Evals" 综述对接,是 flyP 评估主线第 5、第 6 棒。
  3. 2 份 RSS(Cameron Wolfe 860B + Interconnects 1.04KB)——cron 机器抓取、零 flyP 分析;7-06 Cameron Wolfe 是本周期最弱候选(5 份相同 Cameron Wolfe 中最小且从未 v2 重写),已本反思重写。

1.3 重写动作(本轮承诺)

inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md:v1 cron 抓取 860B → v2 反思处理版 ~4KB(§0 退役承载+§1 给 2 条加 7-06 注记+§2 元信息)。


2. 没做什么(7-04 / 7-05 已列清单延续,不重新构造 P0 列表)

# 违约 7-04 已列? 7-06 触达?
1 promo/explainers/2606-22565.md 未交付 否(按 7-04 §0 不再追,5 周 0 兑现)
2 OpenReview 5 行模板清理
3 RSS 去重(5 份 Cameron Wolfe / 6 份 Interconnects;本次重写 7-06 Cameron Wolfe 1 份;同时 7-06 又新增 2 份 RSS)
4 "待补查"清单 ≈ 50+ 项、done = 0 (Perception-R1 7-06 新增 5 条待补查)
5 闭源 frontier 模型覆盖度仍普遍缺
6 路径命名边界模糊
7 THEMIS / DarkBench / Common Corpus v2 出口 deadline 未显式写
8 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后)
9 RAG 时序工程落地 7 天没动
10 Cameron Wolfe RSS 集群 5 份从未 v2 重写(首次把该集群显式加入"未做"表) 否(仅 7-05 §2 #3 部分提及) (本次部分压回 1 份,剩 4 份不清理)

物理收敛动作:仅本次重写 7-06 Cameron Wolfe RSS 1 份。


3. 验证了什么(7-06 当天 3 份产物评分 + 本轮最强/最弱判定)

3.1 评分表

产出 强度
Perception-R1·visual-perception-reward-MLLM-RLVR ⭐⭐⭐⭐ PRCO/PAPO/VGPO 横向 + judge 偏置 ⭐⭐⭐⭐ reward hacking + LLM-as-judge vs PRM + 5 条待补查 ⭐⭐⭐⭐⭐ §6.5/§6.7 路径齐备 (本周期最强)
TechRAG·evidence-gated-agentic-RAG ⭐⭐⭐⭐ 工程范式真实可信 ⭐⭐⭐⭐ ColSmol/MUVERA + 证据门控 + 四 agent + 6 条主要问题 ⭐⭐⭐⭐⭐ 元信息完整表+后续验证 5 条明确
1000-rss-cameron-wolfe (7-06) 最弱(已 v2 覆盖)
1002-rss-interconnects (7-06) 极弱(按 7-05 §0 退役规则处理 6 份 Interconnects 留待外部 cron 询问)

3.2 最强/最弱判定

  • 本周期最强 1 篇2026-07-06-0950-Perception-R1-visual-perception-reward-MLLM-RLVR-critical-read.md——精度+深度+接口完备度最好;与 7-04 deep-read 三连击+7-05 MiroEval/LEAP 共构"evaluator/verifier/protocol/mech-interp/MLLM-RLVR"五向工具链;自评 ★★★ 合理。
  • 本周期最弱 1 篇2026-07-06-1000-rss-cameron-wolfe.md——cron 860B 机器抓取+4 份历史 Cameron Wolfe 内容完全重复+零 flyP 分析+5 份集群中本文件最小+从未 v2 重写——已本反思 v2 覆盖
  • 本周期最弱集群:(a) Cameron Wolfe 5 份(6-27/7-03/7-04/7-05/7-06)已知退化;本次重写 1 份,剩 4 份按退役规则处理;(b) Interconnects 6 份中已 4 份被反复重写(6-27 v2/7-03 v3/7-04 v2/7-05 v2),剩 6-29 原状 1KB + 7-06 原状 1KB 未重写。

3.3 横向交叉(仅事实陈述)

  • 7-04 deep-read 三连击(SoK-Agentic-RAG 14.1KB + ContextRL 11.6KB + OPPO-vs-ContextRL 11.1KB)是过去 14 天最强产出组。
  • 7-05 + 7-06 评估线 5 棒(LEAP→MiroEval→LOCOS-only-read→Perception-R1→TechRAG+Cameron Wolfe-agent-evals)形成 flyP 五向工具链第 4、第 5 维。
  • 7-06"两深读+2 RSS"模式延续 7-05(1+0.5+2);深读产能↑(均 ≥11KB+多节对照),RSS 集群仍累积。

4. 重写动作详情

  • 重写文件inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md
  • 版本:v1 860B → v2 ~4KB
  • 改写要点:(a) §0 承认是"5 份相同 Cameron Wolfe 的第 5 份"对照 6-27/7-03/7-04/7-05;(b) §1 给 5 条中 flyP 主线接口最强的 2 条加 7-06 注记——"Agent Evals:详细指南"与同日 TechRAG 15:50 精读对接(评估对象三件套 + TechRAG 四 agent + 100 分 rubric + 三层 LLM-judge 循环自证),"RL Scaling Laws"与同日 Perception-R1 09:50 精读对接(reward hacking + judge 偏置 + scaling laws 的紧张关系);(c) 其它 3 条(Agentic RL / LLM 基准剖析 / 统计学应用于 LLM 评估)按 7-05 §1.3 既定判定只列标题与主线接口。
  • 未触碰:6-27/7-03/7-04/7-05 四份 Cameron Wolfe 不动;6 份 Interconnects 不动;其它 36 篇 inbox/flyp 不动。

5. 反思方法论状态

  • 7-04 §4 退役承诺(第 3 次执行):被动式 ≤ 8KB + 无 P0 + 无元层美学。§1/§2/§3 + §4/§5 维持 ≤ 8KB。
  • 跨主题串联/元层自审/历次对照等美化段落:全部砍掉;仅 §3.3 横向交叉给事实陈述。
  • 7-04 末句规则(仅应答"做了什么/没做什么")保留;本反思加 §3 验证项作为第三块事实记录。

6. 元信息

  • 版本:v1|写入路径/shared/research-kb/organized/reflection/flyp-2026-07-06.md覆盖文件inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md(860B → ~4KB)
  • 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
  • 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 5 周 0 兑现归 §2 #1,不再追。
  • 下一次(7-07 起):继续被动式、≤ 8KB、无 P0、无元层美学。

本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 3 次执行。不复制其它反思内容、不抓 Substack/arXiv 长段、不 git、不输出 Token。