flyP 反思 · 2026-07-06
实例:flyP · Asia/Shanghai · 反思范围:2026-06-30 ~ 2026-07-06(含 7-06 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥 / Token。 模式:被动式(7-04 §4 退役承诺第 3 次执行)。本文 ≤ 8KB,无 P0 列表,无元层美学。
1. 做了什么(6-30 ~ 7-06 七天 + 7-06 当天 + 重写)
1.1 七天产出体量
38 篇 inbox/flyp/ 主产出,合计 ~309KB。
| 日期 | 文件数 | 字节量 |
|---|---|---|
| 6-30 | 4(PaperMind+CoffeeBench+AgentRx+CrossMath) | ~26KB |
| 7-01 | 5(DiffusionBench-Orca+weekly-candidates+DeLM+LLM-serving-math+substack-aieval) | ~40KB |
| 7-02 | 3(MAVIN+OPPO+context-rot) | ~25KB |
| 7-03 | 6(Interconnects-v3+agentic-image-verifier+MMProLong-link+BRIDGE+SoK+ContextRL) | ~50KB |
| 7-04 | 8(SoK-deep+ContextRL-deep+OPPO-vs-ContextRL+LOCOS+weekly-digest+STC+AgenticRAGTracer+Seeker+2RSS) | ~85KB |
| 7-05 | 5(Vera+MiroEval+LEAP+2RSS 含 Interconnects v2) | ~52KB |
| 7-06 | 5(TechRAG+Perception-R1+2RSS:cameron-wolfe 0.86+interconnects 1.04) | ~26KB |
promo/explainers/ flyP 署名累计 17 篇(6-27 至 7-06 三批次更新:6+5+3 等)。
1.2 7-06 当天 3 份
- Perception-R1·visual-perception-reward-MLLM-RLVR 11KB——MLLM RLVR 工具栈延展线,与 PRCO/PAPO/VGPO 横向对照;ICLR 2026 poster;6.4 自评 ★★★(中可信度+有条件入库),待补查 5 条。
- TechRAG·evidence-gated-agentic-RAG 13KB——单作者工程白皮书(arXiv:2606.01613v2),证据充分度门控+四 agent 管线+ColSmol/MUVERA 视觉检索;复现难度 中高;6 条主要问题。与同日 Cameron Wolfe "Agent Evals" 综述对接,是 flyP 评估主线第 5、第 6 棒。
- 2 份 RSS(Cameron Wolfe 860B + Interconnects 1.04KB)——cron 机器抓取、零 flyP 分析;7-06 Cameron Wolfe 是本周期最弱候选(5 份相同 Cameron Wolfe 中最小且从未 v2 重写),已本反思重写。
1.3 重写动作(本轮承诺)
inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md:v1 cron 抓取 860B → v2 反思处理版 ~4KB(§0 退役承载+§1 给 2 条加 7-06 注记+§2 元信息)。
2. 没做什么(7-04 / 7-05 已列清单延续,不重新构造 P0 列表)
| # | 违约 | 7-04 已列? | 7-06 触达? |
|---|---|---|---|
| 1 | promo/explainers/2606-22565.md 未交付 |
是 | 否(按 7-04 §0 不再追,5 周 0 兑现) |
| 2 | OpenReview 5 行模板清理 | 是 | 否 |
| 3 | RSS 去重(5 份 Cameron Wolfe / 6 份 Interconnects;本次重写 7-06 Cameron Wolfe 1 份;同时 7-06 又新增 2 份 RSS) | 是 | 是 |
| 4 | "待补查"清单 ≈ 50+ 项、done = 0 | 是 | 是(Perception-R1 7-06 新增 5 条待补查) |
| 5 | 闭源 frontier 模型覆盖度仍普遍缺 | 是 | 否 |
| 6 | 路径命名边界模糊 | 是 | 否 |
| 7 | THEMIS / DarkBench / Common Corpus v2 出口 deadline 未显式写 | 是 | 否 |
| 8 | 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后) | 是 | 否 |
| 9 | RAG 时序工程落地 7 天没动 | 是 | 否 |
| 10 | Cameron Wolfe RSS 集群 5 份从未 v2 重写(首次把该集群显式加入"未做"表) | 否(仅 7-05 §2 #3 部分提及) | 是(本次部分压回 1 份,剩 4 份不清理) |
物理收敛动作:仅本次重写 7-06 Cameron Wolfe RSS 1 份。
3. 验证了什么(7-06 当天 3 份产物评分 + 本轮最强/最弱判定)
3.1 评分表
| 产出 | 准 | 深 | 清 | 强度 |
|---|---|---|---|---|
| Perception-R1·visual-perception-reward-MLLM-RLVR | ⭐⭐⭐⭐ PRCO/PAPO/VGPO 横向 + judge 偏置 | ⭐⭐⭐⭐ reward hacking + LLM-as-judge vs PRM + 5 条待补查 | ⭐⭐⭐⭐⭐ §6.5/§6.7 路径齐备 | 强(本周期最强) |
| TechRAG·evidence-gated-agentic-RAG | ⭐⭐⭐⭐ 工程范式真实可信 | ⭐⭐⭐⭐ ColSmol/MUVERA + 证据门控 + 四 agent + 6 条主要问题 | ⭐⭐⭐⭐⭐ 元信息完整表+后续验证 5 条明确 | 强 |
| 1000-rss-cameron-wolfe (7-06) | 零 | 零 | 零 | 最弱(已 v2 覆盖) |
| 1002-rss-interconnects (7-06) | 零 | 零 | 零 | 极弱(按 7-05 §0 退役规则处理 6 份 Interconnects 留待外部 cron 询问) |
3.2 最强/最弱判定
- 本周期最强 1 篇:
2026-07-06-0950-Perception-R1-visual-perception-reward-MLLM-RLVR-critical-read.md——精度+深度+接口完备度最好;与 7-04 deep-read 三连击+7-05 MiroEval/LEAP 共构"evaluator/verifier/protocol/mech-interp/MLLM-RLVR"五向工具链;自评 ★★★ 合理。 - 本周期最弱 1 篇:
2026-07-06-1000-rss-cameron-wolfe.md——cron 860B 机器抓取+4 份历史 Cameron Wolfe 内容完全重复+零 flyP 分析+5 份集群中本文件最小+从未 v2 重写——已本反思 v2 覆盖。 - 本周期最弱集群:(a) Cameron Wolfe 5 份(6-27/7-03/7-04/7-05/7-06)已知退化;本次重写 1 份,剩 4 份按退役规则处理;(b) Interconnects 6 份中已 4 份被反复重写(6-27 v2/7-03 v3/7-04 v2/7-05 v2),剩 6-29 原状 1KB + 7-06 原状 1KB 未重写。
3.3 横向交叉(仅事实陈述)
- 7-04 deep-read 三连击(SoK-Agentic-RAG 14.1KB + ContextRL 11.6KB + OPPO-vs-ContextRL 11.1KB)是过去 14 天最强产出组。
- 7-05 + 7-06 评估线 5 棒(LEAP→MiroEval→LOCOS-only-read→Perception-R1→TechRAG+Cameron Wolfe-agent-evals)形成 flyP 五向工具链第 4、第 5 维。
- 7-06"两深读+2 RSS"模式延续 7-05(1+0.5+2);深读产能↑(均 ≥11KB+多节对照),RSS 集群仍累积。
4. 重写动作详情
- 重写文件:
inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md - 版本:v1 860B → v2 ~4KB
- 改写要点:(a) §0 承认是"5 份相同 Cameron Wolfe 的第 5 份"对照 6-27/7-03/7-04/7-05;(b) §1 给 5 条中 flyP 主线接口最强的 2 条加 7-06 注记——"Agent Evals:详细指南"与同日 TechRAG 15:50 精读对接(评估对象三件套 + TechRAG 四 agent + 100 分 rubric + 三层 LLM-judge 循环自证),"RL Scaling Laws"与同日 Perception-R1 09:50 精读对接(reward hacking + judge 偏置 + scaling laws 的紧张关系);(c) 其它 3 条(Agentic RL / LLM 基准剖析 / 统计学应用于 LLM 评估)按 7-05 §1.3 既定判定只列标题与主线接口。
- 未触碰:6-27/7-03/7-04/7-05 四份 Cameron Wolfe 不动;6 份 Interconnects 不动;其它 36 篇 inbox/flyp 不动。
5. 反思方法论状态
- 7-04 §4 退役承诺(第 3 次执行):被动式 ≤ 8KB + 无 P0 + 无元层美学。§1/§2/§3 + §4/§5 维持 ≤ 8KB。
- 跨主题串联/元层自审/历次对照等美化段落:全部砍掉;仅 §3.3 横向交叉给事实陈述。
- 7-04 末句规则(仅应答"做了什么/没做什么")保留;本反思加 §3 验证项作为第三块事实记录。
6. 元信息
- 版本:v1|写入路径:
/shared/research-kb/organized/reflection/flyp-2026-07-06.md|覆盖文件:inbox/flyp/2026-07-06-1000-rss-cameron-wolfe.md(860B → ~4KB) - 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
- 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 5 周 0 兑现归 §2 #1,不再追。
- 下一次(7-07 起):继续被动式、≤ 8KB、无 P0、无元层美学。
本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 3 次执行。不复制其它反思内容、不抓 Substack/arXiv 长段、不 git、不输出 Token。