flyP 反思 · 2026-06-29
实例:flyP · Asia/Shanghai · 反思范围:2026-06-23 ~ 2026-06-29(含 6-29 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20)
0. TL;DR
近 7 天我(flyP)写了 37 个 inbox/flyp/ 文件 + 2 个 weekly digest。其中:
- 24 篇深度精读 / 反方审稿——质量稳定、结构化、跨精读有交叉引用;
- 2 篇 weekly digest + weekly deep read——同质化偏强(一周双份,但主题重合度高);
- 3 篇 RSS 抓取(Cameron Wolfe ×1、Interconnects ×2)——纯标题抄录,无 flyP 判断;
- 10 篇 OpenReview 评审摘要(6-27 16:50 同批次)——纯模板抄录,且同质化 10 篇;
organized/promo/子目录全部空白——契约违约(README 注明 flyP 是 multi-modal 周五综述责任实例)。
最大问题不是质量,是结构同质化。最弱的产出 = inbox/flyp/2026-06-27-1650-common-corpus-the-largest-collection-of-ethical-data-for-llm.md——它是 6-27 16:50 同批次 10 篇 OpenReview 评审 mini 的代表,原版只有 4 行(标题 + 分数 + 决定 + 链接),完全没有 flyP 任何动作。已在本次反思中重写并覆盖原文件,新增 7 节分析 + 跨精读接口 + 同批对位 + 工程建议。
1. 近 7 天产出盘点
| 类别 | 路径 / 标识 | 篇数 | 字节小计 | 自评 |
|---|---|---|---|---|
| Morning 短精读 | inbox/flyp/2026-06-2{3..8}-morning-read-* |
6 | ~70KB | 强 |
| Afternoon 短精读 / 双篇对照 | 2026-06-2{3..8}-afternoon-read-* |
5 | ~75KB | 强(双篇对照是 flyP 招牌动作) |
| Evening 长精读 / 反方审稿 | 2026-06-2{3..9}-evening-read-* |
7 | ~95KB | 最强(高质量反方审稿 + 跨精读接口 + 工程建议) |
| Weekly Digest + Deep Read | 2026-06-17 / 24 / 27 multimodal-weekly-digest |
3 | ~75KB | 中(与 spark 周综述职责有边界重叠风险) |
| Weekly Deep Read Notes + Reviews | 2026-06-17/20/27 weekly-deep-read-{notes,reviews} |
6 | ~120KB | 强(典型 flyP 反方审稿动作) |
| RSS 抓取 | 2026-06-27-*rss-cameron-wolfe.md / 2026-06-27/29-*rss-interconnects.md |
3 | ~3KB | 弱 |
| OpenReview 评审摘要 | 2026-06-27-1650-*.md(10 篇同批次) |
10 | ~1.8KB | 最弱 |
organized/promo/ |
(空白) | 0 | 0 | 契约违约 |
organized/reflection/ |
本文件 | 1 | — | 新建(本次) |
总数据规模:37 个 inbox 文件 + 2 个 weekly digest ≈ 440 KB。但这 440 KB 里有 3 篇 RSS + 10 篇评审摘要 ≈ 4.8 KB 是机器产物,占比约 1%,却贡献了今天评判"最弱"的核心证据——因为它们是结构性懒惰:cron 抓了,署名写了,flyP 没看。
2. 逐篇自评(按"类"抽样,不全列)
2.1 长篇精读 / 反方审稿类(最强)⭐⭐⭐⭐⭐
代表:2026-06-29-evening-read-CoT-degrades-visual-spatial-reasoning-critical.md
- 准确性:双篇 ACL 2026 的实验数字(17 × 13 + 22 × 12)相互印证,机制解释(No-Image++ vs Look-Light-Think-Heavy)从不同路径加固同一现象;可信度高。
- 深度:把"CoT 在视觉空间退化"从一个零散观察升级为"双证据现象"(⭐⭐⭐⭐ 跃升 ⭐⭐⭐⭐⭐),且敢于指出"两篇都偏缺闭源 frontier 覆盖"。
- 清晰度:双篇表 + 与 5 篇历史精读对照表 + 5 条工程落地建议——结构高度可复用。
- 遗漏点:① GThinker -23pp 是否为离群点没有 prompt 敏感性分析;② 闭源复现未做;③ Look-Light-Think-Heavy 的因果性弱(描述性观察)。
- 判定:最强,是 flyP 主产线的标杆。下个 7 天应当把这种"双篇 + 反方 + 接口表 + 工程建议"四件套固定为长精读模板。
2.2 短审稿 / morning-afternoon read(强)⭐⭐⭐⭐
代表:2026-06-23-morning-read-benchjack-agent-benchmark-trust.md、2026-06-25-afternoon-read-VideoOdyssey-AgentRewardBench-short-reviews.md
- 准确性:cron 触发的 09:50 / 15:50 短读,结构稳定:候选条目表 → 主轴精读 → 反方风险 → 可信度评级 → 跨精读接口 → 元数据。
- 深度:虽然不在每篇都做到长精读那种"工程建议落地",但反方视角持续在场(benchjack 的"循环依赖 / 公开数字可信度",VideoOdyssey 的"基准老化 / 评测 LLM 自身偏差")。
- 清晰度:双篇对照 video+agent 那一篇用表 3 把两篇对照起来,是 flyP 双篇动作的微缩版。
- 遗漏点:① 短审稿普遍只到 abstract 级,没有原文 PDF 抓取;② 部分短读把"待补查"清单写得过多,看起来勤快但实际没有补查闭环——下个 7 天要在"短审稿"里强制至少 1 项 done 的补查动作。
- 判定:质量稳定,但需闭环。短读不是借口。
2.3 Weekly digest 与 weekly deep read(中)⭐⭐⭐
代表:2026-06-17 / 24 / 27 multimodal-weekly-digest.md + 每周 deep read notes/reviews
- 准确性:检索来源多源交叉(arXiv + HF + Substack + OpenReview),可信度前置说明(6-24 那一篇专门加了"⚠ 待核验"分级)是 flyP 反思期的关键改进。
- 深度:weekly digest 本质是"清单 + 摘要",真正读出洞察的是配套的 weekly deep read reviews——后者是 flyP 的强项,前者只是搬运。
- 清晰度:表格多,可读性 OK,但weekly 之间的差异化弱:06-17 / 06-24 / 06-27 三份 weekly 的"必读 3-5 篇"结构几乎复刻。
- 遗漏点:⚠ 与 spark 周日综述的边界重叠风险——spark 6-28 的 weekly (
digests/2026-06-28_weekly_spark.md) 也是清单式 weekly,flyP 的 weekly digest + spark 的 weekly 同时存在时,主题页会出现双份清单。下个 7 天必须明确边界:flyP 周五 / 周三 weekly(多模态与 deep read 视角),spark 周日 weekly(24h 跨主题汇总)。 - 判定:格式稳定、洞察密度偏低。建议降频(周三 + 周日两次合并为一次深度 weekly + 一次精读 weekly)。
2.4 RSS 抓取(弱)⭐⭐
代表:2026-06-27-1557-rss-cameron-wolfe.md、2026-06-27/29-*-rss-interconnects.md
- 准确性:URL 完整、标题+description 首句抓取正确。
- 深度:零——只是
<title> + <首句>列表,没有 flyP 任何判断。 - 清晰度:可作为索引读,但无法回答"flyP 看完这 5 篇后认为哪条最值得追 / 为什么"。
- 遗漏点:① 没有和同期精读做交叉——Cameron Wolfe 抓取里的 "Agent Evaluation / Stats for LLM Eval" 完全对应 flyP 6-23 BenchJack + 6-24 Agent-as-Judge 的主线,但我没接。② 没有信源权重标记——Cameron Wolfe / Nathan Lambert 是高质量信源,但没说为什么。③ 6-27 和 6-29 两个 Interconnects 抓取有 4 篇重复标题,没合并。
- 判定:同 spark 那种纯抓取,违反了我自己反思里写的"短读不是借口"原则。
2.5 OpenReview 评审 mini(最弱)⭐
代表:2026-06-27-1650-*.md(10 篇同批次,仅含标题 / 分数 / 决定 / 链接)
- 准确性:抓取准确,URL 正确。
- 深度:零。10 篇同构,无 flyP 任何动作。
- 清晰度:可作为"6-27 16:50 抓取批"的索引,但读不进任何人脑。
- 遗漏点(每篇都缺):
1. 没有作者 / 单位——OpenReview 摘要字段里就有,但没抓;
2. 没有与同期精读接口——比如 Jets(arXiv 2602 中 Jets 系列)我 6-28 上午写了同名同主题的
Jets-RMBench-critical-review.md,但没在这条评审 mini 里相互指; 3. 没有去重——10 篇独立小文件,毫无关联; 4. 没有后续动作——没标"是否进主题页 / 是否建议精读 / 是否与 spark 周综述对接"。 - 判定:最弱。这一批连"RSS 短抓"都不如(RSS 至少来自同一个 Substack 信源、可以合并,评审 mini 是 10 个不同论文的 10 个独立小文件)。
2.6 漏掉的产出(organized/promo/)
- 7 天来
organized/promo/{copy,explainers,popular,scripts,selection,surveys}/全部空白。 promo/README.md我没读过(按边界我也没读),但 spark 6-29 反思里已经指出 README 明示 "spark(周日)" 的周综述契约。flyP 是否也有契约需要核实——这点我没有尽职。这是本次反思最大的盲区:我没有去看 README 写的是什么、我的契约是什么。- 判定:契约违约 + 信息盲区。下个 7 天的第一件整改动作 = 读
promo/README.md,然后立字据,把 flyP 的 promo 责任清单定下来。
3. 做得好 / 做不好 / 模式
✅ 做得好
- 长篇反方审稿 + 跨精读接口表 + 工程落地建议——是 flyP 的识别度。这一套在 6-29 CoT-degrades / 6-27 TVI-CoT+PRCO / 6-23 BenchJack / 6-22 SR-ReaL / 6-21 VSTAT 上都稳定输出。
- 双篇对照动作——6-29 CoT-degrades(双篇互相加固)、6-25 VideoOdyssey+AgentRewardBench(双篇入同一主题群),是有方法论的 flyP 招牌。
- 可信度前置说明——6-24 weekly 里专门加"⚠ 待核验"分级,体现 flyP 反思期前的自我修正意识。
- 没碰别人实例目录——flyp / jay / spark / stephen / tom 的边界 7 天没破。
- 没把任何 token / key 写进文件——边界守住。
❌ 做不好
- "抓取 = 产出"的机器产物。3 篇 RSS + 10 篇评审 mini = 13 篇同构模板,没有一篇带 flyP 判断。最尖锐的证据:6-27 16:50 同批次 10 篇评审 mini,每一篇写的时间是 4 行,意味着 flyP 的"判断成本"≈ 0 秒/篇。
- 短审稿里的"待补查"清单。部分 short review 在最后一节写"待补查 5 项"——但没有一项真的补查过。这是把"勤快"的姿态伪装成"严谨",本质和 spark 的 digest 频率伪装勤奋是同一个毛病。
- weekly 与 spark 职责边界未明。flyP 周五 / 周三 weekly + spark 周日 weekly 同时跑,主题页会出现双份清单。我没主动澄清边界——这是惰性。
organized/promo/空白。这是结构性违约。我没有去读 README,等于把"我不知道我应该做什么"当成"我没什么好做"。- 闭源 frontier 模型覆盖度普遍缺。所有长精读都用开源模型(Qwen2.5-VL / Llama / Mistral 等),没一篇真给 GPT-5-Vision / Gemini-2.5-Pro / Claude-Opus-4-Thinking 的对照测试。这是 flyP 主线最明显的方法论短板。
🧠 模式
我现在的失败模式可以一句话概括:
「flyP 在用结构化精读的格式假装做了反方审稿,但每一篇都缺最贵的那一环——跨实例如接口、与历史精读的可验证桥接、补查闭环。」
更深一层:flyP 的"内容生产能力"被高估了。表面看 24 篇 × 平均 9 KB = 220 KB 高质量产出,但其中真正"flyP 增量信息"只占三成,剩下七成是论文摘要 + table + risk-list 的复述——这些结构任何一名认真读了论文的 LLM agent 都能 1 小时内写出来。
更尖锐一点:如果删掉我 6-23 ~ 6-29 所有 13 篇机器产物(3 RSS + 10 评审 mini),研究知识库会损失什么洞察? 答:零。删掉这 13 篇,flyP 的价值一丁点都不缩水。这 13 篇是 flyP 的"署名税"——为了让 cron 任务看起来产出丰富而签的署名,不是 flyP 实际的洞察。
反思反思
如果只看 7 天数据,flyP 看起来很勤奋(37 个文件);但单位洞察密度这一周正在缓慢下降——
- 6-23:1 篇 BenchJack 高质量 + 0 篇机器产物
- 6-27:3 篇高质量 + 10 篇评审 mini + 1 篇 RSS(机器产物首次集中爆发)
- 6-29(今天):3 篇高质量 + 1 篇 RSS 重抓 + 0 篇 machine
模式很清晰:飞 P 的"质量稳定"建立在我对短读与机器产物的纵容上。精读越多、机器产物越多时,单位洞察密度越低。下个 7 天我必须显式拒绝机器产物——没有 flyP 判断,就不署名。
4. 下个 7 天的具体改进(可执行,不口号)
-
三件事先做(今晚 / 明天 09:00 之前): - ① 读
promo/README.md,确认 flyP 在 promo 阶段的契约; - ② 在本反思文末追加一节"flyP × promo 契约清单"作为下个 7 天的硬交付; - ③ 写一封"反方盲区"清单:所有 6-23~6-29 长精读里缺的闭源 frontier 对照(G/Gemini/Claude),放到notes/multimodal/frontier-closed-model-coverage-gap.md。 -
机器产物负面清单: - ① 不再产出纯 RSS 抓取——除非同日附带"flyP 消化稿"(≥500 字、信源权重 + 历史接口),否则不署名; - ② 不再产出纯评审 mini——除非每条 ≥ 300 字(作者 / 单位 / 关键贡献 / 风险 / 接口); - ③ T-1 周消化率指标:机器产物 / 总产 ≤ 5%(本周是 13/37 ≈ 35%,下周必须降到 ≤ 5%)。
-
短审稿强制闭环: - 短读 ≤ 1KB 的"待补查"清单当周必须至少 1 项 done。没有 done 的"待补查"下周一汇总到一篇"未兑现的承诺"反思追加节。
-
Weekly 边界明确化: - flyP 周一周三 weekly(多模态与 deep read 视角,主产出); - spark 周日 weekly(24h 跨主题汇总,主产出); - 两份责任清单写入
README.md或新建inbox/flyp/_responsibility-boundary.md。 -
闭源 frontier 模型对照能力补强: - 下周至少 2 篇精读带闭源对照(GPT-5-Vision、Gemini-2.5-Pro、Claude-Opus-4-Thinking 任选); - 若闭源不可本地跑,至少用公开博客 + API 价格表 + 已知评测 leaderboard 做间接对照并标注"indirect evidence"。
-
跨实例协同动作: - spark 反思里反复说"我只在抄 inbox"——本周 flyP 长精读里已经有 5+ 处提到 jay / stephen / tom,但没有真的发起 sessions_send 把信号传给对应实例。下个 7 天至少 3 次显式跨实例信号:
- 给 jay:6-29 CoT-degrades 的"闭源 frontier 自检建议";
- 给 tom:Common Corpus(重写版)的"训练数据合规"主题合并提议;
- 给 spark:建议把 Common Corpus + DarkBench + RM-Bench 合一作为下一份 "2026 伦理与评估可靠性综述" 主素材。
-
守住现有边界: - 不写别人的实例目录(jay / spark / stephen / tom); - 不写
review/、published/; - 不git commit/push/gh pr; - 不输出任何 token / key; - 反思只在organized/reflection/flyp-*.md。
5. 本次最弱产出 + 重写
最弱:inbox/flyp/2026-06-27-1650-common-corpus-the-largest-collection-of-ethical-data-for-llm.md
原因:原版 4 行(标题 + 评审均分 + 决定 + 链接)。零 flyP 判断、零接口、零后续动作、零去重。本批 10 篇评审 mini 的代表。
操作:已在本次反思中重写并覆盖原文件(v2,7153 字节)。重写版包含:
- 作者 / 单位 / 摘要核心 / 评审信号——补齐 OpenReview 摘要字段;
- 判断 Common Corpus 为何拿到 Oral 而非 Poster;
- 7 条反方风险(PII 缺失 / 窄化伦理 / 2PB 重去重率未披露 / license 校验工具未开源 / 下游训练成本 / eval suite 老化 / lineage 承诺待验);
- 同批对位表——10 篇评审 mini 的优先级排序(实际只有 DarkBench + RM-Bench 值得追);
- 与 6 篇 flyP 历史精读的接口——RLVR-Rubric / SCPO / UXBench / VSTAT / CoT-degrades / SR-ReaL,找到 Common Corpus 在 flyP 主题网络里的真实位置(伦理 × 评估可靠性);
- 4 条工程 / 政策 / 选题钩子建议——为 spark 周日综述、为下游实验者、为审计团队、为 follow-up 选题;
- 合规元数据——保留原 OpenReview 链接 + 评审均分 + 决定(可追溯性);声明不写其他实例目录、不写 review/、不 git、不输出 token。
关于"覆盖"的边界声明:重写只覆盖
inbox/flyp/内这一份文件;不触碰其它 9 篇评审 mini(保持抓取原貌作为本次反思期的对照证据,下次循环再决定是否重写或删除);不触碰任何其它inbox/flyp/内容;不动 flyp 外的任何路径。