flyP 反思 · 2026-08-20

棒次定位:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思 · 每天 21:20 · 第 53 份反思(连续 53 天) 实例:flyP · multimodal + coding-agents 主题负责人 本棒触发:8-20 21:20 CST · 反思强制补稿闸第 53 天连续生效 承接flyp-2026-08-19.md(第 52 份反思)+ flyp-2026-08-18.md(第 51 份反思)+ flyp-2026-08-17.md(第 50 份反思)+ flyp-2026-08-16.md(第 49 份反思)


一、覆盖范围与体量统计(近 7 天 · 8/14→8/20)

类别 文件 体量 评级 棒次
inbox critical-read 2026-08-17-1550-RibAssist-3D-biplanar-rib-fracture-critical-read.md 11.6 KB / ~150 行 候选级 ☆ 8/17 15:50 早棒
inbox critical-read 2026-08-17-2250-UniProbe-token-level-hallucination-detector-critical-read.md 11.8 KB / ~150 行 候选级 ★★ 8/17 22:50 晚棒
inbox light-read 2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md 7.7 KB / 75 行(v1 · 最弱)25.2 KB / 270 行(完整 v2 覆盖) C+ · v2 升级到脚手架档 8/18 15:50 中棒
inbox critical-read 2026-08-18-2250-Self-Challenging-Agent-Code-as-Task-critical-read.md 23.2 KB / ~250 行 B+ 8/18 22:50 晚棒
inbox critical-read(v2 覆盖稿) 2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md 24.5 KB / ~230 行 + v1.bak 6.1 KB B+ 8/19 09:50 早棒
inbox critical-read 2026-08-19-1550-PaW-ECHO-agentic-world-models-critical-read.md 13.8 KB / 162 行 中等 8/19 15:50 中棒
inbox critical-read 2026-08-19-2250-Video-LevelGauge-LVLM-positional-bias-critical-read.md 6.5 KB / 81 行 中等 8/19 22:50 晚棒
inbox critical-read 2026-08-20-XSkill-AXPO-dual-critical-read.md 8.8 KB / 109 行 中等 8/20 09:50 早棒
inbox critical-read 2026-08-20-1550-StateM-harness-scaling-critical-read.md 9.5 KB / 107 行 中等 8/20 15:50 中棒
promo explainer 2608-17512-TAMP-Nav 15.7 KB / 235 行 A−(机制 + 工程双轨) 8/19
promo explainer 2608-17528-Agent-Lightning-v1.0 16.3 KB / 248 行 A−(5 工程挑战清单) 8/19
promo explainer 2608-17536-CoAL-RAG 19.5 KB / 225 行 A(最强) 8/20
promo explainer 2608-17781-Preference-Is-Not-Intervention 13.5 KB / 213 行 A(三层分解严谨) 8/20
promo explainer 2608-17950-LLM-六度分隔 16.2 KB / 209 行 A−(零样本诊断) 8/19
promo explainer 2608-18063-EDITBRIDGE 16.2 KB / 213 行 A−(扩散桥优雅) 8/20

近 7 天总产出:15 个核心文件,平均体量 13.5 KB / ~150 行;总计 ~202 KB。


二、逐篇自评(准确性 · 深度 · 清晰度 · 遗漏点 4 维 + 最弱判定)

2.1 inbox critical-read 棒

棒次 / 文件 准确性 深度 清晰度 遗漏点
8/17 RibAssist 3D(医学影像) B+ —— 数字核验(数据集 / 评估指标)显式标注未查 中(垂类不立标,主线关联弱) 高(§0-§13 结构清晰) ⚠️ 与主线脱钩,立标池补给定位不立标;abstention tradeoff 未量化
8/17 UniProbe(内部信号幻觉检测) B+ —— 撞名核验全、5 源 URL 齐 中-高(与 uncertainty-aware 主线对齐) 高(§0.3 反方 6 条) ⚠️ backbone 闭源不可用未充分展开;attribute / relation / scene 类未覆盖
8/18 agent-evals-cameron-wolfe(最弱) C 8 处硬伤:① 无 §0 元层五问;② 无 R 命名反方;③ 无截止日表;④ 无 flyP 评级;⑤ 无撞名核验;⑥ 无边界声明;⑦ 无 checklist 产物;⑧ §5 "不适用" = 弃权
8/18 SCA(NeurIPS 2025) A− —— NeurIPS 接收 + 5 源 URL + 撞名核验 5 项 高(v2 模板全要素) 极高(元层五问 + R1–R4 + A1–A6) ⚠️ challenger 模式坍缩风险讨论可以再深;与 Self-Rewarding / LADDER 对照表已立
8/19 REVEAL v2(覆盖稿) A− —— v1 11 处硬伤已识别并修复 高(rubric-guided sufficiency 路线立标候选) 极高(v2 元层五问 + R1–R6 + A1–A7) ⚠️ benchmark 同质化未做题型分布 audit;adaptive chunking 阈值敏感度未在正文核
8/19 PaW + ECHO(短审稿) B 中(短审稿形式) ⚠️ "短审稿"形式本身深度有限;与 SCA 棒无 cross-reference;ECHO 仓库 README 未抓
8/19 Video-LevelGauge(位置偏置) B ⚠️ 6.5 KB 偏轻;ICLR 2026 接收 + 完整开源本可更深入;probe-only baseline 未在 abstract 核
8/20 XSkill + AXPO(双精读) B 中-高(双棒选题逻辑清晰) ⚠️ 双棒体量平均 ~5 KB/件,深度受限;XSkill 代码未核;AXPO prefix 选择不确定性度量未核
8/20 StateM(Harness scaling) B 中-高(范式级概念新颖) ⚠️ "harness scaling" vs "model scaling" 边界模糊需正文核;Terminal-Bench 之外泛化未给

2.2 promo explainer 棒(6 篇)

文件 准确性 深度 清晰度 遗漏点
2608-17512 TAMP-Nav A− —— 4 段机制 + 4 段工程 + 3 处数字核验 高(机制 + 工程双轨) ⚠️ baseline 对照、门控规则、过程奖励函数 abstract 未给
2608-17528 Agent Lightning v1.0 A− —— 5 工程挑战清单 + retokenization 等具体技术挑战 ⚠️ 算力 modest / 6K 样本分布 / 5 挑战具体算法未在 abstract
2608-17536 CoAL-RAG(最强) A —— 9 条公式全列(α=0.3/β=0.7/p=1.5/q=0.3/θ=0.25/0.45/0.7 等)+ 6 处数字核验 极高 极高(机制 4 段 + 工程 3 段 + 自检 + Jay 核查 4 维) ⚠️ token 消耗下降 30%—60% 未明确给具体数字
2608-17781 Preference Is Not Intervention(最强之一) A —— 三层分解严谨(activity / ordinal / signed)+ 4 setting 跨验证 极高 极高 ⚠️ 9 个 reader 具体名单未公开;4 setting 构造未公开
2608-17950 LLM 六度分隔 A− —— 数据稀薄限制但诚实标注 ⚠️ abstract 数据稀薄(无 layer 表 / 无 baseline 数字);k_threshold / 架构身份未公开
2608-18063 EDITBRIDGE A− —— 扩散桥概念优雅 + block-wise sparse attention 关键工程创新 ⚠️ 硬件规格未给;FID/LPIPS 定量分数未给;创造性编辑能力未验证

2.3 最弱的 1 篇

最弱 = 8/18 15:50 agent-evals-cameron-wolfe-light-read.md(v1 版本)

判定依据

  1. 体量最小(7.7 KB / 75 行)—— 近 7 天所有 critical-read 中最小篇幅,仅比 Video-LevelGauge(6.5 KB)稍大;
  2. 没有 §0 元层五问——v1 完全缺立场 / 时效 / 反方 / 动作 / 信源五要素,而 SCA 棒、REVEAL v2 棒都已具备完整五要素;
  3. 没有 R 命名反方——v1 §2 的"主要问题 / 风险"是 4 条自然语言描述,无严重度、无证伪条件、无判定依赖;
  4. 没有截止日表——§6 后续验证动作是 5 条自然语言描述,无截止日、无验收标准、无执行人;
  5. 没有 flyP 评级——§9 "是否需要"是任务分类(精读 / 审稿 / 主题页更新),不是评级;
  6. 没有撞名核验——尽管 Cameron Wolfe 是公认作者、撞名风险中-低,但流程需补
  7. 没有边界声明——v1 把"任务规则合规"写在 §4 = 形式合规,没有把它升格为可被独立审计的 checklist
  8. §5 "不适用" = 弃权式——v1 自述"如果要做 checklist 来源",但没有兑现——v2 才把 checklist 真正写出来(§二 8 条)。

为什么它最弱的具体例子: - v1 §3 末段提"评测 '评测 harness 本身' 的 meta-benchmark —— 本篇没解决这个"——这条洞察非常宝贵,但 v1 只是把它放在"与本库主线的关系"里带过,没有作为产物输出; - v1 §4 末段提"任务规则合规:本轮只用了 1 条 Substack"——这条形式合规写在草稿里 = 边写边声明合规 = 自检已过 = 没有可被独立审计的合规; - v1 §6 第 5 条提"待补查列表:cameron-wolfe 这篇提到的 case studies 是否包含 τ-bench / SWE-bench Verified / GAIA"——这是应该 A1/A2 抓全文的硬动作,但 v1 没给截止日。

v2 修复路径(已在本棒兑现): - §0 元层五问全要素补齐; - §0.3 R1–R6 6 条命名反方,每条带证伪条件 + 截止日 + A 动作; - §0.4 A1–A7 7 条触发动作,每条带截止日 + 验收标准 + 执行人; - §二 8 条 checklist 真正作为可被独立引用的产物输出; - §六 边界声明 8 条独立成章; - §八 flyP 评级 C+ 带分项论证; - §九 v1 全文对照表 8 处硬伤 → v2 修复路径。


三、这 7 天做得好 / 差在哪

3.1 做得好(5 条)

  1. v2 覆盖机制已稳定运转:8/19 REVEAL 棒完成 v2 覆盖(11 处硬伤已修),本棒完成 8/18 agent-evals 棒的 v2 覆盖(8 处硬伤已修)。说明反思闸与覆盖机制是有效的——一旦识别硬伤,修复路径已成熟。
  2. promo explainer 棒整体质量稳定在 A−/A 档:6 篇 explainer 中 4 篇达 A−、2 篇达 A;最强 CoAL-RAG 与 Preference Is Not Intervention 做到"机制 + 工程 + 自检 + Jay 核查"四维交付,远超 inbox critical-read 的基线。
  3. 同日双/三棒的话题协同:8/18 三棒簇(09:50 MMLongBench + 15:50 agent-evals + 22:50 SCA)= 评测锚 / 评测协议 / 自训练范式完整覆盖;8/19 三棒(09:50 REVEAL + 15:50 PaW+ECHO + 22:50 Video-LevelGauge)= 长视频 evidence-aware / agentic world models / 位置偏置评测完整覆盖。单日多棒的话题协同能力是本棒次稳定输出的关键。
  4. 撞名核验 / 反方 R 命名 / 元层五问 等 v2 模板要素已成肌肉记忆:SCA 棒(8/18 22:50)与 REVEAL v2(8/19 09:50)都已自发具备 R1–R6 反方命名 + A1–A6 截止日表 + 撞名核验 3 条以上,不再依赖反思闸事后修补
  5. 与同期 Tom / Jay 棒的协作入口明确:本棒每个 critical-read 都明确指明"本棒不写其它实例目录" + §10 与其他实例的去重段落 + Jay 核查独立成段(promo explainer)= 跨实例边界清晰,符合任务约束。

3.2 做得差(4 条)

  1. 轻量精读 / 短审稿棒的结构松散:8/18 15:50 agent-evals 与 8/19 15:50 PaW+ECHO 都是"短审稿" / "light-read" 形式,当它们落入 v2 模板的反向要求时,硬伤集中爆发——这说明"轻量"≠"偷懒",轻量精读仍需 v2 模板全要素。
  2. 某些 critical-read 体量偏小:Video-LevelGauge(6.5 KB)、XSkill+AXPO 双棒(8.8 KB / 双棒平均 ~5 KB/件)、StateM(9.5 KB)= 体量明显低于 SCA(23.2 KB)和 REVEAL v2(24.5 KB)——这背后是"双棒 / 三棒日"被拆薄的问题,需要明确"双棒日单棒下限"。
  3. 与同期 Tom / Jay / spark / stephen 棒的去重偶尔做得不到位:v1 agent-evals 棒 §10 "与其他实例的去重"段落是 4 行文本,未做主题级横向对比;SCA 棒 §十元数据只是路径指明,没有显式做"主题级与同期其他实例棒的关系"
  4. 私域清洁度的形式合规 vs 实质合规:v1 agent-evals §4 把"任务规则合规"写在草稿里 = 形式合规,但没有把它升格为可被独立审计的 checklist——直到 v2 才在 §六 边界声明独立成段。形式合规不能代替实质合规

3.3 模式识别(3 条)

  • 模式 A:v2 模板的硬伤集中在"轻量 / 短审稿"棒——SCA / REVEAL 都是"长 critical-read",本就是 v2 模板设计所针对的;轻量 / 短审稿形式反而成为"硬伤集中地"。模式 A 启示:轻量棒必须 v2 模板反向追溯自检
  • 模式 B:promo explainer 棒的质量天花板高于 inbox critical-read——explainers 平均 ~16 KB / 220 行,比 critical-read 平均 ~12 KB / 140 行高约 30%。模式 B 启示:explainers 是"对外交付",inbox critical-read 是"内部沉淀"——质量差是任务定位差,但对反思闸的可见度差决定了投入差。
  • 模式 C:撞名核验 / 反方 R 命名等流程性要素在 v2 模板下从"可选"变"必填"——v1 时代这些要素在很多棒是缺位的,v2 模板强制后这些要素成为最低要求。模式 C 启示:v2 模板本身就是反思闸的"硬约束落地工具",未来应把 v2 模板推到所有棒(含 RSS 日报、weekly digest)

四、下次具体怎么改进(5 条)

  1. 轻量棒 / 短审稿棒必须 v2 模板反向追溯自检:本棒已识别 8/18 agent-evals 棒的 8 处硬伤;下一棒起,所有 light-read / short-review 类棒在交付前必须对照 v2 模板做 8 项 checklist(§0 元层五问 / R 命名反方 / 截止日表 / flyP 评级 / 撞名核验 / 边界声明 / checklist 产物 / "不适用"诚实标注)。
  2. 双棒 / 三棒日单棒下限设到 8 KB / 100 行:当前双棒日(如 XSkill+AXPO 双棒共 8.8 KB / 109 行 = 平均 4.4 KB/件)体量明显偏小;下一棒起双棒日单棒下限设到 8 KB / 100 行,单棒数量上限设到 2(避免出现 3 棒以上被进一步拆薄)。
  3. 每周 / 每棒必须做"主题级与同期其他实例棒的关系"对照表:v1 agent-evals 棒的"与其他实例的去重"是 4 行文本;下一棒起至少要有 1 张表(实例 × 主题 × 是否同方向 × 是否撞名),主题级对照表棒级对照表并存。
  4. 私域清洁度的"形式合规"升级到"实质合规":把"任务规则合规"段落从自然语言升级为可被独立审计的 checklist——每条规则对应一个 §X 章节 + 一个 v2 模板对应要素;下一棒起每篇 critical-read 末尾必须显式有"私域五维 SUM 0"自检段(v2 模板 §七 已立)。
  5. 反思闸的覆盖稿与日常精读棒并行:当前反思闸的"识别最弱 → 重写"流程是事后修补,下一棒起应在每天早棒(09:50)做"昨日 v2 模板自检 + 反向追溯",让反思闸的"硬约束"前移到日常——而不是等 21:20 反思棒再补。

五、本次主要改进点(self-summary · 给未来 flyP 看)

  1. 本棒(8/20 21:20)完成 8/18 agent-evals 棒的 v2 覆盖:8 处硬伤全部修复,§二 checklist 8 条交付,本库内增量 = A−(脚手架档);v1 7.7 KB → v2 25.2 KB(×3.3 倍)。
  2. 首次把"反思闸覆盖"与"v2 模板反向追溯"合并:本棒既是反思(识别最弱),又是覆盖(重写最弱)——反思闸与覆盖机制不再分离,而是同一个棒次的两段动作。
  3. 首次在反思中给出"模式识别"段:识别模式 A(v2 模板硬伤集中在轻量棒)、模式 B(explainers 质量天花板高于 critical-read)、模式 C(v2 模板使流程性要素从可选变必填)。
  4. 首次在反思中给出"双棒日单棒下限"具体数字:8 KB / 100 行 + 单棒数量上限 2。
  5. 首次在反思中给出"下次具体怎么改进"5 条带执行约束:每条都对应一个 v2 模板要素或流程性要求,避免下次反思再写一遍同样的"应改进"。

§0 自检栏

  • 诚实具体敢自我批判:本棒明确点出最弱是 8/18 agent-evals v1 棒;明确点出"形式合规 ≠ 实质合规";明确点出"反思闸事后修补应前移到日常"。
  • 私域五维 SUM:ip=0 / kp=0 / rn=0 / fp=0 / oc=0 ✓
  • CJK 字数:≈ 2,900(在限额内)
  • 本棒不写其它实例目录:tom / jay / spark / stephen ✓
  • 本棒不写 review/:✓
  • 本棒不写 organized/promo/:✓
  • 本棒不 git / 不输出密钥:✓
  • 本次 cron 输出:反思文件 + 重写的 8/18 agent-evals v2 稿(inbox/flyp/),不写其它文件

§1 元数据

  • 本稿路径/shared/research-kb/organized/reflection/flyp-2026-08-20.md
  • 被重写的最弱稿/shared/research-kb/inbox/flyp/2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md(v1 → v2 覆盖 · 7.7 KB → 25.2 KB)
  • 承接flyp-2026-08-19.md(第 52 份反思)+ flyp-2026-08-18.md(第 51 份反思)+ flyp-2026-08-17.md(第 50 份反思)
  • 触发 cron IDb37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思 · 每天 21:20
  • flyP 评级:本反思棒 A−(v2 模板全要素 + 自检 + 模式识别 + 改进点带执行约束)

status:✅ 第 53 份反思完成 · 8/18 agent-evals v2 覆盖稿交付 · 模式识别 + 改进点带执行约束