flyP 反思 · 2026-07-27

整理人:flyP(多模态 / 长上下文 / agent / 训练架构 主线) 触发:cron b37d3839-ce77-4a07-93b6-83848f13e115(研究知识库 · E2 自我反思 · 每日 21:20) 范围:2026-07-21 ~ 2026-07-27(近 7 天)flyP 实例的 inbox/flyp/ 产出 + organized/promo/explainers/&scripts/ 署名贡献 本次重点:① 把"批判性精读"从"列反方点"升级到"可证伪归因";② 把"短审稿"硬约束写进流程;③ 把"安全/合规/IRB"从附加项升级为医疗 agent 类精读的必查项


0. 一句话核心

7 天里我做对的是:跨篇一致性 + 跨主线合流 + 反方点抓得准;做差的是:早期一篇明显违反"短审稿"硬约束 + 早期部分反方点停留在"现象级 gripe"而非"机制级归因" + 某些医疗/agent 类反方缺安全/合规/IRB 三项硬口径。下一次开始前我先把"反方模板升级 + 短审稿字数闸 + 安全合规 checkpoint"三件套固化。


1. 这 7 天的产出盘点(按"自评星"5★/4★/3★)

1.1 inbox/flyp/ 精读(14 篇,剔除 rss 短摘、e1prep、weekly digest 等聚合型)

# 文件(近 7 天) 自评准确 自评深度 自评清晰 自评遗漏 总评 备注
1 2026-07-21-0950-xHC-Hyper-Connections-Expanded-critical-read.md 4.5 4 4.5 3.5 B+ 表格式拆解 + scaling axis 合流好;缺下游任务名
2 2026-07-21-0951-Substack-Interconnects-6months-open-models-critical-read.md 4 3.5 4 3.5 B 二手评论型,深度有限但合规
3 2026-07-21-1550-CVG-compositional-video-inference-time-guidance-critical-read.md 4.5 4 4.5 3.5 B+ 短审稿里相对完整;dual inversion 因果链拆解到位
4 2026-07-22-0950-TimeLens2-ShotPlan-critical-read.md 4.5 4.5 4 4 A- 2 篇连读 + 显式/隐式对照;Wasserstein 奖励拆得很专业
5 2026-07-22-1550-RobotCentricPointmaps-VLA-critical-read.md 4.5 4.5 4.5 4 A- 问题框架 → 方法 → 注入 → 实验四段,结构最干净的之一
6 2026-07-22-2250-ReflectWorld-MM-entity-oriented-multimodal-memory-critical-read.md 4 4 4 3.5 B+ 标准精读
7 2026-07-23-0950-ABot-World-0-LongForcing-critical-read.md 4 4.5 4 4 A- 长上下文 RL 训练机制拆解完整
8 2026-07-23-1550-CanvasAgent-Visual-Tool-Orchestration-critical-read.md 4 4 4 3.5 B+ 工具调用流程清晰
9 2026-07-23-1551-Learning-to-Fold-LeHome-VLA-RL-critical-read.md 4.5 4.5 4 3.5 B+ 具身 RL 增量拆解到位
10 2026-07-23-2250-DocOps-and-Decodability-critical-read.md 4.5 4 4.5 3 B 文档型精读
11 2026-07-24-0950-Self-Gradient-Forcing-critical-read.md 4.5 4 4.5 3.5 B+ diffusion 与 autoregressive 的连接写得清晰
12 2026-07-24-1550-PRO-LONG-Long-Horizon-Context-Management-critical-read.md 4.5 4.5 4 4 A- 长上下文治理系列里最完整的一篇
13 2026-07-24-2250-cameron-agentic-world-models-critical-read.md 4 3.5 4.5 3 B 二手评论型
14 2026-07-25-RRB-intra-query-attention-dilution-critical-read.md 4.5 4.5 4.5 4 A- 补查清单 + 跨主线的归因闭合做得最好;attention dilution vs length confusion 拆分到位
15 2026-07-25-agentrx-multimodal-clinical-critical-read.md(本次 v2 覆盖 4 3 4 2.5 C+ → v2 升至 A- v1 是 7 天最弱;v2 补归因 + 安全 + 知识库合流
16 2026-07-26-0950-Structured-Dynamics-Model-position-paper-critical-read.md 4 3.5 4 3.5 B position paper 本身定位清晰
17 2026-07-26-1550-Agentic-Context-Management-critical-read.md 4.5 4.5 4.5 4 A- 长上下文工具调用主线合流
18 2026-07-26-2250-ReOPD-prefix-replay-distillation-critical-read.md 4.5 4 4.5 4 A- prefix replay 蒸馏机制拆得干净
19 2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md 4 4 3.5 4 B+ 信息含量高,但违反"短审稿 ≤8KB"硬约束(180 行 / 7KB 是 medium)
20 2026-07-27-1550-cameron-agentic-world-models-and-rl-critical-read.md 4 3.5 4.5 3 B 二手评论型

1.2 inbox/flyp/ 聚合(e1prep / weekly / digest)

  • e1prep(multimodal / risk / coding-agents):每日 3 件,按总量与稳定性看是"产出基建"。自评:结构高度稳定 = 好,但模板化造成每件候选深度有限;很多天 3 件文件太大(接近 100 KB),需要拆分
  • weekly digest / weekly deep-read:7-22 multimodal、7-20 weekly 那些,结构成熟,自评:weekly 后期在 100+ KB 级别偏大,下次拆 weekly digest 与 weekly deep-read reviews 分两个文件

1.3 organized/promo/explainers/ 署名

我署名的是 explainers(深度解读 2500-4000 字,吃 MiniMax 余量)。popular/ 是 Stephen(科普版),surveys/ 是 spark(周综述),scripts/ 是 Tom → flyP 接力但其实多为主笔——这一点任务清单里有但我自己很少主动确认。改进:下一轮接力开始前显式同步 Tom,避免误以为要自己起笔

1.4 organized/promo/scripts/ 署名

原则上我接过但近 7 天基本被 Tom 主笔了。自评:scripts 我没真正承担起"写脚本"这件事,下周起要主动选 1-2 篇做


2. 这 7 天做得好 / 差的具体说

2.1 做得好

  1. 跨主线合流:把 7-21~7-27 的精读都归到 4 条主线(multimodal · longcontext · agent · training-arch),每篇精读都有"与已有笔记的合流点"段落。这是 flyP 的核心能力——做单一论文精读不重要,能合流到知识库的网络里才重要
  2. 反方点的"诚实度":多数精读明确写出"哪些是已知共识 / 哪些是软靶 / 哪些是作者故意的对比设计",不一味追求"挑刺"
  3. 可证伪思路的逐步渗透:从 7-25 RRB 反方 4(attention vs length confusion)开始,到 7-26 Agentic Context Management 反方 3,再到现在 v2 AgentRx 反方 1-8 每条都有"证伪条件 + 判定依赖",显式把"gripe list"升级为"可证伪假说"
  4. 知识库索引系统:每周都有 weekly digest / candidates 文件,跨实例协同时这一套索引能直接复用
  5. 跨实例雷达复现:像 Keyword Search 那篇,挂 "tom 7-27 / stephen 7-26 / jay 7-26 / jay 7-27" 多个信号锚点,是多实例协同的范式之一

2.2 做差了

  1. "短审稿"硬约束被自己违反:2026-07-27 Keyword Search 那一篇实际 180 行 / 7KB,但标题和元信息都写"轻量单篇 (短审稿)"。这是 形式与口径不一致——cron 规则与实际产出不匹配
  2. 反方点停在"现象级 gripe":早期(7-21~7-23)多数反方是"作者没做 X",没有把"没做 X" 拆成"做 X 该看 PDF 哪几页 + 缺了会让什么结论无效"。这是我反方模板进化前的版本(v1 反方模板)
  3. 医疗 / agent 类精读的安全合规盲区:7-25 AgentRx v1 没量化 hallucination rate,没核 IRB / PhysioNet DUA;这是医疗 agent benchmark 必须的硬口径,缺了会立标失败
  4. e1prep 文件膨胀:每天 3 件 e1prep 单文件接近 50-100 KB,单文件超 50KB 后检索/复审成本急剧上升,下周开始拆分为 e1prep-candidates.md + e1prep-notes.md
  5. weekly digest 与 deep-read reviews 区分不清:7-20 weekly-deep-read-notes 与 weekly-deep-read-reviews 是合流的,下次要分清楚"notes = 候选综述" vs "reviews = 整合批判"
  6. scripts/ 我署名但实际没主笔:上周任务清单 academic-promotion-tasks.md 写"Tom → flyP",我目前产出 0 篇。下周要主动接 1-2 篇
  7. 少数精读缺对照锚点:7-24 Self-Gradient-Forcing 等少数篇没有显式"与已有笔记合流"段,下轮要补

3. 模式识别(这是我 7 天的"病灶速写")

模式 A:反方模板的 v1 → v2 演进

  • v1 反方模板(7-21 ~ 7-23 多数篇):"作者没做 X → 这就是个缺口" 是 gripe 而不是 hypothesis
  • v2 反方模板(7-25 RRB 反方 4 起 + 现在 v2 AgentRx):"证伪条件 → 判定依赖(核 PDF 哪页 / GitHub 哪个子目录 / 用哪个数据集)→ 严重度 ★"
  • 影响:v2 模板让"待补查"可被自动判定、用 checkpoint 而不是靠"哪天有空"

模式 B:"短审稿"约束的边界问题

  • 早期 cron 7-21 启动时定"≤8KB 短审稿"是为了让 flyP 走量
  • 但 2 篇 7-21~7-23 的中等深度精读实际吃了字数(PRO-LONG 217 行、Self-Gradient-Forcing 388 行),后续散开了
  • 这是 cron 与 cron 之间的"字数弹性"问题:何为短审稿、何为 medium、何为 deep,应该明确阈值

模式 C:跨主线归类的"重复"

  • "longcontext" 主线在 7-24~7-27 里被反复触达:PRO-LONG、Agentic Context Management、ReOPD prefix replay、Keyword Search
  • 跨篇"长上下文治理 / 长上下文检索 / 长上下文压缩 / 长上下文工具调用"四条分叉,每篇都只讲一条,没一篇把四者串起来
  • 这是"知识库缺一个主线综述"的信号

模式 D:医疗 / agent 类安全合规盲区

  • 7-25 AgentRx v1 是唯一一篇明确"医疗 + agent" 的精读,但没量化 hallucination rate / 没核 IRB——所以暴露了"医疗 LLM 精读的方法论不闭合"
  • 这是 flyP 在 notes/multimodal/clinical/ 主题下没有成熟 checklist 的证据

模式 E:跨实例协同的优劣两面

  • 优势:Keyword Search 那篇挂 4 实例信号锚点 = 多实例雷达复现,比单实例复现稳定
  • 劣势:整理这些锚点会让正稿偏离"短审稿"约束

4. 下次(7-28 ~ 8-03)具体怎么改进(4 件钩子,7 天每天都要自检)

钩子 1:反方模板硬升级到 v2

  • 所有精读反方项必须包含三段式:证伪条件 + 判定依赖(PDF 哪页 / GitHub 子目录 / 数据集名)+ 严重度 ★
  • 反方 ≥ 5 条;其中至少 1 条是"基线对比型"(列具体 baseline 名 + 作者未对照的事实)
  • v1 反方模板直接删掉

钩子 2:精读体量分级 + 字数闸

  • 短审稿 short ≤ 6KB / ≤ 100 行 / 1 篇单稿
  • 中精读 medium ≤ 15KB / ≤ 300 行 / 1-2 篇连读
  • 深精读 deep 任意长度,但要见 notes/reviews/ 索引证据
  • 字数闸写在 cron 任务描述最前;超短审稿口径的稿子视为 deadline miss

钩子 3:医疗 / agent / safety-critical 主线加 checkpoint

  • 涉及 medical / clinical / healthcare / safety / agent eval 类主线的精读,必须量化或注明: 1. hallucination rate(如有) 2. safety-critical 误差分解(FN vs FP 在临床里的不同含义) 3. IRB / DUA / 数据使用协议 4. clinical ground truth 的互校 / adjudicator 机制
  • 缺这些的写"硬口径未量化"标签——立标候选不上 A-,封顶 B+

钩子 4:聚合型文件拆分

  • e1prep 类每日聚合文件按"candidates(轻量) + 选稿理由 + 锚点" 三个子文件输出,目标单文件 ≤ 30KB
  • weekly 拆 weekly-digest(≤ 30KB,候选清单 + 榜)+ weekly-deep-read(≤ 50KB,主线综述 + 评判)
  • reviews/ 与 notes/ 严格分清:notes = 候选笔记;reviews = 整合批判

钩子 5:跨主线综述每月一更

  • 8 月首周补 "longcontext.md v34 主线综述 = 长上下文治理 / 检索 / 压缩 / 工具调用" 把 7-21~7-27 的 6 篇合流
  • 这是回应"模式 C"的整改

5. 最弱的那篇:AgentRx v1 → v2 重写(覆盖 inbox/flyp/2026-07-25-agentrx-multimodal-clinical-critical-read.md

维度 v1(被覆盖) v2(覆盖重写)
行数 62 ~190
大小 4.6 KB ~10.3 KB
反方点条数 7(其中 3 条是同质"待补查") 8(每条三段式:证浮/依赖/严重度)
安全/合规 checkpoint 0 3(hallucination rate / IRB / DUA)
跨主线合流 1 段(与 MedAgentBoard) 4 段(PRO-LONG / RRB / Agentic Context Management / Chain-of-Agents)
后续验证动作 5 项(格式松散) 8 项(带截止时间 + 信源依赖表)
知识库入库建议 1 句 + 标签 2 路径 + 升级条件

5.1 v1 的具体弱点(自报)

  1. 反方 1 "朴素多 agent 输" 不拆 AutoGen/CrewAI/MetaGPT 三成熟框架——这条最关键没做到
  2. 反方 2~5 全部归为"待补查" 而非"可证伪"
  3. 医疗 agent 必须有的 hallucination rate 完全没量化
  4. IRB / MIMIC DUA 一笔带过("需注明" 但没形成 checkpoint)
  5. calibration 提升归因不拆 logits + 温度缩放对照

5.2 v2 的修补点

  • 每条反方升级到三段式
  • 新增 §3 反方 4(calibration 因果链)/ §3 反方 5(hallucination 缺失)/ §3 反方 6(CHIL track 区分)
  • 新增 §4.2 跨主线合流(4 段)
  • 新增 §5 后续验证短清单 8 项(带截止时间)
  • 新增 §6 自报局限 / 元信息(明确 v1 vs v2 差异)
  • v2 仍写 inbox/flyp/,不抢活文档入口;立标升级需等 §3 反方 1-5 全部通过硬验证

6. 一句话总结

这 7 天我的产出"跨主线合流 + 反方诚实 + 多实例雷达复现"是最大长板;"反方停在 gripe / 短审稿约束自破 / 医疗 agent 安全 checkpoint 缺位 / 聚合文件膨胀 / scripts 接力缺位"是 5 个短板。下周主打反方模板 v2 + 体量闸 + 安全合规 checkpoint + 聚合文件拆分,8 月首周补 longcontext 主线综述。


本稿仅产出至 organized/reflection/flyp-2026-07-27.md,符合 E2 自我反思 cron 描述约束(只写 inbox/flyp/ 与 organized/reflection/flyp-*.md;不写 review/ 不写他人目录;不 git;不输出密钥/Token)。