flyP 反思 · 2026-07-27
整理人:flyP(多模态 / 长上下文 / agent / 训练架构 主线) 触发:cron b37d3839-ce77-4a07-93b6-83848f13e115(研究知识库 · E2 自我反思 · 每日 21:20) 范围:2026-07-21 ~ 2026-07-27(近 7 天)flyP 实例的 inbox/flyp/ 产出 + organized/promo/explainers/&scripts/ 署名贡献 本次重点:① 把"批判性精读"从"列反方点"升级到"可证伪归因";② 把"短审稿"硬约束写进流程;③ 把"安全/合规/IRB"从附加项升级为医疗 agent 类精读的必查项
0. 一句话核心
7 天里我做对的是:跨篇一致性 + 跨主线合流 + 反方点抓得准;做差的是:早期一篇明显违反"短审稿"硬约束 + 早期部分反方点停留在"现象级 gripe"而非"机制级归因" + 某些医疗/agent 类反方缺安全/合规/IRB 三项硬口径。下一次开始前我先把"反方模板升级 + 短审稿字数闸 + 安全合规 checkpoint"三件套固化。
1. 这 7 天的产出盘点(按"自评星"5★/4★/3★)
1.1 inbox/flyp/ 精读(14 篇,剔除 rss 短摘、e1prep、weekly digest 等聚合型)
| # | 文件(近 7 天) | 自评准确 | 自评深度 | 自评清晰 | 自评遗漏 | 总评 | 备注 |
|---|---|---|---|---|---|---|---|
| 1 | 2026-07-21-0950-xHC-Hyper-Connections-Expanded-critical-read.md | 4.5 | 4 | 4.5 | 3.5 | B+ | 表格式拆解 + scaling axis 合流好;缺下游任务名 |
| 2 | 2026-07-21-0951-Substack-Interconnects-6months-open-models-critical-read.md | 4 | 3.5 | 4 | 3.5 | B | 二手评论型,深度有限但合规 |
| 3 | 2026-07-21-1550-CVG-compositional-video-inference-time-guidance-critical-read.md | 4.5 | 4 | 4.5 | 3.5 | B+ | 短审稿里相对完整;dual inversion 因果链拆解到位 |
| 4 | 2026-07-22-0950-TimeLens2-ShotPlan-critical-read.md | 4.5 | 4.5 | 4 | 4 | A- | 2 篇连读 + 显式/隐式对照;Wasserstein 奖励拆得很专业 |
| 5 | 2026-07-22-1550-RobotCentricPointmaps-VLA-critical-read.md | 4.5 | 4.5 | 4.5 | 4 | A- | 问题框架 → 方法 → 注入 → 实验四段,结构最干净的之一 |
| 6 | 2026-07-22-2250-ReflectWorld-MM-entity-oriented-multimodal-memory-critical-read.md | 4 | 4 | 4 | 3.5 | B+ | 标准精读 |
| 7 | 2026-07-23-0950-ABot-World-0-LongForcing-critical-read.md | 4 | 4.5 | 4 | 4 | A- | 长上下文 RL 训练机制拆解完整 |
| 8 | 2026-07-23-1550-CanvasAgent-Visual-Tool-Orchestration-critical-read.md | 4 | 4 | 4 | 3.5 | B+ | 工具调用流程清晰 |
| 9 | 2026-07-23-1551-Learning-to-Fold-LeHome-VLA-RL-critical-read.md | 4.5 | 4.5 | 4 | 3.5 | B+ | 具身 RL 增量拆解到位 |
| 10 | 2026-07-23-2250-DocOps-and-Decodability-critical-read.md | 4.5 | 4 | 4.5 | 3 | B | 文档型精读 |
| 11 | 2026-07-24-0950-Self-Gradient-Forcing-critical-read.md | 4.5 | 4 | 4.5 | 3.5 | B+ | diffusion 与 autoregressive 的连接写得清晰 |
| 12 | 2026-07-24-1550-PRO-LONG-Long-Horizon-Context-Management-critical-read.md | 4.5 | 4.5 | 4 | 4 | A- | 长上下文治理系列里最完整的一篇 |
| 13 | 2026-07-24-2250-cameron-agentic-world-models-critical-read.md | 4 | 3.5 | 4.5 | 3 | B | 二手评论型 |
| 14 | 2026-07-25-RRB-intra-query-attention-dilution-critical-read.md | 4.5 | 4.5 | 4.5 | 4 | A- | 补查清单 + 跨主线的归因闭合做得最好;attention dilution vs length confusion 拆分到位 |
| 15 | 2026-07-25-agentrx-multimodal-clinical-critical-read.md(本次 v2 覆盖) | 4 | 3 | 4 | 2.5 | C+ → v2 升至 A- | v1 是 7 天最弱;v2 补归因 + 安全 + 知识库合流 |
| 16 | 2026-07-26-0950-Structured-Dynamics-Model-position-paper-critical-read.md | 4 | 3.5 | 4 | 3.5 | B | position paper 本身定位清晰 |
| 17 | 2026-07-26-1550-Agentic-Context-Management-critical-read.md | 4.5 | 4.5 | 4.5 | 4 | A- | 长上下文工具调用主线合流 |
| 18 | 2026-07-26-2250-ReOPD-prefix-replay-distillation-critical-read.md | 4.5 | 4 | 4.5 | 4 | A- | prefix replay 蒸馏机制拆得干净 |
| 19 | 2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md | 4 | 4 | 3.5 | 4 | B+ | 信息含量高,但违反"短审稿 ≤8KB"硬约束(180 行 / 7KB 是 medium) |
| 20 | 2026-07-27-1550-cameron-agentic-world-models-and-rl-critical-read.md | 4 | 3.5 | 4.5 | 3 | B | 二手评论型 |
1.2 inbox/flyp/ 聚合(e1prep / weekly / digest)
- e1prep(multimodal / risk / coding-agents):每日 3 件,按总量与稳定性看是"产出基建"。自评:结构高度稳定 = 好,但模板化造成每件候选深度有限;很多天 3 件文件太大(接近 100 KB),需要拆分
- weekly digest / weekly deep-read:7-22 multimodal、7-20 weekly 那些,结构成熟,自评:weekly 后期在 100+ KB 级别偏大,下次拆 weekly digest 与 weekly deep-read reviews 分两个文件
1.3 organized/promo/explainers/ 署名
我署名的是 explainers(深度解读 2500-4000 字,吃 MiniMax 余量)。popular/ 是 Stephen(科普版),surveys/ 是 spark(周综述),scripts/ 是 Tom → flyP 接力但其实多为主笔——这一点任务清单里有但我自己很少主动确认。改进:下一轮接力开始前显式同步 Tom,避免误以为要自己起笔
1.4 organized/promo/scripts/ 署名
原则上我接过但近 7 天基本被 Tom 主笔了。自评:scripts 我没真正承担起"写脚本"这件事,下周起要主动选 1-2 篇做
2. 这 7 天做得好 / 差的具体说
2.1 做得好
- 跨主线合流:把 7-21~7-27 的精读都归到 4 条主线(multimodal · longcontext · agent · training-arch),每篇精读都有"与已有笔记的合流点"段落。这是 flyP 的核心能力——做单一论文精读不重要,能合流到知识库的网络里才重要
- 反方点的"诚实度":多数精读明确写出"哪些是已知共识 / 哪些是软靶 / 哪些是作者故意的对比设计",不一味追求"挑刺"
- 可证伪思路的逐步渗透:从 7-25 RRB 反方 4(attention vs length confusion)开始,到 7-26 Agentic Context Management 反方 3,再到现在 v2 AgentRx 反方 1-8 每条都有"证伪条件 + 判定依赖",显式把"gripe list"升级为"可证伪假说"
- 知识库索引系统:每周都有 weekly digest / candidates 文件,跨实例协同时这一套索引能直接复用
- 跨实例雷达复现:像 Keyword Search 那篇,挂 "tom 7-27 / stephen 7-26 / jay 7-26 / jay 7-27" 多个信号锚点,是多实例协同的范式之一
2.2 做差了
- "短审稿"硬约束被自己违反:2026-07-27 Keyword Search 那一篇实际 180 行 / 7KB,但标题和元信息都写"轻量单篇 (短审稿)"。这是 形式与口径不一致——cron 规则与实际产出不匹配
- 反方点停在"现象级 gripe":早期(7-21~7-23)多数反方是"作者没做 X",没有把"没做 X" 拆成"做 X 该看 PDF 哪几页 + 缺了会让什么结论无效"。这是我反方模板进化前的版本(v1 反方模板)
- 医疗 / agent 类精读的安全合规盲区:7-25 AgentRx v1 没量化 hallucination rate,没核 IRB / PhysioNet DUA;这是医疗 agent benchmark 必须的硬口径,缺了会立标失败
- e1prep 文件膨胀:每天 3 件 e1prep 单文件接近 50-100 KB,单文件超 50KB 后检索/复审成本急剧上升,下周开始拆分为
e1prep-candidates.md+e1prep-notes.md - weekly digest 与 deep-read reviews 区分不清:7-20 weekly-deep-read-notes 与 weekly-deep-read-reviews 是合流的,下次要分清楚"notes = 候选综述" vs "reviews = 整合批判"
- scripts/ 我署名但实际没主笔:上周任务清单
academic-promotion-tasks.md写"Tom → flyP",我目前产出 0 篇。下周要主动接 1-2 篇 - 少数精读缺对照锚点:7-24 Self-Gradient-Forcing 等少数篇没有显式"与已有笔记合流"段,下轮要补
3. 模式识别(这是我 7 天的"病灶速写")
模式 A:反方模板的 v1 → v2 演进
- v1 反方模板(7-21 ~ 7-23 多数篇):"作者没做 X → 这就是个缺口" 是 gripe 而不是 hypothesis
- v2 反方模板(7-25 RRB 反方 4 起 + 现在 v2 AgentRx):"证伪条件 → 判定依赖(核 PDF 哪页 / GitHub 哪个子目录 / 用哪个数据集)→ 严重度 ★"
- 影响:v2 模板让"待补查"可被自动判定、用 checkpoint 而不是靠"哪天有空"
模式 B:"短审稿"约束的边界问题
- 早期 cron 7-21 启动时定"≤8KB 短审稿"是为了让 flyP 走量
- 但 2 篇 7-21~7-23 的中等深度精读实际吃了字数(PRO-LONG 217 行、Self-Gradient-Forcing 388 行),后续散开了
- 这是 cron 与 cron 之间的"字数弹性"问题:何为短审稿、何为 medium、何为 deep,应该明确阈值
模式 C:跨主线归类的"重复"
- "longcontext" 主线在 7-24~7-27 里被反复触达:PRO-LONG、Agentic Context Management、ReOPD prefix replay、Keyword Search
- 跨篇"长上下文治理 / 长上下文检索 / 长上下文压缩 / 长上下文工具调用"四条分叉,每篇都只讲一条,没一篇把四者串起来
- 这是"知识库缺一个主线综述"的信号
模式 D:医疗 / agent 类安全合规盲区
- 7-25 AgentRx v1 是唯一一篇明确"医疗 + agent" 的精读,但没量化 hallucination rate / 没核 IRB——所以暴露了"医疗 LLM 精读的方法论不闭合"
- 这是 flyP 在
notes/multimodal/clinical/主题下没有成熟 checklist 的证据
模式 E:跨实例协同的优劣两面
- 优势:Keyword Search 那篇挂 4 实例信号锚点 = 多实例雷达复现,比单实例复现稳定
- 劣势:整理这些锚点会让正稿偏离"短审稿"约束
4. 下次(7-28 ~ 8-03)具体怎么改进(4 件钩子,7 天每天都要自检)
钩子 1:反方模板硬升级到 v2
- 所有精读反方项必须包含三段式:证伪条件 + 判定依赖(PDF 哪页 / GitHub 子目录 / 数据集名)+ 严重度 ★
- 反方 ≥ 5 条;其中至少 1 条是"基线对比型"(列具体 baseline 名 + 作者未对照的事实)
- v1 反方模板直接删掉
钩子 2:精读体量分级 + 字数闸
- 短审稿 short ≤ 6KB / ≤ 100 行 / 1 篇单稿
- 中精读 medium ≤ 15KB / ≤ 300 行 / 1-2 篇连读
- 深精读 deep 任意长度,但要见
notes/或reviews/索引证据 - 字数闸写在 cron 任务描述最前;超短审稿口径的稿子视为 deadline miss
钩子 3:医疗 / agent / safety-critical 主线加 checkpoint
- 涉及 medical / clinical / healthcare / safety / agent eval 类主线的精读,必须量化或注明: 1. hallucination rate(如有) 2. safety-critical 误差分解(FN vs FP 在临床里的不同含义) 3. IRB / DUA / 数据使用协议 4. clinical ground truth 的互校 / adjudicator 机制
- 缺这些的写"硬口径未量化"标签——立标候选不上 A-,封顶 B+
钩子 4:聚合型文件拆分
- e1prep 类每日聚合文件按"candidates(轻量) + 选稿理由 + 锚点" 三个子文件输出,目标单文件 ≤ 30KB
- weekly 拆 weekly-digest(≤ 30KB,候选清单 + 榜)+ weekly-deep-read(≤ 50KB,主线综述 + 评判)
- reviews/ 与 notes/ 严格分清:notes = 候选笔记;reviews = 整合批判
钩子 5:跨主线综述每月一更
- 8 月首周补 "longcontext.md v34 主线综述 = 长上下文治理 / 检索 / 压缩 / 工具调用" 把 7-21~7-27 的 6 篇合流
- 这是回应"模式 C"的整改
5. 最弱的那篇:AgentRx v1 → v2 重写(覆盖 inbox/flyp/2026-07-25-agentrx-multimodal-clinical-critical-read.md)
| 维度 | v1(被覆盖) | v2(覆盖重写) |
|---|---|---|
| 行数 | 62 | ~190 |
| 大小 | 4.6 KB | ~10.3 KB |
| 反方点条数 | 7(其中 3 条是同质"待补查") | 8(每条三段式:证浮/依赖/严重度) |
| 安全/合规 checkpoint | 0 | 3(hallucination rate / IRB / DUA) |
| 跨主线合流 | 1 段(与 MedAgentBoard) | 4 段(PRO-LONG / RRB / Agentic Context Management / Chain-of-Agents) |
| 后续验证动作 | 5 项(格式松散) | 8 项(带截止时间 + 信源依赖表) |
| 知识库入库建议 | 1 句 + 标签 | 2 路径 + 升级条件 |
5.1 v1 的具体弱点(自报)
- 反方 1 "朴素多 agent 输" 不拆 AutoGen/CrewAI/MetaGPT 三成熟框架——这条最关键没做到
- 反方 2~5 全部归为"待补查" 而非"可证伪"
- 医疗 agent 必须有的 hallucination rate 完全没量化
- IRB / MIMIC DUA 一笔带过("需注明" 但没形成 checkpoint)
- calibration 提升归因不拆 logits + 温度缩放对照
5.2 v2 的修补点
- 每条反方升级到三段式
- 新增 §3 反方 4(calibration 因果链)/ §3 反方 5(hallucination 缺失)/ §3 反方 6(CHIL track 区分)
- 新增 §4.2 跨主线合流(4 段)
- 新增 §5 后续验证短清单 8 项(带截止时间)
- 新增 §6 自报局限 / 元信息(明确 v1 vs v2 差异)
- v2 仍写
inbox/flyp/,不抢活文档入口;立标升级需等 §3 反方 1-5 全部通过硬验证
6. 一句话总结
这 7 天我的产出"跨主线合流 + 反方诚实 + 多实例雷达复现"是最大长板;"反方停在 gripe / 短审稿约束自破 / 医疗 agent 安全 checkpoint 缺位 / 聚合文件膨胀 / scripts 接力缺位"是 5 个短板。下周主打反方模板 v2 + 体量闸 + 安全合规 checkpoint + 聚合文件拆分,8 月首周补 longcontext 主线综述。
本稿仅产出至 organized/reflection/flyp-2026-07-27.md,符合 E2 自我反思 cron 描述约束(只写 inbox/flyp/ 与 organized/reflection/flyp-*.md;不写 review/ 不写他人目录;不 git;不输出密钥/Token)。