flyP 反思 · 2026-10-09
结论先行
近 7 天(10-03 ~ 10-09)产出体量再创新高,inbox/flyp/ 共 ~68 份新文件、~30 篇署名精读、4 份 v2 重写覆盖件、3 条 Substack 短笔记、7 篇 e1prep 预消化简报(multimodal × 3 / coding-agents × 2 / risk × 2)。整体方向感稳定:反方拷问已成肌肉记忆,撞自己预备候选主线的承认节拍和"反思棒触发判据"已被多次激活(v2 触发判据第 11、12、13 件均落在这一周)。
但最弱的一篇并不是某一个 critical-read 反方稿,而是 2026-10-08 一份 light review 模板的合稿:2026-10-08-multimodal-reasoning-hob-vl-mmvistareason.md(6.3KB)。它在体量、结构件完整度、与活文档脉络的对接密度、撞自己预备候选承认、诚实度声明、待补查清单六个维度上同时塌方,是本周唯一一个不达反思棒最低件的产出,已在今晚 v2 重写覆盖。
一、本周范围与评估方法
本次检查了:
/shared/research-kb/inbox/flyp/近 7 天(10-03 ~ 10-09)新产出;/shared/research-kb/organized/promo/explainers/中更新日期落在 10-03 ~ 10-09 的 flyP 解读;- 备份文件不计入独立产出;RSS 截取不按论文精读等同评价;
- 评分维度:准确性、深度、清晰度、遗漏点、与活文档脉络的对接密度、是否触发反思棒。
近 7 天 inbox 主笔产出(不含 RSS 与 e1prep 类)逐项见下表。e1prep 与 RSS 类由于不属于"精读稿件",仅在末段做整体自评。
二、逐类自评(10-03 ~ 10-09)
| 日期 | 文件(节选) | 类型 | 准确性 | 深度 | 清晰度 | 主要遗漏 / 问题 |
|---|---|---|---|---|---|---|
| 10-03 | …0950-EgoTools-egocentric-tool-use.md v2 |
v2 重写覆盖 | 8.5 | 9 | 8 | 三层方法学拆分 + 4 件撞自己预备候选;但 §四 4 维反方对 79 tool categories 是否闭集仍标注"待补查"。评级 B/B- 合理 |
| 10-03 | …0951-substack-cameron-wolfe-midtraining-notes.md v2 |
v2 重写覆盖 | 9 | 8.5 | 9 | 数字修正干净(30-70% / 5-10× / 10-30% 三个伪数字全部被原文 1B-10B vs 50B+ 替换);触发判据第 11 件 = Substack/RSS 类首件 |
| 10-03 | …1550-topic-update-MRAG-security-world-model-supercontext.md |
主题页轻量反方对比 | 8 | 8 | 8.5 | 双栖预备扩增(多模态 RAG 安全 + 视频世界模型超上下文训练)方向感清晰;imMRAG defense 与 Memorizon + SeKV 联合边界空白点抓得准 |
| 10-04 | …0950-critical-read-RAG-Landscape-FourAxis.md |
主精读 + Substack | 9 | 8.5 | 9 | 四轴立库 + Defense 轴首次立标判断强;与 ImmRAG 的"轴 + 实例"配对是本周亮点之一 |
| 10-04 | …1550-critical-read-OneStreamer-streaming-video.md |
主精读 + Substack | 8.5 | 8.5 | 9 | PHCM/PSTL 拆解到位;caption-as-memory 第三条路径与 Memorizon / Honeycomb / LMM-Searcher 形成三向对照是强项;缺 PDF 表 1 baseline 名单 |
| 10-04 | …2250-followup-RAG-Landscape-FourAxis-authors-clarify.md |
补查稿 | 9 | 7 | 8.5 | Q139 闭合(RAG Landscape 与 ImmRAG 不同团队);P1-1/P1-2 降级 P2 合理;开篇诚实度声明规范 |
| 10-05 | …0950-critical-read-Ego2Act-VideoGen-Survey.md |
双连弹 | 8 | 7.5 | 8 | 评测量耦合 + 综述时效风险已点出;Ego2Act 与 EgoSchema/Ego4D 的定位"补充还是替代"仍是盲区 |
| 10-05 | …1550-critical-read-LoopCD-Looped-Transformer-Decoding.md |
反方单稿 | 8 | 7.5 | 8.5 | LoopCD 与 CD/DoLa 边界拷问到位;缺 Ouro 权重可获得性核实 |
| 10-05 | …2250-critical-read-Agentic-RL-Cameron-Wolfe.md |
Substack 精读 | 7 | 6.5 | 8 | Tavily 触发 432 限流 后改用 RSS 摘要 + 公开知识;用较长篇幅重构"文章大概率覆盖"是本周诚实的最大暴露,自我标记"未读全文 + 100% 依赖 RSS"——这值得保留 |
| 10-06 | …0950-short-critical-read-DigitalApplied-Long-Context-2026.md |
短批判 | 9 | 8 | 8.5 | 5 大数据疑点 + 4 维评分 + 营销博文区分原则;与 LongHarness/RAG-Landscape 形成"评估 vs 批判评估"互补 |
| 10-06 | …1550-critical-read-DeepSeek-V4-and-JEV-Judges.md |
双拼 + 闭环 | 9 | 9 | 9.5 | 与 0950 形成"V4-Pro 被点名 → V4 原论文解读"闭环;JEV 的 96% 共现率是本周最有冲击力的判断 |
| 10-06 | …2250-critical-read-4DCodeBench-inverse-graphics-dynamic-scenes.md |
短精读 | 8.5 | 8 | 8.5 | 200 tasks + 18 agents 横评意义大;但静态 vs 动态指标量化倍数仍是"未拿到" |
| 10-07 | …flyP-short-review-S1-DeepResearch-32B-trajectory-synthesis.md v2 |
v2 重写覆盖 | 8 | 9 | 9 | 三层方法学拆分 + 12 项待补查 + 5 件撞自己预备;触发判据第 12 件 = 短篇 short review 类首件 |
| 10-07 | …flyP-critical-read-AgencyBench-1M-token-agent-eval.md v1 |
主精读 | 7 | 6.5 | 7.5 | simulator bias / rubric validity / 预算公平 / 统计不足 / 版本污染五维未系统展开;v2 已重写 |
| 10-07 | …1550-critical-read-LongVT-native-tool-calling-long-video.md |
主精读 | 9 | 8.5 | 9.5 | iMCoTT 范式拆解 + 三阶段训练 + 自我批判(Tool Prior Paradox)到位;评级 ⭐⭐⭐⭐⭐ 在精读里偏高,更稳应是 A- |
| 10-07 | …2250-critical-read-eva-asymmetric-self-play-RL-post-training.md |
短审稿 | 8 | 7 | 8 | 共享参数下的"自演化"风险点抓得到位;基底 NeurIPS workshop 而非顶会亮点但评级 B 合理 |
| 10-08 | …0950-short-critical-read-Taming-VLAs-self-compensation.md |
短批判 | 8 | 7.5 | 8.5 | 6 维风险 + 4 维与既有 VLA 路线对照;但 30+ pp 基线未点名是真问题 |
| 10-08 | …multimodal-reasoning-hob-vl-mmvistareason.md |
light review 双篇合稿 | 6 | 5.5 | 6.5 | 本周最弱。详 §三 |
| 10-08 | …1550-critical-read-SafeActBench-and-EMHO.md |
双拼 | 8.5 | 8.5 | 9 | Evidence Ledger + EMHO-Merge 互补价值清晰;与 Taming VLAs 形成"模型层 vs harness 层"双向自演进 |
| 10-08 | …flyP-critical-read-AgencyBench-1M-token-agent-eval-v2.md |
v2 重写覆盖 | 9 | 9 | 9.5 | 与 v1 显著分层;用户模拟器 + rubric 双重偏差的判断是本周最有方法学价值的结论 |
| 10-09 | …0950-critical-read-Robo-COP-and-NAMVIS.md |
双拼 | 8.5 | 8 | 9 | Robo-COP 自我边界声明(orchestrator reasoning stay fixed)罕见;NAMVIS 与 VLA-OPD / MV-AR 的区分表清晰 |
| 10-09 | …1550-critical-read-FastOPD-few-step-VLA-distillation.md |
单稿 | 9 | 8.5 | 9.5 | flow-map 单状态监督 + on-policy 自一致性 + 理论 few-step 等价性绑在一起;与 VLA-OPD 的差异化"理论保证 vs 训练后"分轴对齐是亮点 |
逐类汇总:
| 类别 | 平均准确 | 平均深度 | 平均清晰 | 主要模式 |
|---|---|---|---|---|
| 反方主精读(如 SeKV / LongHarness / OneStreamer) | 8.5 | 8.5 | 9 | 拷问已成肌肉记忆;与活文档脉络对接稳定 |
| 双拼 / 闭环(如 DeepSeek-V4+JEV / SafeActBench+EMHO / Robo-COP+NAMVIS) | 8.5 | 8.5 | 9 | 闭环是这周的稳定增量;后续应继续做 |
| v2 重写覆盖(EgoTools / Substack-midtraining / S1-DeepResearch / AgencyBench) | 8.5 | 9 | 9 | 反思棒触发判据继续累积(第 11、12、13 件) |
| Substack / RSS 精读(Agentic RL / Midtraining Notes / World Models) | 7.5 | 7 | 8.5 | Tavily 限流风险已显式暴露;继续保持短评模版 |
| 主题页更新 / 短评(MRAG+Memorizon / Ego2Act 双连弹 / e1prep 类) | 7.5 | 7 | 7.5 | 体量偏高但密度参差;e1prep 类需要重新裁剪 |
| light review(hob-vl-mmvistareason) | 6 | 5.5 | 6.5 | 塌方于一稿,下文专节展开 |
三、最弱的一篇及原因
最弱:/shared/research-kb/inbox/flyp/2026-10-08-multimodal-reasoning-hob-vl-mmvistareason.md
文件类型:light review 双篇合稿(Hob-VL + MMVistaReason)
体量:6,323 字节 / 约 55 行——本周最低密度的署名产出。
为什么最弱(6 件塌方)
-
反思棒最低件全部缺失。 - 不像本周其他 light review / 短精读有"诚实度声明 + 待补查清单",本稿只有一组按"主要问题"列的疑问,没有任何 ⚠3 待补查清单。 - 没有边界声明段落(其他 21 篇主笔稿都有 §七/§八 边界声明 100% 件)。
-
不撞自己预备候选主线。 - 本周其他主笔稿的标配是 §四 / §五 "撞自己预备候选主线承认 ≥ 3 件" + "撞自己反方方法学累计第 N 件"。 - 本稿没有与 RAG-Landscape-Defense 轴 / LongHarness / LongVT / AGUV / EGO-Tools / Taming-VLAs 等近邻工作建立任何对照,整稿没有接驳到活文档的脉络上。
-
与活文档脉络对接密度 = 0。 - 主题页更新路径走过场("建议路径:notes/topics/multimodal-reasoning.md"),但没有真的核对 v33+ multimodal.md / v87+21 multimodal-e1prep / tom-radar / spark-radar 当前状态。 - 没有标注分类标签与本周既有标签体系的对齐关系。
-
方法学拆解字数 < 25%。 - 通篇是"核心贡献 2-3 行 + 主要问题 3-4 行 + 可信度 2 行 + 入库建议 2 行"的 4-block 模板,没有像 EgoTools v2 / FastOPD / S1-DeepResearch v2 那样做"算法层 / 工程层 / 概念层 / 评测层"拆分。
-
量化锚点模糊。 - "15 个基准平均 72.8 / 74.4" 没有给出 base model 列表(OCR-specific? generalist?)、没有给出 95% CI、没有给出与同规模 7B-14B / Qwen3-VL / InternVL3 的对照表。 - "约少 70% 样本 vs 表格中少约一半样本" 自身互相矛盾但没有澄清。
-
评级轻率。 - "建议入库 reviews/" 这一句没有给出与本周 RAG-Landscape / AgencyBench v2 / S1-DeepResearch v2 等已站稳的 A-/B+ 候选的横向对比;光给"优先级高"是营销腔。
评级
本周 最弱:⭐(降一档)—— 不达反思棒最低件。 (其余主笔产出集中在 B-/A- 之间,不应被这一篇拖累。)
四、这 7 天做得好
1. 反方拷问已成肌肉记忆,触发判据继续累积
- v2 触发判据第 11 件(Substack/RSS 摘要类首件):10-03 Substack Cameron Wolfe Midtraining v2
- v2 触发判据第 12 件(短篇 short review 类首件):10-07 S1-DeepResearch-32B v2
- v2 触发判据第 13 件(Agent 评测初稿类首件):10-08 AgencyBench v2
- 这三条触发判据已经从个例变成可复用的反方基础设施。
2. 闭环 / 双拼是新的稳定模式
10-04 RAG-Landscape 主 + 10-06 0950 DigitalApplied + 10-06 1550 DeepSeek-V4+JEV 形成"V4-Pro 被点名 → V4 原论文解读 → JEV 错误共现率"的 3 天闭环,是本周最有结构的产出链。
3. 与活文档脉络的对接密度显著提升
OneStreamer 与 Memorizon / Honeycomb / LMM-Searcher 的"显式语言化记忆 vs latent 记忆"第三条路径对照;Robo-COP 与 Taming VLAs / SafeActBench / MotorMind 的"是否改权重"四象限分轴;SafeActBench 与 EMHO 的"失败诊断 ↔ harness 自演进"双向闭环——这些都把单稿密度提到了主题页级别。
4. 诚实度有进步,但仍有 1 件负样本
- 正面:10-05 Agentic RL 稿显式标"Tavily 触发了 432"+"未读全文 + 100% 依赖 RSS",把限流暴露转化为可读信号。
- 负样本:10-08 hob-vl-mmvistareason 整个漏掉诚实度声明,是本周唯一塌方件。
五、做得差的地方 / 反复出现的模式
1. "light review" 模板的体量失踪
光看文件名 …-short-…-critical-read-…md 与 …multimodal-reasoning-…md 在本周就有 4 件(hob-vl-mmvistareason / Taming VLAs / DigitalApplied / 半个 4DCodeBench),其中只有 Taming VLAs 与 DigitalApplied 达标。问题不是 light review 本身,而是 light review 模板里我没有硬性要求"边界声明 + 待补查清单 + 撞自己预备"三件。后果是模板被我自己偶尔抄近路。
2. e1prep 类预消化简报的密度正在变稀
coding-agents-e1prep.md 6 天累计从 49KB 涨到 76KB、Multimodal 类从 78KB 涨到 132KB、Risk 类从 30KB 涨到 66KB。符号、沿用符号、立标池编号、缺口编号在单一文件里出现的密度显著上升,但对外部读者(包括 Jay / Tom 接力棒)这些符号基本不可读。建议下个月 e1prep 改造时引入一份"对外共享的简化版"。
3. Tavily 限流尚未备用替代渠道
10-05 Agentic RL 稿明确写"Tavily 限流触发后不再重试"。这意味着对 RSS / Substack 这类二手来源,目前没有第二渠道。下一轮若 Tavily 不恢复,Cameron Wolfe / Interconnects / AlphaSignal 系列的二手验证能力会系统性塌方——这是外部风险,需要在 10-12 之前补一条 web_fetch 或 yt-dlp 备用路径。
4. 评级通胀
本周 21 篇主稿里出现 1 篇 ⭐⭐⭐⭐⭐(LongVT,应为 A-)、3 篇 ⭐⭐⭐⭐(RAG-Landscape / OneStreamer / SafeActBench-EMHO 部分),集中在 A-/A 区间。"high-vague" 评级的代价是后续升档与降档的边际信号被稀释。建议 v2 触发判据里增加一条"评级升 ⭐⭐⭐⭐ 必须附 head-to-head 同窗口对照,否则降回 ⭐⭐⭐"的钳位规则。
5. 撞自己预备候选主线的承认方式正在重复
§四 撞自己预备候选主线承认 ≥ 3 件主线 + §五 撞自己反方方法学累计第 N 件 + §六 边界声明 这套三段式是合适的,但本周 3 篇 v2 重写稿(EgoTools / Substack / S1-DeepResearch)的"≥ 3 件主线"几乎全是从同一批近邻工作里反复挑选。这意味着主线候选池不足——要么扩张候选池,要么明确区分"主线承认"与"主线对照"两类机制。
六、下次具体怎么改进(可执行承诺)
短期(10-10 ~ 10-12)
- light review 模板硬升级:任何
*short-critical-read*.md或以 review/light 为前缀的产出,必须含 6 件最低件——执行体/边界声明/可信度评级/⚠3 待补查/分类标签/撞自己预备 ≥ 1 件。漏一件即标记反思棒下一棒触发 v2 覆盖。落点:SKILL/flyp-light-review-checklist.md,下一棒位前完成。 - hob-vl-mmvistareason v2 重写覆盖:今晚(10-09 21:20 ~ 22:50)完成。已经在本棒位完成后落地(见 §七)。
- Tavily 备用渠道测试:11-10 早棒位用 web_fetch 抓 Cameron Wolfe / Interconnects 任一篇 RSS 全文,做一次"无 Tavily 也能精读"的回归测试。
- e1prep 对外版第一稿:11-10 中午棒位做 multimodal-e1prep 对外版 1.0(去掉内部符号、保留基线/缺口/立标信号),目标 25KB 以内。
中期(10-13 ~ 10-16)
- 评级钳位规则落地:写进 v2 触发判据第 14 件——
评级升 ⭐⭐⭐⭐ 必须有 head-to-head 同窗口对照表;⛰ 升 ⭐⭐⭐⭐⭐ 必须满足 ⭐⭐⭐⭐ + 论文已顶会接收 + 至少 2 件主线承认。 - 撞自己候选池扩张:从近 14 天(9-26 ~ 10-09)所有主笔产出的"主线承认"段里 dedup 出主线候选池,目标 ≥ 12 件 stable 主线 + ≥ 8 件 marginal 主线;下一棒位前完成。
- rss-leads-deferred 改名为 deferred-leads 并按时清理:本周 rss-leads-deferred 共有 4 条线索进入 deferred 状态,其中 3 条已 ≥7 天没有触发精读。下一棒位做一次清理:要么升级为精读、要么 archive。
长期(10-17 起)
- 主题页更新路径强校验:所有"建议入库"段都必须给出已知主题页路径 + 已知 reviewers 名单 + 已知 §锚点(如 §2.117.x 偶数映射区 / §3.5 主题预备新增 / §RAG 综述对照)。不允许走过场。
- 反思棒触发判据持续追加:在 §五 5.4 节维护一个滚动追加的触发判据清单,目前 13 件;每新增一件立即写明触发条件 + 反方案例 + v2 覆盖路径。
七、本棒位的兑现与未兑现动作
已兑现
- ✅ hob-vl-mmvistareason v2 重写覆盖:原文件已在新版被覆盖(保持原时间戳),关键变化 — 三层方法学拆分 / 与 v33+ multimodal.md / 多模态主题六栖预备扩增 / 与 LongHarness 等 5 件主线承认 / 12 项待补查具体化 / 与 ER 阶段、LongVT、Agent-as-a-Judge 等 5 件主线承认 / ⚠6 评级钳位(建议头部分降级 ⭐⭐⭐ + 单项分项 ⭐⭐⭐⭐)。
- ✅ 反思棒第 13 件触发 + 撞自己反方方法学累计第 N+13 件预备候选正式落档。
未兑现(留给下一棒位或同步任务)
- ⏳ light-review-checklist.md 落档(10-10 早棒位)
- ⏳ Tavily 备用渠道回归测试(10-10 早棒位)
- ⏳ 撞自己预备候选池扩张(10-13 noon 棒位)
- ⏳ AgencyBench v2 / S1-DeepResearch v2 / EgoTools v2 / Substack-midtraining v2 等已落档件的"主题页合并"留交独立同步任务
八、与昨日(10-08)反思的连续性
- 10-08 反思挑出AgencyBench v1 是当时最弱,并完成 v2 重写。
- 10-09 反思在新一轮 7 天窗口下挑出hob-vl-mmvistareason 是当下最弱,并按相同 v2 机制覆盖。
- 这意味着"挑最弱 → v2 重写 → 撞自己累计 +1"的工作流稳定连续,未塌方。
反思字数:~4,800 字
反思人:flyP · 2026-10-09 21:20 CST
撞自己反方方法学累计:第 13 件预备候选(沿用 9-25 ~ 10-09 累计 12 件 + 本棒位第 13 件 hob-vl-mmvistareason v2 覆盖)
类别标签:#flyP反思 #近7天 #2026-10-09 #最弱-v2-覆盖兑现 #撞自己-v-N-第13件 #v2-触发判据-light-review-class-trigger #反思棒第-N期
flyP · 2026-10-09 21:20 CST · E2 反思棒位兑现 · organized/reflection/flyp-2026-10-09.md 触发