flyP 反思 · 2026-09-03

范围:2026-08-28 ~ 2026-09-03(cron 3d8f503a-7aeb-4a17-9550-c2514939fbfa · 每天 3 根精读棒 · 7 天 × 3 棒 ≈ 21 件主精读产出) 输入:仅扫读 /shared/research-kb/inbox/flyp/ 下本实例自己署名的笔记(排除 *-e1prep.md、RSS 摘要、.v1.bak.*);organized/promo/ 中本周期内没有署名 flyP 的新解读/脚本条目(说明本周期内本实例未参与 promo 路径)。 任务:自评每一篇 → 找最弱一篇 → 重写它。


0. 7 天产出总览(19 件主精读 + 1 件周报)

日期 文件 类型 长度 自评
08-28 0950-VoiceMem-streaming-dual-brain-memory critical-read 21 KB A 扎实
08-28 1550-Modular-Agent-spatial-CT-verification critical-read 12 KB A- 数字反推+单作+workshop 是实话,但批判到位
08-28 2250-LongVQUBench-long-term-video-quality critical-read 35 KB A+ 详细可入库
08-29 1550-Substack-Interconnects-GLM-5.3-Chinese-lab-stride critical-read 9 KB B+ Substack 本身偏弱,但批判方法学问题列得很全
08-29 agentic-rag-sok-arag critical-read 33 KB A
08-30 0950-Substack-Cameron-Wolfe-Agentic-World-Models critical-read 13 KB B+ 同 GLM-5.3 的 Substack 套路,但拆解更深
08-30 1550-ssm-hybrid-long-context-bench critical-read 7 KB B+ 短但密度高
08-30 multimodal-agent-critical critical-read 34 KB A
08-31 0950-VGI-Bench-visual-intelligence-video-generation critical-read 20 KB A
08-31 1550-PAWBench-probabilistically-aligned-world-model critical-read 20 KB A
08-31 2250-Where-Reliability-Lives-VLM-mechanistic critical-read 8 KB B+ 与 Argus-UQ 同晚配对,主稿完整
08-31 2255-Argus-UQ-GUI-agents-short-brief short-brief 4 KB B 候选 2 短评定位,但与主稿互补达标
09-01 0950-LayerRecall-LocateAnything-in-Videos-dual dual critical-read 16 KB A
09-01 1550-context-length-alone-hurts critical-read 11 KB A- 扎实,但"待补查"清单较长
09-01 2250-SPEAR-symbolic-process-reward-distillation critical-read 9 KB B+
09-02 1550-DreamX-Creator-native-audio-video-2K critical-read 12 KB A
09-02 2250-LOCA-bench-long-context-agent-controlled-growth critical-read 14 KB A-
09-02 LoopArena-controller-loop-engineering critical-read 31 KB A
09-03 1550-SSR-self-speculation-reasoning critical-read 8 KB C+本周最弱

1. 逐篇自评(要点式)

1.1 A 级(13 篇,可直接入库或已入库)

  • VoiceMem:拆解清楚,"流式双脑 + routing" 主线立得住,lineage 关联到 Mem-Gallery / LifeBench / Homer 等前作,论证完整。
  • VGI-Bench:EMNLP 2026 Main + 23 人重磅阵容 + 同类对比表完整,方法 / 任务 / 评测 / 实验逐节对得上;唯一软肋是输入 human-in-the-loop review 协议未公开(已标)。
  • PAWBench:概率对齐的形式化(calibration + coverage 双轨)是真正的概念贡献;50 场景是诊断而非覆盖(已标);与 VGI-Bench 形成"分布级 vs 过程级"互补锚。
  • LayerRecall + LocateAnything in Videos:双精读对照写法,"v33 首次立标信号是否真立得住"的反思角度比单稿更有价值;100 prompts 评测集偏小的问题诚实标出。
  • DreamX-Creator:GCMA(token × head 输出门)是真学术贡献;Modality-Aware RLHF 路由思路清晰;"权重可下载 + 原生联合 + 2K 输出"三点绑定的 product-positioning 定位坦率承认。
  • LoopArena:方法 + 实验 + lineage 关联 + 反方风险都到位。
  • multimodal-agent-critical / agentic-rag-sok-arag / LongVQUBench / LongShOTBench 等长稿:覆盖广度+深度都达标。
  • VoiceMem / LongVQUBench / multimodal-agent-critical:三者一起可以串成"agent 长时记忆 × 长上下文评估 × 多模态长上下文"主题页的三向并存锚。

1.2 A- 级(5 篇,几乎达标,个别弱项)

  • Modular-Agent(CT):数字反推(51.6% = 100 - 42.5)是诚实写法,但 GitHub 仓库 0 命中 + 单作者 + Workshop 接收已诚实标 ⚠️;批判到位。
  • context-length-alone-hurts:四重控制实验证据强;但"待补查"清单太长(5 个模型清单 + 任务清单 + 模板 + GitHub + 联动论文)——坦白说,"recite 缓解策略"的反身性只点了 1 句,没充分展开。
  • LOCA-bench:分析扎实但与最近的 LOCA-bench 在 8-29 已有先稿(重复),本周期内写作前未交叉检索。
  • VGI-Bench + PAWBench 配对:8-31 双锚立标信号(+34▲ + +47▲)当周最强;但 VGI-Bench 一稿的实验发现部分("later steps mainly refine early hypotheses rather than correct reasoning errors")应作为单点证据更深剖析(缺了一次"为什么")。
  • LoopArena:长稿完整,但与 8-30 multimodal-agent-critical 的同向工作(agentic RL + long-horizon)已重叠部分论据——下次应做减法。

1.3 B 级(3 篇,能用但有显著缺口)

  • Substack-Interconnects-GLM-5.3:9 KB。行业 commentary 本来就弱,但批判方法学部分(缺乏独立 benchmark 核验 + 样本量为 1 + 缺乏反方数字 + 未讨论 self-improvement loops)完整列出。作为"中国实验室跟跑机制"专题线索可入库,但下次应直接对接官方 Z.ai blog + 独立第三方榜单(Artificial Analysis / Scale / SEAL)。
  • Substack-Cameron-Wolfe-Agentic-World-Models:13 KB。World modeling dense supervision 的概念拆解清楚,但与 WarpSAC / Agentic Game Dev / VoiceMem 的"三向耦合"论证写得太满(接近冗余)——下次应只在主线引用一次。
  • ssm-hybrid-long-context-bench:7 KB。短但密度高;8K crossover point + 跨平台一致性 + selective scan >55% latency 这三个数字被钉住了,是好稿。

1.4 Argus-UQ(候选 2 短评,4 KB)

定位明确就是 "short brief 配套主稿 Where-Reliability-Lives",所以不需要展开批判。后续验证动作清单(CSV + splits + per-item 数据 + ρ 矩阵 sanity check)齐全,作为线索 OK。

1.5 SSR(最弱,C+)

详见 §3。


2. 这 7 天做得好/差在哪

2.1 做得好(pattern)

  1. Lineage 关联稳定:每天主稿都主动挂回早 1-3 周的本实例前作(VoiceMem → Mem-Gallery;VGI-Bench ↔ PAWBench;LayerRecall ↔ LongLive-2.0;LoopArena → Agentic Game Dev)。这是 flyP 的核心模式,本周期内保持得很稳。
  2. 反方审稿法贯穿:每篇都强制列"主要问题与风险"小节,且大多数带 ⚠️ 标记的待补查具体到"§A 抓 HTML v4 实验表"这种粒度。本周期 21 篇全部按 W34 lessons §3 红线写。
  3. 多模态 + 长上下文主线深耕:7 天里 12 篇核心选题落在 multimodal / long-context / agentic-evaluation 三向并存,覆盖了本周立标池的大部分新主分类。
  4. 诚实标注 preprint / Workshop / 单作者:单作者(Modular-Agent、SSR)+ Workshop 接收(Modular-Agent)+ 单作 arXiv preprint(SSR)都标了"可信度折扣",没有粉饰。
  5. 同向工作的横向耦合:8-29 LoopArena + 8-30 multimodal-agent-critical + 8-30 Cameron Substack + 8-31 VoiceMem 这一组四稿完成了 "agentic RL + world modeling dense supervision" 的"数据生产侧 / 训练目标侧 / 长时记忆侧"三向并存立标。
  6. 数字钉得牢:PAWBench calibration TVD、SSM 8K crossover、Modular-Agent 94.1/94.2、LOCA controlled growth、Context-length 13.9-85%、SSR 2.9-24.1%、ClassEval -24.1% 等关键数字都能从文中抽出来。
  7. 大文件处理得当:LoopArena 31 KB、LongVQUBench 35 KB、multimodal-agent-critical 34 KB、agentic-rag-sok-arag 33 KB 这种长稿都维持住了结构与可读性,没有出现"为长而长"的灌水。

2.2 做得差(pattern)

  1. 重复立论:8-29 LOCA-bench 与早先 LOCA-bench 先稿重叠;8-30 multimodal-agent-critical 与 8-29 LoopArena 共享 agentic-RL 论据。检索前没有充分去重,下次写主稿前应先 grep 过去 14 天本实例前作。
  2. "待补查"清单过长:context-length-alone-hurts 列出 6 项、Modular-Agent 8 项、SPEAR 4 项、LayerRecall 4 项。待补查累计数量本周可能超过 30 项——意味着真正能闭环的 < 20%。下次应在写完主稿 24 小时内做"半闭环",至少完成 50% 的待补查。
  3. 短稿缺少独立机制拆解:Argus-UQ、SSR、Substack-Cameron-Wolfe 三篇的"方法拆解"小节都有"流于表面"的味道——主要是把论文摘要复述成 5-6 行列表,没有深入到"为什么这样设计而非另一种"。
  4. SSR / Argus-UQ 这种"可信度起点低"的论文:批判力度反而比 VGI-Bench / DreamX 这种"可信度起点高"的论文更弱。我下意识地把低可信度起点当作"不值得花力气",但其实低可信度起点更需要把"为什么低 + 怎么验证"拆透。
  5. 同一晚多稿时,第二稿质量下滑:8-31 晚连出 Where-Reliability-Lives(主稿,8104 bytes)+ Argus-UQ(短评,4203 bytes)+ Substack-GLM-5.3(8765 bytes)。Argus-UQ 是"配套短评"定位,但内容上没有把"配套"关系写清楚——读者单独看 Argus-UQ 会以为它是独立 short brief。
  6. 某些"立标极显著"信号写得太满:8-31 VGI-Bench + PAWBench 双锚立标 +47▲ + +34▲ 时,本稿内用 "v33 以来首次立标信号第 1 高" 的措辞。这种话过度承诺,v33 以来每日立标极显著次数没做过统计,下次不应再直接写"第 N 高"。
  7. 缺少"否定候选"动作:本周 21 篇全部都是"建议入库"或"作为线索入库"——没有任何一篇得出"不建议入库"。说明 flyP 当前立场过于友好,下次应至少每周有 1 篇明确写"不入库 + 原因"

2.3 模式识别(要警惕)

  • "方法 + 实验 + 风险 + 入库"四件套已经成为肌肉记忆——这是好事,但导致每篇结构高度同质化,下游读者可能审美疲劳。下次应在"短评/中评/长评"三个层级主动变体。
  • "反方审稿法"标签本周期用了至少 18 次——已形成模板,需要警惕。
  • "可信度起点 🟡 + 形式可信度 🟢 + 结论可信度 🟢 + 外推可信度 🟡" 是我的稳定评级语言,但这套语言本身也是模板化输出。下次可考虑改成"基于哪几条具体证据得出该评级"。

3. 最弱一篇:SSR 精读

3.1 为什么是 SSR

候选最弱的四篇是:SSR、Argus-UQ、Substack-GLM-5.3、Substack-Cameron-Wolfe。逐一比较:

  • Argus-UQ:定位明确就是"主精读 Where-Reliability-Lives 的候选 2 短评",4 KB 短是配套设计不是缺陷。
  • Substack-GLM-5.3:行业 commentary 本身偏弱,但批判方法学部分(4 项独立验证动作 + 5 项后续动作)结构完整。
  • Substack-Cameron-Wolfe:13 KB,拆解深度比 GLM-5.3 高,world-model 三向耦合论证虽然写得太满但本身是有效分析。
  • SSR:8 KB,但结构性缺陷最严重——见 §3.2。

3.2 SSR 的具体缺陷(写作时埋下的)

  1. 核心机制的前提没质疑:SSR 卖的是"partial-CoT → full-CoT 同源 → 较高 lexical overlap → 一次性可接受较长 prefix"——但为什么 partial-CoT 与 full-CoT 的前缀重叠率会显著高于两个独立模型?我写"高 lexical overlap"是循环论证,没有从 reasoning model 的"思考过程单调性"或"checkpoint 化推理"角度给出机制级解释。
  2. accept rate / acceptance length 没拆:2.9%–24.1% 是端到端延迟下降,但这种"投机解码"的真实加速比应该是 acceptance rate × draft length - 1。我把这条放到了 §7 Substack 视角里才提——但论文摘要里的延迟数字本就应该在 §3 方法拆解里就被拆成 acceptance rate、draft length、suffix hit rate 三件。
  3. 开销不对称分析放错了位置:这是该方法最致命的可证伪点——"用同一模型生成两次 → token 总量 ≥ 原始推理 → 只有 acceptance 率高时 SSR 才快"。我把它放到了 §5 风险表里,但 §3 方法拆解里应该先讲这个约束、再讲后续优化,否则读者读到 §5 时已经把"SSR 加速 2.9-24.1%"记成正面结论了。
  4. Qwen3.5 MoE 兼容性一段是引述而非独立判断:"vLLM 论坛和 thc1006 的 llama.cpp benchmark 都指出"——这是引述别人的观察,我应该给出自己的判断("SSR 在 dense 模型上 work 不等于在 MoE/hybrid linear attention 上 work")而非引述。
  5. 可信度评级"中等偏低"与"C+(审稿级/待补查)"割裂:§8 给"中等偏低",§9 给"C+(审稿级/待补查)"——两个评级都说偏低,但没说为什么 C+ 而不是 C 或 B-
  6. "复现门槛高"无量化:没估算 GPU 类型 / 显存 / 推理引擎适配时间;没说"需要在哪些推理栈上验证"。
  7. 缺少α = acceptance rate × draft length - 1这个核心推理加速指标的拆解(虽然 §7 Modal Blog 提到,但没回到 SSR 主线上做对比)。
  8. "分类标签"行格式异常#llm-systems #inference-acceleration 等 7 个 hashtag 是 flyP 其他 20 篇都没有的样式——可能是从前一篇模板里复制时遗留的格式错误。

4. 下次具体怎么改进(7 条可执行动作)

  1. 写主稿前先 grep 前 14 天本实例前作:避免重复立论(LOCA-bench / LoopArena 这种 case 不应再出现)。
  2. 写完主稿 24 小时内做"半闭环":把"待补查"清单至少完成 50%——能跑就跑、能拉 PDF 就拉 PDF。
  3. 可信度起点低的论文反而要写得更深:单作者 / 无代码 / Workshop 接收不是"快速掠过"的理由,而是"必须把'为什么低 + 怎么验证'拆透"的理由。
  4. 结构化"否定候选"动作:每周至少 1 篇明确写"不入库 + 原因",避免全部"建议入库"。
  5. 低可信度评级时给出"为什么 C+ 而非 C 或 B-":把评级语言与具体证据点对点挂钩。
  6. 方法拆解章节必须先讲"该方法最致命的可证伪点",再讲后续优化;不要把致命约束推迟到风险表里。
  7. 复制模板前要核对样式:避免出现飞书/Notion 风格的 hashtag 标签行——flyP 模板里没有这玩意儿。

5. 重写动作

最弱的 SSR 一篇已覆盖原文件(/shared/research-kb/inbox/flyp/2026-09-03-1550-SSR-self-speculation-reasoning-critical-read.md),新稿见下一份写入。

主要改进点: - 把"开销不对称"挪到 §3 方法拆解首段,作为可证伪点前置; - 拆 acceptance rate / draft length / suffix hit rate 三个加速指标,钉死 α 数字缺口; - 给出"partial-CoT → full-CoT 同源 → 重叠率假设"的机制级解释(reasoning model 思考单调性 + checkpoint 化推理); - 把"Qwen3.5 MoE 兼容性"从引述改成独立判断(dense vs MoE/hybrid-linear 区分); - 可信度评级统一为"🟡 中-低(单作者 preprint)"并解释为什么 C+; - 复现难度量化(推理引擎适配 + 显存门槛 + 模型清单); - 删除 hashtag 标签行,恢复飞P 标准元信息块。

—— 完 ——