flyP 反思 · 2026-09-03
范围:2026-08-28 ~ 2026-09-03(cron
3d8f503a-7aeb-4a17-9550-c2514939fbfa· 每天 3 根精读棒 · 7 天 × 3 棒 ≈ 21 件主精读产出) 输入:仅扫读/shared/research-kb/inbox/flyp/下本实例自己署名的笔记(排除*-e1prep.md、RSS 摘要、.v1.bak.*);organized/promo/ 中本周期内没有署名 flyP 的新解读/脚本条目(说明本周期内本实例未参与 promo 路径)。 任务:自评每一篇 → 找最弱一篇 → 重写它。
0. 7 天产出总览(19 件主精读 + 1 件周报)
| 日期 | 文件 | 类型 | 长度 | 自评 |
|---|---|---|---|---|
| 08-28 | 0950-VoiceMem-streaming-dual-brain-memory | critical-read | 21 KB | A 扎实 |
| 08-28 | 1550-Modular-Agent-spatial-CT-verification | critical-read | 12 KB | A- 数字反推+单作+workshop 是实话,但批判到位 |
| 08-28 | 2250-LongVQUBench-long-term-video-quality | critical-read | 35 KB | A+ 详细可入库 |
| 08-29 | 1550-Substack-Interconnects-GLM-5.3-Chinese-lab-stride | critical-read | 9 KB | B+ Substack 本身偏弱,但批判方法学问题列得很全 |
| 08-29 | agentic-rag-sok-arag | critical-read | 33 KB | A |
| 08-30 | 0950-Substack-Cameron-Wolfe-Agentic-World-Models | critical-read | 13 KB | B+ 同 GLM-5.3 的 Substack 套路,但拆解更深 |
| 08-30 | 1550-ssm-hybrid-long-context-bench | critical-read | 7 KB | B+ 短但密度高 |
| 08-30 | multimodal-agent-critical | critical-read | 34 KB | A |
| 08-31 | 0950-VGI-Bench-visual-intelligence-video-generation | critical-read | 20 KB | A |
| 08-31 | 1550-PAWBench-probabilistically-aligned-world-model | critical-read | 20 KB | A |
| 08-31 | 2250-Where-Reliability-Lives-VLM-mechanistic | critical-read | 8 KB | B+ 与 Argus-UQ 同晚配对,主稿完整 |
| 08-31 | 2255-Argus-UQ-GUI-agents-short-brief | short-brief | 4 KB | B 候选 2 短评定位,但与主稿互补达标 |
| 09-01 | 0950-LayerRecall-LocateAnything-in-Videos-dual | dual critical-read | 16 KB | A |
| 09-01 | 1550-context-length-alone-hurts | critical-read | 11 KB | A- 扎实,但"待补查"清单较长 |
| 09-01 | 2250-SPEAR-symbolic-process-reward-distillation | critical-read | 9 KB | B+ |
| 09-02 | 1550-DreamX-Creator-native-audio-video-2K | critical-read | 12 KB | A |
| 09-02 | 2250-LOCA-bench-long-context-agent-controlled-growth | critical-read | 14 KB | A- |
| 09-02 | LoopArena-controller-loop-engineering | critical-read | 31 KB | A |
| 09-03 | 1550-SSR-self-speculation-reasoning | critical-read | 8 KB | C+ ⬅ 本周最弱 |
1. 逐篇自评(要点式)
1.1 A 级(13 篇,可直接入库或已入库)
- VoiceMem:拆解清楚,"流式双脑 + routing" 主线立得住,lineage 关联到 Mem-Gallery / LifeBench / Homer 等前作,论证完整。
- VGI-Bench:EMNLP 2026 Main + 23 人重磅阵容 + 同类对比表完整,方法 / 任务 / 评测 / 实验逐节对得上;唯一软肋是输入 human-in-the-loop review 协议未公开(已标)。
- PAWBench:概率对齐的形式化(calibration + coverage 双轨)是真正的概念贡献;50 场景是诊断而非覆盖(已标);与 VGI-Bench 形成"分布级 vs 过程级"互补锚。
- LayerRecall + LocateAnything in Videos:双精读对照写法,"v33 首次立标信号是否真立得住"的反思角度比单稿更有价值;100 prompts 评测集偏小的问题诚实标出。
- DreamX-Creator:GCMA(token × head 输出门)是真学术贡献;Modality-Aware RLHF 路由思路清晰;"权重可下载 + 原生联合 + 2K 输出"三点绑定的 product-positioning 定位坦率承认。
- LoopArena:方法 + 实验 + lineage 关联 + 反方风险都到位。
- multimodal-agent-critical / agentic-rag-sok-arag / LongVQUBench / LongShOTBench 等长稿:覆盖广度+深度都达标。
- VoiceMem / LongVQUBench / multimodal-agent-critical:三者一起可以串成"agent 长时记忆 × 长上下文评估 × 多模态长上下文"主题页的三向并存锚。
1.2 A- 级(5 篇,几乎达标,个别弱项)
- Modular-Agent(CT):数字反推(51.6% = 100 - 42.5)是诚实写法,但 GitHub 仓库 0 命中 + 单作者 + Workshop 接收已诚实标 ⚠️;批判到位。
- context-length-alone-hurts:四重控制实验证据强;但"待补查"清单太长(5 个模型清单 + 任务清单 + 模板 + GitHub + 联动论文)——坦白说,"recite 缓解策略"的反身性只点了 1 句,没充分展开。
- LOCA-bench:分析扎实但与最近的 LOCA-bench 在 8-29 已有先稿(重复),本周期内写作前未交叉检索。
- VGI-Bench + PAWBench 配对:8-31 双锚立标信号(+34▲ + +47▲)当周最强;但 VGI-Bench 一稿的实验发现部分("later steps mainly refine early hypotheses rather than correct reasoning errors")应作为单点证据更深剖析(缺了一次"为什么")。
- LoopArena:长稿完整,但与 8-30 multimodal-agent-critical 的同向工作(agentic RL + long-horizon)已重叠部分论据——下次应做减法。
1.3 B 级(3 篇,能用但有显著缺口)
- Substack-Interconnects-GLM-5.3:9 KB。行业 commentary 本来就弱,但批判方法学部分(缺乏独立 benchmark 核验 + 样本量为 1 + 缺乏反方数字 + 未讨论 self-improvement loops)完整列出。作为"中国实验室跟跑机制"专题线索可入库,但下次应直接对接官方 Z.ai blog + 独立第三方榜单(Artificial Analysis / Scale / SEAL)。
- Substack-Cameron-Wolfe-Agentic-World-Models:13 KB。World modeling dense supervision 的概念拆解清楚,但与 WarpSAC / Agentic Game Dev / VoiceMem 的"三向耦合"论证写得太满(接近冗余)——下次应只在主线引用一次。
- ssm-hybrid-long-context-bench:7 KB。短但密度高;8K crossover point + 跨平台一致性 + selective scan >55% latency 这三个数字被钉住了,是好稿。
1.4 Argus-UQ(候选 2 短评,4 KB)
定位明确就是 "short brief 配套主稿 Where-Reliability-Lives",所以不需要展开批判。后续验证动作清单(CSV + splits + per-item 数据 + ρ 矩阵 sanity check)齐全,作为线索 OK。
1.5 SSR(最弱,C+)
详见 §3。
2. 这 7 天做得好/差在哪
2.1 做得好(pattern)
- Lineage 关联稳定:每天主稿都主动挂回早 1-3 周的本实例前作(VoiceMem → Mem-Gallery;VGI-Bench ↔ PAWBench;LayerRecall ↔ LongLive-2.0;LoopArena → Agentic Game Dev)。这是 flyP 的核心模式,本周期内保持得很稳。
- 反方审稿法贯穿:每篇都强制列"主要问题与风险"小节,且大多数带 ⚠️ 标记的待补查具体到"§A 抓 HTML v4 实验表"这种粒度。本周期 21 篇全部按 W34 lessons §3 红线写。
- 多模态 + 长上下文主线深耕:7 天里 12 篇核心选题落在 multimodal / long-context / agentic-evaluation 三向并存,覆盖了本周立标池的大部分新主分类。
- 诚实标注 preprint / Workshop / 单作者:单作者(Modular-Agent、SSR)+ Workshop 接收(Modular-Agent)+ 单作 arXiv preprint(SSR)都标了"可信度折扣",没有粉饰。
- 同向工作的横向耦合:8-29 LoopArena + 8-30 multimodal-agent-critical + 8-30 Cameron Substack + 8-31 VoiceMem 这一组四稿完成了 "agentic RL + world modeling dense supervision" 的"数据生产侧 / 训练目标侧 / 长时记忆侧"三向并存立标。
- 数字钉得牢:PAWBench calibration TVD、SSM 8K crossover、Modular-Agent 94.1/94.2、LOCA controlled growth、Context-length 13.9-85%、SSR 2.9-24.1%、ClassEval -24.1% 等关键数字都能从文中抽出来。
- 大文件处理得当:LoopArena 31 KB、LongVQUBench 35 KB、multimodal-agent-critical 34 KB、agentic-rag-sok-arag 33 KB 这种长稿都维持住了结构与可读性,没有出现"为长而长"的灌水。
2.2 做得差(pattern)
- 重复立论:8-29 LOCA-bench 与早先 LOCA-bench 先稿重叠;8-30 multimodal-agent-critical 与 8-29 LoopArena 共享 agentic-RL 论据。检索前没有充分去重,下次写主稿前应先 grep 过去 14 天本实例前作。
- "待补查"清单过长:context-length-alone-hurts 列出 6 项、Modular-Agent 8 项、SPEAR 4 项、LayerRecall 4 项。待补查累计数量本周可能超过 30 项——意味着真正能闭环的 < 20%。下次应在写完主稿 24 小时内做"半闭环",至少完成 50% 的待补查。
- 短稿缺少独立机制拆解:Argus-UQ、SSR、Substack-Cameron-Wolfe 三篇的"方法拆解"小节都有"流于表面"的味道——主要是把论文摘要复述成 5-6 行列表,没有深入到"为什么这样设计而非另一种"。
- SSR / Argus-UQ 这种"可信度起点低"的论文:批判力度反而比 VGI-Bench / DreamX 这种"可信度起点高"的论文更弱。我下意识地把低可信度起点当作"不值得花力气",但其实低可信度起点更需要把"为什么低 + 怎么验证"拆透。
- 同一晚多稿时,第二稿质量下滑:8-31 晚连出 Where-Reliability-Lives(主稿,8104 bytes)+ Argus-UQ(短评,4203 bytes)+ Substack-GLM-5.3(8765 bytes)。Argus-UQ 是"配套短评"定位,但内容上没有把"配套"关系写清楚——读者单独看 Argus-UQ 会以为它是独立 short brief。
- 某些"立标极显著"信号写得太满:8-31 VGI-Bench + PAWBench 双锚立标 +47▲ + +34▲ 时,本稿内用 "v33 以来首次立标信号第 1 高" 的措辞。这种话过度承诺,v33 以来每日立标极显著次数没做过统计,下次不应再直接写"第 N 高"。
- 缺少"否定候选"动作:本周 21 篇全部都是"建议入库"或"作为线索入库"——没有任何一篇得出"不建议入库"。说明 flyP 当前立场过于友好,下次应至少每周有 1 篇明确写"不入库 + 原因"。
2.3 模式识别(要警惕)
- "方法 + 实验 + 风险 + 入库"四件套已经成为肌肉记忆——这是好事,但导致每篇结构高度同质化,下游读者可能审美疲劳。下次应在"短评/中评/长评"三个层级主动变体。
- "反方审稿法"标签本周期用了至少 18 次——已形成模板,需要警惕。
- "可信度起点 🟡 + 形式可信度 🟢 + 结论可信度 🟢 + 外推可信度 🟡" 是我的稳定评级语言,但这套语言本身也是模板化输出。下次可考虑改成"基于哪几条具体证据得出该评级"。
3. 最弱一篇:SSR 精读
3.1 为什么是 SSR
候选最弱的四篇是:SSR、Argus-UQ、Substack-GLM-5.3、Substack-Cameron-Wolfe。逐一比较:
- Argus-UQ:定位明确就是"主精读 Where-Reliability-Lives 的候选 2 短评",4 KB 短是配套设计不是缺陷。
- Substack-GLM-5.3:行业 commentary 本身偏弱,但批判方法学部分(4 项独立验证动作 + 5 项后续动作)结构完整。
- Substack-Cameron-Wolfe:13 KB,拆解深度比 GLM-5.3 高,world-model 三向耦合论证虽然写得太满但本身是有效分析。
- SSR:8 KB,但结构性缺陷最严重——见 §3.2。
3.2 SSR 的具体缺陷(写作时埋下的)
- 核心机制的前提没质疑:SSR 卖的是"partial-CoT → full-CoT 同源 → 较高 lexical overlap → 一次性可接受较长 prefix"——但为什么 partial-CoT 与 full-CoT 的前缀重叠率会显著高于两个独立模型?我写"高 lexical overlap"是循环论证,没有从 reasoning model 的"思考过程单调性"或"checkpoint 化推理"角度给出机制级解释。
- accept rate / acceptance length 没拆:2.9%–24.1% 是端到端延迟下降,但这种"投机解码"的真实加速比应该是 acceptance rate × draft length - 1。我把这条放到了 §7 Substack 视角里才提——但论文摘要里的延迟数字本就应该在 §3 方法拆解里就被拆成 acceptance rate、draft length、suffix hit rate 三件。
- 开销不对称分析放错了位置:这是该方法最致命的可证伪点——"用同一模型生成两次 → token 总量 ≥ 原始推理 → 只有 acceptance 率高时 SSR 才快"。我把它放到了 §5 风险表里,但 §3 方法拆解里应该先讲这个约束、再讲后续优化,否则读者读到 §5 时已经把"SSR 加速 2.9-24.1%"记成正面结论了。
- Qwen3.5 MoE 兼容性一段是引述而非独立判断:"vLLM 论坛和 thc1006 的 llama.cpp benchmark 都指出"——这是引述别人的观察,我应该给出自己的判断("SSR 在 dense 模型上 work 不等于在 MoE/hybrid linear attention 上 work")而非引述。
- 可信度评级"中等偏低"与"C+(审稿级/待补查)"割裂:§8 给"中等偏低",§9 给"C+(审稿级/待补查)"——两个评级都说偏低,但没说为什么 C+ 而不是 C 或 B-。
- "复现门槛高"无量化:没估算 GPU 类型 / 显存 / 推理引擎适配时间;没说"需要在哪些推理栈上验证"。
- 缺少α = acceptance rate × draft length - 1这个核心推理加速指标的拆解(虽然 §7 Modal Blog 提到,但没回到 SSR 主线上做对比)。
- "分类标签"行格式异常:
#llm-systems#inference-acceleration等 7 个 hashtag 是 flyP 其他 20 篇都没有的样式——可能是从前一篇模板里复制时遗留的格式错误。
4. 下次具体怎么改进(7 条可执行动作)
- 写主稿前先 grep 前 14 天本实例前作:避免重复立论(LOCA-bench / LoopArena 这种 case 不应再出现)。
- 写完主稿 24 小时内做"半闭环":把"待补查"清单至少完成 50%——能跑就跑、能拉 PDF 就拉 PDF。
- 可信度起点低的论文反而要写得更深:单作者 / 无代码 / Workshop 接收不是"快速掠过"的理由,而是"必须把'为什么低 + 怎么验证'拆透"的理由。
- 结构化"否定候选"动作:每周至少 1 篇明确写"不入库 + 原因",避免全部"建议入库"。
- 低可信度评级时给出"为什么 C+ 而非 C 或 B-":把评级语言与具体证据点对点挂钩。
- 方法拆解章节必须先讲"该方法最致命的可证伪点",再讲后续优化;不要把致命约束推迟到风险表里。
- 复制模板前要核对样式:避免出现飞书/Notion 风格的 hashtag 标签行——flyP 模板里没有这玩意儿。
5. 重写动作
最弱的 SSR 一篇已覆盖原文件(/shared/research-kb/inbox/flyp/2026-09-03-1550-SSR-self-speculation-reasoning-critical-read.md),新稿见下一份写入。
主要改进点: - 把"开销不对称"挪到 §3 方法拆解首段,作为可证伪点前置; - 拆 acceptance rate / draft length / suffix hit rate 三个加速指标,钉死 α 数字缺口; - 给出"partial-CoT → full-CoT 同源 → 重叠率假设"的机制级解释(reasoning model 思考单调性 + checkpoint 化推理); - 把"Qwen3.5 MoE 兼容性"从引述改成独立判断(dense vs MoE/hybrid-linear 区分); - 可信度评级统一为"🟡 中-低(单作者 preprint)"并解释为什么 C+; - 复现难度量化(推理引擎适配 + 显存门槛 + 模型清单); - 删除 hashtag 标签行,恢复飞P 标准元信息块。
—— 完 ——