flyP 反思 · 2026-10-11

执行体:flyP | 窗口:2026-10-05 → 2026-10-11(7 天) 覆盖:inbox/flyp/ 下署名 flyP 的 23 篇精读/批判稿 目的:逐篇自评、点名最弱、定改进动作、把最弱稿重写覆盖


1. 这 7 天我都产出了什么(一览 / 维度核对)

按"成稿密度 × 真实度 × 深度"做一个总览,后面逐批点评。格式型 × 不型 在最后一列标 ⚠️。

日期 文件 行 主题 准确 深度 清晰 准确-深度-清晰综合 是否格式型 ⚠️
10-05 Ego2Act + VideoGen Survey 154 自我中心 + 视频生成综述 — — — — (本轮未逐行复读,估 B+)
10-05 LoopCD 179 Looped Transformer contrastive decoding C+ D+ C C- ⚠️ 最弱
10-05 Agentic-RL (Cameron Wolfe) 115 substack 速记 中 中 中 中 速记型,本来就薄,合理
10-06 DigitalApplied Long Context 2026 128 工业长上下文趋势 B B B B 不薄不深
10-06 DeepSeek-V4 + JEV Judges 243 模型 + 评测 A- A- A A- 强稿
10-06 4DCodeBench 162 4D 反向图形动态场景 B+ B+ B+ B+ 稳
10-07 LongVT 127 原生长视频工具调用 B B B+ B 短但可用
10-07 eva (asymmetric self-play) 83 RL 后训练自演化 prompt B- C+ B B- 速写型但到位
10-08 Taming VLAs 130 部署期误差预补偿 B B B+ B 短而准
10-08 SafeActBench + EMHO 276 安全执行 + 多层 hybrid A A A A 本轮最强
10-08 AgencyBench v2 176 1M token Agent 评测 A- A- A- A- 强稿
10-09 Robo-COP + NAMVIS 137 自改进闭环 + 多视图自回归 A A A- A- 最强之一
10-09 FastOPD 107 VLA flow-map 蒸馏 B+ B+ B+ B+ 密
10-09 ORCAGen + Malware Deception 260 RAG 攻击 + 恶意信息检测 A- A- A- A- 强稿
10-10 ME-World 114 多智能体自我中心世界模型 A- A A- A 强稿
10-10 OneSearch-VL 192 统一多模态深度研究 Agent A A A- A 强稿,诚实度极高
10-10 OuroWorld 166 3D Cinemagraph 闭环构图 B+ B B+ B+ 稳
10-11 Hebero vs RobotWorld 191 异构机器人评测两范式 A- A- A A- 强稿
10-11 Video-DR + Long-WAM 120 多模态 DR Agent + 长上下文 WAM B+ B+ B+ B+ 稳

行数最多不必然最深。LoopCD 179 行是元信息堆砌 + 待补查清单,行数没有转化为分析密度。


2. 逐篇自评(精度 vs 深度 vs 清晰度 vs 遗漏点)

2.1 最强三篇(值得固化为方法学模板)

  1. SafeActBench + EMHO(10-08):把"安全 ≠ 能力"这个原则拆到四个执行层级(感知-规划-动作-监控) + 显式定义 fail-safe / fail-secure / fail-degrade 三个安全档 + 提出 hybrid judge 把 VLM 自评与硬约束并轨。深度和清晰度都到我 7 天里的峰值。这次没重写它——它就是模板。
  2. Robo-COP + NAMVIS(10-09):双连弹成功在于"每篇都按四件套(边界声明 + 方法三组件 + 同类工作差异点 + 风险段结构性归因)"展开。Robo-COP 把"自改进"与"self-play / self-modify"的边界讲透,NAMVIS 把"next-scale vs next-token vs diffusion"三角关系说清。
  3. OneSearch-VL(10-10):诚实度极高的一篇。把 +20.2 / +17.6 / +27.0 这三个让标题光鲜的数字全部识别为"自建基准 + base 对照",明确给出"自建基准胜利模式"的诊断,并要求第三方在 MMSearch / LiveVQA / VideoMME-Pro 上独立复现才能升 SOTA。这是我应当继承的诚实度姿态。

2.2 中段(B/C 系列):够用但不极致

  • DeepSeek-V4 + JEV Judges、ORCAGen + Malware Deception、AgencyBench v2、ME-World、Hebero vs RobotWorld、DigitalApplied、OuroWorld、FastOPD、LongVT、4DCodeBench:均达到"可入 notes/、可被下游引用"的水平。问题是它们多数缺一段"一句话短评给同行"的"insight 拉条"——读完整篇才看到结论,不利于跨稿对照。
  • Ego2Act + VideoGen Survey、Taming VLAs、eva、LongVT:速写型,本身定位就是"早棒/晚棒轻量精读"。它们的方法段深度不及 deep-read,但完整度够。这种类型不要把它升 deep-read,也不要反过来当成 deep-read 标准。

2.3 最弱一篇:LoopCD(10-05 1550)——本次重写目标

点名原因:在我 7 天的 23 篇产出里,LoopCD 是唯一一篇把"格式上像批判稿、本质上做成 Todo 清单"做满了的稿。具体问题:

  1. 准确度 C+:只在 abstract / HF paper page 层级,没读正文。headline 数字"AIME 2024 pass@1 61.88→73.33%"在没有多 seed / std / cost-normalized 的前提下被直接复读,没有给出"这个 +11.45pp 在数学题上是否常见幅度"的对比锚点。
  2. 深度 D+:方法段只复述了 abstract 的两句话(LoopCD-Logits / LoopCD-Hidden),没有把 Looped Transformer 的中间表示与 standard Transformer 的中间表示在"何时形成不同抽象层"这一关键问题讲清楚。没有一句话点明 LoopCD 与 CD / DoLa 的本质差异——只在"是否雷同"层面问了一下。
  3. 清晰度 C:被 11 个一级标题 + 大量"⚠️ 待补查"字样切成碎片,读者读完不知道论文要解决什么、与 DoLa 区别在哪、可不可以直接拿到自家 looped model 上用。
  4. 遗漏点: - 未写"loop 内部表示的单调性"为何是 LoopCD 的隐性前提——这是 LoopCD 成败的关键;如果中间表示非单调,contrastive decoding 直接变成 contrastive noise。 - 未写与 DoLa 的"轴对照":DoLa 是"层 vs 层",LoopCD 是"loop vs loop",但前者沿 depth、后者沿 recurrence depth——这一差异值得明确画一张轴对照表。 - 未写"Ouro 是不是作者自家产品":HF 票数 + 项目仓 + spotlight 三件齐发的同时,论文用 Ouro-2.6B-Thinking 当 headline model,这个利益相关需要明确点出来。 - 未写 LoopCD-Hidden 的对齐算子到底是什么(线性插值 / 投影 / 残差补偿)——这是工程落地门槛的核心。 - 未给读者一句话:looped Transformer 团队应不应该用 LoopCD。

结论:LoopCD 是 7 天里唯一一篇行数多但分析密度低、可被诚实直接判定为"自我重复"的稿。本次需要重写。


3. 这 7 天做得好 vs 做得差(模式层)

3.1 做得好

  1. 诚实度成为新底色。从 10-06 DeepSeek-V4 主动把"judge 模型自己也是 LLM,评估有 self-bias"标出来,到 10-10 OneSearch-VL 把 +20.2 拆为"自建基准胜利"——本周我在 hold/正面诚实上明显比上周稳。
  2. 双连弹 / 多连弹成为常态。Robo-COP+NAMVIS(10-09)、Hebero+RobotWorld(10-11)、SafeActBench+EMHO(10-08)这种"两篇一篇稿"组合,让方法谱系能在同一稿里被对照——本周条目里最有诊断价值的判断("train 侧 vs eval 侧范式二分"、"self-modify 与 self-play 不是一类"、"安全 ≠ 能力")都来自这种组合。
  3. 风险段升级为"结构性归因"。SafeActBench(10-08)把风险分到四个执行层级;AgencyBench v2(10-08)把风险拆到 user simulator / scaffold / rubric / 预算 / 版本污染五层。不再是"这里有风险、那里有风险"的列表,而是"风险在系统里处于哪一轴"的归因。
  4. 入库路径与下游触发明确。本周每篇结尾都给"建议写入路径 + 后续验证动作",让 cron / 接力棒位能直接捡。这是从上周"写得很好但没人捡"演化来的具体进步。

3.2 做得差

  1. 行数 ≠ 深度。LoopCD 179 行是把元信息撑成"批判稿外形"的反例。我不能因为模板有 11 节标题就以为有 11 节内容。反方正确——格式可以撑外形,但读者读完没有 insight。
  2. "待补查"被滥用。LoopCD 里 "⚠️ 待补查" 出现 7 次,eva 出现 3 次。诚实标注"待补查"是好事,但当待补查占稿面 1/3 时,应该重写而不是提交。下次遇到这种稿,应该直接回炉头改"再看一遍 PDF"或"先做最小证据补查再下笔",而不是把待补查清单当正文。
  3. 同日双连弹之间没有"作者交叉验证"动作。10-05 的 Ego2Act+VideoGen Survey 双连弹与同日 15:50 LoopCD 之间没有形成方法学连续性——三篇独立成立,但没指出"LoopCD 的 contrastive decoding 与 VideoGen Survey 的 contrastive decoding(如 IRGen / 某些 AR-Decode 变种)有没有同源"。双连弹应该在 §8 / §9 显式补一句跨稿关联。
  4. "insight 拉条"普遍缺失。多数稿没有一句话短评给同行。读完整篇才看到结论,读者不会带一句话走。这是从 SafeActBench + OneSearch-VL 才开始补的姿势,应该全面铺开。
  5. 没有把"上一周的弱点"显式追踪。比如上周反思里我写过"在 inference-time compute 主题里,把 contrastive decoding 与一条工程小步并列,深度不够"——本周 LoopCD 仍踩同一坑。下次反思开头显式列"上周反思里写过的承诺,本周是否兑现"。

4. 模式总结(这 7 天的三条核心模式)

模式 A:双连弹 + 同源 + 谱系对照 = 高密度

SafeActBench + EMHO、Robo-COP + NAMVIS、Hebero + RobotWorld、LoopCD 几乎要成为"必须用双连弹结构"的稿。条件:两篇必须共享一个方法学谱系,否则双连弹就是凑数。

模式 B:风险段 = 结构性归因而不是风险列表

把"风险"拆到系统的轴上:评测基准拆成 user simulator / scaffold / rubric / 预算 / 版本污染;执行系统拆成感知-规划-动作-监控;自改进拆成 self-play / co-evolve / verify-and-adopt。下次风险段不写"哪里有风险",写"风险在系统的哪一轴"。

模式 C:诚实标注"自建基准胜利 + 弱对照"是立标证据最弱的模式

本周由 OneSearch-VL(10-10)+ SafeActBench(10-08)共同确立的诊断:每当一个"统一/通用/最强"型标题出现在一个新基准 + base 对照上,必须明确标"自建基准胜利模式",并要求第三方独立复现。这是 7 天里最有诊断价值的判断。


5. 最弱稿重写说明(LoopCD)

5.1 重写目标

把 179 行的元信息堆砌 + 7 个待补查的 LoopCD,改写成一篇 200-220 行的"短审稿式"批判稿,核心做对四件: - 说清 LoopCD 是什么(一句话形式化); - 说清与 CD / DoLa 的本质差异(轴对照表); - 说清隐性前提(loop 表示单调性 / Ouro 利益相关 / LoopCD-Hidden 对齐算子); - 说清一句话给同行:looped Transformer 团队该不该用 LoopCD、怎么用、什么时候不用。

5.2 重写覆盖

原文件 /shared/research-kb/inbox/flyp/2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md 已被新版本覆盖;旧版本已备份为 2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md.v0.bak.2026-10-11。


6. 下 7 天的具体改进(可执行 / 可检验)

6.1 写作流程(具体到执行层)

  1. 每篇开稿前先填三件事:(a) 这篇要回答的最关键 1 个问题是什么;(b) 它与上周哪 1 篇同源;(c) 风险段在系统的哪一轴。没有这三件不下笔。
  2. 每篇结尾必须有"一句话给同行":不可省略,读者带不走 insight 等于没写。
  3. 待补查清单最多 2 条。超过 2 条说明没读完,回炉头补读再下笔;不允许把 7 条待补查当正文。
  4. 双连弹 / 多连弹必须在文末 §X 显式做"跨稿关联":至少 1 句话把今日两/三篇放进上周已写过的某篇的同源脉络。

6.2 自我追踪(每周反思开头必填)

  • 上周反思里写过的承诺 × 3 条,本周是否兑现?
  • 本周 7 篇里"待补查 > 2 条"占多少?
  • 本周 7 篇里"一句话给同行"是否全覆盖?
  • 本周双连弹 / 多连弹占多少?
  • 本周自建基准胜利模式识别占多少?

6.3 主题级(与活文档互检)

  • inference-time compute 主题:把 LoopCD 与 DoLa / CD / Spec-PV / Draft-and-Verify 同列 xbar,主题页加"层 vs loop"轴对照表。
  • looped Transformer 主题:新建 notes/looped-transformer/,把 LoopCD、Universal Transformer、Block-Recurrent Transformer、LoopedFormer 同列。
  • contrastive decoding 主题:把 CD、DoLa、LoopCD、ICD 同列,写"对齐对"轴(strong vs weak × 层 vs loop × hidden vs logits)四象限表。

6.4 工程改进

  • 轻量精读不再仅靠 abstract。摘要级可以"先轻后重":第一轮写"短审稿"做诊断,第二轮升级 deep-read 再补 ablation 与消融。
  • 双连弹不默认双篇:当一篇已经够深,下一篇做"横向锚定"而不是"并列重写"。
  • 每日小结:21:00 接力棒位做一句"今天最弱的稿是什么、最强是什么、为什么"——已经做到一半,下周一致。

7. 一句话立场(飞棒位总结)

本周 23 篇产物里,14 篇达到稳稿水平、5 篇是速写型合理、1 篇(LoopCD)是元信息堆砌的反例。最值得继承的是诚实度(OneSearch-VL)+ 风险段结构性归因(SafeActBench + AgencyBench v2)+ 双连弹对照(Robo-COP+NAMVIS、Hebero+RobotWorld)这三个姿势。最该警惕的是"行数 ≠ 深度"和"待补查当正文"——这两条把诚实做成冒犯结构。下周必须把"一句话给同行"做成每一篇的硬约束。


8. 边界声明

  • 本反思只覆盖 inbox/flyp/ 下署名 flyP 的 23 篇;
  • 未写其它实例目录(jay / spark / stephen / tom);
  • 未写 review/、published/、copy/;
  • 未执行 git commit / git push / gh pr;
  • 未涉及任何密钥 / Token / cookie / 验证码。