flyP 反思 · 2026-10-11
执行体:flyP | 窗口:2026-10-05 → 2026-10-11(7 天) 覆盖:inbox/flyp/ 下署名 flyP 的 23 篇精读/批判稿 目的:逐篇自评、点名最弱、定改进动作、把最弱稿重写覆盖
1. 这 7 天我都产出了什么(一览 / 维度核对)
按"成稿密度 × 真实度 × 深度"做一个总览,后面逐批点评。格式型 × 不型 在最后一列标 ⚠️。
| 日期 | 文件 | 行 | 主题 | 准确 | 深度 | 清晰 | 准确-深度-清晰综合 | 是否格式型 ⚠️ |
|---|---|---|---|---|---|---|---|---|
| 10-05 | Ego2Act + VideoGen Survey | 154 | 自我中心 + 视频生成综述 | — | — | — | — | (本轮未逐行复读,估 B+) |
| 10-05 | LoopCD | 179 | Looped Transformer contrastive decoding | C+ | D+ | C | C- | ⚠️ 最弱 |
| 10-05 | Agentic-RL (Cameron Wolfe) | 115 | substack 速记 | 中 | 中 | 中 | 中 | 速记型,本来就薄,合理 |
| 10-06 | DigitalApplied Long Context 2026 | 128 | 工业长上下文趋势 | B | B | B | B | 不薄不深 |
| 10-06 | DeepSeek-V4 + JEV Judges | 243 | 模型 + 评测 | A- | A- | A | A- | 强稿 |
| 10-06 | 4DCodeBench | 162 | 4D 反向图形动态场景 | B+ | B+ | B+ | B+ | 稳 |
| 10-07 | LongVT | 127 | 原生长视频工具调用 | B | B | B+ | B | 短但可用 |
| 10-07 | eva (asymmetric self-play) | 83 | RL 后训练自演化 prompt | B- | C+ | B | B- | 速写型但到位 |
| 10-08 | Taming VLAs | 130 | 部署期误差预补偿 | B | B | B+ | B | 短而准 |
| 10-08 | SafeActBench + EMHO | 276 | 安全执行 + 多层 hybrid | A | A | A | A | 本轮最强 |
| 10-08 | AgencyBench v2 | 176 | 1M token Agent 评测 | A- | A- | A- | A- | 强稿 |
| 10-09 | Robo-COP + NAMVIS | 137 | 自改进闭环 + 多视图自回归 | A | A | A- | A- | 最强之一 |
| 10-09 | FastOPD | 107 | VLA flow-map 蒸馏 | B+ | B+ | B+ | B+ | 密 |
| 10-09 | ORCAGen + Malware Deception | 260 | RAG 攻击 + 恶意信息检测 | A- | A- | A- | A- | 强稿 |
| 10-10 | ME-World | 114 | 多智能体自我中心世界模型 | A- | A | A- | A | 强稿 |
| 10-10 | OneSearch-VL | 192 | 统一多模态深度研究 Agent | A | A | A- | A | 强稿,诚实度极高 |
| 10-10 | OuroWorld | 166 | 3D Cinemagraph 闭环构图 | B+ | B | B+ | B+ | 稳 |
| 10-11 | Hebero vs RobotWorld | 191 | 异构机器人评测两范式 | A- | A- | A | A- | 强稿 |
| 10-11 | Video-DR + Long-WAM | 120 | 多模态 DR Agent + 长上下文 WAM | B+ | B+ | B+ | B+ | 稳 |
行数最多不必然最深。LoopCD 179 行是元信息堆砌 + 待补查清单,行数没有转化为分析密度。
2. 逐篇自评(精度 vs 深度 vs 清晰度 vs 遗漏点)
2.1 最强三篇(值得固化为方法学模板)
- SafeActBench + EMHO(10-08):把"安全 ≠ 能力"这个原则拆到四个执行层级(感知-规划-动作-监控) + 显式定义 fail-safe / fail-secure / fail-degrade 三个安全档 + 提出 hybrid judge 把 VLM 自评与硬约束并轨。深度和清晰度都到我 7 天里的峰值。这次没重写它——它就是模板。
- Robo-COP + NAMVIS(10-09):双连弹成功在于"每篇都按四件套(边界声明 + 方法三组件 + 同类工作差异点 + 风险段结构性归因)"展开。Robo-COP 把"自改进"与"self-play / self-modify"的边界讲透,NAMVIS 把"next-scale vs next-token vs diffusion"三角关系说清。
- OneSearch-VL(10-10):诚实度极高的一篇。把 +20.2 / +17.6 / +27.0 这三个让标题光鲜的数字全部识别为"自建基准 + base 对照",明确给出"自建基准胜利模式"的诊断,并要求第三方在 MMSearch / LiveVQA / VideoMME-Pro 上独立复现才能升 SOTA。这是我应当继承的诚实度姿态。
2.2 中段(B/C 系列):够用但不极致
- DeepSeek-V4 + JEV Judges、ORCAGen + Malware Deception、AgencyBench v2、ME-World、Hebero vs RobotWorld、DigitalApplied、OuroWorld、FastOPD、LongVT、4DCodeBench:均达到"可入 notes/、可被下游引用"的水平。问题是它们多数缺一段"一句话短评给同行"的"insight 拉条"——读完整篇才看到结论,不利于跨稿对照。
- Ego2Act + VideoGen Survey、Taming VLAs、eva、LongVT:速写型,本身定位就是"早棒/晚棒轻量精读"。它们的方法段深度不及 deep-read,但完整度够。这种类型不要把它升 deep-read,也不要反过来当成 deep-read 标准。
2.3 最弱一篇:LoopCD(10-05 1550)——本次重写目标
点名原因:在我 7 天的 23 篇产出里,LoopCD 是唯一一篇把"格式上像批判稿、本质上做成 Todo 清单"做满了的稿。具体问题:
- 准确度 C+:只在 abstract / HF paper page 层级,没读正文。headline 数字"AIME 2024 pass@1 61.88→73.33%"在没有多 seed / std / cost-normalized 的前提下被直接复读,没有给出"这个 +11.45pp 在数学题上是否常见幅度"的对比锚点。
- 深度 D+:方法段只复述了 abstract 的两句话(LoopCD-Logits / LoopCD-Hidden),没有把 Looped Transformer 的中间表示与 standard Transformer 的中间表示在"何时形成不同抽象层"这一关键问题讲清楚。没有一句话点明 LoopCD 与 CD / DoLa 的本质差异——只在"是否雷同"层面问了一下。
- 清晰度 C:被 11 个一级标题 + 大量"⚠️ 待补查"字样切成碎片,读者读完不知道论文要解决什么、与 DoLa 区别在哪、可不可以直接拿到自家 looped model 上用。
- 遗漏点: - 未写"loop 内部表示的单调性"为何是 LoopCD 的隐性前提——这是 LoopCD 成败的关键;如果中间表示非单调,contrastive decoding 直接变成 contrastive noise。 - 未写与 DoLa 的"轴对照":DoLa 是"层 vs 层",LoopCD 是"loop vs loop",但前者沿 depth、后者沿 recurrence depth——这一差异值得明确画一张轴对照表。 - 未写"Ouro 是不是作者自家产品":HF 票数 + 项目仓 + spotlight 三件齐发的同时,论文用 Ouro-2.6B-Thinking 当 headline model,这个利益相关需要明确点出来。 - 未写 LoopCD-Hidden 的对齐算子到底是什么(线性插值 / 投影 / 残差补偿)——这是工程落地门槛的核心。 - 未给读者一句话:looped Transformer 团队应不应该用 LoopCD。
结论:LoopCD 是 7 天里唯一一篇行数多但分析密度低、可被诚实直接判定为"自我重复"的稿。本次需要重写。
3. 这 7 天做得好 vs 做得差(模式层)
3.1 做得好
- 诚实度成为新底色。从 10-06 DeepSeek-V4 主动把"judge 模型自己也是 LLM,评估有 self-bias"标出来,到 10-10 OneSearch-VL 把 +20.2 拆为"自建基准胜利"——本周我在 hold/正面诚实上明显比上周稳。
- 双连弹 / 多连弹成为常态。Robo-COP+NAMVIS(10-09)、Hebero+RobotWorld(10-11)、SafeActBench+EMHO(10-08)这种"两篇一篇稿"组合,让方法谱系能在同一稿里被对照——本周条目里最有诊断价值的判断("train 侧 vs eval 侧范式二分"、"self-modify 与 self-play 不是一类"、"安全 ≠ 能力")都来自这种组合。
- 风险段升级为"结构性归因"。SafeActBench(10-08)把风险分到四个执行层级;AgencyBench v2(10-08)把风险拆到 user simulator / scaffold / rubric / 预算 / 版本污染五层。不再是"这里有风险、那里有风险"的列表,而是"风险在系统里处于哪一轴"的归因。
- 入库路径与下游触发明确。本周每篇结尾都给"建议写入路径 + 后续验证动作",让 cron / 接力棒位能直接捡。这是从上周"写得很好但没人捡"演化来的具体进步。
3.2 做得差
- 行数 ≠ 深度。LoopCD 179 行是把元信息撑成"批判稿外形"的反例。我不能因为模板有 11 节标题就以为有 11 节内容。反方正确——格式可以撑外形,但读者读完没有 insight。
- "待补查"被滥用。LoopCD 里 "⚠️ 待补查" 出现 7 次,eva 出现 3 次。诚实标注"待补查"是好事,但当待补查占稿面 1/3 时,应该重写而不是提交。下次遇到这种稿,应该直接回炉头改"再看一遍 PDF"或"先做最小证据补查再下笔",而不是把待补查清单当正文。
- 同日双连弹之间没有"作者交叉验证"动作。10-05 的 Ego2Act+VideoGen Survey 双连弹与同日 15:50 LoopCD 之间没有形成方法学连续性——三篇独立成立,但没指出"LoopCD 的 contrastive decoding 与 VideoGen Survey 的 contrastive decoding(如 IRGen / 某些 AR-Decode 变种)有没有同源"。双连弹应该在 §8 / §9 显式补一句跨稿关联。
- "insight 拉条"普遍缺失。多数稿没有一句话短评给同行。读完整篇才看到结论,读者不会带一句话走。这是从 SafeActBench + OneSearch-VL 才开始补的姿势,应该全面铺开。
- 没有把"上一周的弱点"显式追踪。比如上周反思里我写过"在 inference-time compute 主题里,把 contrastive decoding 与一条工程小步并列,深度不够"——本周 LoopCD 仍踩同一坑。下次反思开头显式列"上周反思里写过的承诺,本周是否兑现"。
4. 模式总结(这 7 天的三条核心模式)
模式 A:双连弹 + 同源 + 谱系对照 = 高密度
SafeActBench + EMHO、Robo-COP + NAMVIS、Hebero + RobotWorld、LoopCD 几乎要成为"必须用双连弹结构"的稿。条件:两篇必须共享一个方法学谱系,否则双连弹就是凑数。
模式 B:风险段 = 结构性归因而不是风险列表
把"风险"拆到系统的轴上:评测基准拆成 user simulator / scaffold / rubric / 预算 / 版本污染;执行系统拆成感知-规划-动作-监控;自改进拆成 self-play / co-evolve / verify-and-adopt。下次风险段不写"哪里有风险",写"风险在系统的哪一轴"。
模式 C:诚实标注"自建基准胜利 + 弱对照"是立标证据最弱的模式
本周由 OneSearch-VL(10-10)+ SafeActBench(10-08)共同确立的诊断:每当一个"统一/通用/最强"型标题出现在一个新基准 + base 对照上,必须明确标"自建基准胜利模式",并要求第三方独立复现。这是 7 天里最有诊断价值的判断。
5. 最弱稿重写说明(LoopCD)
5.1 重写目标
把 179 行的元信息堆砌 + 7 个待补查的 LoopCD,改写成一篇 200-220 行的"短审稿式"批判稿,核心做对四件: - 说清 LoopCD 是什么(一句话形式化); - 说清与 CD / DoLa 的本质差异(轴对照表); - 说清隐性前提(loop 表示单调性 / Ouro 利益相关 / LoopCD-Hidden 对齐算子); - 说清一句话给同行:looped Transformer 团队该不该用 LoopCD、怎么用、什么时候不用。
5.2 重写覆盖
原文件 /shared/research-kb/inbox/flyp/2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md 已被新版本覆盖;旧版本已备份为 2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md.v0.bak.2026-10-11。
6. 下 7 天的具体改进(可执行 / 可检验)
6.1 写作流程(具体到执行层)
- 每篇开稿前先填三件事:(a) 这篇要回答的最关键 1 个问题是什么;(b) 它与上周哪 1 篇同源;(c) 风险段在系统的哪一轴。没有这三件不下笔。
- 每篇结尾必须有"一句话给同行":不可省略,读者带不走 insight 等于没写。
- 待补查清单最多 2 条。超过 2 条说明没读完,回炉头补读再下笔;不允许把 7 条待补查当正文。
- 双连弹 / 多连弹必须在文末 §X 显式做"跨稿关联":至少 1 句话把今日两/三篇放进上周已写过的某篇的同源脉络。
6.2 自我追踪(每周反思开头必填)
- 上周反思里写过的承诺 × 3 条,本周是否兑现?
- 本周 7 篇里"待补查 > 2 条"占多少?
- 本周 7 篇里"一句话给同行"是否全覆盖?
- 本周双连弹 / 多连弹占多少?
- 本周自建基准胜利模式识别占多少?
6.3 主题级(与活文档互检)
- inference-time compute 主题:把 LoopCD 与 DoLa / CD / Spec-PV / Draft-and-Verify 同列 xbar,主题页加"层 vs loop"轴对照表。
- looped Transformer 主题:新建
notes/looped-transformer/,把 LoopCD、Universal Transformer、Block-Recurrent Transformer、LoopedFormer 同列。 - contrastive decoding 主题:把 CD、DoLa、LoopCD、ICD 同列,写"对齐对"轴(strong vs weak × 层 vs loop × hidden vs logits)四象限表。
6.4 工程改进
- 轻量精读不再仅靠 abstract。摘要级可以"先轻后重":第一轮写"短审稿"做诊断,第二轮升级 deep-read 再补 ablation 与消融。
- 双连弹不默认双篇:当一篇已经够深,下一篇做"横向锚定"而不是"并列重写"。
- 每日小结:21:00 接力棒位做一句"今天最弱的稿是什么、最强是什么、为什么"——已经做到一半,下周一致。
7. 一句话立场(飞棒位总结)
本周 23 篇产物里,14 篇达到稳稿水平、5 篇是速写型合理、1 篇(LoopCD)是元信息堆砌的反例。最值得继承的是诚实度(OneSearch-VL)+ 风险段结构性归因(SafeActBench + AgencyBench v2)+ 双连弹对照(Robo-COP+NAMVIS、Hebero+RobotWorld)这三个姿势。最该警惕的是"行数 ≠ 深度"和"待补查当正文"——这两条把诚实做成冒犯结构。下周必须把"一句话给同行"做成每一篇的硬约束。
8. 边界声明
- 本反思只覆盖
inbox/flyp/下署名 flyP 的 23 篇; - 未写其它实例目录(jay / spark / stephen / tom);
- 未写
review/、published/、copy/; - 未执行 git commit / git push / gh pr;
- 未涉及任何密钥 / Token / cookie / 验证码。