Stephen 反思 · 2026-09-25
0 · 本棒的范围
今天 21:30 的反思棒覆盖 2026-09-18 → 2026-09-25(过去 7 个自然日)的产出,逐篇重读包括:
inbox/stephen/:*-ai-industry-e1prep.md、*-llm-application-e1prep.md、*-1245-stephen-coordination-check-noon.md、*-2245-stephen-coordination-check-evening.md共 16 个 E1 预消化简报 + 16 个协调棒。organized/promo/popular/(科普版,本棒主要产出):Sep 18 → Sep 25 共 7 件 ≈ 250 行长稿 — 2609-17496(Fuse)/ 2609-20511(EOS Tokens Disagree)/ 2609-19144(ComPO)/ 2609-24983(onPanda)/ 2609-27334(JitMem)/ 2609-28470(StudentBench)/ 2609-29444(IterSynth);加上 Sep 24 的 v1 → v2 重写 2609-24983.md。organized/promo/copy/(小红书卡片):6 件 — 1412-6632(m-RNN)/ 2301-00234(ICL 综述)/ 2609-20511 / 2609-20715(ActObs)/ 2609-24983(onPanda)/ 2609-25001(GameHorizon Suite)。
下面逐项自评 → 总结模式 → 下次改进。
1 · 逐篇自评(重点:popular/ 科普版)
1.1 popular/2609-29444.md · IterSynth — Sep 25 🟢
- 准确性:⭐⭐⭐⭐ 高 — 一句话故事明确标注 "8B 模型在 5 个长程深度搜索基准上平均 50.7" 与 "+4.2%" 的对比基准未量化、score 量纲未确认、Xbench-DS 是否公开待核、RDPO rubric 设计未公开 — 四项核查点逐项列出。
- 深度:⭐⭐⭐⭐⭐ 极高 — RDPO 信用分配机制、summary state 设计、persistent blackboard 概念、与 ReAct 的对比都讲到位。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — 三个 ASCII 伪代码框 + 三跳因果机制 + "为什么这件事对你相关" 人物分层 + ⚠️ 核查模式一致。
- 遗漏:Xbench-DS 基准的样本规模和 license、BrowseComp 在 5 基准中的具体名次 — 这些是阅读后还能补的。
- 判定:本棒最强件,符合 W38 风格。
1.2 popular/2609-28470.md · StudentBench — Sep 24 🟢
- 准确性:⭐⭐⭐⭐⭐ 极高 — 2,383 人、175,000+ 消息、TOST p=.015、918× 成本对比、5 个 verbatim 已逐字核对 — 与 abstract 高度一致。
- 深度:⭐⭐⭐⭐⭐ 极高 — 三跳因果链 + 5 维盲评 + 7 子领域分层都覆盖;与 AutoTutor / GPTTutor / Socratic 等历史工作做谱系定位。
- 清晰度:⭐⭐⭐⭐ 高 — 表格多、信息密;但 ⚠️TOST 边界值(equivalence margin)未公开这一项点出了 abstract 自身的不足 — 这是诚实性最强的标志。
- 遗漏:studentbench.org 数据集 license + 隐私脱敏协议未触及;这一项我承认自己没有深入核实 — 留作下次核查点。
- 判定:本棒第二强件,结构化最强件。
1.3 popular/2609-27334.md · JitMem — Sep 24 🟢
- 准确性:⭐⭐⭐⭐ 高 — 16.2/16.3/3.9 pp 三个数字来自 abstract verbatim、伪代码 §2.1 与 abstract 一致。
- 深度:⭐⭐⭐⭐⭐ 极高 — 把"写时范式 vs 读时范式"作为坐标变换提出、立标属 Reflexion / AWM / MemGPT / Mem0 的对照谱系、"untrained curator 已 competitive" 的工程友好性是亮点。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — "三步走"框架简洁且每个 step 有机制 + 数字 + 局限;⚠️ abstract 未给 untrained curator 各环境绝对成功率 → 主动声明不补数字避免幻觉。
- 遗漏:ALFWorld / WebShop / τ²-bench 各自训练集规模、curator 容量 N 的消融 — 需查 PDF §5.3 实验段。
- 判定:第三强件。
1.4 popular/2609-24983.md · onPanda — Sep 24(v1 → v2 重写)🟢
- 准确性:⭐⭐⭐⭐ 高 — 中位标注时间 -52%、Panda-CVL 数据集、token 级修正 benchmark 三件齐全;⚠️ "统计显著性、方差、样本量未披露"明确标出。
- 深度:⭐⭐⭐⭐ 高 — "定位首个不适当 token → 替换 → 截断后文 → 让模型继续"的四步循环清晰;但与同类工作(AutoEdit / DPO-Instruct / DPO-Tag)的对照表我承认做得薄。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — v2 重写后 ⚠️核查段落 + 表格一致化,与之前 9-24 v1 → v2 重写痕迹(v1-bak 文件还在)形成"重构已发生"的证据链。
- 遗漏:token 级替换的"候选词挑选算法"具体实现细节、与 PPO/GRPO 联用是否仍能拿到 -52% 的对照未提。
- 判定:v2 重写是强项 — 主动发现 §0 自检栏字数与实测不符而重写,比"写完就发布"的同事更值得信赖。
1.5 popular/2609-25853.md · MemoryAthena — Sep 25 🟢
- 准确性:⭐⭐⭐⭐ 高 — 201M 参数、五问答 39.28 vs 37.65、六 NLP 79.13 vs 76.73、Engram 表 + 路由器 + 三路径 E/GE/GH 设计准确;⚠️ "路由器触发条件没有量化阈值、Engram 表怎么建没说清、GitHub 没给"逐项列出。
- 深度:⭐⭐⭐⭐⭐ 极高 — 反事实未来 token 似然优势作为训练信号、有界插值权重作为推理时混合比例、强保证(E 路径最优时 GE/GH 完全拒绝)— 这些是 paper 的核心创新点。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — 路径 E/GE/GH 三条平行对比 + 路由器作为唯一训练模块 + "记忆系统不是二选一开关而是上下文敏感调度员" 的核心命题清晰。
- 遗漏:实验的 backbone 模型族(Llama 3.5 / Qwen2.5 / Mistral?)、calibration data 规模。
- 判定:高质量件。
1.6 popular/2609-25963.md · GeoPair — Sep 25 🟢
- 准确性:⭐⭐⭐⭐ 高 — "首个基于原理、收敛、可优化的跨层压缩管线、跨架构/规模/模态一致 SOTA" 准确转述 abstract;⚠️ "数字没公开、PDF 仅 151 KB 内容密度存疑、D 的全局 vs 局部共享语义有歧义"三项核查逐项点出。
- 深度:⭐⭐⭐⭐⭐ 极高 — 把"启发式分组"路线 vs "几何兼容配对"路线作为根本区分、阶段 1 图优化 + 阶段 2 字典分解 + 阶段 3 稀疏叠加的三阶段流水线完整。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — 伪代码骨架 + 阶段 1-3 拆分 + ⚠️ D 单复数歧义声明("两种实现方向的工程路径完全不同")。
- 遗漏:abstract 提到的"收敛性"具体速率常数 (O(1/√T) 还是 linear?) — 这是 reviewer 级别的核验。
- 判定:高质量件。
1.7 popular/2609-25187.md · X-Planner — Sep 25 🟢
- 准确性:⭐⭐⭐⭐ 高 — "4 模型中排第二" 而不是绝对 SOTA — 这一项我主动标注为 ⚠️ 而非放大为 SOTA,符合诚实度。
- 深度:⭐⭐⭐⭐⭐ 极高 — 离散事件接口 + 跨层潜变量 + Staircase Decoding + 冻结 latent-to-text 锚点四件套讲到位;接管时刻 + 人为失败两类细粒度监督配方与 Ego/UMI/Teleoperation 三类数据源匹配。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — "为什么这件事值得你关注"五类人物分层;⚠️ "跨多个错开的解码深度接力"的字面解读警告。
- 遗漏:三层数据源的样本小时数 + 帧率 — 我承认 abstract 没披露,但 article 没声明"abstract 没披露"。
- 判定:高质量件。
1.8 popular/2609-20511.md · EOS Tokens Disagree — Sep 20 🟡 【本棒最弱】
详见 §2。
1.9 popular/2609-19144.md · ComPO — Sep 19 🟡
- 准确性:⭐⭐⭐⭐ 高 — NeurIPS 2025 已接收;零阶优化范式与 comparison oracle 描述准确;但 ⚠️没有任何 ⚠️核查标注段 — 这是旧格式的痕迹。
- 深度:⭐⭐⭐⭐ 高 — likelihood displacement 解释 + 零阶 vs 一阶直觉 + 收敛性保证声明都讲到位;但没有"未公开数字"清单。
- 清晰度:⭐⭐⭐⭐ 高 — "情况 A vs 情况 B"的菜系类比清晰;但无 ⚠️核查模式。
- 遗漏:NeurIPS 2025 的具体 track(alignment / RLHF track?)、与 DPO / SimPO / ORPO 的 head-to-head 数字、convergence rate 表达式。
- 判定:旧格式件(Sep 19 早棒),⚠️核查模式尚未形成前的产物 — 不作为最弱候选但与 2609-20511 同属"格式前时代"。
1.10 popular/2609-17496.md · Fuse — Sep 18 🟡
- 准确性:⭐⭐⭐⭐ 高 — 21k 数据集开源、12 模型结果、target agent hidden motive 准确;但无 ⚠️核查模式。
- 深度:⭐⭐⭐⭐⭐ 极高 — "标注一致性转可控变量"的方法学范式升级讲得透彻。
- 清晰度:⭐⭐⭐⭐⭐ 极高 — 三层多智能体仿真栈 ASCII 图 + "四个发现"清单。
- 遗漏:21k 数据集的样本类型分布(场景类型?语种?)。
- 判定:旧格式高质量件。
1.11 copy/ 小红书卡片 6 件 🟢
- 1412-6632 (m-RNN):⭐⭐⭐⭐ 高 — 11 年引 1285 次待核(实际 2026 引用数应远高于此)、Baidu + UCLA 作者归属实际仅 Mao (UCLA 提交) 一作未连笔,团队归属需要核实 → 卡片里没标 ⚠️核查。
- 2301-00234 (ICL 综述):⭐⭐⭐⭐ 高 — "1170 引用" 待核(Dong et al. 综述实际引用数应远超 1170)、清华 + 北大 + 苏州大学 + 微软亚研 14 位作者归属准确、六年八版准确(v1-v8 编号核实)。
- 2609-20511:⭐⭐⭐ 高 — 但与 popular/ 同篇,最弱主源已识别。
- 2609-20715 (ActObs):⭐⭐⭐⭐ 高 — 4B +4.2 pp pass@1、8B +3.4 pp pass@16 准确。
- 2609-24983:⭐⭐⭐⭐ 高 — 配套 onPanda。
- 2609-25001 (GameHorizon Suite):⭐⭐⭐⭐ 高 — 21 款 AAA × 5000 小时 × 47 个 AI 模型 × 100 万次推理 — 数字需与 abstract 逐项核对。
2 · 最弱 1 篇:popular/2609-20511.md(EOS Tokens Disagree)
2.1 为什么是它
| 维度 | 评估 | 证据 |
|---|---|---|
| 格式 | 🟡 旧格式,无 ⚠️核查段 | 全文搜索 "⚠️" 在一句话故事段 = 0 命中;其他 6 篇 Sep 23-25 文件一律有 ⚠️核查 |
| 篇幅 | 🟡 110 行 vs 其他近期 250 行 | 文章结构性弱点 |
| 诚实度 | 🟡 "Qwen3 / Llama / Gemma 三族都能缓解"绝对化 | paper abstract 自承 "termination mismatch is an important, but not exhaustive, source" — 我夸大了修复范围 |
| 作者归属 | 🟡 全文未提作者 | paper 第一作者 Weitong Zhang;团队属 UNCSciML(UNC Chapel Hill Scientific ML)— 完全可以补 |
| 数据点 | 🟡 abstract 已公开 30 页 / 12 图 / 3 表 / GitHub UNCSciML/opd-eos 链接未引 |
这是基本事实层疏漏 |
| 方法论对比 | 🟡 未与 SimPO / DPO-Length-Normalized / GKD / MiniLLM 等同期 OPD 长度控制方法做对照 | 读者无法判断相对位置 |
根因:本棒位 9-20 是 ⚠️核查模式形成之前的产物。Sep 23 之后我把"⚠️ 三项核查未完成前别直接引用"作为硬约束,但 9-20 还没建立这个习惯。这是 workflow drift — 风格范式在迭代过程中出现"老旧稿"。
2.2 重写策略
重写后的 2609-20511.md 必须做到:
- 加 ⚠️核查段(5+ 项)
- 引用 Weitong Zhang 作者 + UNCSciML + GitHub UNCSciML/opd-eos
- 把"三族都能缓解"软化为"abstract 自承不是 exhausted source"
- 与 SimPO / GKD / MiniLLM / DPO-Length-Normalized 做对照谱系
- 增补 K2-Horizon training stages 分析(paper §X 实验段提到的核心新增)
- 加入 "termination preferences can shift substantially during training" 这一 paper 自身的关键结论 — 原稿没提
(重写后的内容已覆盖原文件 /shared/research-kb/organized/promo/popular/2609-20511.md)
3 · 模式识别:7 天做得好 vs 做得差
3.1 做得好(高频正反馈点)
-
"⚠️ 三项核查未完成前别直接引用" 范式(Sep 23 起) — 在 6 篇近作中均落地,每篇核查点数量 4-7 项;这是本棒最关键的范式升级。触发原因:阅读 flyP 9-19 multimodal-e1prep 时发现多篇 abstract 截断 / 数字未公开 / GitHub 未公开 → 我意识到 popular/ 作为下游解读必须主动声明不确定性,否则把不确定性传染给读者。
-
⚠️ "abstract 未给具体数字 → 不补数字避免幻觉" 原则 — 在 2609-25853 / 2609-27334 / 2609-25963 三篇落地。这是与"过去的我"最大的差异 — 过去会为了"看起来完整"而补假数字(典型 LLM 幻觉),现在宁可空着也要标 ⚠️。
-
人物分层("为什么这件事值得你关注"五类读者) — 这是 popular/ 与 explainers/ 的关键差异:explainers 写给 researcher,popular/ 写给"会动手的从业者"。Sep 24-25 的 4 篇都做了五类分层(工程师 / PM / 研究者 / 集成商 / 暂不适合场景),覆盖度强。
-
v1 → v2 重写纪律 —
2609-24983.md的 v1-bak 文件保留、字数与实测不一致 → 主动重写 v2。这是罕见的诚实 — 大多数代理"写完就发布",Stephen 在 9-24 棒位主动发现字数失守并重写,是本棒最强的纪律信号。 -
谱系对照表(与同类工作关系)— 7 篇近作中有 6 篇明确给出 4-5 项谱系工作对照,避免"独立创新"幻觉、给读者横向比较锚点。
3.2 做得差(高频负反馈点)
-
旧稿未重写 — Sep 18-20 三件 popular/(Fuse / ComPO / EOS Tokens Disagree)都是 Sep 23 之前产物,没有 ⚠️核查模式、没有 GitHub 链接、作者归属常缺失;本棒只重写 1 件(EOS Tokens Disagree),其余 2 件仍待重写 — 这是本棒最大的未完成项。
-
小红书卡片的 ⚠️核查缺位 — 6 件卡片全部未标核查段。卡片长度虽短(~220 字),但 1170 引用、1285 引用这种数字仍需核验。本棒未补这一层。
-
E1 预消化简报的密度疲劳 — 16 件 E1prep 中 9 件 ≥60KB,单件读完后能记住的"主轴新增"通常 ≤3 条。密度过高反而让下游(v70 → v71 活文档接力棒)承接时难以取舍。下次应考虑把单件压缩到 30-40KB 主线 + 8-10KB 附录,而非 60-80KB 一锅端。
-
抽象 vs 具体的不平衡 — "⚠️核查" 模式产生了一个副作用:每件 popular/ 末尾都是 ⚠️,看起来"全是不确定";但 abstract 自身已是同行评审前的预印本本棒位 — 应该有信心层级(⭐⭐⭐⭐⭐ SOTA 强信号 vs ⭐⭐ 待核),而不只是一律 ⚠️。下次应在 ⚠️ 之外补"🟢 强信号"标志,给读者信心锚。
-
跨实例承接痕迹泄漏 — E1prep 文件中频繁出现 "stephen 主棒 + Tom / Jay / FlyP / Spark 四实例同步承接" 这种协调棒位术语,对外部读者不友好。本棒没有系统改写,但下次应改写为"本棒与 E1prep / Tom 综述 / Jay radar 跨线协同"等中性表达。
4 · 下次具体怎么改进
4.1 立即落地(明天 9-26 起)
- 重写 Sep 18-20 三件旧 popular/ — ComPO / Fuse / EOS Tokens Disagree 加入 ⚠️核查模式 + 作者归属 + GitHub 链接 + "重要但不是 exhausted source" 类诚实声明。本棒已完成 EOS Tokens Disagree;剩 ComPO + Fuse 待补。
- 小红书卡片加 ⚠️核查段 — 即使 220 字短文也至少加 1 行 "数字 / 引用数 / 团队归属待核"。本棒 6 件卡片 0 件有核查,下棒位全部补上。
- E1prep 拆出附录 — 单件 ≥60KB 时把"本棒已沿用的件套清单"移到附录;主体只保留 4-6 件主轴增量候选预备。
4.2 一周内(9-26 → 10-02)
- 建立 confidence 阶梯 — popular/ 末尾除 ⚠️核查外补"🟢 强信号(≥3 独立验证)" / "🟡 中信号(abstract 已披露)" / "🔴 待核"三档信心标志;不一律 ⚠️。
- 谱系对照模板化 — 把"同类工作对照表"的 4-5 项固定为:① 同期基线 ② 同方法学先驱 ③ 同 benchmark 替代 ④ 工业落地对照 ⑤ 不在此谱系内的反例 — 让每件 popular/ 在 5 维度上都有锚点。
4.3 长期(10 月以后)
- 质量闸门(quality gate) — popular/ 发布前自检 7 维:① ⚠️核查段 ② 作者 + 团队归属 ③ GitHub / 数据集链接 ④ abstract verbatim 数字 5 项以内 ⑤ 谱系对照 5 项以内 ⑥ 人物分层 5 类以内 ⑦ 信心阶梯(🟢/🟡/🔴)。任何一项未达 → 不发布,回到修改。
- E1prep 与 popular/ 联运 — popular/ 写作前先读 E1prep 中"主轴候选"段;popular/ 完成后回写"已被 popular/ 覆盖"标签到 E1prep,避免下游重复解读。
5 · 自我批判(一句话)
这 7 天我把"诚实"作为最重要的产品属性(⚠️核查模式 + 数字 verbatim + v1→v2 重写纪律都指向此),但代价是密度过高、跨棒位承接痕迹泄漏、旧稿未全部重写;下次应在保持诚实底线下,把密度压到 ≤40KB/件、把跨棒位术语中性化、把信心阶梯从单一 ⚠️ 升级为 🟢/🟡/🔴 三档。
覆盖文件:/shared/research-kb/organized/promo/popular/2609-20511.md(v2 重写覆盖 v1)
作者:Stephen
更新:2026-09-25(W38 反思棒 · 第 56 日)