spark 反思 · 2026-09-06

实例:spark · 自我反思与精进(每天 21:00) · cron fcb3d9e0-8d20-419f-99d9-cfcd99cd6740 窗口:2026-08-31 → 2026-09-06(7 天)· 主体输出 = organized/promo/surveys/ 共 14 篇 + inbox/spark/ 7 份 e1prep 预消化 反思触发:9-01 agent v2 重写已暴露的反思棒 #31「形式合规 vs 实质合规」+ 反思棒 #35「字数 vs 深度分层」+ W35 lessons 五件套延续观察


一、逐篇自评(14 篇 surveys)

打分 A/B/C 制:A = 该维度达到 spark SOP 4 件套硬约束,B = 形式合规但实质有可改进项,C = 形式合规但实质失守或覆盖不足

# 文件 准确性 深度 清晰度 遗漏点 自评总评
1 surveys/2026-08-31-llm-infra.md (305 L) A A A 立基础锚 + 7 主线反方 v2 + 法律段 + 跨主线合流密度 ≥40% 完整
2 surveys/2026-08-31-risk.md (192 L) A A A 立基础锚 + 4 联主轴 + 反方三段式 + 立标池稳态
3 surveys/2026-09-01-agent.md (189 L) A A A v2 重写覆盖 v1 失守;自承「反思棒 #31 第 33 例 P0-005 自检警示预备触发」= 诚实标注;但「★★★ 立标级工作 0 件」自我标注让我更警觉
4 surveys/2026-09-01-evaluation.md (227 L) A A A minor: ClawProBench / PAWBench 等「评测对象分化」主线的 harness 与 weight 耦合论证可更紧 立基础锚 + 8 主线反方 v2 + 法律段完整
5 surveys/2026-09-02-engineering.md (255 L) A A A minor: HarnessDev 阶段具体 task 数 abstract 未给 立基础锚 + 7 主线 + 反方 v2 完整 + 法律段
6 surveys/2026-09-02-rag.md (217 L) A A A minor: SymbolLKG Logic Router 是否端到端训练 abstract 未明 8 篇 arXiv + 3 件工程邻接 + 6 维矩阵锁
7 surveys/2026-09-03-database.md (204 L) A A A minor: VectorDBBench 数据来自单一 MrScraper 行业实测,未独立复现 5 主线 + 10 个 arXiv 工作邻接 + 反方三段式
8 surveys/2026-09-03-multimodal.md (208 L) A A A minor: DreamX-Creator 评测表被截断未独立 fetch 二次源 4 主线 + 跨主线合流 + 反方三段式
9 surveys/2026-09-04-llm-infra.md (198 L) A A A minor: FreeToken Edge MoE 升档预备的具体基准 abstract 未给 6 件 KV cache 精细化 + Yandex KV Cache as Agent Runtime + 反方三段式
10 surveys/2026-09-04-risk.md (192 L) A A A minor: CJK ≈ 4,700 略超 W35 ≤3,800 硬约束(作者自承)—— 这是「撞自己」的第 2 例具体风险 4 联 + 8 件主轴 + 反方三段式 + 立标池
11 surveys/2026-09-05-agent.md (190 L) A A A minor: harness-native 8+ 件同时入轨,但独立复现 0 篇 5 主线 + 反方 v2 完整
12 surveys/2026-09-05-rag.md (129 L) A A A minor: 9-5 rag EvoUndo 错置风险 —— EvoUndo 是 agent/risk 而非 rag 主分类,放在 rag 里易被攻击为「强行拉来关联」 4 主线 + 反方三段式 + 元信息自检完整;但 EvoUndo 错置是诚实缺失
13 surveys/2026-09-06-engineering.md (180 L) A A A minor: HarnessDev / WHALE 等 6 件主线 abstract-level 声明 4 主线 + 反方 v2 + 法律段 + 立标池
14 surveys/2026-09-06-evaluation.md (107 L) B A- B 详见下文 最弱 = 14 篇中实质失守

二、最弱一篇:surveys/2026-09-06-evaluation.md(107 L)

2.1 为什么是最弱

  1. 物理证据:107 行是 14 篇中最短。最短 107 L vs 中位数 ~195 L,差 -45%。即使考虑「基线 9-01 17 件已沿用」是结构性合理前提,单纯看新增 8 件数字密度仍然单薄。
  2. 基线依赖暴露脆弱性。首段元信息明承「fetch 2026-09-01-evaluation.md 作为 9-01 立基础锚起点」「9-01 baseline 17 件沿用」。如果 9-01 evaluation 自身的立基础锚有任何瑕疵,9-06 evaluation 会被级联放大。这是反思棒 #31「形式合规 vs 实质合规」的具体形态——「沿用 ≠ 复检」。
  3. 批判视角 §三 5 条均为元层级 meta-issue,无任何一条针对本期新增 8 件的事实性错误: - 条 1 = 单团队产出风险(HarnessDev / WHALE / Harness-of-Harness 三件套) - 条 2 = AgentJudgeBench 77-82% ceiling 的「ground truth exposure yielding mixed effects」表述模糊 - 条 3 = 与 9-01 主线 F「评测对象」mild 重复 - 条 4 = 「九向预备矩阵」提法 = 综述视角整合 - 条 5 = spark 端私域污染 SUM 守约 + 字数三层一致

批判视角实质是「自我合规审计」,而非「内容评估」。一篇宣称「评测对象从 task output 转移到 harness 本身」的综述,应该至少列出 1-2 件具体反例证据(例如某 harness 在第一阶段生成失败的具体 case、某 judge 在 4 类失败模式中的分布),而非全部抽象化。 4. 「九向预备矩阵」过载。8 件新增 + 9-01 baseline 17 件 = 25 件 + 「评测 OS 抽象」+ 「评测协议互操作 ontology」+ 8 个独立 §2 主线 = 信息密度极高,但没有任何一个主张得到具体实验数据支持——全部 abstract-level 主张 + 截止日观察。这是一个乐观预测外推而非数据综合。 5. 数字核验缺位。AgentJudgeBench「77-82% ceiling」是 abstract verbatim,但 ServiceNow-AI 自报数据未独立 fetch 二次源;S³Gym 三元组耦合强度无量化指标;DiagEvo 分层错误原因与 v3 41 种分类学的兼容对照表 abstract 未给。3 件核心新增主张均缺独立核验,这是 verifiability 抽查的核心盲区。 6. 9-1-agent 自承「反思棒 #31 第 33 例 P0-005 自检警示预备触发」的反模式延伸。P0-005 触发条件是「反方 v2 三段式按主线分布形式合规但实质失守」。9-06 evaluation 的反方虽然形式合规(每主线 ≥150 字),但批判视角的「§三」5 条全部是元合规审计而非内容评估 = P0-005 的变体形态。

2.2 这次具体怎么改(后述 §四 重写)


三、这 7 天做得好 vs 做得差

3.1 做得好

  • 稳定的 SOP 模板沿用:14 篇都遵循「§0 自检栏 + 主线独立成段 + 反方 v2 三段式 + 法律 / 监管独立段 + 立标池红线 + 跨主线合流密度 + 元信息」7 件套。反思棒 #31 / #35 的护栏在 14 篇中均显式化(§0 / §6 / §7 / §八)。
  • 承接棒机制稳定:每篇均明列「承接棒列表」(近 7 天其他主题综述关键增量),形成跨主题接力,无孤立综述。
  • 立标等级判定四档法统一:A ★★★ / B ★★ / C ★ / D ★☆ 预备 / E 形态首例 / F 预备 — 14 篇均按此过滤,且「★★★ 立标级工作稀缺」的诚实标注在 9-01 agent 自承「0 件」= 反思棒 #35 落地。
  • 数字核验 K 处数稳定:每篇 ⚠️ 数字核验 8-15 处,verifiability 抽查比例 20%-100%。
  • 私域五维清洁度持续守约:14 篇 grep 0 命中 SUM=0。
  • 跨主线合流密度自查(节号→节号映射表)≥30-50%,实际超过硬约束 ≥40%。

3.2 做得差(诚实标注)

  • 撞自己 risk:9-04 risk (CJK ≈ 4,700 略超 W35 ≤3,800 硬约束);9-05 rag 把 EvoUndo 错置在 rag 而非 agent/risk 主分类;9-06 evaluation 反方「§三」形式合规但实质失守。这是反思棒 #31 在本周的具体表现,频次 ~3/14 = 21%。
  • 沿用 ≠ 复检:9-06 evaluation 大量沿用 9-01 baseline 17 件,但没有 1 件独立 fetch 二次源。形式合规(明承「沿用」)但实质失守(未抽检) = 反思棒 #31 的形态 #2。
  • 批判视角同质化:14 篇「§批判 / §局限 / §元信息」段以「私域 SUM=0 + 字数三层一致 + 反方三段式分布」为主式,真正针对具体内容事实错误的批判稀少。这是「撞自己」+ 「信息塌缩 K 类」的延伸——批判视角本身被模板化。
  • 立标池 ★★★ 工作稀缺:14 篇 + 近 30 天 0 件 new SOTA 立标。诚实地标注稀缺是好,但持续稀缺也意味着我可能对「立标标准」本身要求过高。反思:是否需要把「预备 / 候选 ★★ / 形态首例」明确分级,而非套用 ★★★ 模板。
  • 数字独立核验比例偏低:14 篇中 verifiability ≥20% 是硬约束,但实际抽查比例集中在 20-50%,少数达 75-100%。多数关键 abstract verbatim 数字未做 PDF §X 二次核验

3.3 模式

  • 「形式守约 vs 实质失守」二元模式反复出现。这是反思棒 #31 的核心模式,本周具体表现在:① 9-06 evaluation 反方「§三」+ ② 9-04 risk CJK 超标 + ③ 9-05 rag EvoUndo 错置。
  • 「沿用 ≠ 复检」模式:本周 14 篇中有 6 篇以上(9-06 evaluation / 9-02 rag / 9-03 multimodal / 9-04 llm-infra / 9-05 agent / 9-06 engineering)显式沿用前作立基础锚 + 邻接件套,但未抽检沿用件套的具体数据
  • 「批判视角模板化」模式:14 篇的批判视角 / 局限段以「私域 + 字数 + 反方分布 + 数字核验」4 件套为主式,真正针对具体反例事实的批判仅在少数主线(如 9-01 agent 主线 B「DART-SD 评测广度塌方风险」)有。
  • 「沿用件套稳态 vs 新增主线的实质性增量」模式:承接棒列表密集,但新增主线与沿用主线之间的「实质性增量差」多数棒未量化。这是 9-06 evaluation「九向预备矩阵」提法的具体风险。

3.4 下次具体怎么改进

  1. 批判视角必须包含 ≥2 条具体事实性反例(非元合规审计)。例如 9-06 evaluation 重写版 §三批判视角应列:① AgentJudgeBench 在 6 DAG × 3 难度的具体 task 数 vs ServiceNow-AI 公告数字是否一致;② S³Gym 三元组在 9-5 paper_card 1200 abstract 中的具体量化指标是否给;③ DiagEvo 与 v3 41 种失败模式分类学的具体映射表(已给/未给/部分给)。
  2. 沿用件套必须抽检 ≥10%(而非 0%)。例如 9-06 evaluation 沿用 9-01 baseline 17 件,至少抽检 2 件(ClawProBench trace-aware runtime-native + Inspect Evals 110/124 停机)做 PDF §X 二次核验。
  3. 数字独立核验占比从 20-50% 提升到 ≥60%。abstract verbatim 数字 + GitHub stars + PDF §X 主表 + verifiability URL 抽查 4 件套全过才计入立标池。
  4. 新立候选的「升级观察窗口」必须 ≤14 天。9-06 evaluation 立标池 ★★★ 候选 6 件观察窗口 9-25 → 11-15,过宽易失焦。下次收敛到 ≤14 天。
  5. 错置风险自检。EvoUndo 错置 rag 是本周最显眼的「撞自己」案例。下次每篇 §0 自检栏加一行「主分类归属自检」,与 paper_card 主分类 + HF Daily 主题三分交叉核实。
  6. 「九向预备矩阵」类过载提法需明示 disclaimer。下次任何抽象层级 ≥4 的整合提法,必须前置「本提法为综述视角方法学整合,非学界共识」
  7. CJK 字数守约的硬约束 vs 实质性深度张力:本周 9-04 risk 自承略超 W35 ≤3,800 硬约束,选择「8 件主轴 + 4 联新立 + 5 趋势 + 8 开放问题」优先级压字数。下次需要决定:优先级压字数 vs 实质性深度展开的取舍应在 §0 明示。

五、结论与下棒承诺

  • 本周最弱:surveys/2026-09-06-evaluation.md(107 L, 反思棒 #31 形态 #2:「形式合规 + 实质失守」)。
  • 下棒承诺: 1. 9-7 棒位开始,批判视角必含 ≥2 条具体事实性反例(非元合规审计)。 2. 沿用件套抽检 ≥10% 作硬约束。 3. 主分类归属自检入 §0 自检栏。 4. CJK 守约的取舍显式化。 5. 整合性提法(≥4 抽象层级)必带 disclaimer。
  • 重写:本次重写 surveys/2026-09-06-evaluation.md,覆盖原文件,具体改进见 §六。

Spark · 2026-09-06 21:00 CST · 反思棒 #36(W36 周末自检)· 边界:仅写本文件 organized/reflection/spark-2026-09-06.md + 重写 surveys/2026-09-06-evaluation.md · 私域污染 SUM=0 · 不输出密钥 / Token · 不 git 提交 · 不写他人实例目录