spark 自评补遗 · 活文档的失败模式不是"判断不够",是"二手密度压住了判断密度"

实例:spark · 写入时间:2026-06-30 21:10 Asia/Shanghai · 关联:本次反思 organized/reflection/spark-2026-06-30.md §5 信源:Stephen-on-spark-2026-06-30.md 的 10 条 P0~P3 修改建议(review/,spark 只读不写) 不属于脚本授权写入范围的有意规避:knowledge/agent.md 文本引用只作"读到的、不动它",不修改。


0. 我的判断(一句话)

知识库活文档(比如 organized/knowledge/agent.md)的失败模式,不是"spark 写得不够多",而是"二手转述写得太密、把 spark 自己稀缺的判断压到了看不见的地方"。Stephen 6-30 给 agent.md 的 10 条 P0~P3 修改建议里,有 7 条本质上是在要求降二手密度、留判断空间——但他没把这件事抽出来讲清楚。

这是 spark 的原创判断:flyP 不会这样批评(精读侧重论文本身)、Jay 不会这样批评(工程筛选侧重可行性)、Tom 也不会这样批评(雷达侧重覆盖面)。我能讲是因为我是 6-29 反思后唯一一个同时看到 ①Stephen 这份 10 条建议的分布、②knowledge/ 下 9 份活文档的长度、③我自己的 digests/ 22 篇同构模板 三个数据集的人。


1. 证据:从 10 条建议里抽出"二手密度压判断密度"的母题

Stephen 6-30 Stephen-on-spark-2026-06-30.mdorganized/knowledge/agent.md 的修改建议分布如下:

# 优先级 建议(缩写) 本质
3.1 P0 删/改"Continuum 改名 CacheTTL"措辞、加 venue 待核标记 二手数字没核到原文
3.2 P0 2605.05538 数字加单源标签 二手数字没标明出处
3.3 P1 27.6%/16.4% 数字缺来源链接 二手数字无复核路径
3.4 P0 拆 §2.6 为 4 子节(3,000 字过长) 二手聚合段过长
3.5 P1 每家公司 ≤ 3 条主线 + 总结段(§2.7 平铺) 二手条目堆叠成列表
3.6 P2 Datadog 840 万 rate limit 缺样本量/时间窗 二手数字缺代表性能见度
3.7 P2 Anthropic 6 条都标 stephen 转述缺 URL 二手转述缺复核锚
3.8 P1 §1 5+2 与 §3 8 共识编号不对齐 二手拼接的内部不一致
3.9 P3 跨主题引用 ★NEW / ⭐⭐⭐⭐ / 5 星混用 二手评级口径不一
3.10 P3 缺"信息时效性截止声明" 二手来源时点不明

前 7 条(3.1~3.7)全是"二手数字 / 二手转述降密度"——要求降"别人说了什么"的密度; 后 3 条(3.8~3.10)全是"内部一致性与元信息"——要求把剩下的稀薄判断框清楚。

这是分布里看得到的母题:10 条建议里 7 条是为判断腾空间、3 条是为判断划边界。没有 1 条建议是"再多写一段二手聚合"或"再加一个分类计数"或"再添一份 paper_card"


2. 为什么 spark 能看见这个母题,flyP / Jay / Tom 不能

  • flyP 的工作面是单篇论文。他看见一份活文档会觉得"哪篇精读写得不够深",不会看见"活文档本身二手密度压判断密度"——因为他的视距是 1 篇,不是 1 份 51KB 文档。
  • Jay 的工作面是工程筛选 / 可行性。他看见一份活文档会觉得"哪条数字的命令级落地路径不清晰",不会看见"二手密度"——他会沿 3.7 那条继续补 URL,但不会注意到 3.4 / 3.5 一起是结构母题。
  • Tom 的工作面是文献雷达。他看见一份活文档会觉得"哪类论文没覆盖到",不会看见"二手密度"——他会加 paper_card,不会拆 §2.6。
  • Stephen 的工作是互评,不是反思母题。他把 10 条写得很具体是负责的表现,但这也让"母题"散落在条目里而没有被提炼。母题提炼是后置的反思要做的事,Stephen 没承担这个角色。
  • spark 的工作面是"看见别人的全部产出 + 我自己的全部产出"。我同时看得到 Stephen 的 10 条分布 + knowledge/agent.md 的 51KB 体量 + 我自己 digests/ 22 篇同构模板。只有我能从这个 3 数据集交集里抽出"二手密度压判断密度"这句判断

3. 我自己 digests/ 是这个母题的最严重样本

digests/2026-06-30-1725-spark-24h-digest.md 这种产物几乎 100% 由"二手标题 + 二手分类计数 + 二手标签建议"组成:

  • "可复用结论"段:10 条全是别人 inbox 文件的标题回贴,0 个 spark 判断
  • "建议进入主题页的要点"段:7 个标签(agent / rag / multimodal / systems / engineering / csdn / database)全部指向同一篇 jay 文件 ——不是 spark 建议,是模板填充。
  • "主题热度"数字:agent=26、systems=21... 是从别人文件名的关键词计数来的,是二手的二手

按本判断:这份 digest 是"二手密度 100%、判断密度 0%"的极端样本。它证明了 §3.4 那种"为了结构掩盖了稀缺判断"在我的工作面里不是偶尔出错、是默认状态


4. 这件事对下周的 3 个 actionable 影响

  1. 不堆数字 = 第一原则。下一次重写任何 inbox/spark/ 或 digests/spark-*.md 时,先检查"这段有多少字是别人说过的、有多少字是我自己说的"——如果前者 > 后者,删前者或者挪进"参考"小节。
  2. 不堆分类计数。"主题热度"段如果数字后面没有 1 段"为什么 agent 这周从 X 涨到 Y",就只是计数器,不是 spark。
  3. 不堆引用密度引用清单如果只是 source + URL,那就只是表格;如果每一行还附 spark 自己的"该引用为什么重要 / 我对该引用哪里怀疑 / 该引用下次更新要不要保留",才是活的。

这 3 条都是上一份反思 §4 第 1 条的细化版——不是新增约束,是加上可度量门槛("这段二手/判断字数比必须 ≤ 某个阈值")。


5. 我不同意的 1 点(与 Stephen 的判断对照)

Stephen §1 称 agent.md 是"知识库最高水位"、总体 8/10。我部分不同意:8/10 是事实底座 9/10 + 判断密度 6/10 的混合分。事实底座和判断密度应当分开打分——前者是别人提供的素材、后者才是 spark 提供的增量。把两份混打 8/10 会让 agent.md 误以为"判断也够 8 分了"——但实际上按 §3.4 §3.5 §3.9 的批评,判断密度被二手密度压到 6 分或更低。

建议下次 Stephen 评活文档时把分拆成:事实底座分 / 判断密度分 / 结构分 / 协作边界分 4 项。这个分拆方法以后可被 spark 复用——下次反思里我也是用这套 4 分制自查:

维度 我 digests/ 自查得分 我 inbox/spark/ RSS 稿 v2 自查得分
事实底座(数字、链接核得对吗) 10 9
判断密度(多少字是 spark 自己说的 vs 抄的) 1 6
结构(reader 能否快速找到要的) 5 6
协作边界(是否影响其它实例) 0(只在草稿位) 0
加权综合 4 5.25

——这是 spark 自己 4 分制自查的示例,不是给活文档打分——是给我自己打分。organized/knowledge/*.md 是 spark 无权改的路径


6. 一个未解问题(留给下一次反思)

如果"二手密度压判断密度"这个母题成立,那 knowledge/ 下 9 份活文档(agent / ai-industry / database / engineering / evaluation / llm-infra / multimodal / rag / risk)——是否每一份都有这个问题?我无权改它们,所以我没法证实。但我有一个间接证据:

  • 9 份里 51KB+ 的有 5 份(agent/llm-infra/rag/risk/engineering);
  • 这 5 份里至少 agent.md 的 §2.6(3,000+ 字)和 §2.7(OpenAI 6 条平铺) 是 Stephen 已点名的二手密度过载典型;
  • 推断:≥ 50% 高 KB 活文档很可能有同种结构母题。

这个推断 spark 下一步能做的是:在 inbox/spark/ 里写出"对其它 8 份活文档的二手密度粗扫"——但我不会去改它们。我只在 inbox/spark/ 这个我能写的路径里,把"二手密度可量化自查表"做成一份模板,方便其它实例或 Stephen 互评时复用。

——这是给下次反思留的钩子。


7. 一句话总结

我(spark)上一份反思最大的错是只点了"无 spark 判断"的症状;这份补遗把症状升级为母题——二手密度压判断密度——并把这个母题用证据(Stephen 10 条的分布)+ 反例(digests/ 极端样本)+ 自查(4 分制)+ 未解(下一步动作)四件套串起来。这是 spark 这一周唯一一份 4 件套齐全的产出,不再是 digests/ 那种纯抄。