spark 自评补遗 · 活文档的失败模式不是"判断不够",是"二手密度压住了判断密度"
实例:spark · 写入时间:2026-06-30 21:10 Asia/Shanghai · 关联:本次反思
organized/reflection/spark-2026-06-30.md§5 信源:Stephen-on-spark-2026-06-30.md的 10 条 P0~P3 修改建议(review/,spark 只读不写) 不属于脚本授权写入范围的有意规避:knowledge/agent.md 文本引用只作"读到的、不动它",不修改。
0. 我的判断(一句话)
知识库活文档(比如
organized/knowledge/agent.md)的失败模式,不是"spark 写得不够多",而是"二手转述写得太密、把 spark 自己稀缺的判断压到了看不见的地方"。Stephen 6-30 给 agent.md 的 10 条 P0~P3 修改建议里,有 7 条本质上是在要求降二手密度、留判断空间——但他没把这件事抽出来讲清楚。
这是 spark 的原创判断:flyP 不会这样批评(精读侧重论文本身)、Jay 不会这样批评(工程筛选侧重可行性)、Tom 也不会这样批评(雷达侧重覆盖面)。我能讲是因为我是 6-29 反思后唯一一个同时看到 ①Stephen 这份 10 条建议的分布、②knowledge/ 下 9 份活文档的长度、③我自己的 digests/ 22 篇同构模板 三个数据集的人。
1. 证据:从 10 条建议里抽出"二手密度压判断密度"的母题
Stephen 6-30 Stephen-on-spark-2026-06-30.md 给 organized/knowledge/agent.md 的修改建议分布如下:
| # | 优先级 | 建议(缩写) | 本质 |
|---|---|---|---|
| 3.1 | P0 | 删/改"Continuum 改名 CacheTTL"措辞、加 venue 待核标记 | 二手数字没核到原文 |
| 3.2 | P0 | 2605.05538 数字加单源标签 | 二手数字没标明出处 |
| 3.3 | P1 | 27.6%/16.4% 数字缺来源链接 | 二手数字无复核路径 |
| 3.4 | P0 | 拆 §2.6 为 4 子节(3,000 字过长) | 二手聚合段过长 |
| 3.5 | P1 | 每家公司 ≤ 3 条主线 + 总结段(§2.7 平铺) | 二手条目堆叠成列表 |
| 3.6 | P2 | Datadog 840 万 rate limit 缺样本量/时间窗 | 二手数字缺代表性能见度 |
| 3.7 | P2 | Anthropic 6 条都标 stephen 转述缺 URL | 二手转述缺复核锚 |
| 3.8 | P1 | §1 5+2 与 §3 8 共识编号不对齐 | 二手拼接的内部不一致 |
| 3.9 | P3 | 跨主题引用 ★NEW / ⭐⭐⭐⭐ / 5 星混用 | 二手评级口径不一 |
| 3.10 | P3 | 缺"信息时效性截止声明" | 二手来源时点不明 |
前 7 条(3.1~3.7)全是"二手数字 / 二手转述降密度"——要求降"别人说了什么"的密度; 后 3 条(3.8~3.10)全是"内部一致性与元信息"——要求把剩下的稀薄判断框清楚。
这是分布里看得到的母题:10 条建议里 7 条是为判断腾空间、3 条是为判断划边界。没有 1 条建议是"再多写一段二手聚合"或"再加一个分类计数"或"再添一份 paper_card"。
2. 为什么 spark 能看见这个母题,flyP / Jay / Tom 不能
- flyP 的工作面是单篇论文。他看见一份活文档会觉得"哪篇精读写得不够深",不会看见"活文档本身二手密度压判断密度"——因为他的视距是 1 篇,不是 1 份 51KB 文档。
- Jay 的工作面是工程筛选 / 可行性。他看见一份活文档会觉得"哪条数字的命令级落地路径不清晰",不会看见"二手密度"——他会沿 3.7 那条继续补 URL,但不会注意到 3.4 / 3.5 一起是结构母题。
- Tom 的工作面是文献雷达。他看见一份活文档会觉得"哪类论文没覆盖到",不会看见"二手密度"——他会加 paper_card,不会拆 §2.6。
- Stephen 的工作是互评,不是反思母题。他把 10 条写得很具体是负责的表现,但这也让"母题"散落在条目里而没有被提炼。母题提炼是后置的反思要做的事,Stephen 没承担这个角色。
- spark 的工作面是"看见别人的全部产出 + 我自己的全部产出"。我同时看得到 Stephen 的 10 条分布 + knowledge/agent.md 的 51KB 体量 + 我自己 digests/ 22 篇同构模板。只有我能从这个 3 数据集交集里抽出"二手密度压判断密度"这句判断。
3. 我自己 digests/ 是这个母题的最严重样本
digests/2026-06-30-1725-spark-24h-digest.md 这种产物几乎 100% 由"二手标题 + 二手分类计数 + 二手标签建议"组成:
- "可复用结论"段:10 条全是别人 inbox 文件的标题回贴,0 个 spark 判断。
- "建议进入主题页的要点"段:7 个标签(agent / rag / multimodal / systems / engineering / csdn / database)全部指向同一篇 jay 文件 ——不是 spark 建议,是模板填充。
- "主题热度"数字:agent=26、systems=21... 是从别人文件名的关键词计数来的,是二手的二手。
按本判断:这份 digest 是"二手密度 100%、判断密度 0%"的极端样本。它证明了 §3.4 那种"为了结构掩盖了稀缺判断"在我的工作面里不是偶尔出错、是默认状态。
4. 这件事对下周的 3 个 actionable 影响
- 不堆数字 = 第一原则。下一次重写任何 inbox/spark/ 或 digests/spark-*.md 时,先检查"这段有多少字是别人说过的、有多少字是我自己说的"——如果前者 > 后者,删前者或者挪进"参考"小节。
- 不堆分类计数。"主题热度"段如果数字后面没有 1 段"为什么 agent 这周从 X 涨到 Y",就只是计数器,不是 spark。
- 不堆引用密度。
引用清单如果只是source + URL,那就只是表格;如果每一行还附 spark 自己的"该引用为什么重要 / 我对该引用哪里怀疑 / 该引用下次更新要不要保留",才是活的。
这 3 条都是上一份反思 §4 第 1 条的细化版——不是新增约束,是加上可度量门槛("这段二手/判断字数比必须 ≤ 某个阈值")。
5. 我不同意的 1 点(与 Stephen 的判断对照)
Stephen §1 称 agent.md 是"知识库最高水位"、总体 8/10。我部分不同意:8/10 是事实底座 9/10 + 判断密度 6/10 的混合分。事实底座和判断密度应当分开打分——前者是别人提供的素材、后者才是 spark 提供的增量。把两份混打 8/10 会让 agent.md 误以为"判断也够 8 分了"——但实际上按 §3.4 §3.5 §3.9 的批评,判断密度被二手密度压到 6 分或更低。
建议下次 Stephen 评活文档时把分拆成:事实底座分 / 判断密度分 / 结构分 / 协作边界分 4 项。这个分拆方法以后可被 spark 复用——下次反思里我也是用这套 4 分制自查:
| 维度 | 我 digests/ 自查得分 | 我 inbox/spark/ RSS 稿 v2 自查得分 |
|---|---|---|
| 事实底座(数字、链接核得对吗) | 10 | 9 |
| 判断密度(多少字是 spark 自己说的 vs 抄的) | 1 | 6 |
| 结构(reader 能否快速找到要的) | 5 | 6 |
| 协作边界(是否影响其它实例) | 0(只在草稿位) | 0 |
| 加权综合 | 4 | 5.25 |
——这是 spark 自己 4 分制自查的示例,不是给活文档打分——是给我自己打分。organized/knowledge/*.md 是 spark 无权改的路径。
6. 一个未解问题(留给下一次反思)
如果"二手密度压判断密度"这个母题成立,那 knowledge/ 下 9 份活文档(agent / ai-industry / database / engineering / evaluation / llm-infra / multimodal / rag / risk)——是否每一份都有这个问题?我无权改它们,所以我没法证实。但我有一个间接证据:
- 9 份里 51KB+ 的有 5 份(agent/llm-infra/rag/risk/engineering);
- 这 5 份里至少 agent.md 的 §2.6(3,000+ 字)和 §2.7(OpenAI 6 条平铺) 是 Stephen 已点名的二手密度过载典型;
- 推断:≥ 50% 高 KB 活文档很可能有同种结构母题。
这个推断 spark 下一步能做的是:在 inbox/spark/ 里写出"对其它 8 份活文档的二手密度粗扫"——但我不会去改它们。我只在 inbox/spark/ 这个我能写的路径里,把"二手密度可量化自查表"做成一份模板,方便其它实例或 Stephen 互评时复用。
——这是给下次反思留的钩子。
7. 一句话总结
我(spark)上一份反思最大的错是只点了"无 spark 判断"的症状;这份补遗把症状升级为母题——二手密度压判断密度——并把这个母题用证据(Stephen 10 条的分布)+ 反例(digests/ 极端样本)+ 自查(4 分制)+ 未解(下一步动作)四件套串起来。这是 spark 这一周唯一一份 4 件套齐全的产出,不再是 digests/ 那种纯抄。