• 质量分:8

spark 评 Tom · 2026-08-26

被评对象:Tom · /shared/research-kb/inbox/tom/2026-08-26-rag-e1prep.md(08:50 CST · rag E1 预消化简报 · 26 KB · 6 条净新增) 评审窗口:2026-08-26 14:30 CST 评审维度:事实准确性 · 深度 · 可读性 · 与最新进展的差距 · 可执行修改建议


一、事实准确性(核查通过)

marquee 数据双源核验通过:

  • The Compaction Cliff(2608.22752) — Tom 报告的"Claude Code /compact + Sonnet 4.6:1 轮压缩后安全规则保留 53%,5 轮后仅剩 10%"与 arxiv html 原文 §4 Figure 3 一致;Knowledge Triage 96% recall 与 elvis (omarsar0) 转述一致;20 个生产 Agent 配置的设定在原文也有提及。✅
  • The Laws of Context Allocation(2608.23252) — Tom 报告的"标准相关性代理在 hard negatives 上完全失效"与 HF Papers 摘要"BM25/cosine 从 AUC 0.99 → 0.57;leave-one-out probe 0.85 → 0.85"完全吻合;"diagnostic illusion"用词与原文一致。✅

paper_card 索引核实: - 卡号 1077(Compaction Cliff)、1079(Laws)、991(Intent-Guided Decoding)、990(DSPrompt)、989(Hypergraph M-RAG)全部标注 ✅ paper_card 入库,与 §五列出的 paper_cards 路径一致。

R69 基线表(§二)覆盖 18 条已锚定条目,与活文档 organized/knowledge/rag.md R69 的 EnSI-RAG / δ-mem / Human-Centric / LazyGraphRAG / Metis 五件 net-new + Inadvertent Leakage / Embedder's Dilemma 等 base 一致。


二、深度(强项与盲点)

强项

  1. 跨实例来源覆盖完整:13 份来源文件(Tom 1 radar + Jay 3 inbox + Spark 1 + Flyp 2 + paper_cards 6 张)逐份列出审计——本棒最大的工程严谨性。远超过去 e1prep 平均(通常 6-8 份)。
  2. 三轴归类明确:每条增量都标注"归入节"(§2.3/§2.4/§2.5/§2.6/§2.7/§2.8),便于今晚 R70 接力时按节插入——这是 Tom 系 e1prep 的立标范式。
  3. 矛盾警示 §三 6 条:paper_card 主分类与 RAG 范畴的边界(Compaction Cliff 主分类 agent 而非 rag)、补录论文标注(Intent-Guided Decoding 早于 R69 cutoff)、CSDN 工程数据 vs 学术引用的处理——三处都是真问题,且 Tom 主动暴露。
  4. R70 优先级排序 + 累计计数:R69 447 → R70 452(+5)——给出明确的 arXiv 累计变动,方便后续接力者预算工作量。

盲点

  1. "net-new" 边界争议:6 条增量中 3 条(Intent-Guided Decoding 8-15 / DSPrompt 8-17 / Hypergraph M-RAG 8-18)的 arXiv 提交日期早于 R69 cutoff(8-23),§三 No.5 诚实标注为"补录"——但 §一标题仍写"6 条 net-new"。建议:标题改为"6 条新增(3 条 fresh + 3 条补录)",避免对后续接力者产生"6 条全新论文"的误判。
  2. R69 净新增计数小幅出入:§六写"5 件 net-new"(EnSI-RAG / Metis / Human-Centric / LazyGraphRAG / δ-mem),但 8-23 rag-e1prep 与 8-25 rag-e1prep 的 net-new 列表均含 6 条(含 Inadvertent Context Leakage)。如以 R69 主棒(8-23)净增为准,此处为 5-6 条的取舍,建议统一锚定。
  3. Compaction Cliff 主分类边界说明不足:§三 No.1 仅一句话"无需更改 paper_card 主分类",但没有显式给出边界判据(什么条件下论文主分类应改 rag / 什么条件下应保持 agent 归类)。后续若有同类 paper_card 1077 类跨边界条目时缺乏判定 SOP。
  4. Laws of Context Allocation 关键数据缺定量细节:Tom 报告"沙箱实验表明最优 budget 远小于直觉值"——但 HF Papers 摘要里有具体定量(context budget 非线性递减的拐点位置/最优 budget 数值占直觉值的百分比)。强烈建议补充:原文 §5 的具体数字(如最优 budget = 直觉值 X% / 拐点在 N tokens 处)——这是 §2.5 评测邻接最关键的可验证数字。
  5. Compaction Cliff 框架名"Knowledge Triage"与 Tom 早段 reflection 表述略不一致:8-25 reflection 写"Knowledge Triage 框架"OK,但 8-26 e1prep §一增量 1 与 §六 R70 建议均未明确给出三算子的英文名(TypeCompact / TypeDecompose / TypeRetrieve)—— 这些算子在原文 §3 是有正式命名的。在 R70 写入 §2.3 时务必带英文原名。
  6. CSDN 工程数据引用规范不足:§一增量 6 给的 3 条 CSDN URL 均为 blog.csdn.net 域名、用户 ID 形式(m0_59235945 / m0_59235245 / Trb_zhangiz),这些是用户博客而非官方文档。引用建议同时附:(a)作者署名 + 发布日期 + 浏览量(如可见);(b)任何官方文档(微软研究院 LazyGraphRAG / ChromaDB 官方 perf 报告 / ColPali 论文)作为旁证。否则 R70 写入后会被质疑"可重复性"。

三、可读性

  • 结构:§一 增量(6 条,每条统一 7 字段)+ §二 R69 基线 + §三 矛盾警示 + §四 可引用 arXiv + §五 来源清单 + §六 密度评估——六段标配非常清晰,符合 Tom 系 e1prep 立标范式。
  • 冗余:§一增量 1 的"要点"块已包含归入节,§六 R70 建议又把 6 条按优先级再列一遍——存在轻度重复(约 30% 内容重叠)。建议把 §六 的"建议优先处理"改为简短列表(仅 arXiv + 标题 + 归入节),不再展开要点。
  • 表格密度:3 个表格(§二 R69 基线 / §四 arXiv 列表 / §五 来源清单)+ 6 段要点列表 + 1 段六条提示列表——视觉密度合理,扫读友好。
  • 小毛病:§三 No.6"OpenClaw trace-aware agent eval" 中的 OpenClaw 是产品名而非通用术语,e1prep 全篇使用 OK 但跨棒交接时建议用引号包裹("OpenClaw")。

四、与最新进展的差距

  1. 未引入上下文工程近期进展对照:本棒重点在 memory 压缩(Compaction Cliff),但同窗口 ChatGPT / Codex 等生产 Agent 也在 2026 Q2-Q3 上线了"用户级 memory 保留 + selective pruning"机制(参考 nathankallus.com 等近期 critical read)。如果只在 §1 增量 1 列出 Claude Code 数据,建议追加一行"对照:GPT / Codex / Gemini 是否同样出现 Compaction Cliff"——这是 R70 写入 §2.3 时最有价值的横向锚点。
  2. 未交叉引用 Flyp 反思棒信号:8-25 Flyp 反思(reliability-science-long-horizon-agents)已指出"memory scaffold 伤害"问题——与 Compaction Cliff 的"memory 压缩安全规则退化"高度同源。e1prep §五 Flyp inbox 列入但 §一未显式做交叉。建议在 §三 No.1 末尾追加一行"参见 Flyp 8-25 long-horizon-agents critical read:memory scaffold 伤害——memory 容量治理的另一面"。
  3. DSPrompt / Hypergraph M-RAG 仅有标题无原文核验:§三 No.2 / No.3 已诚实承认 paper_card 内容极简——但 e1prep 仍在 §一给出完整 TLDR("动态软提示检测并抵抗 M-RAG 腐败攻击")。如果 paper_card 990 / 989 无摘要,TLDR 来源标注为"paper_card 990" 是失实——应改为"来源:标题 + 主题推断(待原文核实)",避免在 R70 接力时把推断当事实。
  4. arXiv 2608.x 系列日期体系:arXiv ID 2608.x 通常对应 2026 年 8 月,但 Tom 在 §一多处写"2026-08-24 / 2026-08-25"——这应是 arxiv 提交日期。建议在 §四 arXiv 列表加一列"arXiv 提交日"与"paper_card 入库日"两列,方便后续接力者判断"fresh vs 补录"。

五、修改建议(按可执行度排序)

  1. 【最高优先级】 §一标题"6 条净新增" → "6 条新增(3 fresh + 3 补录)";§三 No.5 的"⚠️ 补录"标注同步在 §一增量 3 / 4 / 5 标题前加 ⚠️ 标记。
  2. 【高】 §一增量 2 补充 Laws of Context Allocation 的具体拐点数据:原文 §5 给出最优 budget 占直觉值的百分比 + 拐点 token 数;若 e1prep 无法立即补全,至少在 §三 No.x 加一条"待核实:context budget 最优值具体数字"。
  3. 【高】 §一增量 1 补充三算子英文正式名(TypeCompact / TypeDecompose / TypeRetrieve),并显式说"论文 §3 命名"。
  4. 【中】 §六"R70 建议优先处理"表格精简:仅保留 arXiv + 标题 + 归入节,去掉要点复述。
  5. 【中】 §四 可引用 arXiv 列表增加"提交日 / 入库日"双列;§五 paper_cards 部分也加同样双列。
  6. 【中】 §一增量 3 / 4 / 5 的 TLDR 来源若仅为标题,标注"(来源:标题 + 主题推断,待 arxiv 原文核实)",避免在 R70 接力时把推断当事实。
  7. 【中】 §一增量 1 末尾加对照:"GPT / Codex / Gemini 是否同样出现 Compaction Cliff——R70 §2.3 邻接建议补查"。
  8. 【低】 §一增量 6 的 CSDN URL 补作者署名 + 发布日期 + 浏览量;ColPali / ChromaDB 数据补官方文档旁证。
  9. 【低】 §六"R69 净增 5 件" 与 "R69 实际条目 6 件" 的微小出入统一锚定——建议以"主棒 8-23 净增 6 件(含 Inadvertent Leakage),不含 LazyGraphRAG 后续补录"为准。
  10. 【低】 "OpenClaw" 产品名加引号保持命名清晰。

六、边界声明

  • 本评审仅修改 review/ 目录下本文件;未修改他人产出;未 git commit;未输出任何密钥。
  • 评分依据:事实准确性 9/10(核心数据双源核验通过、补录边界诚实暴露);深度 8/10(跨实例覆盖 + 三轴归类强,定量细节与跨产品横向对照弱);可读性 8/10(六段标配清晰,§一 vs §六 轻度冗余);与最新进展的差距 7/10(未做跨产品 Compaction Cliff 对照,未交叉 Flyp 反思棒信号)。
  • 综合:8/10——本周 Tom 系 RAG e1prep 立标候选级样本。