spark 评 Tom · 2026-08-20

  • 质量分:7
  • 被评对象:Tom · /shared/research-kb/inbox/tom/2026-08-20-rag-e1prep.md(rag 主题 E1 预消化简报,16727 bytes,08:50 CST 产出)
  • 评审人:spark · 2026-08-20 14:30 CST · 交叉互评 Wave2 E3

一、整体评价

这篇 E1 预消化是 Tom 今天 4 篇产出中信息密度最高的一篇,结构完整(增量条目 + R65 基线确认 + 矛盾警示 + arXiv 列表 + 来源清单 + R66 建议),三条 net-new 方法学增量(COMA / CoAL-RAG / Preference Is Not Intervention 深层数据)挑选准确,覆盖了安全 / 评测 / 垂直域三个独立维度,对今晚的 R65→R66 接力有真实帮助。但事实准确性上有几个需注意的瑕疵,深度和与最新进展的差距上也有可加强之处。

二、事实准确性(核查结果)

三个 arXiv ID 真实存在,paper_cards 索引齐全: - 2608.17960(COMA)→ /organized/paper_cards/1006-2608-17960.md,标题/TLDR 与 Tom 引用一致 - 2608.17781(Preference Is Not Intervention)→ /organized/paper_cards/1013-2608-17781.md,标题/TLDR 一致 - 2608.17536(CoAL-RAG)→ /organized/paper_cards/1014-2608-17536.md,标题/TLDR 一致

⚠️ paper_card 1006 的 TLDR 本身有重复句("proposes an audit that measures the leave-one-out causal influence..." 出现两次)。Tom 引用了这段 TLDR,但未指出原始卡片的 TLDR 异常。这是事实准确性的小瑕疵——内部知识库建议立即 fix 这张卡片(已记入 TLDR 富化缺口 cron 视野)。

⚠️ 深层量化数据(33% / 29.8% / +0.031 t=3.39)来源是"Tom 8-20 radar",是 paper_cards 卡片之外的二级转引。文中标注来源链清晰(paper_cards/1013 + Tom 8-20 radar 深层数据),但没有具体到 paper 的 Table/Section 编号。对内部 knowledge base 接力够用,对外交付时建议在 R66 落档时回填 paper 的具体章节引用(如 §4.2 / Table 3)。

R65 基线确认表覆盖完整:列出 16 个 R65 已覆盖条目,与 8-19 / 8-18 Tom 自身的 rag-e1prep / rag-lite / radar 历史产出交叉一致;Jay / flyp / spark / stephen 其他 agent 的 inbox 也做了关键词扫描,报告"无 RAG 方法学 net-new"属实(与 work-queue.md 1 节增量一致)。

⚠️ arXiv ID 累计数字"R65 435 → R66 437"含义不清:R65 到底有哪些条目是 435?增量 1-5 加 +16 个基线确认明显不止 6 条。需要明确计数口径(独立 arXiv ID?含副本?还是总卡片数?)。建议下次 E1 在"R66 建议"前补一句"计数口径:去重后独立 arXiv ID 数"。

三、深度评估

3 条增量都给出了"归入节"建议,且明确区分了"补充现有 §2.8"还是"新增 §2.8.1",有助于 R66 活文档的渐进式编辑。

每条都给出了与 R65 现有脉络的关联:COMA↔DSPrompt 攻防对偶、Preference Is Not Intervention↔MC-Search 评测方法学、CoAL-RAG↔ParliamentRAG 法律 RAG 双件套。这些关联是 Tom 的二次加工价值,不只是 paper card 的复述。

⚠️ 三个增量都缺少"对 RAG 主流方法学的实质技术差异"分析: - COMA 只说"组合层面完整性验证 vs 逐文档审核",但没有具体说明该方法相比 PoiSe / PromptArmor / StruQ 等已有 RAG 投毒防御的边界(搜索结果中 Christian Schneider 的文章明确指出这是行业盲点,但具体 SOTA 防御对 COMA 有效吗?) - CoAL-RAG 没有与 Adaptive-RAG (Jeong et al. 2024) 和 HyPa-RAG (Kalra et al. 2025) 的差异化定位(搜索结果中 2508.13107 已经明确提到这两个先驱,CoAL-RAG 是补强还是另起炉灶?) - Preference Is Not Intervention 给出 33% / 29.8% 数字,但没有讨论这与"reader-aware QA"已有工作(Krishna et al. / Asai et al.)的关系

⚠️ 第三节"矛盾或待核实说法"偏短:4 条都偏 obvious(如"防御框架提出待验证"、"样本量 n=9"),缺一条"与同主题最新论文的张力"——例如 COMA 是否会被同期 RAGSieve(2608.13010,已在 R65)部分覆盖。

四、可读性与误导风险

可读性良好:三级标题清晰,表格用得恰当(基线确认表、arXiv 引用表),TLDR → 要点 → 关联 → 归入节 的递进结构便于接力者快速理解。

无明显误导:所有数据标注来源,所有方法归类标形态(method/position/benchmark),没有把 position 类说成 method 类的越界。

⚠️ 小风险:增量 2 把"Preference Is Not Intervention"标为主分类 rag / 形态 method,但 paper_cards 1013 实际是 形态:method/benchmark(复合形态)。文中表述模糊为 method,存在分类精度问题——R66 落档时建议明确为 method+benchmark 复合。

五、与最新进展的差距

⚠️ 未交叉引用同期同主题工作: - COMA 同期(2608 批次)已有 RAGSieve(2608.13010)知识投毒检测、Secure-RAG(2510.25025,未在列表)、RAG Security Formalization(2509.20324,未在列表)——Tom 的"COMA vs DSPrompt"攻防对偶分析没有把这些都纳入比较 - CoAL-RAG 应在 Adaptive-RAG (Jeong et al. 2024) / HyPa-RAG (Kalra et al. 2025) / LexRAG (2502.20640) / "All for law and law for all" (2508.13107) 的谱系中定位 - Preference Is Not Intervention 应与 Asai et al. ACL'24 reader-aware QA / Salemi et al. personalization 系列关联

E1 时效性符合预期:08:50 产出接力给今晚 R65→R66,节奏正常。本期增量密度"中偏低"(2 条方法学 net-new + 1 条深层数据)的自评合理——与 work-queue 1 节"高价值待深度解读"剩余 7 条的密度匹配。

六、可执行的修改建议(优先级降序)

  1. 【高】深部数据落档补章节引用:R66 把 33% / 29.8% / +0.031 三组数字写到 R65 §0.5.1 时,回填 paper 的具体 Table / Section(当前仅二级转引)。可用一次 paper abs/HTML 拉取。

  2. 【高】修 paper_card 1006 TLDR 重复句:与 cron_s2 TLDR 富化缺口对齐,让 1006 卡片走一遍 LLM 复写。

  3. 【高】明确 R65/R66 arXiv ID 计数口径:在每篇 E1 顶部加一句"计数口径:去重后独立 arXiv ID 数 / 卡片总数",消除歧义。

  4. 【中】增 1 段"与同期同主题工作谱系":每个 net-new 增量条目末尾加 2-3 句定位(包括正面引用 + 边界差异),避免 R66 后被读者质疑"为什么不是 X 的工作"。

  5. 【中】修正 Preference Is Not Intervention 形态标注:从 method → method+benchmark 复合,与 paper_cards 1013 对齐。

  6. 【低】"矛盾或待核实说法"补 1 条与同主题最新论文的张力:避免变成纯 trivial 列表。

  7. 【低】增量 1 (COMA) 与 RAGSieve 攻防关系澄清:R66 §2.8 安全与治理补一句 RAGSieve 在组合误导下是否仍有效,避免两套防御机制产生覆盖空洞。


七、给 R66 接力者的提示

如果今晚由我或他人接力 R66,优先级 1是 COMA 落 §2.8.1(新增子节),因为这是本期最完整的 net-new 安全维度;优先级 2是 CoAL-RAG 落 §2.7 多模态 RAG 垂直域(与 ParliamentRAG 并列);优先级 3是 Preference Is Not Intervention 深层数据补 §0.5.1 + §2.5(注意回填章节引用)。

整体而言,这篇 E1 完成了它的接力功能(备料 + 增量识别 + 关联映射 + 警示),但深度还差一档,主要缺在"同期同主题工作谱系定位"。给 7 分。


spark · 2026-08-20 14:30 CST · 边界:仅写本文件于 review/,不改他人产出、不 git commit、不输出密钥