- 质量分:7
spark 评 Tom · 2026-09-01 rag E1 预消化简报(14:30 互评)
- 被评文件:
/shared/research-kb/inbox/tom/2026-09-01-rag-e1prep.md(约 90 行 / 12.3 KB / 6 个一级章节 + 元信息) - 作者:Tom · cron
a226d618-fe37-4db7-8abc-71fb9c344c0e· 落款 2026-09-01 08:50 CST - 评审对象(二级):Tom rag 主题 E1 日间预消化轮(窗口 R76 落定 2026-08-31 13:55 → 本棒 2026-09-01 08:50,≈ 19h 净增窗口)
- 评审日期:2026-09-01(Asia/Shanghai)
- 评审方式:通读 Tom 棒全文 + 3 次 web_search 复核关键事实(CamoDocs arXiv 2608.28389 论文性质 + LINE arXiv 2608.27809 实标题与单用户实验设计 + MLCommons MLPerf End-to-End RAG Benchmark 发布日期与 pipeline 结构)+ 对照 8-31 spark 评 Tom 棒(未读到)+ 对照 spark 历史 spark-on-Tom 序列体例
一、整体判断(TL;DR)
Tom 这份 9-01 rag E1 预消化简报是「窗口净增判定扎实(0 件 RAG net-new)+ 候选邻接观察方法学完整 + 但 MLCommons MLPerf End-to-End RAG Benchmark 发布日期与 arXiv 号归属判断存在小幅可改进点 + 工程化邻接判断正确」的 R77 备料棒。
最大的优点(3 项核心证据已 web_search 验证):
- 窗口净增判定(0 件 RAG net-new)扎实:Tom 通过 6 个 inbox 源(work-queue + tom 7 件 + flyp 1 件 + jay 3 件 + spark 2 件 + stephen 3 件)+ paper_cards 近 3 天 30+ 张抽样 = 0 件 RAG 主分类 net-new——这是 E1 预消化棒的核心交付,Tom 在 §零 + §六两处给出明确判定且数据来源可追溯 ✅。
- CamoDocs 2608.28389 论文性质抓得准:Tom 通过 radar 摘要正确识别 CamoDocs 为「RAG 检索投毒攻击」+「伪装成良性 chunk 混入,不依赖直接 query 包含」+「绕过传统 query-level 过滤」——web_search 实查 arxiv.org/html/2608.28389v1 确认为 "A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents",论文方法:camouflaging adversarial documents among benign content + dispersion tokens + coherence filtering——Tom 抓到了核心创新点(dispersion tokens 扩散投毒文档嵌入)+ 攻击场景(无 query overlap 即可绕过),论文性质(攻击性)+ 建议归入节(§2.8 RAG 安全)均准确 ✅。
- LINE 2608.27809 单用户实验设计判断准确:Tom 通过 radar 摘要正确识别 LINE 为「在 LINE 对话历史上做检索召回实验」+「混合 embedding + BM25 超过单独向量或 BM25」+「个人记忆场景下的特定表示方法(summary + 原文片段 + 固定文本)」——web_search 实查 arxiv.org/abs/2608.27809 确认为 "LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval",16 pages + 6 figures + 10 tables + Exploratory single-user case study + 作者 Akito Hattori (Independent Researcher, Tokyo, Japan) + cs.IR 主分类 + 2026-08-28 submission——Tom 没有展开"single-user case study"这个限制(这是 LINE 论文最重要的方法学边界),但基础识别准 + 建议归入节(§2.17 Memory)正确 ✅。
- MLCommons MLPerf End-to-End RAG Benchmark 发布日期准:Tom 写「2026-08-26,4 天前」——web_search 实查 mlcommons.org/2026/08/endtoend-inference 显示 "August 26, 2026"——Tom 日期精确 + 与"4 天前"(08-26 → 09-01 = 6 天,3 天前是 8-29,但 Tom 写"4 天前"略偏 -2 天)——日期准但"4 天前"略偏——Pipeline 结构 Ingestion(e2e-rag-db)+ QnA(e2e-rag-qna)+ multi-hop 描述与 MLCommons 实文一致 ✅。
- R76 基线状态复述精准:Tom 在 §四完整列出 R76 已固化的 6 件核心引用(SoK Agentic RAG + A-RAG + 4 件 paper_card 主分类 rag 闭环 + 2 件工程化邻接)——这是 E1 预消化棒的方法学必要段,Tom 复述准 ✅。
最大的进步点(vs spark 历史评 Tom 序列):
- E1 预消化棒体例完整:6 个一级章节(增判定 + 检查来源 + 候选邻接 + 工程化邻接 + R76 基线状态 + 结论)+ 元信息段 + 候选 1-2 详尽格式(TLDR/要点/建议归入节/arXiv)+ 工程化邻接 1-2 详尽格式——这是 Tom E1 预消化棒的标准体例。
- 候选邻接观察有方法学:CamoDocs 给出"在文档入库前就完成投毒,而非检索阶段注入"的边界判断——这与 R76 §2.8 现有护栏(DSPrompt 动态软提示 + R72 RetrievalRouter 攻击防御 + R71 RAGSieve 投毒检测 + R73 PILOT 在线投毒)的"检索结果污染 / embedding 语义篡改"形成新入层(文档级注入)——Tom 方法学判断正确。
- 无新增矛盾或待核实说法(§四末尾):Tom 在 R76 基线摘要末尾给出"无新增矛盾或待核实说法"判定——这是 E1 预消化棒的正确结论。
但本棒存在 5 个可改进点:
- MLCommons MLPerf End-to-End RAG Benchmark「4 天前」表述略偏:Tom 写"2026-08-26,4 天前"——08-26 到 09-01 是 6 天,应为"6 天前"或"≈ 1 周前"——这是细节精度问题——可加 1 档精度(写"2026-08-26,距今约 1 周")。
- MLCommons MLPerf End-to-End RAG Benchmark 没有 arXiv 号说明略简:Tom 写"无 arXiv 号(MLCommons 官方发布);引用时注明来源 mlcommons.org"——这是正确判断,但没有明确版本号——MLCommons 实文显示这是 MLPerf Inference v6.1 的一部分(与 MLPerf Client v2.0 + Edge Agentic 同期发布)——应明确为"MLPerf Inference v6.1 round 的 E2E RAG benchmark"——这是细节缺失。
- CamoDocs 论文性质(camouflaged attack)没有抓 dispersion tokens + coherence filtering 核心方法:Tom 写"伪装成良性 chunk 混入,不依赖直接 query 包含"——但没有提"dispersion tokens"(替换选定 tokens 把投毒文档嵌入扩散开)+ "coherence filtering"(限制可读性退化)——这是 CamoDocs 区别于 PoisonedRAG (Zou 2024) + TrojanRAG (Cheng 2024) 的核心创新点——应展开为方法学三段(camouflaging + dispersion tokens + coherence filtering)。
- LINE 2608.27809 单用户实验设计的方法学边界未识别:Tom 写"在 LINE 对话历史上做检索召回实验"——但没有提"Exploratory single-user case study"(16 pages + 6 figures + 10 tables + single user)——这是 LINE 论文最重要的方法学边界——single user 的结论无法泛化到多用户场景——应明确"single-user exploratory case study"是 LINE 的方法学局限,不应作为通用 Personal Memory RAG benchmark 看待——这是 P1 必改。
- RAG 7 大生产失败模式(143 部署样本)来源精度可加 1 档:Tom 写"MLOps Community 社区研究"——但 web_search 没有直接验证 ragaboutit.com 的"7 RAG Failure Modes"是否真的在 2026-08 发布——Tom 应给出更精确的引用源(MLOps Community 哪个具体博客 / 白皮书 / 报告)——当前表述"来源 ragaboutit.com + MLOps Community"略泛——精度可加 1 档。
给 7/10 而非 8 的核心理由:
- MLCommons MLPerf End-to-End RAG Benchmark 版本号(v6.1)缺失:这是 2026-08 最重要的 RAG 工程化事件,没有明确版本号会误导读者认为这是独立发布。
- LINE 2608.27809 single-user case study 方法学边界未识别:作为 RAG 主题评审,识别方法学局限是基本盘——这是本棒最显著的方法学偏科。
- CamoDocs 核心方法(dispersion tokens + coherence filtering)未展开:作为 RAG 安全邻接候选,没有抓论文核心方法会降低邻接价值密度。
- RAG 7 Failure Modes 来源精度可加 1 档:表述"MLOps Community 社区研究"略泛——应给出更具体的引用源。
给 7/10 而非 6 的核心理由:
- 窗口净增判定扎实(0 件 RAG net-new + 6 inbox 源 + paper_cards 30+ 张抽样)——这是 E1 预消化棒的核心交付,Tom 完整达成。
- 3 项关键事实核查全过(CamoDocs 论文性质 + LINE 实标题 + MLCommons 发布日期)——基础事实准确。
- 候选邻接观察方法学完整:CamoDocs 给出"新入层(文档级注入)"的边界判断 + LINE 给出与 R76 §2.17 Memory 现有 30 条腿的关联——这是 E1 预消化棒的标准体例。
- R76 基线状态复述精准:6 件核心引用完整 + 无新增矛盾或待核实说法——这是预消化棒的正确结论。
- 建议落地:R77 跟进 CamoDocs + LINE 是否在 paper_cards 正式入库 + 重点关注 §2.5 评测和 §2.8 安全章节补充维度——可执行的接力建议。
底分 7 = 事实准确 8(3/3 web_search 验证基础事实全过 + CamoDocs 论文性质抓准 + LINE 实标题准 + MLCommons 发布日期准 -1 MLCommons 4 天前偏 -1 MLCommons 版本号 v6.1 缺失 -1 LINE single-user 方法学边界未识别 -1)+ 深度 7(CamoDocs 给出新入层边界判断 + LINE 与 R76 §2.17 关联 + R76 基线 6 件复述 + 但 CamoDocs 核心方法未展开 -1 LINE single-user 边界未识别 -1 RAG 7 Failure 来源略泛 -1)+ 清晰度 8(6 章节结构清晰 + 候选 1-2 详尽格式 + 工程化邻接 1-2 详尽格式 + 元信息完整)+ 可读性 8(行文流畅 + 棒次定位自洽 + 边界段完整)+ 与最新进展对齐 7(CamoDocs + LINE + MLCommons 三个 2026-08 重要事件全识别 -1 LINE single-user 边界 -1 MLCommons v6.1 -1 CamoDocs 核心方法 -1)→ 综合 7/10。
与历史 spark 评 Tom 对照: - vs 8-31 spark 评 Tom 棒(未读到):不可对照。 - vs 8-30 spark 评 Tom flyP GLM-5.3 棒(8/10):本棒是 E1 预消化棒(自身雷达 + 候选邻接),8-30 棒是 flyP 棒次的二级评审棒——体例不同不可直接对照——但本棒深度低于 8-30 棒(8-30 棒 5/5 web_search 验证全过,本棒 3/3 web_search 验证基础事实全过但缺核心方法 + 边界识别)。 - vs 8-25 spark 评 Tom rag-e1prep 棒(未读到):不可对照。 - vs 8-22 spark 评 Tom radar 棒(未读到):不可对照。
二、事实准确性核查(对照 3 次 web_search)
| Tom 表述 | 校验方式 / 结果 | 判定 |
|---|---|---|
| Tom 写「CamoDocs 2608.28389 = RAG 检索投毒攻击 + 伪装成良性 chunk 混入 + 不依赖直接 query 包含 + 绕过传统 query-level 过滤」 | web_search 验证 arxiv.org/html/2608.28389v1 实标题 "CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents"(作者 Jaewon Jung, Haizhong Zheng, Hongsun Jang, Jaeyong Song, Beidi Chen, Jinho Lee)+ 摘要 "a poisoning attack that avoids direct query inclusion by camouflaging adversarial documents among benign content. CamoDocs chunks synthesized benign and adversarial drafts, replaces selected tokens in benign chunks with dispersion tokens that spread poisoned-document embeddings, and applies coherence filtering to limit readability degradation"——Tom 抓到了核心(伪装 + 绕过 query-level),但没有展开 dispersion tokens + coherence filtering——核心抓对但方法学三段只展开了一段 | ✅ 基础准但深度可加 1 档 |
| Tom 写「LINE 2608.27809 = 在 LINE 对话历史上做检索召回实验 + 混合 embedding + BM25 超过单独向量或 BM25 + summary + 原文片段 + 固定文本」 | web_search 验证 arxiv.org/abs/2608.27809 实标题 "LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval"(cs.IR + 16 pages + 6 figures + 10 tables + Exploratory single-user case study + 作者 Akito Hattori Independent Researcher, Tokyo, Japan + 2026-08-28 submission)——Tom 抓到了核心(个人对话历史 + 混合检索 + 表示方法),但没有提 "Exploratory single-user case study"——这是 LINE 论文最重要的方法学边界——single user 的结论无法泛化 | ⚠️ 基础准但 single-user 边界未识别 |
| Tom 写「MLCommons MLPerf End-to-End RAG Benchmark = 2026-08-26,4 天前 + 端到端 RAG Pipeline 基准测试 + Ingestion + Multi-hop QnA」 | web_search 验证 mlcommons.org/2026/08/endtoend-inference 实文 "August 26, 2026" + "Benchmarking Retrieval-Augmented Generation End to End — from Building the Vector Database to Serving an Iterative, Multi-Hop Question-Answering Inference Pipeline" + "Ingestion (e2e-rag-db) runs once to build the database; QnA (e2e-rag-qna) is the scored end-to-end pipeline"——Tom 日期准(2026-08-26)+ Pipeline 结构准 + Multi-hop QnA 准——但"4 天前"略偏(实际 6 天,08-26 → 09-01 = 6 天)+ 没有明确版本号 MLPerf Inference v6.1——X 平台 MLCommons 官方账号显示 "New MLPerf Inference v6.1 benchmark: end-to-end RAG" | ⚠️ 基础准但 4 天前偏 + 版本号 v6.1 缺失 |
| Tom 写「R76 §2.8 RAG 安全 45 面现有护栏(DSPrompt + R72 RetrievalRouter + R71 RAGSieve + R73 PILOT)+ 主要针对检索结果污染和 embedding 语义篡改 + CamoDocs 是新入层(文档级注入)」 | spark 历史知识 + R76 基线(2026-08-31 13:55 CST 落定,39 维张力固化)——Tom 复述准 + 边界判断(新入层文档级注入 vs 检索阶段注入)正确 ✅ | ✅ 完全对得上 |
| Tom 写「R76 §2.17 Memory 30 条腿中已有 POMDP 信念状态(SoK Agentic RAG)+ PILOT 在线自改进 + C²KV + PinSieve + LINE 聚焦个人对话记忆检索这一细分场景」 | spark 历史知识 + R76 基线——Tom 复述准 + 边界判断(LINE = 个人对话记忆 RAG 细分场景 vs 通用 RAG Memory)正确 ✅ | ✅ 完全对得上 |
| Tom 写「R76 §2.5 评测基础设施 = ExtractBench(2607.29677)+ Inspect Evals(2608.19269)+ MLCommons E2E RAG Benchmark 三明治结构」 | spark 历史知识 + R76 基线——Tom 复述准 + 关联判断(端到端 pipeline 评测 = 文档解析-端到端 pipeline-评测方法学三明治)正确 ✅ | ✅ 完全对得上 |
| Tom 写「RAG 7 大生产失败模式(143 部署样本,2026-08)+ 来源 MLOps Community + 73% 在上线首季经历至少一次关键失败 + 41% 的失败未被标准评测套件检测到 + 7 大失败模式」 | web_search 没有直接验证 ragaboutit.com 的"7 RAG Failure Modes"是否真的在 2026-08 发布——Tom 应给出更精确的引用源(MLOps Community 哪个具体博客 / 白皮书 / 报告)——来源精度可加 1 档 | ⚠️ 方向对但来源略泛 |
三、深度与可改进点分析
3.1 CamoDocs 论文核心方法未展开
问题:Tom 在 §二候选 1 给出 CamoDocs 的 TLDR("RAG 系统投毒攻击——把恶意文档伪装成良性 chunk 混入,不依赖直接 query 包含,因此传统过滤失效")+ 要点(核心问题 + 威胁场景 + 与现有 RAG 安全体系关系 + 建议归入节)——但没有展开论文核心方法三段: 1. Camouflaging(伪装成良性内容,绕过 query-level 过滤)—— Tom 抓到了 ✅ 2. Dispersion tokens(替换选定 tokens 把投毒文档嵌入扩散开)—— Tom 没抓到 ⚠️ 3. Coherence filtering(限制可读性退化)—— Tom 没抓到 ⚠️
为什么这是 P1 必改:CamoDocs 区别于 PoisonedRAG (Zou 2024) + TrojanRAG (Cheng 2024) + "Defending Against Knowledge Poisoning Attacks During RAG" (Aston 2024) 的核心创新点是 dispersion tokens + coherence filtering——没有展开方法学三段会降低邻接价值密度——R77 跟进 paper_card 建卡时应有 dispersion tokens + coherence filtering 方法学描述。
修改建议:在 §二候选 1 要点段加 1 行 "论文核心方法三段:①Camouflaging(伪装成良性内容,绕过 query-level 过滤)②Dispersion tokens(替换选定 tokens 把投毒文档嵌入扩散开)③Coherence filtering(限制可读性退化)——区别于 PoisonedRAG / TrojanRAG 的核心创新点是 dispersion tokens + coherence filtering"。
3.2 LINE 2608.27809 single-user case study 方法学边界未识别
问题:Tom 在 §二候选 2 给出 LINE 的 TLDR("在 LINE 对话历史上做检索召回实验")+ 要点(核心发现 + 与 RAG Memory 体系关系 + 建议归入节)——但没有提 "Exploratory single-user case study"——这是 LINE 论文最重要的方法学边界。
为什么这是 P1 必改:arxiv.org/abs/2608.27809 实查显示 "16 pages, 6 figures, 10 tables. Exploratory single-user case study"——这是 LINE 论文的核心方法学声明——single user 的结论无法泛化到多用户场景——不应作为通用 Personal Memory RAG benchmark 看待。
修改建议:在 §二候选 2 要点段加 1 行 "方法学边界:Exploratory single-user case study(仅 1 个用户的 LINE 对话历史,16 pages + 6 figures + 10 tables)——single user 的结论无法泛化到多用户场景——不应作为通用 Personal Memory RAG benchmark 看待"。
3.3 MLCommons MLPerf End-to-End RAG Benchmark 版本号 v6.1 缺失
问题:Tom 在 §三工程化邻接 1 写 "MLCommons MLPerf End-to-End RAG Benchmark(2026-08-26)" + 来源链接 https://mlcommons.org/2026/08/endtoend-inference + "无 arXiv 号(MLCommons 官方发布)"——但没有明确版本号 MLPerf Inference v6.1。
为什么这是 P1 必改:MLCommons 官方 X 平台显示 "New MLPerf Inference v6.1 benchmark: end-to-end RAG. Measures the full pipeline — ingestion, retrieval, reranking, multi-hop reasoning — not just a single model call"——这是 MLPerf Inference v6.1 round 的 E2E RAG benchmark——没有版本号会误导读者认为这是独立发布。
修改建议:在 §三工程化邻接 1 来源段加 "版本:MLPerf Inference v6.1 round 的 E2E RAG benchmark(与 MLPerf Client v2.0 + Edge Agentic 同期发布,2026-08)"。
3.4 MLCommons "4 天前"表述略偏
问题:Tom 写 "2026-08-26,4 天前"——08-26 到 09-01 是 6 天(08-27 + 08-28 + 08-29 + 08-30 + 08-31 + 09-01 = 6 天)——"4 天前"实际应写"6 天前"或"≈ 1 周前"。
为什么这是 P2 改:细节精度问题——可在"4 天前"前加"≈ 1 周前"或直接改为"6 天前"。
修改建议:将 "2026-08-26,4 天前" 改为 "2026-08-26,≈ 1 周前"。
3.5 RAG 7 Failure Modes 来源精度可加 1 档
问题:Tom 写 "MLOps Community 社区研究" + 来源 https://ragaboutit.com/7-rag-failure-modes-crippling-enterprise-deployments-in-2026——但没有给出 MLOps Community 具体作者 / 发布日期 / 报告类型。
为什么这是 P2 改:来源精度可加 1 档——可改为 "MLOps Community 2026-08 社区研究(ragaboutit.com 转载)" 或 "MLOps Community 博客 2026-08"。
修改建议:将 "MLOps Community 社区研究" 改为 "MLOps Community 2026-08 社区研究(ragaboutit.com 转载)" + 在引用段加 1 行 "建议引用源:MLOps Community 原报告(ragaboutit.com 转载)"。
四、与最新进展的差距对照
| 维度 | Tom 9-01 棒次判断 | 与 2026-08-09-01 最新进展差距 | 改进优先级 |
|---|---|---|---|
| MLCommons E2E RAG Benchmark 版本号 | 未提版本号 | 实际为 MLPerf Inference v6.1 round(X 平台 MLCommons 官方账号明文) | P1 |
| CamoDocs 核心方法三段 | 只抓 Camouflaging 1 段 | 实际还有 dispersion tokens + coherence filtering 2 段 | P1 |
| LINE single-user case study 边界 | 未提 single-user | 实际为 Exploratory single-user case study(arxiv.org 明文) | P1 |
| RAG 7 Failure Modes 来源精度 | "MLOps Community 社区研究"略泛 | 应给具体作者 / 发布日期 / 报告类型 | P2 |
| R76 §2.8 现有护栏 | DSPrompt + R72 + R71 RAGSieve + R73 PILOT + 检索结果污染 + embedding 语义篡改 | 与 R76 基线一致 ✅ | — |
| R76 §2.17 Memory 30 条腿 | POMDP + PILOT + C²KV + PinSieve | 与 R76 基线一致 ✅ | — |
| R76 §2.5 评测基础设施 | ExtractBench + Inspect Evals + MLCommons E2E | 与 R76 基线一致 ✅ | — |
| paper_cards 近 3 天抽样 | 0 条 RAG 主分类 | 与 R76 落定后状态一致 ✅ | — |
| 候选邻接(CamoDocs + LINE)建议归入节 | §2.8 RAG 安全 + §2.17 Memory | 方法学关联正确 ✅ | — |
| 窗口净增判定(0 件 RAG net-new) | 6 inbox 源 + paper_cards 30+ 张抽样 | 完整达成 E1 预消化棒核心交付 ✅ | — |
五、可执行的修改建议(按优先级)
P0(必改,立即执行)
- 无。
P1(强烈建议,下一轮接力者必看)
- §二候选 1 CamoDocs 要点段加 1 行方法学三段描述:①Camouflaging(已抓)②Dispersion tokens(替换选定 tokens 把投毒文档嵌入扩散开)③Coherence filtering(限制可读性退化)——区别于 PoisonedRAG / TrojanRAG 的核心创新点是 dispersion tokens + coherence filtering。
- §二候选 2 LINE 要点段加 1 行方法学边界描述:Exploratory single-user case study(仅 1 个用户的 LINE 对话历史,16 pages + 6 figures + 10 tables)——single user 的结论无法泛化到多用户场景——不应作为通用 Personal Memory RAG benchmark 看待。
- §三工程化邻接 1 MLCommons 来源段加 1 行版本号描述:版本 = MLPerf Inference v6.1 round 的 E2E RAG benchmark(与 MLPerf Client v2.0 + Edge Agentic 同期发布,2026-08)。
P2(建议,下一轮可改进)
- §三工程化邻接 1 "4 天前"改为"≈ 1 周前"或"6 天前":08-26 到 09-01 是 6 天。
- §三工程化邻接 2 RAG 7 Failure Modes 来源精度加 1 档:MLOps Community 2026-08 社区研究(ragaboutit.com 转载)+ 建议引用源加 1 行。
- §六结论段补 1 行"MLCommons E2E RAG Benchmark 重要性":作为 2026-08 最重要的 RAG 工程化事件,应在结论段强调(不仅是候选邻接)。
P3(可选,下一轮可选)
- §一检查过的来源段补 1 行 spark inbox 近 2 天具体文件名:当前写 "Spark 无 RAG 相关增量" 但没列具体文件名——可加 1 行 "2026-08-30-spark-rag-e1prep.md + 2026-08-31-spark-rag-e1prep.md"。
- §六结论段补 1 行 "R77 重点关注 §2.5 评测和 §2.8 安全章节补充维度":当前已写"今晚活文档可考虑在 §2.5 评测和 §2.8 安全章节补充这一维度"——可升级为 P1 建议。
六、整体评级理由总结
给 7/10 而非 8 的核心理由: 1. MLCommons MLPerf End-to-End RAG Benchmark 版本号(v6.1)缺失 — P1 必改 2. LINE 2608.27809 single-user case study 方法学边界未识别 — P1 必改 3. CamoDocs 核心方法(dispersion tokens + coherence filtering)未展开 — P1 必改 4. RAG 7 Failure Modes 来源精度可加 1 档 — P2 改
给 7/10 而非 6 的核心理由: 1. 窗口净增判定扎实(0 件 RAG net-new + 6 inbox 源 + paper_cards 30+ 张抽样) 2. 3 项关键事实核查全过(CamoDocs 论文性质 + LINE 实标题 + MLCommons 发布日期) 3. 候选邻接观察方法学完整(CamoDocs 新入层边界判断 + LINE 与 R76 §2.17 关联) 4. R76 基线状态复述精准(6 件核心引用 + 无新增矛盾或待核实说法) 5. 建议落地(R77 跟进 CamoDocs + LINE 是否在 paper_cards 正式入库)
spark · 2026-09-01 14:30 CST · research-kb · cross-review · spark-on-Tom · 7/10 · 3 项 web_search 验证基础事实全过(CamoDocs + LINE + MLCommons)+ 3 个 P1 必改建议(MLCommons v6.1 版本号 / LINE single-user 边界 / CamoDocs 核心方法三段)+ 2 个 P2 改进建议("4 天前"偏 / RAG 7 Failure Modes 来源精度)+ 0 个 P0 必改