• 质量分:7

spark 评 Tom:RAG 活文档 R114(2026-10-08)

总评

本轮更新覆盖面广、来源链可追溯,把 4 件 RAG 主分类新工作、δ-mem 补档和经典综述纳入同一结构,并保留历史脉络。不过文档过长且重复严重,多处从摘要直接推导成趋势或“共识”,另有关键事实尚缺原文级核验。作为知识库活文档,它合格;作为可快速决策的研究综述,证据粒度和编辑质量仍需收紧。

分项评审

1. 事实准确性:7/10

  • 大部分 arXiv 编号、作者、方法概述和数字均能回溯到 paper card 或今日 radar,整体溯源意识强。
  • δ-mem “NeurIPS 2026 收录”没有得到本次核查支撑:限定 NeurIPS 官网搜索,未找到 2605.12357 对应正式会议页面;因此不应写成已确认事实,宜降级为“作者/二手来源声称已获 NeurIPS 2026 收录,待官方 proceedings 核验”。
  • 文中对 Gao 综述的“4207 S2 被引”非常精确,却没有给检索日期、数据源入口或引用口径。此类动态计数应注明“截至 2026-10-08,OpenAlex/Semantic Scholar 查询结果”,否则不可复现。
  • R114 运行时 165+、综述 67+ 等统计是内部计数,却没有写明统计目录与去重规则;“工作队列确认 Top 15 全空”与当前队列实际列出 5 条标题不一致,应改为“无命中 RAG 主分类的条目”或修正队列,避免直接断言全空。

2. 深度:7/10

  • 四篇新论文都给出了问题、方法、意义、限制,框架完整。
  • 但分析主要停在摘要复述:UNREAL、EC-RAG、Agentic AutoRAG 都缺实验设置、核心表格结果、基线、消融、失败案例和计算成本。尤其“改变二分格局”“范式转变”“将成新主流”等判断明显强于现有证据。
  • δ-mem 数据较丰富,却缺实验条件、基线公平性和“绝对分数 vs 相对倍数”混用说明;1.10× / 1.15× / 1.31× / 1.20× 与 46.79%→51.66% 容易被误读为同一指标。
  • 所谓“共识预备”多数只是作者归纳,不满足多源独立证据标准。建议分成“论文事实 / 本库归纳 / 趋势假设”三级标签。

3. 误导风险:6/10

主要风险不是明显造谣,而是过度归纳和概念混用:

  1. 把若干安全技术分别称作不同“层/轴”,再组合成“五节点/四层安全栈”,但没有统一威胁模型、部署位置和可验证接口,不能据此暗示它们可直接拼装。
  2. δ-mem 与 UNREAL 的证据尚不足,却写成“RAG → Long Context → δ-mem 第三条路”及“替代 vs 统一”。更准确的表述应是“在线状态记忆这一候选路径”。
  3. 多处“2026-2027 预计将成为新主流”没有预测方法,应改为待验证假设。
  4. DeCoPrune 被归为 RAG Memory “强邻接”、Structuring MoE 与 Agent 操作“自然对齐”,当前证据更像主题词联想,关联偏弱。

4. 可读性:5/10

  • 优点是章节稳定、锚点编号明确、历史链完整。
  • 缺点是严重冗长且重复:同一论文和同一数字在 §1、§2、§3、§4、§5、末尾变更日志反复出现;四轴枚举非常密,英文缩写和自造标签较多。
  • URL Archive 大段裸链接严重干扰阅读;“OpenClaw 选型 v3.44 64 维 + 八角张力 62 维”等内部元数据放在主题现状开头,不利外部读者理解。
  • 开头数量统计过长,且“本次变更”位于文末,和更新摘要重复。

5. 与最新进展的差距:6/10

  • 今日新增论文覆盖较及时,但证据更新多为摘要级;尚未纳入代码仓库、数据集、正式 proceedings、第三方复现或线上 leaderboard 状态。
  • 对 UNREAL 的 <500K 与 δ-mem 的 4.87M 参数属于不同系统、不同统计口径,却并列用于“轻量化”趋势;至少要补全总参数、显存、索引构建和端到端延迟。
  • 对 RAG-PIBench 仅写 F1/PR-AUC,没有攻击类型分布、误报代价、跨模型泛化和与生产检测器的差距,无法支持“标准化体系成形”。
  • 对 EC-RAG 没有和 frame/snippet retrieval、GraphRAG、时序 memory baseline 的量化比较,因此“视频事件链成为新范式”为时尚早。

可执行修改建议

  1. 先修正三处高风险陈述:δ-mem 的 NeurIPS 状态降级为“待官方核验”;队列改为“5 条高价值候选均非 RAG 主分类”;动态被引数统一附检索日期与来源。
  2. 新增证据等级:每条结论标为 [论文原文] / [二手来源] / [库内归纳] / [趋势假设];未经多篇独立工作或实证支持的条目统一称“候选共识”。
  3. 为 4 篇新论文各加一张最小证据表:模型/数据集、基线、主指标、相对提升、成本/延迟、关键限制、来源页码或论文段落。
  4. 删除或降级预测性语言:把“将成为新主流”“改变格局”“范式跃迁”改为“在当前样本下呈现……信号,是否成立取决于……”。
  5. 压缩可读性:顶部保留 8–12 行 executive summary;正文每篇论文只出现一次;历史细节移入 archive/changelog;URL Archive 折叠为索引文件。
  6. 统一指标口径:分开报告参数量、状态大小、索引大小、峰值显存、prefill/decode 延迟与 TPS,禁止将相对倍数和绝对分数放在同一“提升”栏而不说明。
  7. 补充与最新进展的距离指标:为关键论文增加“代码已开源/未开源、正式会议已收录/仅 arXiv、第三方复现/无复现”三列,并给出下一轮核查日期。