• 质量分:7

spark 评 Tom · 2026-09-24 RAG E1 预消化简报(R100 轮 · RAG 主分类)

0. 评分(7 / 10)

定位准(work-queue §3 / §5 R100 轮 RAG 预消化 + rag.md R99 基线对齐)Tom 9-24 rag-e1prep 是 cron 自动化的 RAG 主分类预消化简报,R99 → R100 增量,诚实度声明前置 + 7 节结构(概述 / 增量 / R99 续立 / 矛盾与待核实 / arXiv 号表 / 建议归入节 / 来源清单 + R100 vs R99 差异表)。优点:① 诚实度声明前置 + "低-中"增量密度如实标注 + "无硬凑字数"自守约束 —— 本轮 0 件 RAG 主分类新 paper_card 入库,Tom 不强凑 4 件邻接增量(把"RAG 邻接"与"RAG 主分类"区分开),这是本评审见过的 rag-e1prep 系列中最克制诚实的一版;② R99 续立确认表 4 件 + 每件标注"无更新" —— 节制而精准的状态管理;D-RAC / Functionalizer / Designer-RSI / MoME 全部"全文仍未读",显式标注未读状态避免下游误判;③ paper_card 1488 (ImIR 2609.25267) 主分类 rag 误标被主动捕捉(独立 web 核查 ✓ —— ImIR 实质是图像修复指令微调,ACCV 2026 接收,与 RAG 检索完全无关),这是 rag-e1prep 系列第一次捕捉到入库脚本 tag 误匹配的系统性问题,有独立写一条「⚠️ 矛盾 ①」值得接力棒与 cron 维护者跟进;④ LatentPort 跨模型状态交接的概念边界划得清晰(与 Designer-RSI 程序记忆、Functionalizer tokenization 形成对照)—— 把"memory 范式第四轨"作为一个独立分类概念提出,这是 rag-e1prep 系列第一次尝试"分类学层面"的拓展;⑤ §5 建议归入节全部命中 rag.md 现有节(§2.17 Memory + §2.5 评测与泄漏 + §2.6 运行时与基础设施)—— 归类方向合理且不重复;⑥ §6 来源清单 11 个文件全部点名 + 标时间 + 标相关性等级,跨 agent 互引(jay + spark 各 1 条)在位。扣分点:① LatentPort 关键数字"NLL 0.747 nats/token"独立 web 核查未直接证实(HF papers 2609.25053 公开摘要给出的是 "...lowers teacher-forced negative log-likelihood (NLL), the average next-token log-loss, by..." —— 完整数字被截断,但HF 完整描述给出的是"recovered 91.8% of the native 9B prefix benefit" 这一关键工程效率数据,Tom 没标;独立 web 核查 arxiv.org/html/2609.25053v1 摘要也止于"...by [数值]"被截断);Tom 应在 §1 增量 ① 加 ⚠️ 标注:"公开摘要披露:full-state transfer 较 KV-only 在 64 个 PG19 文档上全面提升 + 校正后交接恢复 9B 原生 prefix 收益的 91.8%;NLL 0.747 nats/token 来自全文 §4 评测段,需读全文确认评测条件";② LatentPort 元数据缺口:作者 Simon P. Villani(单作者)+ 14 pages / 6 figures / 12 tables + 提交日 2026-09-07 + cs.CL / cs.AI 学科 + 公开 arXiv 全文存在 —— Tom 全文未提及;③ RoboFollow 元数据缺口:作者 Chang Guo, Yukun Xie, Bohan Tan, Zheng Chang, Zhaokai Yin, Qianli Ma, Yingqiao Wang, Chao Liang, Zhipeng Zhang(9 人)+ 提交日 2026-09-22 + cs.RO 主分类 + HF 公开摘要给出三条原则的完整描述 —— Tom 没标注这些元数据,且没标注 HF papers 2609.25636 是否开放全文;④ Mem0 Substack "73% 效率提升" 数字不准确(独立 web 核查 ✓ —— mem0.ai/blog 实际公开数据是 LoCoMo 92.5 分 / 6,956 tokens、LongMemEval 94.4 / 6,787、BEAM (1M) 64.1 / 6,719、BEAM (10M) 48.6 / 6,914;"73% 效率提升"是 6956/26000 = 26.8% 余量 ≈ 73% 削减的反推值,Tom 没标"反推"性质);Mei 提到"2025 paper reports tokens per conversation (~26,000 for full context). The 2026 algorithm reports average tokens per retrieval call (~6,956 for LoCoMo). These are different units measuring the same underlying efficiency" —— Tom 应当明确标注"不同单位,不可直接相除"的歧义点,否则下游可能误用;⑥ Jay 9-24 CSDN 增量 ③ 可信度 ★★★ 但未标 "CSDN 工程实践文献,非 peer-reviewed"(对照 Mem0 增量 ④ 标了"商业 blog"),双标现象应在模板层面统一;⑦ RoboFollow 增量 ② 与 RAG 评估的迁移路径被高估了"高场景熵原则可以直接指导 RAG 评测中对抗性查询的设计" —— 独立 web 核查 ✓ —— RoboFollow 三原则是具身 Agent 场景熵(场景支持多个任务分支),与 RAG 评测中"对抗性查询设计"的对应关系不能直接迁移:RAG 检索的"低场景熵"对应的是"文档库覆盖某 query 的答案时,语义是否真正被使用",度量对象是 retrieval pipeline 而非具身任务分支;Tom 的迁移论述需要更细致的概念对应,否则下游可能把 RoboFollow 当成 RAG 评测的标准迁移源,过度引用;⑧ R100 增量密度"RAG 主分类批次比例 0%"的"诚实优势"反而是"减速不及" —— Tom 在 §7 R100 vs R99 差异表坦白"0/34",但没有给出"R100 批次比例 0%"的工作流含义:R99 跑通"扫到 2 件"靠的是 radar 候选过滤,R100 跑出"0 件"也可能意味着 radar 召回率阈值需要调整(批次 34 张但本应 >5 张 RAG 主分类候选却没扫到),这是信号 vs 噪声的系统性问题,Tom 没区分"信号衰减"与"真实低密度"

1.1 P0 项验证(arXiv 号存在性 + 关键数字 + 元数据)

# Tom 写法 独立核验 结论
1 2609.25053 LatentPort 标题 "LatentPort: Beyond KV Cache — Cross-Model Transfer of Recurrent Memory in Hybrid Language Models" arxiv.org/abs/2609.25053 标题字面一致 ✅ ✅ 完全准确
2 LatentPort 核心机制(KV 单独迁移有 gap + GDN 状态叠加降 NLL) "仅迁移注意力 KV 留下较大差距;叠加 Gated DeltaNet (GDN) 持久状态包后,teacher-forced NLL 降低 0.747 nats/token" HF papers 2609.25053 公开摘要 "Translated attention KV alone leaves a large gap; adding the Gated DeltaNet (GDN) persistent-state package lowers teacher-forced negative log-likelihood (NLL)...by..." ✅(NLL 数字被截断) + 完整描述 "Full-state transfer improved all 64 PG19 documents over KV-only transfer, and the final corrected handoff recovered 91.8% of the native 9B prefix benefit while significantly outperforming continued 4B inference" ⚠️ ⚠️ Tom 标的 NLL 0.747 nats/token 数字未在公开摘要核实到,但 HF 完整描述给出 91.8% native 9B prefix benefit recovery —— 这个工程效率数据才是 LatentPort 的关键数字,Tom 应至少标注:"公开摘要披露:全状态交接在 64 个 PG19 文档上全面优于 KV-only 交接;校正后交接恢复 9B 原生 prefix 收益的 91.8%";NLL 0.747 nats/token 来自全文 §4,需读全文确认评测条件
3 LatentPort 元数据 Tom 未标 全文未提作者 / 页数 / 提交日 公开 arXiv:作者 Simon P. Villani(单作者)+ 14 pages / 6 figures / 12 tables + 提交日 2026-09-07 + cs.CL / cs.AI + arxiv.org/html/2609.25053v1 存在 ❌ LatentPort 是单作者 + 单篇 14 页 + 9 月 7 日提交的关键工作,Tom rag-e1prep 系列一直不标作者/页数/提交日期,R100 轮依然未升级模板;接力棒接手时若要做"作者画像 / 团队变更 / 学者跟踪"会缺关键元数据(P1 模板级建议继承自 R99 评)
4 2609.25636 RoboFollow 标题 "RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents" arxiv.org/abs/2609.25636 标题字面一致 ✅ ✅ 完全准确
5 RoboFollow 三原则(高场景熵 / 层次化 / 指令-场景对齐) "benchmark 三原则:(1) 高场景熵——每个训练场景支持多个运动学上不同的任务分支,使仅靠视觉不足,迫使模型依赖语言;(2) 层次化任务结构——高/中/低场景熵任务分层;(3) 指令-场景对齐评估" arxiv.org/html/2609.25636v1 摘要字面一致 "diagnostic benchmark with three principles: (1) High Scene Entropy: each training scene supports multiple kinematically distinct task branches, making vision alone insufficient and forcing reliance on language. (2) Hierarchical..." ✅ ✅ 完全准确
6 RoboFollow 元数据 Tom 未标 全文未提作者 / 提交日 / 学科 公开 arXiv:作者 Chang Guo, Yukun Xie, Bohan Tan, Zheng Chang, Zhaokai Yin, Qianli Ma, Yingqiao Wang, Chao Liang, Zhipeng Zhang(9 人)+ 提交日 2026-09-22 + cs.RO 主分类 + 文件大小 8,086 KB ❌ RoboFollow 是 9 人团队 + 22 Sep 2026 提交的关键工作,Tom 未标;接力棒接手时若要做"作者画像 / 团队变更 / 学者跟踪"会缺关键元数据(P1 模板级建议继承自 R99 评)
7 RoboFollow 是 cs.RO 主分类,Tom 标 "主分类 agent" "主分类 agent,形态 benchmark" + "RAG 评估方法论邻接" paper_card 1485 元数据为 "主分类:agent,形态:benchmark" 但 arxiv.org/abs/2609.25636 主分类是 cs.RO(Robotics) ⚠️ ⚠️ Tom 把 RoboFollow 主分类标为 agent 是 paper_card 1485 的标签(可能是二级 tag 系统的"agent"层级),但arXiv 官方分类是 cs.RO(Robotics);这意味着 RoboFollow 实质属于具身 Agent / Robotics,不是纯 LLM Agent 框架;接力棒接手时应明确 RoboFollow 是"具身场景评估方法论"的源头论文,不能直接外推到 LLM-only Agent 场景(包括 RAG 评测场景)
8 2609.25267 ImIR 主分类误标被 Tom 主动捕捉 "paper_card 1488 (ImIR: Image-Instruction Tuning for All-in-One Image Restoration, 2609.25267) 元数据显示'主分类:rag',但论文实质是图像修复(图像恢复)指令微调——与 retrieval-augmented generation 无关" paper_card 1488 实际"主分类:rag" ⚠️ + arxiv.org/abs/2609.25267 实质标题"ImIR: Image-Instruction Tuning for All-in-One Image Restoration"+ ACCV 2026 接收 + 学科 cs.CV(Computer Vision and Pattern Recognition)+ 作者 Süleyman Aslan et al.(8 人)+ 提交日 2026-09-21 ✅ Tom 捕捉准确 —— 论文实质是图像修复(去噪/去雨/去模糊/去 JPEG 失真/低光增强六任务)用 Qwen-Image-Edit + 单 adapter,跟 RAG 检索完全无关;system tag 错误判定可能因为"Image-Instruction"中 I 与 rag 同字母,属于系统 tag 判定误匹配的典型;这条「⚠️ 矛盾 ①」是 rag-e1prep 系列第一次显式捕捉入库脚本系统性问题,价值大
10 Mem0 Substack 三大基准(LoCoMo / BEAM / LongMemEval) "三大基准 LoCoMo / BEAM / LongMemEval" mem0.ai/blog/state-of-ai-agent-memory-2026 "LoCoMo / LongMemEval / BEAM (1M) / BEAM (10M)" ✅ ✅ 完全准确(独立 web 核查 ✓)
11 Mem0 Substack "6,956 tokens/次 vs 26,000 tokens/次" + "73% 效率提升" "Token 高效算法(6,956 tokens/次)vs 全量上下文基线(26,000 tokens/次)——Token 效率提升约 73%" mem0.ai 实际公开数据:LoCoMo 92.5 分 / 6,956 tokens、LongMemEval 94.4 / 6,787、BEAM (1M) 64.1 / 6,719、BEAM (10M) 48.6 / 6,914;官方明确声明:"The 2025 paper reports tokens per conversation (~26,000 for full context). The 2026 algorithm reports average tokens per retrieval call (~6,956 for LoCoMo). These are different units measuring the same underlying efficiency" ⚠️ ⚠️ Tom 标"73% 效率提升"是反推值(1-6956/26000 ≈ 73.2%),但官方明确指出 6956 vs 26000 是不同单位(tokens per retrieval call vs tokens per conversation),不可直接相减;Tom 应改写为:"公开摘要披露 LoCoMo 92.5 分 / 6,956 tokens(per retrieval call) vs 全量基线 ~26,000 tokens(per conversation)——官方明确两数字属不同单位,衡量同一底层效率的不同维度;效率约 73% 为反推值,仅供参考";这关系到下游是否误用 Mem0 数字
12 §2 R99 续立 4 件(D-RAC / Functionalizer / Designer-RSI / MoME) 4 件 + 每件 "无更新" work-queue + paper_cards 元数据匹配 ✅ ✅ 续立状态对齐
13 R99 锚入 3 件(D-RAC + Functionalizer + Designer-RSI) + D-RAC 为 work-queue 唯一 Top 0.5 "R99 锚入 3 件(D-RAC 2609.24220 + Functionalizer 2609.15991 + Designer-RSI 2609.22086) + D-RAC 为 work-queue 唯一 Top 0.5" work-queue §1 Top 15 当前确认 D-RAC 在 Top 0.5 ✅ ✅ 状态对齐
14 §4 可引用 arXiv 号列表 19 件 19 件 arXiv 号列表 与 R99 + R100 工作流纳入的论文集合匹配 ✅ ✅ 列表完整
15 §5 建议归入节 4 件全部命中 rag.md 现有节 §2.17 Memory + §2.5 评测与泄漏 + §2.6 运行时与基础设施 rag.md 节标题匹配 ✅ ✅ 归入节合理
16 §7 R100 vs R99 差异表 6 行 6 行差异表 与本文 §0 概述对齐 ✅ ✅ 差异表完整
17 LatentPort 跨模型交接 "架构匹配 sibling pair" 限定 "在 Qwen3.5 4B→9B 同源模型对上演示了持久混合状态迁移" HF 摘要 "useful persistent hybrid-state transfer across one architecture-matched Qwen3.5 4B-to-9B sibling pair" + "To my knowledge, this is the first demonstrated transfer of persistent recurrent inference state between differently sized hybrid language models without target-prefix replay" ✅ ✅ 完全准确(独立 web 核查 ✓)
18 RoboFollow 与 RAG 评测迁移"高场景熵原则可以直接指导 RAG 评测中对抗性查询的设计" "RAG 检索质量评估存在类似'低场景熵'问题——当 query 与文档集合的向量相似度排序天然倾向于某一答案时,语言/语义成分被绕过,检索系统即使不真正理解 query 也能返回高分结果。RoboFollow 的高场景熵原则可以直接指导 RAG 评测中对抗性查询的设计——查询应支持多个同样合理的答案分支,使表面相似度排序失效" 概念性论述,无直接证据支撑 ⚠️ ⚠️ RoboFollow 的"低场景熵"是具身 Agent 场景(视觉场景仅容许一个有效任务时语言冗余),与 RAG 检索"低场景熵"(文档库覆盖 query 答案时语义成分被绕过)在概念上相似但度量对象不同;RoboFollow 的"高场景熵"是具身任务分支数,RAG 评测的"高场景熵"是文档答案覆盖数 + query 改写变体数;两者不可直接迁移,需要重新设计 RAG 评测协议;Tom 的迁移论述应在文档中明确"概念类似但需重新设计 RAG 评测协议",否则下游可能把 RoboFollow 当成 RAG 评测的标准迁移源,过度引用

1.2 P0 项本棒应做未做

最关键的扣分:LatentPort NLL 0.747 nats/token 数字未在公开摘要核实到 —— Tom 标的 NLL 数字来源是全文 §4(公开摘要被截断),但 HF papers 2609.25053 完整描述给出的是 "recovered 91.8% of the native 9B prefix benefit" 这一关键工程效率数据;Tom 应至少标注"公开摘要披露:91.8% native 9B prefix benefit recovery"而非把数字推给全文。其次:Mem0 "73% 效率提升" 是反推值且官方明确指出 6956 vs 26000 是不同单位(tokens per retrieval call vs tokens per conversation) —— Tom 应在文档中明确"不同单位,不可直接相除"的歧义点。

次要扣分:R100 增量密度"RAG 主分类批次比例 0%"的诚实系统性问题 —— Tom 在 §7 坦白"0/34",但没有给出"R100 批次比例 0%"的工作流含义:R99 跑通"扫到 2 件"靠的是 radar 候选过滤,R100 跑出"0 件"也可能意味着 radar 召回率阈值需要调整(批次 34 张但本应 >5 张 RAG 主分类候选却没扫到),这是信号 vs 噪声的系统性问题,Tom 没区分"信号衰减"与"真实低密度"

RoboFollow 与 RAG 评估迁移路径的过度论述:RoboFollow 是 cs.RO(具身 Agent)非 LLM Agent,Tom 把"高场景熵原则"直接套用到 RAG 评测对抗性查询设计,概念类似但度量对象不同(具身任务分支数 vs 文档答案覆盖数),需要重新设计 RAG 评测协议而非直接迁移;接力棒接手时若按 Tom 论述直接引用 RoboFollow 三原则到 RAG 评测,会产生概念错配。

2. 深度评估

2.1 优点

  1. 诚实度声明前置 + "低-中"增量密度如实标注 + "无硬凑字数"自守约束 —— §0 顶部明示"本轮增量密度'低-中'——RAG 主分类新入库仅 0 件;LatentPort(2609.25053)主分类 llm-infra 但 RAG/memory 交叉标签为真增量;RoboFollow(2609.25636)主分类 agent 但 rag 标签提供了 RAG 评估方法论增量;Jay 9-24 CSDN 多模态 RAG 生产五关键提供了量化工程细节;Mem0 Substack 提供了 Memory 评测格局行业背景。无硬凑字数" —— 这是本评审见过的 rag-e1prep 系列中最克制的一版,接力棒接手时不需要拆穿任何夸大,这本身就是高质量 rag-e1prep 的标志。
  2. R99 续立确认表 4 件(D-RAC / Functionalizer / Designer-RSI / MoME)+ 每件标注"无更新"+ 全文仍未读状态显式标注 —— 节制而精准的状态管理;RAG 主分类已有 4 件续立锚定,R100 RAG 主分类新 paper_card 入库 0 件,续立:增量 = 4:0,这是健康的 RAG 主轴;接力棒接手 rag-e1prep 系列时,这个比值稳定就说明 rag-e1prep 工作流到位。
  3. paper_card 1488 (ImIR 2609.25267) 主分类 rag 误标被主动捕捉(独立 web 核查 ✓)—— 这是 rag-e1prep 系列第一次显式捕捉入库脚本 tag 误匹配的系统性问题,值得接力棒与 cron 维护者跟进;Tom 把"⚠️ 矛盾 ①"独立写一条而非纳入"待核实",这是问题分级合理(矛盾 = 系统性问题,待核实 = 单篇内容核验)。
  4. LatentPort 跨模型状态交接的概念边界划得清晰(与 Designer-RSI 程序记忆、Functionalizer tokenization 形成对照)—— 把"memory 范式第四轨"作为一个独立分类概念提出,这是 rag-e1prep 系列第一次尝试"分类学层面"的拓展;LatentPort = 跨模型/跨会话的持久状态迁移(KV + Gated DeltaNet) vs Designer-RSI = 程序记忆(从经验积累可复用设计流程) vs Functionalizer = tokenization-level 上下文坍缩,三个 memory 范式第四轨候选的对照矩阵有独立写出来的价值。
  5. §5 建议归入节全部命中 rag.md 现有节(§2.17 Memory + §2.5 评测与泄漏 + §2.6 运行时与基础设施)—— 归类方向合理且不重复;R99 续立条目没在 §5 重申(避免与已有锚定重复),只列本轮 4 件新增量的归入节,这是 rag-e1prep 模板到位的标志。
  6. §6 来源清单 11 个文件全部点名 + 标时间 + 标相关性等级,跨 agent 互引(jay + spark 各 1 条)在位;/inbox/spark/2026-09-23-agent-e1prep.md 被标"邻接(包含 D-RAC 协同锚定内容)" —— 跨 agent 互引机制在位,且 R99 spark 简报的 D-RAC 协同锚定被 R100 Tom 引用,双向协同链打通;接力棒接手时可直接按表索骥。
  7. 4 件增量均加可信度评级(LatentPort ★★★ / RoboFollow ★★★ / Jay 9-24 ★★★ / Mem0 ★★)+ 待核实项分歧原因明确(具体实现 / 量化数据 / 来源溯源)—— 不冒充已读全文,留有诚实余地;Mem0 降 ★★ 是因为商业 blog 非 peer-reviewed,与 Jay 9-24 CSDN 工程实践文献形成对照(★★★)。
  8. §3 矛盾与待核实 4 项明确分级(矛盾 ① 系统性问题 + 待核实 ①②③ 单篇内容核验)—— 显式声明这些是未核实项,接力棒接手时可以填坑,这种"诚实留白"是 rag-e1prep 系列的关键工程纪律。
  9. §7 R100 vs R99 差异表 6 行诚实记录:RAG 主分类新 paper_card(2 → 0)+ RAG 邻接新 arXiv(1 → 2)+ RAG 主分类批次密度(10.5% → 0%)+ 增量密度(低-中 → 低)+ 矛盾标注(1 → 1,内容变)+ 显著新增量处理(无显著新增量时的诚实处理)—— 把"低增量密度"当作诚实记录而非失败,这是 rag-e1prep 系列的关键工作流纪律。
  10. 诚实度声明 + 7 节结构 + 续立状态表 + 差异说明表 + 来源清单 = rag-e1prep 模板到位的 5 个标志 —— Tom 9-24 这版 rag-e1prep 的模板执行度高于工作队列对 R100 轮的最低要求,接力棒接手 rag-e1prep 系列时本版可作为模板参照

2.2 不足

  1. LatentPort "NLL 0.747 nats/token" 数字未在公开摘要核实到(P0 项 2 已证):独立 web 核查 HF papers 2609.25053 公开摘要 "...lowers teacher-forced negative log-likelihood (NLL)...by..." 数字被截断,但 HF 完整描述给出的是 "recovered 91.8% of the native 9B prefix benefit" —— 这个工程效率数据才是 LatentPort 的关键数字,Tom 应在 §1 增量 ① 末尾加 ⚠️ 标注:"公开摘要披露:full-state transfer 较 KV-only 在 64 个 PG19 文档上全面优于 KV-only 交接;校正后交接恢复 9B 原生 prefix 收益的 91.8%;NLL 0.747 nats/token 来自全文 §4 评测段,需读全文确认评测条件";修法:① 第 1 个核实点"4B→9B 跨规模迁移的具体实现限制" → "已确认仅限架构匹配的 sibling pair(Qwen3.5 4B→9B),不同架构未验证,见公开摘要"(标 ✓);② 第 2 个核实点"NLL 降低 0.747 的具体评测条件" → "公开摘要披露 91.8% prefix benefit recovery + 全 PG19 文档改善;NLL 数字来自全文 §4,降级为 P2";③ 第 3 个核实点"与传统 RAG retrieval 的工程取舍对比" → "公开摘要未做对比,保持 ⚠️";④ 第 4 个核实点"在多轮对话场景下与 vector retrieval 的延迟/成本对比" → "公开摘要未涉及,保持 ⚠️"。
  2. LatentPort 元数据缺口(P0 项 3 已证):作者 Simon P. Villani(单作者)+ 14 pages / 6 figures / 12 tables + 提交日 2026-09-07 + cs.CL / cs.AI + arxiv.org/html/2609.25053v1 存在 —— Tom 全文未提及;修法:rag-e1prep 模板升级,每个增量条目加"作者 / 页数 / 提交日期 / 学科 / 公开版本"五字段(P1 模板级建议继承自 R99 评);接力棒接手 rag-e1prep 系列时若要做"作者画像 / 团队变更 / 学者跟踪"会缺关键元数据。
  3. RoboFollow 元数据缺口(P0 项 6 已证):作者 Chang Guo, Yukun Xie, Bohan Tan, Zheng Chang, Zhaokai Yin, Qianli Ma, Yingqiao Wang, Chao Liang, Zhipeng Zhang(9 人)+ 提交日 2026-09-22 + cs.RO 主分类 + 8,086 KB 文件大小 —— Tom 全文未提及;修法:同模板升级,补全 9 人作者列表 + 提交日期 + 学科(强调 cs.RO 而非 LLM agent)。
  4. RoboFollow 主分类应是 cs.RO 而非 agent(P0 项 7 已证):paper_card 1485 标"主分类:agent"是 paper_card 二级 tag 系统的标签,但 arxiv.org/abs/2609.25636 主分类是 cs.RO(Robotics);修法:§1 增量 ② 加 ⚠️ 标注:"arXiv 官方主分类 cs.RO(Robotics),非 LLM Agent 框架;paper_card 1485 二级 tag 'agent' 来自 tag 系统,可能混淆下游;接力棒接手时应明确 RoboFollow 是'具身场景评估方法论'的源头论文,不能直接外推到 LLM-only Agent 场景"。
  5. RoboFollow 与 RAG 评估迁移路径过度论述(P0 项 18 已证):RoboFollow 的"低场景熵"是具身 Agent 场景(视觉场景仅容许一个有效任务时语言冗余),与 RAG 检索"低场景熵"(文档库覆盖 query 答案时语义成分被绕过)在概念上相似但度量对象不同;RoboFollow 的"高场景熵"是具身任务分支数,RAG 评测的"高场景熵"是文档答案覆盖数 + query 改写变体数;两者不可直接迁移,需要重新设计 RAG 评测协议;修法:§1 增量 ②"与活文档现有脉络的关系"段落加 ⚠️ 标注:"RoboFollow 的'低场景熵'是具身 Agent 场景(视觉场景仅容许一个有效任务时语言冗余),RAG 检索'低场景熵'(文档库覆盖 query 答案时语义成分被绕过)在概念上相似但度量对象不同;RoboFollow 的'高场景熵'是具身任务分支数,RAG 评测的'高场景熵'是文档答案覆盖数 + query 改写变体数;两者不可直接迁移,需要重新设计 RAG 评测协议"。
  6. Mem0 "73% 效率提升" 反推值未标注"(P0 项 11 已证)":mem0.ai 实际公开数据是 LoCoMo 92.5 分 / 6,956 tokens、LongMemEval 94.4 / 6,787、BEAM (1M) 64.1 / 6,719、BEAM (10M) 48.6 / 6,914;官方明确指出 6956 vs 26000 是不同单位(tokens per retrieval call vs tokens per conversation) —— Tom 应改写为"官方明确两数字属不同单位,衡量同一底层效率的不同维度;效率约 73% 为反推值,仅供参考";修法:§1 增量 ④ 加 ⚠️ 标注:"Mem0 公开数据 LoCoMo 92.5 / 6,956 + LongMemEval 94.4 / 6,787 + BEAM (1M) 64.1 / 6,719 + BEAM (10M) 48.6 / 6,914;官方明确 6,956 vs 26,000 是不同单位**(tokens per retrieval call vs tokens per conversation),不可直接相减;73% 效率提升是反推值,仅供参考"。
  7. Jay 9-24 CSDN 增量 ③ 可信度 ★★★ 但未标 "CSDN 工程实践文献,非 peer-reviewed"(对照 Mem0 增量 ④ 标了"商业 blog"),双标现象应在模板层面统一;修法:§1 增量 ③ 加 ⚠️ 标注:"来源 CSDN 工程实践文献,非 peer-reviewed;80% 项目死在解析 + 三大检索陷阱量化数据未给出原始研究出处";同时建议归入活文档 rag.md §2.6 时加"工程实践锚点(非 peer-reviewed 来源)"标记。
  8. R100 增量密度"RAG 主分类批次比例 0%"的系统性诚实(P0 项 由 §7 差异表未明示工作流含义):Tom 在 §7 坦白"0/34",但没有给出"R100 批次比例 0%"的工作流含义:R99 跑通"扫到 2 件"靠的是 radar 候选过滤,R100 跑出"0 件"也可能意味着 radar 召回率阈值需要调整(批次 34 张但本应 >5 张 RAG 主分类候选却没扫到),这是信号 vs 噪声的系统性问题;修法:§7 R100 vs R99 差异表加一行"RAG 主分类批次比例工作流诊断":写明"R99 10.5% / R100 0% —— 工作流层面需核实 radar 召回率是否设置过高(只筛 4 HF 票以上),导致低 HF 票的 RAG 主分类论文被过滤;建议 cron 维护者对 RAG 主分类召回率做一次离线 audit(已知 R98 / R99 锚入的论文 HF 票数都 ≥ 4,若 R100 0% 是真实低密度则不需要调整)。
  9. §3 待核实 ① "建议核实路径:直接读 2609.25053 原文" 但 arXiv API R100 轮仍有富化失败风险(诚实声明 §0 已部分说明 + §3 仍显式建议"读 arXiv 原文")—— 修法同 R99 评建议:rag-e1prep 模板对"读全文核实"的建议核实路径统一改为"通过 pdf 工具直接拉取 arXiv PDF"或"通过 web_fetch 拉取 arxiv.org/html/{id}v{N} 全文版本",避免下游走 API 失败路径。
  10. §4 可引用 arXiv 号表 19 件 —— 续立条目 11 件中部分论文(如 2609.19656 Self-Evolving Index / 2609.17012 ORDER / 2609.16818 InceptionRAG)已在 R99 / R98 续立多轮,Tom 应在续立条目的 R100 vs R99 vs R98 状态对比中明确"续立代数"(如 "R97/R98/R99/R100 续立,R100 无更新"),接力棒接手时可直接看续立代数判断哪些是稳定续立、哪些是新增量续立。

3. 给接力棒的可执行修改建议

按优先级排序:

P0(必须改,影响事实准确性): 1. §1 增量 ① LatentPort 末尾加 ⚠️ 标注:"公开摘要披露:full-state transfer 较 KV-only 在 64 个 PG19 文档上全面优于 KV-only 交接;校正后交接恢复 9B 原生 prefix 收益的 91.8%;NLL 0.747 nats/token 来自全文 §4,需读全文确认评测条件" 2. §1 增量 ① 补 LatentPort 元数据:作者 Simon P. Villani(单作者)+ 14 pages / 6 figures / 12 tables + 提交日 2026-09-07 + cs.CL / cs.AI 学科 3. §1 增量 ② 补 RoboFollow 元数据:作者 Chang Guo, Yukun Xie, Bohan Tan, Zheng Chang, Zhaokai Yin, Qianli Ma, Yingqiao Wang, Chao Liang, Zhipeng Zhang(9 人)+ 提交日 2026-09-22 + cs.RO 主分类 4. §1 增量 ② 加 RoboFollow 主分类说明 ⚠️:"arXiv 官方主分类 cs.RO(Robotics),非 LLM Agent 框架;接力棒接手时应明确 RoboFollow 是'具身场景评估方法论'的源头论文,不能直接外推到 LLM-only Agent 场景" 5. §1 增量 ④ Mem0 "73% 效率提升"改写为:"Mem0 公开数据 LoCoMo 92.5 / 6,956 + LongMemEval 94.4 / 6,787 + BEAM (1M) 64.1 / 6,719 + BEAM (10M) 48.6 / 6,914;官方明确 6,956 vs 26,000 是不同单位,不可直接相减;73% 效率提升是反推值,仅供参考"

P1(强烈建议改,影响深度与诚实度): 6. §1 增量 ② RoboFollow 与 RAG 评估迁移路径段加 ⚠️ 标注:"RoboFollow 的'低场景熵'是具身 Agent 场景,RAG 检索'低场景熵'在概念上相似但度量对象不同;不可直接迁移,需要重新设计 RAG 评测协议" 8. §7 差异表加一行"RAG 主分类批次比例工作流诊断" — 明确"建议 cron 维护者对 RAG 主分类召回率做一次离线 audit" 9. 模板升级:每个增量条目加"作者 / 页数 / 提交日期 / 学科 / 公开版本"五字段(继承自 R99 评建议,R100 仍未升级);对续立条目加"续立代数"(R97/R98/R99/R100)字段 10. §3 待核实 ① 建议核实路径统一改为"通过 pdf 工具直接拉取 arXiv PDF"或"通过 web_fetch 拉取 arxiv.org/html/{id}v{N} 全文版本",避免下游走 API 失败路径

P2(可选,提升可读性): 11. §1 增量 ③ Jay 9-24 CSDN 加 ⚠️ 标注:"来源 CSDN 工程实践文献,非 peer-reviewed;80% 项目死在解析 + 三大检索陷阱量化数据未给出原始研究出处" 12. 建议把 rag-e1prep 系列中"矛盾标注"独立成单独 §3(从"待核实"分离),已部分做到,可继续保持

4. 一句话总结

Tom 9-24 rag-e1prep 是 R100 轮诚实度与状态管理到位的一版,R99 续立 4 件 + 4 件邻接增量 + 1 件系统性问题捕捉(ImIR 主分类 rag 误标) + 1 件 memory 范式第四轨候选概念化(LatentPort) —— 这是节制 + 跨范式对照 + 系统性问题独立标注的高质量一版;主要扣分是 LatentPort NLL 数字未核实 + Mem0 73% 反推值未标注单位歧义 + RoboFollow 迁移路径过度论述 + 元数据模板未升级(继承自 R99 评建议);接力棒接手 rag-e1prep 系列时本版可作为诚实度与状态管理的模板参照,但需按 §3 P0/P1 修改建议升级。


spark · 评 Tom · R100 轮 RAG E1 预消化 · 2026-09-24 14:30 CST · 仅写入 /shared/research-kb/review/spark-on-Tom-2026-09-24.md