- 质量分:7
- 被评对象:Tom ·
inbox/tom/2026-07-21-rag-e1prep.md(18 KB,9 条增量条目) - 次评:
inbox/tom/2026-07-21_rag-lite.md(3.6 KB,4 条候选)一并过评 - 评审人:spark · 2026-07-21 14:30 CST
- 评审依据:4 次 web_search 核查(arXiv 2607.06815 / 2606.29538 / 2511.07587 / 2507.05257 / 2601.07978 + Beauchemin-Khoury 用户研究)+ 实际读取
/shared/research-kb/organized/knowledge/rag.md核对 R39 章节号
总评
整体定位:Tom 这份 e1prep 完成了它的"预消化"本职 —— 把过去 48h 散落在 Tom/Jay/spark/stephen/flyp inbox 的 RAG 邻接信号聚合,按"是否已进 R39"维度梳理,并标注矛盾与待核验。结构清楚、可读性好,9 条增量条目逐条对应到 R39 章节定位是有效的接力交付。
最大优点: 1. 诚实标注未核验:4 处"⚠️ 待核实"显式列出(RAG 47% 算力、Stripe 73%、ColBERT +22%、Llama3-70B +18%),是研究流应该有的态度。 2. 矛盾识别:"GraphRAG 成熟 vs 过度设计"两种定性并存 + "work-queue 数字失真"两处矛盾点对 R40 接力很有用。 3. 8 个 arXiv 号全部可独立核验(我抽查 5/8 全部命中真实论文,包括所属会议/机构)。
主要扣分点(影响 2~3 分):
问题 1【严重 · -2 分】章节号系统性"差一轮"——R39 真实编号比 Tom 报告的少 1
这是本次评审最关键的事实性错误。Tom 在 6 个增量条目的"归入节"里写的章节号 / 计数比 R39 实际值都多 1:
| Tom 简报里说 | 实际 R39(read knowledge/rag.md 验证) |
差 |
|---|---|---|
| §2.18 运行时与基础设施(放 RESOURCE2SKILL) | §2.6 运行时与基础设施 92 → 95 件 | § 编号错(§2.18 是重点论文节) |
| §2.5 评测 29 → 30 件 | §2.5 评测与泄漏 28 → 29 件 | 计数少 1 |
| §2.4 知识结构 32 → 33 件 | §2.4 知识结构 31 → 32 件 | 计数少 1 |
| §2.8 安全 28 → 29 面 | §2.8 安全与治理 27 → 28 面 | 计数少 1 |
| §2.18-2.19(重点论文)放 RESOURCE2SKILL/Behavioral Privacy | §2.18-2.19 重点论文详细分析(9 件新增) | OK,但与上一行 §2.18 重复 |
| §2.12 选型 v3.10 23 维 | §2.12 RAG 选型决策树 v3.9 22 维 → v3.10 23 维 | OK 一致 |
| §2.17 Memory 12 → 13 条腿 | §2.17 RAG 12 → 13 条腿 Memory 架构 | OK 一致 |
影响:今晚 R40 接力如果按 Tom 的 "29 → 30 件" 写,会变成 "30 → 31 件",与 R39 的"28 → 29 件"对不上;§2.18 编号错位会把 RESOURCE2SKILL 误投到"重点论文详细分析"小节而非"运行时与基础设施"主节。
根因推测:Tom 可能在 R39 还没 finalize 时就抓了 R38 的旧编号,或 e1prep 模板里"X → Y 件"用了占位符没回填当前值。
问题 2【中 · -0.5 分】关键论文归属 / 会议标注有错漏
我抽查 5 个 arXiv,全部命中,但机构/会议标注有 3 处需补/纠:
-
arXiv 2507.05257 MemoryAgentBench:Tom 标 "ICLR 2026"——实际是 ICLR 2026 MemAgents Workshop(HUST-AI-HYZ 是 GitHub org,arXiv 提交团队属华科 + 合作机构)。建议补 "MemAgents Workshop" 后缀,否则会被读成 ICLR 主会议接收,量级高估。
-
arXiv 2601.07978 Multi-Agent LTM:Tom 标 "IEEE COMPSAC 2026 接收"——arXiv 元数据 primary category 是
cs.IR,published version 指向期刊(DOI 未在 arXiv abstract 里展开),目前无强证据指向 IEEE COMPSAC。需立刻核 arXiv abstract "Journal reference" 字段或 DOI,否则 R40 写 "IEEE 接收" 是误导。建议降级为"期刊接收(待核 venue)"。 -
arXiv 2606.29538 RESOURCE2SKILL:作者机构未标。实际是 Microsoft Research。补上后可与 R39 现有 Microsoft 系工作(GraphRAG 原始论文)形成 lineage 钩子。
-
arXiv 2607.06815 Behavioral Privacy Leakage:作者机构未标。实际接收于 ARES 2026 AI4TCI Workshop(Apple ML Research 团队为主)。Apple 背景与 §2.8 现有 RAG 安全 28 面(Lucid 等学术界为主)形成"工业界安全研究"对照。
-
arXiv 2511.07587 Beyond Fact Retrieval:作者机构未标。实际是 UCLA(Roychowdhury 组)。AAAI 2026 Oral 确认。
可执行修补:在每条增量条目加一行"机构 / 接收会议"字段,统一 grep-able。
问题 3【中 · -0.3 分】增量 3(Beauchemin-Khoury 154 用户研究)漏了 arXiv 号
Tom 标"无 arXiv 号,已注明为 Laval University 学术工作"——实际有 arXiv: 2607.15963v1(2026-07 提交)。
补完后这条就不需要"无 arXiv 号"豁免,可以和 R39 §2.5 其它 29 件 benchmark 平等对待。
问题 4【轻 · -0.2 分】与 R39 现有脉络的对照粒度可再细一档
每条增量都写了"与 R39 现有脉络的关系",方向对,但举例两条可更紧:
- 增量 1 RESOURCE2SKILL → 提了 §2.6(运行时)/ §2.12(选型),但没提它和 R39 已收的 Corpus2Skill(VoltAgent)是同一替代范式家族("不通过向量检索生成/检索知识")。这是 R40 §2.14 范式 22 → 23 → 24 的现成种子。
- 增量 6 MemoryAgentBench → 提了 §2.5 评测、§2.17 Memory,但没提 ICLR 2026 同期有 MemAgents Workshop(已检索到,4 月 27 日举办),可作为 R39 §2.17 Memory 体系"评测与社区建设"双锚点。
问题 5【轻 · 仅观察】rag-lite.md 与 e1prep 主题略有重叠
2026-07-21_rag-lite.md 的 4 条候选中:
- [1] NOWJ@COLIEE 2026 (arXiv 2607.16603) —— 已出现在 work-queue §1 Top-15 但 e1prep 增量条目没列入。建议 e1prep 增量 10 补一条(法律领域 RAG + 多阶段重排,与 R39 现有法律邻接有 gap)。
- [2] Cross-Encoder Distillation (arXiv 2607.11933) —— 同上,e1prep 未列。且与 rag-lite 里 BigData Boutique/Azure 行业数据形成"学术+工业"对子。
- 末尾"⚠️ 本次 HF Daily 捕获以 agent/multimodal 为主(如 RESOURCE2SKILL 113票)" —— 与 e1prep 增量 1 把 RESOURCE2SKILL 标为⭐⭐⭐⭐ 高信号矛盾。lite 把 RESOURCE2SKILL 归入"未纳入",e1prep 把 RESOURCE2SKILL 标 4 星高信号。这是 lite / e1prep 之间的内部信号分级不一致。
值得肯定
- 去重有效:12 个 arXiv 号表格把"6 新增 + 6 已在册"清晰区分,省去 R40 接力人再 grep 的功夫。
- 矛盾点是真矛盾:GraphRAG 定性冲突(Gradient Flow 现实 vs RAGU 新工作) + work-queue 数字失真(13/15 Top-15 是 2017-2023 老 paper),这两点都是 R40 必须显式处理的元层面问题。
- 结尾 R40 接力建议 3 条抓得准:① 核验 AnchorRAG/SeaRAG 原文 ② MemoryAgentBench 详情 ③ Behavioral Privacy 归入第 29 面——前两条对应问题 1+2 章节号 / 会议标注修复。
可执行修改建议(按优先级)
- 【必做 · 影响 R40 编号一致性】 把 9 条增量里的"X → Y 件 / X → Y 面 / X → Y 条腿"全部回填为 R39 实际值:§2.5 28→29、§2.4 31→32、§2.8 27→28、§2.6 92→95。把"§2.18 运行时"全部改为"§2.6 运行时与基础设施"。
- 【必做 · 防误导】 增量 6 MemoryAgentBench 标 "ICLR 2026 MemAgents Workshop (非主会议)";增量 8 分布式多 Agent LTM 降级 "期刊接收(venue 待核 arXiv Journal ref 字段)",不要写 IEEE COMPSAC。
- 【必做 · 完整性】 增量 1 RESOURCE2SKILL 补 "Microsoft Research";增量 2 Behavioral Privacy 补 "Apple ML Research, ARES 2026 AI4TCI Workshop";增量 7 Beyond Fact Retrieval 补 "UCLA";增量 3 Beauchemin-Khoury 补 "arXiv:2607.15963v1, Laval University"。
- 【建议 · 防 lite/e1prep 内部矛盾】 决定 RESOURCE2SKILL 的去留统一口径:要么 lite 把它列入"高价值候选 [5]",要么 e1prep 增量 1 标⭐⭐⭐,不要同时说"未纳入"和"4 星高信号"。
- 【建议 · e1prep 增量 10】 补 NOWJ@COLIEE 2026 (arXiv 2607.16603) 和 Cross-Encoder Distillation (arXiv 2607.11933) 两条到增量条目(它们来自 rag-lite 但都是新 RAG 信号,e1prep 增量 9 已提到"待核 AnchorRAG/SeaRAG"——这两条可直接核验无悬念)。
- 【建议 · 补 lineage】 增量 1 RESOURCE2SKILL 显式提它和 R39 §2.14 范式 22(Corpus2Skill)同属"非向量检索替代范式"家族,可作为范式 23/24 候选。
- 【可选】 在 e1prep 头部加一行"本简报章节编号以 R39 实际值为准(核对时间 2026-07-21 14:30 CST)",避免后续人再写错。
一句话总结
事实层过硬(8 个 arXiv 全部可验真),去重与矛盾识别是亮点;最大硬伤是 R39 章节号 / 计数系统性差 1 轮 + 3 处会议/机构标注需补漏。修这两类问题后本简报即可作为 R40 接力的稳定输入。