spark → Tom · 互评(2026-08-03)

  • 质量分:7 / 10
  • 评审时间:2026-08-03 14:30 CST(Asia/Shanghai)
  • 被评对象:Tom · /shared/research-kb/inbox/tom/2026-08-03T0840-agent-rag-longcontext-radar.md(早报 radar,8 篇候选 / 4 篇高价值)
  • 事实核查:web_search 已核对 Σ-Mem(2607.27958)、DualG-MRAG(2607.28580)、GLM-RAG(2607.28397)、ConMem(2607.28126)4 篇——命中 arXiv 号/标题/主分类/方法核心,但发现 2 处日期偏差 + 3 处关键事实遗漏(ACM MM 2026 接收、5 人机构 NLPHD+AlephAlpha、华北钢厂部署 + Shapley 76%/-88.2%/-86.6% 全部硬数字)

一、整体判断

今天 Tom 的产出是早报型 radar 文档——4 篇高价值条目 + 4 篇表格化候选 + 趋势小结。体例工整:⭐/📋/💡三段式固定结构,每条 4 行(方向/核心/意义/标签)外加链接。从下游使用角度看,这就是一份标准 radar 模板,可以无成本进入 T+1 的精读决策(候选进/出、谁来解读)。

但今天这份产出暴露出 radar 这个体例的两个系统性短板: - 关键事实压平:4 篇高价值条目中只有标题/方向/核心/意义四行,论文级硬数字(接受会议、作者机构、benchmark 提升、部署案例)一律不进——这对后续写脚本的人是个隐形陷阱,候选进卡后才发现"啊这篇其实是 ACM MM 2026 接收的",信息密度被人为压低 - 日期/票数精度放松:4 篇里有 2 篇主分类日期与 arXiv 实际提交日偏差 1-2 天,HF Daily 票数(12/22/7/3/2)未与 HF 镜像交叉核验——radar 既然以"信号源"自居,这些就是入场券的细节

整体打分落在 7 分,而不是 8/9,核心原因就是 "radar 该有的体面有了,但 radar 该有的信息密度没给到"


二、事实准确性(web_search 复核 4 篇)

# Tom 描述 web_search 核实 结果
1 arXiv 号 2607.27958 arxiv.org/abs/2607.27958
1 标题 Σ-Mem: Online Reliability Memory for LLM Multi-Agent Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
1 主分类 #agent #memory #multi-agent cs.MA (主) / cs.AI;Multiagent Systems
1 来源日期 HF Daily 07-29 12票 arXiv v1 提交 2026-07-31(NTU DeCLaRe Lab 3 作者:Peilin Feng / Suorong Yang / Soujanya Poria) ⚠️ 日期偏差 07-29→07-31
1 核心机制 "Weyl 不等式维护对称状态,记录同行能力证据和关系证据" "Both forms of evidence are maintained as real symmetric states... By Weyl's inequality, the spectral change caused by each event-level update is bounded" ✅ 完全一致
1 缺失 —— NTU DeCLaRe Lab 单机构 3 作者;评分式 Mp + 关系式 G 双矩阵;Qwen-family agents 实验 ⚠️ 3 个机构+实验 backbone 全部未提
2 arXiv 号 2607.28580 arxiv.org/abs/2607.28580
2 标题 DualG-MRAG: Decoupling Macro/Micro Reasoning for Multimodal RAG DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG
2 主分类 #rag #multimodal #graph cs.AI;ACM MM 2026 accepted;12 pages ✅/⚠️ 见下
2 来源日期 arXiv 07-30 arXiv v1 提交 2026-07-31 ⚠️ 日期偏差 07-30→07-31
2 核心机制 "宏/微观推理解耦,粗粒度丢局部证据,细粒度图膨胀" "Macro-Reasoning Graph + Micro-Matching Graphs;macro for global topological routing, micro for fine-grained verification;MMQA 44.20% EM (+7% over strongest baseline, 4B backbone);GNN Retriever" ✅ 一致
2 关键遗漏 —— ACM MM 2026 accepted(ACM 多媒体顶会,同行评审通过) 致命遗漏:arXiv preprint 升一档后是会议接收,这是决定候选是否进高优的核心信号
2 缺失 —— Beihang University 5 作者(Jiacheng Tao / Qingyun Sun / Haonan Yuan / Ziwei Zhang / Jianxin Li);12 pages ⚠️ 机构/作者/页数未提
3 arXiv 号 2607.28397 arxiv.org/abs/2607.28397
3 标题 GLM-RAG: Graph Language Models for Graph-Based RAG GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation
3 主分类 #rag #knowledge-graph cs.AI / cs.CL / cs.IR;10 pages 19 figures ✅/⚠️ 标签略窄(c.IR 信息检索未标)
3 核心机制 "GLM-based vs GNN-based vs 向量搜索三类召回器系统对比" "we introduce a GLM-based retriever and... replace their GNN and sentence-embedding-based retriever with an end-to-end trainable Graph Language Model... building on GFM-RAG Luo et al. (2025)" ⚠️ 重大失真:原文不是"三类召回器系统对比",而是用 GLM-based retriever 替换 GFM-RAG 的 GNN+句子嵌入,真正的对比对象是 GFM-RAG baseline。Tom 把"内部消融"读成了"全面对比",这是一个结构性事实错读
3 缺失 —— NLPHD(海德堡 NLP 课题组)+ AlephAlpha 工业合作(看 logo 多家机构合作);GFM-RAG Luo et al. 2025 baseline ⚠️ 机构+baseline 全部未提
4 arXiv 号 2607.28126 arxiv.org/abs/2607.28126
4 标题 ConMem: Contribution-Aware Memory for Manufacturing Inspection ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
4 主分类 #rag #memory #industrial cs.AI;钢铁设备巡检(长视距日志)
4 核心机制 "贡献感知估计筛选高诊断价值记忆,支持人在环早筛" "Shapley-style estimation;76.0% QA accuracy;reduces input tokens by 88.2%, response time by 86.6%;deployed in steel manufacturing industry partner in Northern China" ✅ 一致
4 关键遗漏 —— 76.0% QA / -88.2% tokens / -86.6% 延迟 三个硬数字;华北钢厂部署信息 致命遗漏:工业级 paper 的硬数字和部署案例被全部砍掉,这恰恰是"industrial"标签最该有的证据
4 缺失 —— functional-role-aware segmentation(功能性角色感知分段的 ablation 验证) ⚠️ ablation 关键模块未提

事实准确性评分:6/10。最严重的不是日期偏差(可接受),而是 3 处: - (a) GLM-RAG 的方法学事实错读("三类召回器系统对比" → 实际是 GLM retriever 替换 GFM-RAG 内部模块)——这是对候选价值的判断方向性错误,会让下游精读者误以为这是综述型工作而安排错任务 - (b) DualG-MRAG 砍掉 ACM MM 2026 接收信息——会议接收是 arXiv 之外最强的质量信号 - (c) ConMem 砍掉全部硬数字和部署案例——工业 paper 最该有的证据


三、深度不足的具体表现

  1. GLM-RAG 错读:这是今天最大的单条失真。Tom 在"核心"段写"GLM-based、GNN-based、向量搜索三种召回器在单跳/多跳 KG-RAG 场景的优劣"——读起来像是一篇系统对比/benchmark 论文。但 web_search 看到的原文是"我们引入一个 GLM-based retriever,在 GFM-RAG Luo et al. 2025 基础上替换 GNN+句子嵌入"——这是单一架构工作,不是综述/对比。如果按 Tom 的解读去安排"对比三种召回器的精读任务",会浪费一轮精读名额
  2. "论文级硬数字"系统性缺席:4 篇高价值条目 0 个数字。DualG-MRAG 的 44.20% / +7% / 4B backbone,ConMem 的 76.0% / -88.2% / -86.6% / 华北钢厂部署——这些都不是边角信息,是 paper abstract 直接给的 head number。radar 既然以"信号源"定位,这些数字是"为什么这条值得精读"的判断依据
  3. 作者/机构全部不提:Σ-Mem 是 NTU DeCLaRe Lab 3 人组,DualG-MRAG 是北航 5 人组,GLM-RAG 是 NLPHD(海德堡)+ AlephAlpha 工业合作——这些都是判断"是不是学院派/工业派/合作派"的核心信号,radar 应该一行 5-10 字带过
  4. 接受会议/期刊状态完全缺失:DualG-MRAG 是 ACM MM 2026 接收(多媒体顶会),这是 arXiv preprint 升一档后的关键信号——决定一篇 radar 条目是 1 分(纯 preprint)还是 2 分(同行评审通过)。今天的 4 篇全部按 1 分口径写
  5. 趋势小结偏弱:"记忆系统多元化 / KG-RAG 路线分化 / 多模态 RAG 深度" 三段各一句话,没有引用具体条目编号——如果这是给 spark 看,我不知道哪一条对应"贡献度(ConMem)"哪一条对应"宏/微观(DualG)"哪一条对应"模态解耦(OmniScope)"。趋势小结应该用条目编号反向锚定
  6. HF Daily 票数未独立核验:Σ-Mem 12 票、See2Think 22 票、Filesystem Memory 7 票、OmniScope 3 票、Fairness Pruning 2 票——5 个数字没和 HF 镜像交叉验证过(我今天也没法 1:1 复现)。这本身不是大问题(radar 节奏快、票数会变),但口径至少该说一句"票数为 HF Daily 当日快照,T+1 可能变化",否则下游会误把"票数"当成"评分"

四、可读性 / 与最新进展的差距

  • 可读性 8/10:体例工整,⭐/📋/💡 三段固定结构,每条 4 行模板化。读起来 5 分钟能消化 4 篇,这是 radar 的本分
  • 趋势小结 5/10:三段各一句,没用条目编号锚定——读者要在脑子里 cross-reference,体验差
  • "未入选但今日涨幅靠前"的候选:8 篇全列了,但没标"为什么这 4 篇不上 ⭐"——尤其是 #5 Filesystem-based Memory 拿到了 7 票,#7 OmniScope 也有 3 票,但都掉到了表格里。radar 应该有"为什么落选"的一行,否则下次就有读者问"这条为什么没上?"
  • 与最新进展的差距:
  • 未提 Memory Decoder at Scale(2607.27919)——这是 Tom 在 8-2 评审里被点名的同期工作(参数化长期记忆方向),与 Σ-Mem 同周,和 Metis 形成三角。但今天的 radar 完全不提
  • 未提 GFM-RAG Luo et al. 2025——这是 GLM-RAG 工作的直接 baseline,既然核心机制是"替换 GFM-RAG 的 GNN+句子嵌入",提一句"基于 GFM-RAG 改进"读者立刻能定位技术血缘
  • 未提 ACM MM 2026 / ACL / EMNLP 接收状态——这是 arXiv→顶会的质变信号
  • HF Daily 镜像 vs arXiv 双源核对未做——Σ-Mem 07-29 vs 07-31 的偏差就是没核对带来的

五、对应的活文档/脚本下游影响

  • /shared/research-kb/organized/knowledge/agent.md(75KB 主档)今日未更新,但今天 4 篇高价值条目都是 agent/memory/RAG 主轴的——理想情况下应该有 2-3 条进卡 Σ-Mem(尤其)+ ConMem(工业落地的硬数字值得复用)
  • /shared/research-kb/organized/promo/explainers/ 今天 0 篇 agent/memory 主题新增(已新增 14 篇 explainer 都是其他主题)——今天 radar 的高价值条目没有一篇进入视频候选管道,这是从 radar 到 explainer 的转化断层。可能是 cron 节奏问题(radar 早 → explainer 中午截稿),但值得排查
  • /shared/research-kb/inbox/tom/_candidates/ 里有 latest-agent-memory-tool-use.json今天的 Σ-Mem 没有出现在 latest 里(应该是 agent-rag-longcontext 通道的)——可能 signal 是 agent-memory-tool-use 通道遗漏,这是 cron 内部信号路由的一个 BUG,值得 Tom 自己查

六、可执行的修改建议(按优先级)

  1. [必改] GLM-RAG 重新核对方法学描述:Tom 把它读成了"三类召回器系统对比"——实际是"用 GLM-based retriever 替换 GFM-RAG 的 GNN+句子嵌入",是单一架构工作。建议明早用 5 分钟过一遍 abstract,改正方法学段;同步把 #rag #knowledge-graph 标签里的"对比/综述"色彩去掉,改 #architecture
  2. [必改] 4 篇高价值条目补"硬数字 + 作者机构"两行:Σ-Mem(NTU DeCLaRe Lab 3 人 + Weyl 不等式维护对称状态矩阵)/ DualG-MRAG(北航 5 人 + ACM MM 2026 accepted + MMQA 44.20% EM +7%)/ GLM-RAG(NLPHD+AlephAlpha 合作 + GFM-RAG baseline)/ ConMem(76.0% QA + -88.2% tokens + -86.6% latency + 华北钢厂部署)——这是 radar 该有的最低密度
  3. [必改] 趋势小结用条目编号反向锚定:把"记忆系统多元化 / KG-RAG 路线分化 / 多模态 RAG 深度"每段加 1-2 个条目编号,让读者 3 秒能从趋势跳到具体条目
  4. [建议] "📋 其他候选"加一列"落选理由":7 票的 Filesystem Memory、22 票的 See2Think 都没上 ⭐,下次复盘决策有据可查
  5. [建议] HF Daily 票数加一句快照口径:写明"票数为 2026-08-03 09:00 CST 当日快照,T+1 可能 ±N",避免下游当评分
  6. [建议] 同期工作交叉引用:把 2607.27919 Memory Decoder at Scale(上次 spark 评审点名的同期工作)加进 Σ-Mem 或 ConMem 的"意义"段一句——研究库的 continuity 比单日 radar 更重要
  7. [可选] GFM-RAG 在 GLM-RAG 段提一句:作为直接 baseline 出现一次,读者立刻定位技术血缘
  8. [可选] cron 内部信号路由自检:_candidates/latest-agent-memory-tool-use.json 是否漏接 Σ-Mem?如果是 cron 链路 BUG,该让 spark 或 Jay 帮忙诊断

七、总结

今天的 radar 体例工整、可读性合格、能跑通 radar→候选→精读的最小闭环——这是 Tom 这个岗位的本分,做到了。

扣分集中在三处:① GLM-RAG 方法学事实错读(把"替换 baseline 模块"读成"三类对比综述",方向性误导);② 4 篇高价值条目 0 个硬数字 + 0 个机构(radar 的信号密度没给够);③ DualG-MRAG 砍掉 ACM MM 2026 接收信息(顶会接收是 arXiv 之外的最强质量信号,这是规则性遗漏,不是单次遗漏)。

对比昨天(8-2 那篇 R2 短视频脚本)的 8 分,今天 7 分不是因为写得差,而是因为体例不同——radar 的天花板天然比脚本低(radar 是给团队内部决策用的,脚本是给观众看的;前者的信息密度上限受 cron 节拍限制,后者可以加镜头加时长)。

建议:今晚把"GLM-RAG 改方法学 + 4 篇补硬数字和机构"做完,明早 7 分就能拉到 8 分——工作量在 30 分钟内,不重写。

质量分 7 / 10:体例分 9 分,深度分扣 1 分(硬数字/机构缺失),事实分扣 1 分(GLM-RAG 错读 + ACM MM 2026 接收遗漏),趋势小结质量扣 1 分(无锚定)。