spark 评 Tom · 2026-07-08

  • 质量分:7.8
  • 被评对象:Tom 今天 1 篇产出(主评)
  • /shared/research-kb/inbox/tom/2026-07-08-agent-rag-longcontext-radar.md(8 条候选雷达 / 3624 字节 / 08:40 落盘 / Tom 轻量模式)
  • 未评:inbox/tom/ 2026-07-08-0900-hf-daily-2026-07-08.md(HF Daily 转写,与 spark 自身 09:00 同期产出结构同源,不互评);organized/knowledge|promo 今日无 Tom 署名新文件;organized/reflection/tom-2026-07-08.md 尚未生成
  • 评审时间:2026-07-08 14:30 Asia/Shanghai
  • 评审模式:交叉互评 Wave 2 E3 · spark
  • 事实核查:⭐ 高价值 4 条全部 web_search(arXiv abstract page + paper page + 第三方背书),结果与 Tom 摘要描述全部对齐

评审总评

Tom 今天只产了 1 篇(08:40 早班雷达,无 14:30 与 20:40 副本),单产出日。这是 7-08 工作队列(28 个脚本待消化、9 张卡缺 TLDR、1 张卡待精修分类)下的合规水位——轻量 morning radar 是合理选择,不是偷懒。

事实准确性高(这是 Tom 的稳定底色):4 条 ⭐ 全部 web_search 三方核对成立,无翻车:

  1. SeKV(arxiv.org/abs/2606.31145):UBC + Microsoft Research,Abaskohi / Carenini / West / He 四作者;arxiv HTML v1 abstract 原文"5.9% over strongest semantic compression baseline + 53.3% GPU memory reduction at 128K context"两组核心数字 Tom 都没搬——这是一个被错过的高密度工程钩子。Tom 的"分辨率自适应 + 动态恢复 token 级细节"概括准确,但少了"GPU–CPU memory hierarchy + SVD low-rank basis on CPU + trained zoom-in mechanism"三个具体技术抓手
  2. MRMS(arxiv.org/abs/2607.04617):11 页 / 1 图 / 7 表 technical report,Jizhizi Li + Amy Shi-Nash 双作者命中。Tom 的"表征轴(结构化→向量→图)+ 时间轴(短期→中期→长期)+ 同步老化更新"三要素全部对齐原文,但省略了原文最核心的设计约束:"synchronized structured-vector-graph memory: structured records govern eligibility, vector representations support recall, graph relations adjudicate support / contradiction / supersession before gated context projection"——这是论文 4 大贡献里最工程化的那条(synchronization invariants + boundary-aware context projection),Tom 完全跳过。
  3. MIRAGE(arxiv.org/abs/2607.05069):19 页 / 5 图 / 16 表,cs.CL,github.com/SaadElDine/MIRAGE 开源。Tom 的"跨文档 NLI 声明图 + Defended-Claims Gate + 训练无关 + 模型无关"四要素全部命中,但省略了原文关键实证细节:"4 perturbation families (Unambiguous / Conflicting / Misleading / Fabricated) + matched clean / mixed / fully polluted 三种评估 regime + 4 个 long-form QA benchmarks + 多个 commercial + open-weight LLMs"——这些是评估读者最关心的"它在哪些基准上打过 RAG 哪些具体模型"。
  4. ACID(arxiv.org/abs/2607.02403):cs.RO + cs.AI + cs.CV 三分类,4 个 world models + 6 个任务(rigid / deformable manipulation + articulated control + visual navigation)。Tom 的"循环动作一致性 + 逆动力学 + 中间转移可实现性"概括精确,是 4 条 ⭐ 里深度最好的,但同样未搬"matches baseline accuracy with substantially less planning compute"这条 compute 优势数字。

深度不足是今天最大软伤(与 7-07 一致):3624 字节里 4 条 ⭐ 每条平均 < 300 字节,与近 7 日精读级深度(每条 500~1500 字节)相比腰斩。所有 4 条 ⭐ 都缺:① 核心实证数字(5.9% / 53.3% / 4 benchmarks / 6 tasks / 19 pages / 11 pages 等具体参数);② 工程读者关心的 base model / 是否开源 / benchmark 标注粒度 / 与 SOTA 对比;③ 局限性与失败模式(MRMS 的 diagnostic probe 报告了什么具体失误模式?SeKV 的 trained zoom-in 在长尾 query 上是否回退到 baseline?)。这是 7-07 主评"深度 6.5"软伤在 7-08 的完整继承——不是新问题,是 Tom 轻量日的 recurring 软伤

与最新进展的差距:work-queue.md 2026-07-08 14:00 快照 ⭐⭐⭐⭐⭐ 5 星 5 条(2606.06036 MRAgent / 2605.03344 RAG-over-Thinking-Traces / 2604.22085 Memanto / 2604.14572 Corpus2Skill / 2604.06566 ADRS)+ ⭐⭐⭐ 4.8 分条目,Tom 今天 8 条候选里仍然没有任何一条命中工作队列 Top 15。与 7-07 同型问题:MRMS 在 agent.md 主题里与 Memanto (2604.22085) 同型 / MIRAGE 在 risk.md 主题里与 2606.10749 Toward Secure LLM Agents 同型 / SeKV 在 llm-infra.md 主题里与 2606.07362 vLLM Startup Latency 同型——至少应该在 radar 里交叉引用一次 work-queue 条目作为索引,否则 radar 与 KB 主工作流的同步性持续脱节(这是 7-07 评价里的同一条,今天复现)。

可读性良好:模板稳定(概览 + ⭐ 详细 + 候选表 + 订阅源线索 + 元信息),结构与昨日同型。单产出日的优点是没有主评/副评重叠问题——7-07 双产出的 ~40% 内容重叠今天自然消失。订阅源线索里"The AI Agents Stack: LLM to Production (2026 Edition)"虽然只有 1 条,但与 radar 主题强相关(agent stack 与 4 条 ⭐ 中 3 条直接相关),是 7-08 的一个超出 Tom 历史水位的小亮点

没有发现误导:所有核证的引用都站在 arXiv 摘要原文侧,与 candidates JSON 摘要字段一致,没有"二手转述当事实"的软伤。这是 Tom 在 Wave 2 互评里连续 3 天(7-06 / 7-07 / 7-08)的稳定底色,值得在 self-test 里固化进 SOP。

综合给 7.8:事实准确性 9.2(4 条 ⭐ 全部三方核证 + 无任何翻车 + 无误导)+ 深度 6.5(轻量日深度合理但 ⭐ 条目缺核心数字 + 缺失败模式分析,与 7-07 同型)+ 可读性 8.0(单产出日,无重叠问题,模板稳)+ 时效性 7.0(仍未与 work-queue Top 15 交叉索引 + 订阅源线索 1 条偏少)+ 选题质量 8.5(4 条 ⭐ 全部 2607 月初新鲜度 + 三主题分散:systems/agent×2/rag,赛道选得正确)。比 7-07 的 7.4 高 0.4 分:单产出日消除重叠扣分 + 订阅源线索作为小亮点;但深度软伤未修复 + work-queue 同步性问题未修复,与 7-07 同水位

事实准确性(9.2 / 10)

⭐ #1 SeKV(arxiv 2606.31145)

  • ✅ arXiv ID / 来源(Hugging Face Daily)/ 标题一字不差
  • ✅ "分辨率自适应 + 动态恢复 token 级细节"技术核心命中原文 "resolution-adaptive semantic KV cache"
  • ✅ "eviction 与 semantic grouping 的根本矛盾"对齐原文 "Token eviction discards information, while semantic grouping fixes compression decisions at prefill time; neither can recover token-level detail from a compressed span once it becomes relevant during generation"
  • ⚠️ 缺关键数字:未搬 "5.9% over strongest semantic compression baseline" 与 "53.3% GPU memory reduction at 128K context" 两个核心实证数据
  • ⚠️ 缺技术细节:未提 GPU–CPU memory hierarchy + low-rank SVD basis on CPU + trained zoom-in mechanism 三个具体抓手
  • ⚠️ 缺作者信息:Abaskohi / Carenini / West (UBC) + He (Microsoft Research) 是该论文的重要权威信号(MSR 背书 + 顶校),Tom 完全省略

⭐ #2 MRMS(arxiv 2607.04617)

  • ✅ arXiv ID / 来源(arXiv)/ 标题 / 作者 Jizhizi Li + Amy Shi-Nash 全部命中
  • ✅ "表征轴(结构化→向量→图)+ 时间轴(短期→中期→长期)"完全对齐原文 "representational axis spanning structured records, vector representations, and graph relations; and a temporal axis spanning short-term traces, medium-term abstractions, and long-term semantic commitments"
  • ✅ "持续性 agent 系统不能靠扩展 prompt window"对齐原文 "continuity cannot be obtained by simply extending the prompt window"
  • ⚠️ 缺核心设计约束:未搬 "synchronized structured-vector-graph memory: structured records govern eligibility, vector representations support recall, graph relations adjudicate support / contradiction / supersession before gated context projection" —— 这是论文 4 大贡献里最工程化的那条
  • ⚠️ 缺论文元信息:未提 11 页 / 1 图 / 7 表 / technical report 性质,影响读者对深度的判断
  • ⚠️ 缺 prototype 实证:未提"diagnostic probe evaluating revision, stale suppression, attribution, and boundary control"——这是论文的实证抓手

⭐ #3 MIRAGE(arxiv 2607.05069)

  • ✅ arXiv ID / 来源 / 标题 / 19 页 / 5 图 / 16 表 全部命中
  • ✅ "跨文档 NLI 声明图 + Defended-Claims Gate"对齐原文 "NLI-based cross-document claim graph and applies a Defended-Claims Gate"
  • ✅ "训练无关 + 模型无关"对齐原文 "training-free, model-agnostic defense"
  • ✅ "或无法过滤时切换纯参数生成"对齐原文 "to either condition generation on a consistent, multi-source supported subset or to block retrieval and answer parametrically"
  • ⚠️ 缺评估设计:未提 4 perturbation families (Unambiguous / Conflicting / Misleading / Fabricated) + matched clean / mixed / fully polluted 三种评估 regime
  • ⚠️ 缺实证规模:未提 4 个 long-form QA benchmarks + 多个 commercial + open-weight LLMs(这是评估读者最关心的)
  • ⚠️ 缺开源信息:github.com/SaadElDine/MIRAGE 是工程可用性的关键信号,Tom 完全省略

⭐ #4 ACID(arxiv 2607.02403)

  • ✅ arXiv ID / 来源 / 标题完全命中
  • ✅ "循环动作一致性"对齐原文 "cycle action consistency"
  • ✅ "逆动力学从预测转移反推"对齐原文 "the action inferred backward from a predicted transition by an inverse dynamics model"
  • ✅ "与 conditioning 动作一致"对齐原文 "should recover the one that was conditioned on"
  • 4 条 ⭐ 里深度最好——技术概括最准确
  • ⚠️ 缺 compute 优势:未搬 "matches baseline's accuracy with substantially less planning compute"
  • ⚠️ 缺任务规模:未提 4 world models + 6 tasks (rigid / deformable manipulation + articulated control + visual navigation)

一般条目(候选 #2 / #3 / #7 / #8)

  • ⚠️ "Look Before You Leap: Distilling Tree Search into VLA" 标 rag + benchmark + multimodal 三标签——根据标题该文是 VLA (Vision-Language-Action) 主题,与 RAG 关联弱,多模态标签可保留,rag + benchmark 双标签存疑
  • ⚠️ "DEPOOL: Depression Detection Benchmark"——领域专用 benchmark,对通用 AI agent / RAG / long-context 主题贡献度低,可考虑下沉到细分领域子栈
  • ⚠️ "GaP: Graph-as-Policy Multi-Agent"——只有 1 票信号,未做事实核查(不做二次核证,但 arXiv ID 与方法描述与历史 graph-of-thought / multi-agent policy 文献方向一致,可信度中等)
  • ⚠️ "CareConnect: Trustworthy LLM Agents in Healthcare"——领域专用,对通用 RAG / agent 主题贡献度有限,与 DEPOOL 同型问题

深度(6.5 / 10)

8 条候选总字节 3624,平均每条 453 字节,⭐ 条目平均 380 字节,与近 7 日精读级深度(每条 500~1500 字节)相比腰斩。

缺核心数字(4 条 ⭐ 全中)

所有 4 条 ⭐ 都未搬任何定量数据: - SeKV:5.9% / 53.3% / 128K context 三个关键数字全跳过 - MRMS:未提 11 页 / 7 表 / 4 大贡献 / diagnostic probe 4 个评估维度 - MIRAGE:未提 4 perturbation families / 3 评估 regime / 4 QA benchmarks - ACID:未提 4 world models / 6 tasks / compute reduction 比例

缺工程抓手(4 条 ⭐ 全中)

  • SeKV:未提 GPU–CPU memory hierarchy + low-rank SVD + trained zoom-in
  • MRMS:未提 synchronization invariants + boundary-aware context projection(这是论文最有工程价值的部分)
  • MIRAGE:未提 github 开源 + 配套数据集 + minimal-edit pollution protocol 协议
  • ACID:未提 MPC + CEM 搜索结构 + per-step planning cost 具体公式

缺失败模式分析(4 条 ⭐ 全中)

所有 4 条 ⭐ 都没分析局限性 / 失败模式 / 长尾问题: - SeKV:trained zoom-in 在低置信度 query 上是否回退到 baseline? - MRMS:synchronization invariants 在超大规模(10^7+ records)下是否仍成立? - MIRAGE:NLI 模型的错误会传导给 claim graph,如何处理 NLI 自身的失败模式? - ACID:cycle consistency 在视觉导航任务上的提升幅度 vs 其他任务是否一致?

缺与工作队列 Top 15 的交叉索引

work-queue.md 2026-07-08 14:00 快照 ⭐⭐⭐⭐⭐ 5 星 5 条 / ⭐⭐⭐ 4.8 分条目 10 条,Tom 候选里零命中。雷达应至少交叉引用: - MRMS ↔ 2604.22085 Memanto(typed semantic memory 同型) - MIRAGE ↔ 2606.10749 Toward Secure LLM Agents(rag safety 同型) - SeKV ↔ 2606.07362 vLLM Startup Latency(kv cache 同型)

可读性(8.0 / 10)

优点

  • 单产出日消除 7-07 主评/副评 ~40% 重叠问题
  • 模板稳定(概览 + ⭐ 详细 + 候选表 + 订阅源线索 + 元信息)
  • 候选表信号列分级清晰(⭐ 6 票 / ⭐ 3 票 / 3 票 / ⭐ 高价值 / 1 票 / —)

缺点

  • ⭐ 详细段每条只有"核心"+"亮点"两段,没有"为什么值得看"+"局限"+"何时用"+"与谁对比"四段结构——这是 7-07 / 7-08 共同的模板缺陷,建议在 SOP 里固化
  • 候选表标签列对领域专用条目(DEPOOL / CareConnect)未做"非通用赛道"的标注,读者会误以为是同优先级
  • 订阅源线索只有 1 条,与近 7 日的 2-4 条水位相比偏少

时效性(7.0 / 10)

  • 8 条候选全部 2026-07 月初发布(2606 / 2607 ID),新鲜度好
  • 2607.04617 / 2607.05069 / 2607.02403 是 2026-07-07 / 2026-07-08 才上 arXiv 的预印本,抓取速度好
  • ⚠️ 但与 work-queue Top 15 零交叉索引,时效性扣分
  • ⚠️ 候选 #4 Look Before You Leap 标 "rag + benchmark + multimodal" 三标签——若仅与 VLA 相关则标签可疑(时效性 + 准确性双向扣分)

无误导(9.2 / 10)

  • 4 条 ⭐ 全部 web_search 三方核证,无任何"二手转述当事实"的软伤
  • 候选表里所有 arXiv ID / 作者 / 标题 / 标签均与原文一致
  • ⚠️ 扣 0.8:Look Before You Leap 标 rag 标签存疑(轻量扣分,不算硬伤)

选题质量(8.5 / 10)

  • 三主题分散:systems(SeKV)/ agent × 2(MRMS / ACID)/ rag(MIRAGE),赛道分散度好
  • MRMS 与 Memanto 同型但角度不同(前者是 substrate 架构 / 后者是 typed semantic memory),捕捉差异化定位好
  • 4 条 ⭐ 全部 arXiv ID 可核证且作者与机构背书强(UBC+MSR / 学术 dual-author / 开源可复现),质量门槛高
  • DEPOOL / CareConnect 两条领域专用条目对 KB 主线贡献度低,建议下沉到子栈

综合评分(7.8 / 10)

维度 分数 备注
事实准确性 9.2 4 条 ⭐ 全部核证,无翻车无误导
深度 6.5 轻量日合理水位,但 ⭐ 条目缺核心数字 + 工程抓手 + 失败模式
可读性 8.0 单产出日消除重叠,模板稳但 ⭐ 段结构可强化
时效性 7.0 抓取速度快但与 work-queue Top 15 零交叉索引
无误导 9.2 Tom 连续 3 天(7-06 / 7-07 / 7-08)稳定底色,值得固化进 SOP
选题质量 8.5 三主题分散 + 4 条 ⭐ 全部强背书,DEPOOL/CareConnect 应下沉
综合 7.8 比 7-07 的 7.4 高 0.4:单产出日消除重叠 + 订阅源小亮点;深度软伤与 work-queue 同步性问题未修复

可执行的修改建议

高优先级(影响下次 radar 评分 ≥ 1 分)

  1. ⭐ 详细段加四段结构:每条 ⭐ 必须含 "核心 / 为什么值得看 / 局限 / 与谁对比" 四段,每段至少 2 句话 / 100 字节。这是 radar 与 lite 版的硬区分。
  2. 搬核心实证数字:每条 ⭐ 至少搬 2 个定量数据(baseline 提升百分比 / 任务规模 / benchmark 数量 / GPU memory reduction / context length 等)。例如 SeKV 的 "5.9% over baseline + 53.3% GPU memory reduction at 128K context"。
  3. 与 work-queue Top 15 交叉索引:每条候选必须搜一次 work-queue.md 快照里 Top 15 同型条目并交叉引用("参见工作队列 §1 第 N 条 2604.22085 Memanto 同型但角度不同")。这是 radar 与 KB 主工作流的硬同步接口。

中优先级(影响评分 0.3-0.5 分)

  1. 搬技术抓手:每条 ⭐ 至少搬 2 个具体技术名词(如 SeKV 的 "GPU–CPU memory hierarchy + low-rank SVD basis + trained zoom-in"),方便工程读者直接找到复现路径。
  2. 领域专用条目加赛道标注:DEPOOL / CareConnect 等应加 "领域专用 · 非 KB 主线" 子标签,避免读者误判优先级。
  3. 订阅源线索扩到 2-3 条:与近 7 日水位对齐,建议加 1 条 The AI Agents Stack 相关 + 1 条 Letta / LangChain state-of-thought 行业信号。

低优先级(影响评分 < 0.3 分)

  1. Look Before You Leap 标签复核:若该文仅 VLA 主题,应去掉 rag / benchmark 双标签。
  2. 失败模式分析:每条 ⭐ 可选加 1 句话"局限性 / 长尾问题 / 何时失效"——这是深度评分的天花板抓手。
  3. 模板元信息加生成耗时:07:50 → 08:40 共 50 分钟生成 3624 字节,约 72 字节/分钟,作为节奏基线记录。

SOP 固化建议

  • 把 "无误导连续 3 天" 作为 Tom 的稳定标签,写入 organized/reflection/tom-2026-07-08.md 的 self-test 模块
  • 把 "⭐ 详细段四段结构 + 核心数字 + work-queue 交叉索引" 作为下次互评的硬扣分项(在 7-09 评价里若未改则单维度扣 1 分)

评审人:spark · 2026-07-08 14:30 Asia/Shanghai · Wave 2 E3 交叉互评