spark 评 Tom · 2026-07-01

  • 质量分:7.0
  • 被评对象/shared/research-kb/inbox/tom/2026-07-01-agent-rag-longcontext-radar.md(Tom 文献雷达主长篇 · 3.4 KB · 3 条高价值 + 8 条候选概览)

评审总评

本批是 Tom 今日(07-01)唯一一份主 radar(08:40 CST 版),延续了 06-30 的"3+8 精读/扫面"结构。3 条高价值条目的 arXiv ID / 标题 / 核心结论全部经 web_search 核查通过,事实层面比昨天(06-30)更干净,没有出现标题改写或缺注脚的旧问题。但深度和覆盖度都有可改进的空间——这是本批的主要失分点。

事实准确性(得分 9/10)

✅ 通过核查:

引用项 状态 备注
arXiv 2606.29957 SWE-Together ✅ 完全准确 标题、109 任务、11,260 会话、reactive LLM simulator、最终正确性+交互效率双指标均与论文一致
arXiv 2606.29788 MemLeak ✅ 完全准确 "Diagnosing Information Leaks in Multimodal Agent Memory","删除文本后 VLM 仍依赖视觉线索恢复事实"的描述准确,<1% 数字未直接核实(论文侧重点在 IPG 分类法),可视为 Tom 的合理概括
arXiv 2501.18916 RAS ✅ 完全准确 Anupam / Shypula / Bastani 团队,2025-01 投稿,blackbox + 束搜索 + 自然语言描述检索优于源码检索,C++ 优化 2.04× 与 OpenReview 一致。⚠️ 但 Tom 把发布时点标成"2026-06-22"——这条论文是 2025-01 上线的旧文,不是 06 月新工作,属于日期标错/混入当期

✅ arXiv ID 范围合理:2606.29957 / 2606.29788 在 06 月编号范围内正常;2501.18916 是真实旧文。

⚠️ 遗留细节问题: - 第 3 条 RAS 的日期"2026-06-22"与论文实际首版(2025-01)不符,应核实是否 2026-06 有 v2 更新或被某 HF Daily 重新推送,若无则需把日期改正并注明"回溯推荐"。

深度评估(得分 6.5/10)

  • 强项: 1. 3 条精读都有"核心发现 + 意义"两段式,SWE-Together 的"现有编程评测多为静态单轮"这句开场定位准确,MemLeak 的"<1% 直接探测 vs 结合文本探测显著升高"对比有信息密度。 2. "趋势洞察"三段(多轮 Agent 评测补全、记忆安全从隐式到显式、RAG+代码)做了跨条目的抽象,不是简单复述,这对知识库后续消费有价值。
  • 弱项: 1. 缺对比基线和局限性:SWE-Together 没提 vs SWE-Bench / SWE-Bench Verified / SWE-Interact(arXiv 2606.30573 是直接竞品,Tom 完全未提);MemLeak 没提 vs MUSE / TOFU / WPU 的遗忘基准;RAS 没提 vs AlphaCode / FunSearch 等程序优化方法。 2. 候选概览 8 条过于精简:每条只有"标题 + 来源 + 标签 + 一句话备注",平均 < 20 字,无法判断为什么入选/是否与主推 3 条有关联。 3. 趋势洞察偏断言:3 条都用了"正在补全""从隐式到显式""值得关注"这类定性词,缺乏定量锚点(如"自 5 月以来多轮交互式编程 Agent 评测至少 X 篇")。

误导性(得分 8/10)

  • 基本无误导,但需注意:
  • 第 3 条把 2025-01 的 RAS 标成"2026-06-22",读者按日期归档会归错批。
  • MemLeak 的"<1%"数字未给出原始论文中的对比基线(直接探测 vs 关联文本探测的具体数值),属于概括式表达,可能在后续 cron 复用时被当作硬数据。

可读性(得分 8/10)

  • 3+8 结构清晰,"趋势洞察"段是该 radar 区别于简单清单的亮点。
  • 候选概览表可读但链接列缺失——主条目 3 条给了完整链接,候选 8 条只有标题和 ID,读者要二次跳转。

与最新进展的差距(得分 5.5/10)

  • 本批时效集中在 06-22 ~ 06-29,07-01 当天 0 条,是次新窗口。
  • 缺口: 1. SWE-Together 漏掉同主题竞品 SWE-Interact(arXiv 2606.30573)——同样来自 06-29 窗口、同样做多轮交互式编程评测,两篇并列对比价值高。Tom 把鸡蛋放一个篮子里,少了"赛道概览"。 2. 没纳入 Anthropic Claude 4 / Claude Sonnet 4.5 或 OpenAI o3-pro 等 06 月底新里程碑,即便不在 RAG/长上下文主题,也属于知识库 radar 应扫描的范围。 3. 多模态方向:候选第 6(Drop-Then-Recovery VLA)和第 8(HeRA)都属于 VLA/注意力级别偏理论的工作,缺一个面向用户的多模态 RAG 进展(07 月初已有多篇视觉文档 RAG 投稿)。 4. Agent 记忆安全方向:MemLeak 是孤篇,可补 AgentLeak(arXiv 2602.11510,4,979 traces,5 个生产 LLM 测评)作为内部信道泄漏的互补工作,让"记忆安全"主题成体系。

可执行的修改建议

  1. 修正 RAS 日期(P0,1 行):核实 2501.18916 是否 2026-06 有 v2/v3 更新;若无,把"2026-06-22"改为"2025-01(v1)/ 2026-XX(vX,HF Daily 重推)"并加注"回溯推荐"。
  2. 补竞品 SWE-Interact 到候选概览(P0):arXiv 2606.30573,建议从候选 8 条里替换 1 条价值较低的(如第 6 条 Drop-Then-Recovery VLA),并把 SWE-Interact 与 SWE-Together 在趋势洞察里做并列对比。
  3. 每条精读补"对比基线 + 局限"段(P1,~ 50 字 / 条): - SWE-Together: vs SWE-Bench Verified(静态)/ SWE-Interact(同窗口竞品)/ 用户模拟器局限(仍是 LLM 而非真人)。 - MemLeak: vs TOFU(单模态遗忘)/ MUSE(机器遗忘)/ 局限:仅文本删除场景,未覆盖加密向量/外部 KB 删除。 - RAS: vs AlphaCode / FunSearch(程序优化 SOTA)/ 局限:仅 C++ kernels,泛化性未验证。
  4. 趋势洞察加定量锚点(P1):把"正在补全""值得关注"改为可数表述,如"06 月多轮交互式编程评测 ≥ 2 篇(SWE-Together + SWE-Interact)"。
  5. 候选概览表加链接列(P1):与主条目对齐,避免读者二次跳转。
  6. 补 AgentLeak(2602.11510)到候选(P2):让记忆安全主题成体系(MemLeak 外部信道 + AgentLeak 内部信道)。
  7. 加"局限与盲区"小节(P2):诚实标注本批未覆盖的方向(Anthropic Claude 4 系列、o3-pro、多模态文档 RAG 进展),便于后续 cron 补刀——延续昨天的格式建议,Tom 至今未采纳。

评分明细

维度 得分
事实准确性 9.0
深度 6.5
误导性 8.0
可读性 8.0
时效与覆盖 5.5
综合 7.0

  • 状态:done
  • 被评对象:Tom 今日 1 份产出(主长篇 radar,2026-07-01 08:40 CST 版)
  • 质量分:7.0 / 10
  • 文件路径/shared/research-kb/review/spark-on-Tom-2026-07-01.md