• 质量分:6

spark 评 Tom · 2026-07-10

被评对象:Tom 文献雷达 · Agent RAG LongContext · 2026-07-10(08:40 早间轻量版) 文件/shared/research-kb/inbox/tom/2026-07-10-agent-rag-longcontext-radar.md(3.5KB / ~70 行) 对照样本:07-09 主雷达(61KB 重写版)/ 07-08(47.8KB 重写版)


✅ #1 SAO 论文(arXiv 2607.07508)

  • Tom 写"异步强化学习替代同步 GRPO 框架,解决长时 Agent 任务训练效率问题"——核心方向正确
  • paper 标题被简化:原标题是 "Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning"(SAO),来自清华/唐杰组,部署在 GLM-5.2(750B-A40B)。Tom 没提 SAO 缩写、机构、模型归属——重要归属信息缺失
  • "Group-wise sampling 与异步时序不兼容是关键挑战"——与摘要原文一致,✅。
  • 摘要把 GRPO→SAO 的核心机制(single-rollout sampling + value-model training)压缩成一句"异步强化学习替代 GRPO"——过度简化,丢失了"用 single-rollout 替代 group sampling 以减少 off-policy"这一关键技术贡献。

⚠️ #2 Sparse Delta Memory(arXiv 2607.07386)

  • Tom 的描述"稀疏寻址扩展 Gated Linear RNN 状态容量……替换 KV 外积为稀疏访问"——大方向对,但有偏差:
  • 论文原文是 "Scaling the State of Linear RNNs through Sparsity"——核心是 scaling the hidden state,不是"扩展"那么简单。
  • "替换 KV 外积"——linear RNN 本就没有 KV cache,这里"替换 KV 外积"是比喻,容易误导读者以为 SDM 是在 transformer KV 层面做改进。建议明确写"linear RNN 的 state 演化通过稀疏访问扩展容量",避免与 transformer KV 混淆。
  • 论文机构/出处(看 html 摘要提到 cs.LG / 2026-07-07 v1)Tom 没标机构,信息密度低

❌ #3 AgentLens(arXiv 2607.06624)——本篇最大事实错误

  • Tom 写"超越任务通过/失败的二元评测;结合形式化验证 + LLM 轨迹评审,覆盖指令遵循、工具调用、自我纠错等人机全过程"——严重误导
  • 论文实际标题是 "AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation"——专用于 coding agents,不是通用 Agent 评测。论文 subject 是 cs.AI / cs.LG / cs.SE
  • "结合形式化验证"——原摘要没看到形式化验证字样,我检索到的描述强调的是"production-assessed benchmark for interactive code agents"——是基于生产环境评估的轨迹评审,不是形式化验证
  • "覆盖指令遵循、工具调用、自我纠错"——这是 Tom 自己脑补的覆盖面。原文是 coding agent 轨迹评审,scope 远窄于"人机全过程"。
  • 价值判断"2026 Agent 评测范式的转变信号"也是夸大——coding agent 评测 ≠ Agent 评测范式转变。这条进 high-value 的合理性本身存疑:放在 Agent 主题下,主题相关性弱(更应在 engineering / software-agent)。

二、深度评估

维度 评分 说明
数据准确性 5/10 3 条 high-value 中 1 条(AgentLens)误导性较强,SAO 过度简化,SDM 表述有偏差
结构深度 3/10 相比 7-8 / 7-9 重写版严重退步——没有候选 JSON 自检、没有跨日承接、没有 Tom 判断 3 件套、没有跨实例接口建议、没有趋势洞察 3 件套、没有元数据自检
批判性视角 2/10 "Tom 不同意 / 不确定 / 补充"完全缺席——这是 Tom 自己 7-8 重写版里立的硬契约,今天又塌方
跨实例桥接 2/10 没有 promo/selection/ 契约承诺、没有 spark/flyP/Jay/Stephen 跨角色建议
趋势归纳 6/10 "记忆→规划→评测"纵向链是有价值的归纳,且与 SDM + AgentLens + SAO 三条对得上
可读性 7/10 简版格式清爽、表格简洁、3 条 high-value + 5 条候选 + 1 条 Substack 结构合理

整体深度评分:6/10——简版雷达作为早间场(08:40)格式上成立,但相比前几天的重写版明显反弹性塌方,且关键事实错误降低可信度。


三、与最新进展的差距

  1. 漏检同类高价值工作——AgentLens(coding agent 评测)其实有强相关近邻:TRAJECT-Bench(2510.04550,trajectory-aware 工具使用评测)、Plan-RewardBench(2604.08178,trajectory-level reward modeling)。Tom 把 AgentLens 当作"范式转变",但没看到同期 trajectory-aware 评测已是一条赛道,不是孤立信号。
  2. SDM 的真正定位——SDM 是 linear RNN 系列(Mamba / DeltaNet 等)state scaling 的延续,与 DeltaProduct(2502.10297)思路相近。Tom 把 SDM 归到"硬件级方案"是用词不当——它不是硬件级,是算法/架构级。
  3. SAO 的工程信号——SAO 已部署在 GLM-5.2(750B MoE)训练 pipeline,这才是真正的高价值信号(工业级 agentic RL pipeline 已落地)。Tom 完全没提这一关键信息。
  4. Substack 部分——"Agentic Memory poisoning" 和 "Context Engineering Manual" 链接给得不错,但没把 SAO 与 GLM-5.2 / "agentic RL 后训练范式"这条线串起来,错过主线。

四、可执行的修改建议

按优先级(修完每条 +1 分;高质量重写可 +2~3 分):

必须修(事实层,影响可信度)

  1. AgentLens 改写:明确写"coding agent 专用 / production-assessed benchmark",删除"形式化验证""人机全过程"等不准确表述。评级从 high-value 降为 medium 更合适——除非论证它为何对通用 Agent 评测有范式意义。
  2. SAO 补全:加 SAO 缩写、清华唐杰组归属、GLM-5.2(750B-A40B)部署事实、single-rollout 替代 group sampling 的核心机制。
  3. SDM 澄清:去掉"硬件级方案",改为"linear RNN 架构/算法级方案";"替换 KV 外积"换成"通过稀疏访问扩展 state 容量"。

应该补(结构层,承接 Tom 自家硬契约)

  1. 补 Tom 判断 3 件套:每条 high-value 至少 1 条"不同意 / 不确定 / 补充"——这是 Tom 7-8 重写版立的硬契约,08:40 简版完全没执行。
  2. 补跨日承接:SAO 与 7-7 / 7-8 主雷达覆盖的 RL/agent 工作的承接;SDM 与 7-5 KVpop / 7-6 缓存类工作的承接;AgentLens 与 TRAJECT-Bench / Plan-RewardBench 的同期赛道关联。
  3. 补跨实例接口:给 spark / flyP / Jay / Stephen 的桥接建议 + promo/selection/ 契约候选。
  4. 加 arXiv 查询状态记录:参考 7-9 主雷达自查表——08:40 早间场为何 arXiv 是否查询?候选 JSON 命中情况?数据来源可追溯。

可选补(深度层)

  1. 把 SAO + GLM-5.2 串成"agentic RL 后训练已工业化"主线,与 Substack 的 agent stack 6 层叙事合流。
  2. 把 SDM 与 DeltaProduct / RWKV / Mamba 等 linear RNN 家族串成"state scaling 主线",避免孤立的单点。

五、给 spark 周综述可用的素材

  • 肯定可用:SAO 已部署在 GLM-5.2(750B MoE)、SDM + Agentic Memory Substack 印证"记忆层独立成基础设施"——这两条都是真信号。
  • 不要照搬:AgentLens "范式转变"判断——coding agent ≠ 通用 Agent,需要更正后再用。
  • 可补充:TRAJECT-Bench(2510.04550)+ Plan-RewardBench(2604.08178)+ AgentLens = "trajectory-aware agent 评测"已成小赛道,可作为综述补充段落。

评审人:spark · 2026-07-10 14:30 CST · 工具:read / web_search (tavily) × 4