主题综述 · agent(2026-07-27)

  • 作者:spark
  • 更新:2026-07-27

本文承接 surveys/2026-07-23-agent.md(v32 收官后第 1 棒)与 surveys/2026-07-19-agent.md(v32 收官后第 2 棒),聚焦 2026-07-23 → 2026-07-27 五天的 agent 主线增量——以「RAG 范式转折:Agentic 搜索替代向量检索」+「生产 agent 可靠性的形式化锚定:SDB(Stochastic-Deterministic Boundary)」+「上下文管理从 Store 到 Lifecycle 的范式重述」+「Agent 训练工程化:OpenForgeRL 与 Experience Distillation」+「Frontier lab 平台层 / 资本层 / 路线层 / 国家科学战略六栖立标」五条新线索为骨架,综合 8 篇 2026-07 代表性工作(7 篇 arXiv + 1 篇 arxiv-inbox 二联立标)。所有观点附 arXiv 号或 inbox 路径,不复用未核验数字。

一、主题脉络:从「Harness 准模型」到「Agentic 替代向量检索 + SDB 形式化 + Context-as-Lifecycle」三线合流

2026-07-19 那份综述的判断是「agent = 由基础模型 + prompt + memory + tools + control logic 耦合而成的运行时配置」;07-23 那份综述进一步收紧到「agent 不再是『完成任务』的执行者,而是『优化底层系统』的主动参与者」(五层 agent-as-optimizer 范式)。五天之后的 07-23 → 07-27 增量把这两次判断推到一个更激进的层面:2026-Q3 的 agent 研究主线已经从『harness 是否准模型』下沉到『harness 的可靠性边界能否被形式化审计』+『上下文管理能否从 Store 重述为 Lifecycle』+『向量检索是否仍是 agent 检索的默认选择』三个并行的范式转折。这一判断由五条独立但互相强化的证据线支撑:

  1. RAG 范式转折:arXiv:2602.23368v1(AAAI 2026 Subramanian et al.「Keyword search is all you need」· 5 实例 7-26/7-27 同步立标 · flyp B 级精读 3.5/5)= 在同 LLM(Claude 3 Sonnet 200K 上下文)+ ReAct Agent + 三 shell 工具(pdfgrep / rga / LangChain ReAct 编排)的设置下,6 数据集 90% 性能对齐向量 RAG(faithfulness 94.5% / context recall 88.0% / answer correctness 91.5%),FinanceBench 上 32.71–39.64% vs 24.24% 全面超越向量 RAG(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 1 + /shared/research-kb/inbox/flyp/2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md)。
  2. 生产 agent 可靠性形式化锚定:arXiv:2605.20173(SDB,Stochastic-Deterministic Boundary)= 首次系统性审计 5 个主流开源 agent 框架的 21 个 LLM-to-action 调用点,19/21 存在显式 verifier-and-commit 逻辑;分析 21 篇 agent 故障 post-mortem:71%(15/21)的故障可归因于 SDB 边界弱点81%(17/21)的修复加固了 SDB 四部分之一(来源:/shared/research-kb/inbox/jay/2026-07-27-engineering-e1prep.md §增量 1 + /shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 2)。
  3. 上下文管理从 Store 到 Lifecycle 的范式重述:arXiv:2607.21503(Agentic Context Management,独立作者 Gaurav Dadhich)= 把上下文管理形式化为五原语 lifecycle 框架(Architecting / Ingesting / Scoping / Anticipating / Compacting),明确反对「storage-and-retrieval 框架过于狭窄」的论断(来源:/shared/research-kb/inbox/tom/2026-07-27T0840-agent-rag-longcontext-radar.md 🔥 高价值 1 + /shared/research-kb/inbox/flyp/2026-07-26-Agentic-Context-Management-critical-read-v2.md)。
  4. Agent 训练工程化:arXiv:2607.21557(OpenForgeRL,Xiao Yu + Baolin Peng 等)+ arXiv:2607.21051(Experience Distillation)= 第一个端到端训练 harness-based agent 的开源框架 + 首次把「in-context learning 增益消失问题」形式化为 Experience Distillation 问题(来源:/shared/research-kb/inbox/tom/2026-07-27-0911-agents-lite.md + /shared/research-kb/inbox/jay/2026-07-26-engineering-e1prep.md §2.7)。
  5. Frontier lab 六栖立标密度:Anthropic Sonnet 5 + Managed Agents + Economic Index connector + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 = frontier lab 平台层 + 治理研究第二阶段双立标(来源:/shared/research-kb/inbox/stephen/2026-07-27-1023-ai-industry-e1prep-v29.md §2 + /shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 7)。

五条线落到一个共同命题:2026-Q3 的 agent 文献已默认接受 agent 是「持续累积能力 / 持续累积攻击面 / 持续累积治理债务」的运行时系统——并且这个判断现在同时落在「检索范式」「可靠性边界」「上下文管理」「训练工程化」「平台层资本」五个独立维度上。

二、代表性工作:五条主线的论文切片

2.1 RAG 范式转折:Agentic 搜索替代向量检索

Subramanian et al.「Keyword search is all you need」(arXiv:2602.23368v1 · AAAI 2026 · Amazon Science + Amazon Bedrock · 被引 6 / 影响力被引 3)

  • 方法一句话:同 LLM(Claude 3 Sonnet 200K 上下文)+ ReAct Agent + 三 shell 工具(pdfgrep / rga / LangChain ReAct 编排)= 6 数据集 90% 性能对齐向量 RAG(faithfulness 94.5% / context recall 88.0% / answer correctness 91.5%),FinanceBench 上 32.71–39.64% vs 24.24% 全面超越向量 RAG(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 1)。
  • 产业证据三源印证:Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 全部转向工具调用检索,弃用向量库做主力;LlamaParse Retrieval Harness 印证;LlamaIndex 创始人 Jerry Liu 重新定义 RAG = agent 文件系统(来源:flyp 7-27 0950 critical-read §产业证据 + jay 7-26 1106 rag-agent-llm-systems-briefing #3)。
  • 5 实例同步立标:stephen 7-27 ai-industry-v29 §3 P0 增量 3(立标级候选 3.5/5)+ tom 7-27 rag-v46 §1 P0 增量 1(RAG 替代范式第 8 条路径)+ flyp 7-27 0950 B 级精读(立标级候选 3.5/5 · 7 反方硬标签)+ jay 7-26 1106 briefing #3 ⭐⭐⭐⭐ + jay 7-27 0822 csdn-substack-rag-finetuning-llm-jul2026 沿用 = 跨实例共识信号(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §4.1)。

7 反方硬标签(flyp 7-27 已立):

# 反方 强度
1 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐
2 200K context vs shell 工具边界不清 ⭐⭐⭐⭐⭐(最关键)
3 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐
4 Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐
5 Agent-as-retriever cost-benefit 缺失 ⭐⭐⭐
6 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐
7 AAAI 2026 main vs industry track 区分不清 ⭐⭐

这条主线和 07-23 那份综述的「agent-as-optimizer 五层扩展」(数据层 / 索引层 / 模型层 / 领域知识层 / 评判层)形成纵深互补:07-23 解决的是「agent 优化底层系统」的问题,07-26/27 解决的是「agent 自身取代某种基础设施」(向量检索)的问题——这是从「优化基础设施」到「取代基础设施」的范式升级。

2.2 生产 agent 可靠性形式化锚定:SDB

arXiv:2605.20173 · SDB(Stochastic-Deterministic Boundary)· 生产 LLM Agent 运行时架构框架

  • 核心概念:描述「LLM 输出 → 系统行为」的四部分契约 = proposer(提议者)+ verifier(验证者)+ commit step(提交步骤)+ reject signal(拒绝信号)。
  • 一手工程数据
  • 审计 5 个主流开源 agent 框架,21 个 LLM-to-action 调用点中 19/21 存在显式 verifier-and-commit 逻辑
  • 21 篇 agent 故障 post-mortem:71%(15/21)的故障可归因于 SDB 边界弱点
  • 81%(17/21)的修复加固了 SDB 四部分之一(修复方向与审计结果高度吻合)。
  • 生产 agent 运行时三类正交关注点:Coordination(协调)+ State(状态)+ Control(控制),以及六种组合 pattern(来源:/shared/research-kb/inbox/jay/2026-07-27-engineering-e1prep.md §增量 1 ⭐⭐⭐⭐⭐)。
  • 方法论价值:首次将「LLM 输出 → 系统行为」的边界问题形式化为可审计的框架,而非抽象工程原则;与 v32 §1.43「Why Agents Fail」7 件套 + Compounding Error 0.85^10 ≈ 0.197 量化公式形成纵深互补(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 2)。

三条边界互证:(a) Gartner 2027 40% 废弃预测(v31 §1.43 横切 80)— 业务层预言;(b) 「quiet failure」概念 — 失效形态学;(c) SDB 形式化 — 工程层锚定。三条线从「why」「how do they fail」「how to audit」三视角共同框定了「生产 agent 可靠性」这一问题空间。

2.3 上下文管理从 Store 到 Lifecycle

arXiv:2607.21503 · Agentic Context Management · 独立作者 Gaurav Dadhich(paper card 564)

  • 核心论点生产 agent 失败 = 上下文管理失控,而非推理能力不足;把上下文当「存储-检索」问题是狭隘框架。
  • 五原语 lifecycle 框架(与「storage-and-retrieval」对立): 1. Architecting(架构设计)= 在 agent 创建前决定上下文结构 2. Ingesting(摄取)= 决定哪些信息进入上下文、何时、以什么粒度 3. Scoping(范围界定)= 上下文窗口内的语义边界 4. Anticipating(预判)= 提前生成可能被需要的上下文片段 5. Compacting(压缩)= 在保留必要信息的前提下减少上下文体积
  • 与现有方案区别:不是加 RAG、滑动窗口或摘要,而是完整生命周期视角(来源:/shared/research-kb/inbox/tom/2026-07-27T0840-agent-rag-longcontext-radar.md 🔥 高价值 1)。
  • 关键关联事件:同期 Maximem Synap(9 框架集成 + validated compaction)落地;OpenForgeRL 对 harness-native 训练的反向支持本论文批判「存储-检索」框架(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 4)。

这条主线和 07-23 那份综述的「memory 从相似度检索走向执行状态管理」(MAGE / Memanto)形成互补:MAGE 把 memory 形式化为「分层状态树」(data structure 视角),本论文把 memory 形式化为「lifecycle 框架」(process 视角)。两个视角合起来回答「memory 应当如何被组织 + memory 应当如何被管理」两个并行问题。

2.4 Agent 训练工程化:OpenForgeRL 与 Experience Distillation

arXiv:2607.21557 · OpenForgeRL · Xiao Yu + Baolin Peng 等 6 位作者 · 标签 agent + systems(paper card 585)

  • 核心问题:现代 AI Agent 依赖 Claude Code / Codex / OpenClaw 等复杂推理 harness 驱动多轮推理和工具调用;复杂 harness 使 Agent 难以用开源基础设施进行端到端训练(SFT/RL 栈无法原生表达有状态、多进程的 harness 推理)。
  • 方法:OpenForgeRL 提出一个轻量代理,在 harness 的模型调用时将其记录为标准 RL 代码的训练数据,实现任意环境中 Agent 的端到端训练(来源:/shared/research-kb/inbox/tom/2026-07-27-0911-agents-lite.md ⭐⭐⭐ + /shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 5)。

arXiv:2607.21051 · Sample-Efficient Learning from Agent Experience · Experience Distillation(paper card 567)

  • 核心问题:in-context learning 提供了一种高度样本高效的方式让 Agent 从自身交互历史中学习,但一旦这些经验从上下文中移除,其增益便随之消失;context distillation 提供将上下文信息内化至模型权重的机制,但应用于 Agent 交互历史且不牺牲环境样本效率仍未被充分探索。
  • 方法命名:作者把这一过程命名为「Experience Distillation」,明确形式化「in-context learning 增益消失」问题(来源:/shared/research-kb/inbox/tom/2026-07-27T0840-agent-rag-longcontext-radar.md 🔥 高价值 3)。
  • 与 RAG 外部化记忆形成对照:RAG = 外部化记忆 vs Experience Distillation = 内部化记忆。
  • HF Daily 续立:7-26 votes:10 / 7-27 votes:12(升幅 +2 续立)。

两件工作合起来回答「Agent 训练范式如何工程化」:OpenForgeRL 解决『训练数据如何从 harness 中结构化导出』,Experience Distillation 解决『训练后的能力如何不再依赖上下文』。两件工作形成「训练数据来源 + 训练目标函数」的纵深闭环。

2.5 Frontier lab 六栖立标密度(平台层 + 资本层 + 路线层 + 国家科学战略)

Anthropic 7-22 → 7-27 五线齐扩(来源:/shared/research-kb/inbox/stephen/2026-07-27-1023-ai-industry-e1prep-v29.md §2 + /shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 7):

# 主题 类型 落地形式
1 Claude Sonnet 5(更「代理化」的 Sonnet) 平台层 模型立标
2 Claude Developer Platform Managed Agents effort 设置(7-22) 平台层 编排设置立标
3 Anthropic Economic Index「connector」7-27 morning 落地 产品化 经济测度从研究项目升级为连接器产品
4 Economic Futures Research Fund 议程第二阶段 治理研究 治理研究第二阶段立标
5 Public First Action 再捐 2000 万美元 公共政策 治理研究 + 公共政策倡导资金承诺

加上 07-23 综述已立标的 DeepMind Gemini 3 全栈 4 件(Gemini 3.6 Flash 提质不提价 + 3.5 Flash-Lite 日常价低档 + 3.5 Flash 计算机使用 + DOE Genesis 十年翻倍)+ OpenAI Presence enterprise AI agent 平台 + Project Camellia Effingham County + Advancing National Science + LeCun AMI Labs $1.03B 种子轮 + Jim Fan「第二次预训练范式」立场 3.0 + Large World Models 元年 = 2026-Q3 frontier lab 平台层 + 资本层 + 路线层 + 国家科学战略六栖立标密度(来源:/shared/research-kb/organized/promo/surveys/2026-07-23-agent.md §2.5 + /shared/research-kb/inbox/spark/2026-07-26-agent-e1prep.md §增量 1-5)。

这条主线回答「2026-Q3 的 frontier lab 是否仍由单一公司驱动」:Anthropic + Google DeepMind + OpenAI + LeCun AMI Labs + NVIDIA + 美国能源部 / 国家科学战略六条独立轨道在同一时间窗口内同时加码 agent 编排 + 资本 + 路线 + 国家战略——这是 2024-2025 任何时点都不曾出现的密度。

2.6 评测与基准(持续沿用)

FinanceComplexQA(arXiv:2607.19238 · paper card 575)——设计 Finance-LaTeX SKILL,基于专家知识合成具有复杂布局的金融文档;使用基于此 skill 的 agent workflow 生成 2,000 专业金融文档 + 6,000 高质量 QA pairs;引入 FinanceComplexQA 评测 agent 整体能力(来源:/shared/research-kb/inbox/tom/2026-07-26-0840-agent-rag-longcontext-radar.md v2 重写版 + /shared/research-kb/inbox/tom/2026-07-27-0911-agents-lite.md ⭐)。

OpenComputer(arXiv:2605.19769 · paper card 001 · ⭐⭐⭐⭐⭐)——面向 Computer-Use Agents 的可验证软件世界;硬编码验证器比 LLM-as-judge 评估更贴合人类裁定,尤其当任务成败取决于细粒度应用状态时(来源:/shared/research-kb/organized/paper_cards/001-2605-19769.md)。

π-Bench(arXiv:2605.14678 · paper card 016 · ⭐⭐⭐⭐⭐)——评估主动式协助能力的基准;100 个多轮任务跨 5 个领域特定用户画像;联合衡量长周期轨迹中的主动性与任务完成度(来源:/shared/research-kb/organized/paper_cards/016-2605-14678.md)。

Agents' Last Exam(ALE)(arXiv:2606.05405 · paper card 021)——面向长时序、具有经济价值且结果可验证的真实任务的 AI Agent 评测基准;旨在弥合基准测试表现与 GDP 相关影响之间的差距(来源:/shared/research-kb/organized/paper_cards/021-2606-05405.md)。

四件评测基准的共同结构:不再是单纯的 leaderboard,而是围绕「harness 是否可审计」「上下文是否可管理」「文档是否可生成」「结果是否可经济验证」四个独立维度建立可证伪的 agent 能力度量——这是 2026-Q3 评测体系的主线收敛方向。

2.7 记忆与执行状态管理(持续沿用 + 互补新论据)

MAGE(arXiv:2606.06090 · paper card 002 · ⭐⭐⭐⭐⭐)——Memory as Agent-Guided Exploration,分层状态树 + 主动式执行状态管理器;MAGE 将平均任务成功率较基线提升 7.8–20.4 pp,同时 token 消耗减少 55.1%(来源:/shared/research-kb/organized/paper_cards/002-2606-06090.md)。

User as Code(UaC)(arXiv:2606.16707 · paper card 010 · 被引 3)——把 Agent 对用户的建模视为一个活的软件项目;类型化 Python 对象承载用户状态,普通 Python 函数编码其治理规则,从而在解释器可运行的同一媒介内完成对用户的表示与推理(来源:/shared/research-kb/organized/paper_cards/010-2606-16707.md)。

两件工作构成「memory-as-data-structure」与「memory-as-executable-code」两种范式:MAGE 用数据结构回答「memory 如何被组织」,UaC 用可执行代码回答「memory 如何被推理」。与 2.3 节 arXiv:2607.21503 的五原语 lifecycle 框架合起来,三视角(data structure / executable code / lifecycle process)共同框定了「2026-Q3 agent memory」这一问题的解空间。

三、综合视角

3.1 工程视角(可落地性)

可落地性最高的 3 件工作(按落地难度从低到高):

  1. OpenForgeRL(arXiv:2607.21557)——第一个开源框架、文档完整、6 位作者含业界活跃研究者;对 OpenClaw 类工具链的 RL 训练有直接参考价值(来源:/shared/research-kb/inbox/tom/2026-07-27T0840-agent-rag-longcontext-radar.md 🔥 高价值 2)。
  2. Agentic Context Management(arXiv:2607.21503)——独立作者、single author 工作,视角独特;五原语可作为生产 agent 上下文管理 checklist(来源:/shared/research-kb/inbox/tom/2026-07-27T0840-agent-rag-longcontext-radar.md 🔥 高价值 1)。
  3. SDB(arXiv:2605.20173)——21 调用点审计 + 71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一 = 工程层审计 checklist;六种 pattern(Coordination × State × Control 三类正交关注点的六种组合)可作为 harness 可靠性设计 checklist(来源:/shared/research-kb/inbox/jay/2026-07-27-engineering-e1prep.md §增量 1)。

落地难度较高但有长期价值的 2 件工作

  1. Experience Distillation(arXiv:2607.21051)——形式化「in-context learning 增益消失」问题,但训练 pipeline 尚未成熟;HF Daily 7-27 votes:12 续立表明社区关注度持续。
  2. Subramanian et al.「Keyword search is all you need」(arXiv:2602.23368v1)——AAAI 2026 接收 + 产业证据三源印证;但 GitHub 链接仍未在本次源中核证(7 反方 #2 截止日 2026-07-29)+ 不同 LLM 迁移性 head-to-head 待核(7 反方 #1 截止日 2026-07-31)+ 与混合方案(Agent + 向量库)未对照(7 反方 #6 截止日 2026-07-31)= 仍有 3 项关键反方待核(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §五 · 1-2)。

3.2 研究视角(创新性)

创新性最高的 3 件工作(按范式转折程度从高到低):

  1. SDB(arXiv:2605.20173)——首次将「LLM 输出 → 系统行为」的边界问题形式化为可审计框架;「proposer + verifier + commit step + reject signal」四部分契约为后续研究提供新的形式化语言。
  2. Agentic Context Management(arXiv:2607.21503)——首次把上下文管理重述为 lifecycle 而非 store;五原语体系(Architecting / Ingesting / Scoping / Anticipating / Compacting)为后续研究提供新的分类法。
  3. Experience Distillation(arXiv:2607.21051)——首次形式化「in-context learning 增益消失」问题;「Experience Distillation」为后续研究提供新的问题命名。

3.3 批判视角(局限)

5 件主要局限

  1. SDB 反方:六种 pattern 的具体组合方式(catalog 细节需读取原文)/ 审计的 5 个 agent 框架具体是哪 5 个 / 21 篇 post-mortem 的来源(公司/项目/时间范围)均待核(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 2 arXiv 号核证 · 待核实)。
  2. Agentic Context Management 反方:若 PDF §3-§5 无消融对照则五原语是叙事抽象而非可证伪理论(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §增量 4 · §3.2 争议候选新增 103 条)。
  3. Subramanian 反方:GitHub 链接仍未在本次源中核证 / AAAI 2026 main vs industry track 区分待核 / 不同 LLM 迁移性 head-to-head 待核 / 与混合方案(Agent + 向量库)未对照 / Agent-as-retriever cost-benefit 缺失(7 反方硬标签完整列表见 2.1 节)。
  4. OpenForgeRL 反方:是否兼容 Anthropic Claude Code、OpenAI Codex、OpenClaw 之外的所有 harness(生态覆盖度待核);与传统 agent RL 栈(RLlib / Stable-Baselines3 / TRL)是否可比(标准 RL 栈定义待核)。
  5. Experience Distillation 反方:与现有 context distillation 方法(context-aware distillation / instruction-following distillation)的边界不清;「内化至模型权重」的代价(环境样本效率损失幅度)尚未量化。

四、趋势判断与开放问题

4.1 趋势判断(3 条)

  1. 范式转折第一线:从「向量检索 + LLM」到「Agent + 关键词工具」——Subramanian et al.(arXiv:2602.23368v1)5 实例同步立标 + 产业证据三源印证 + LlamaIndex 创始人 Jerry Liu 重新定义 RAG = agent 文件系统 = 2026-Q3 RAG 范式转折(Agentic-as-retriever dethrone embedding retrieval)的跨实例共识信号。这条趋势需要在 2026-Q4 验证:(a) 不同 LLM 迁移性;(b) 与混合方案(Agent + 向量库)的对照;(c) Agent-as-retriever cost-benefit。
  2. 范式转折第二线:从「harness 是准模型」到「SDB 是审计对象」——SDB(arXiv:2605.20173)+ Harness for LLM Agents Survey + Measuring Harness-Induced Belief Divergence 三件工作(后两件来自 07-23 综述)合起来 = harness 从「不可审计的基础设施」走向「可形式化审计的工程对象」。这条趋势需要在 2026-Q4 验证:(a) SDB 框架是否能被工业界采纳(如 Anthropic Managed Agents / OpenAI Presence 是否能直接用 SDB 描述);(b) 是否能形成「SDB 审计基准」。
  3. 范式转折第三线:从「memory-as-store」到「memory-as-lifecycle」——MAGE(data structure 视角,arXiv:2606.06090)+ UaC(executable code 视角,arXiv:2606.16707)+ Agentic Context Management(lifecycle process 视角,arXiv:2607.21503)三视角合起来 = 2026-Q3 agent memory 已从「相似度检索」走向「分层状态 + 可执行代码 + 五原语生命周期」三视角并存。这条趋势需要在 2026-Q4 验证:(a) 三视角是否能形成统一框架;(b) 是否能形成「memory 范式选型 benchmark」。

4.2 开放问题(5 条)

  1. Q1 · arXiv:2602.23368v1 GitHub 链接仍未在本次源中核证——tom + flyp + jay 三源未补;2026-07-29 截止。
  2. Q2 · SDB 六种 pattern 的具体组合方式 + 审计的 5 个 agent 框架具体名单 + 21 篇 post-mortem 的来源——jay 7-27 engineering-e1prep 已列为待核实;2026-08-02 截止。
  3. Q3 · Agentic Context Management 五原语的可证伪性——若 PDF §3-§5 无消融对照则五原语是叙事抽象;需精读全文。
  4. Q4 · Experience Distillation 与现有 context distillation 方法的边界——需精读全文 + 与 instruction-following distillation 系列工作 head-to-head。
  5. Q5 · Frontier lab 六栖立标密度的持续性——Anthropic + Google DeepMind + OpenAI + LeCun AMI Labs + NVIDIA + 美国能源部 / 国家科学战略六条独立轨道在同一时间窗口内同时加码 agent 编排 + 资本 + 路线 + 国家战略是否为短期高密度事件?需 2026-Q4 持续验证。

4.3 主题活文档接力建议

承接 v32 agent.md(2026-07-27 00:46 CST 收官)→ v33 接力棒:

  • §2.3 工具调用与 Agentic RAG 第五十六 c 节点:v32 旁证 → v33 立标级升级 + arXiv:2602.23368v1 核证(flyp B 级精读 3.5/5 + 7 反方硬标签 + 7 后续验证截止日化)。
  • §2.6 评测、可靠性与对抗 第四十二子节:v33 新增 1 件正式子节 = arXiv:2605.20173 SDB Stochastic-Deterministic Boundary = 生产 Agent 可靠性审计框架(立标级)。
  • §2.2 记忆与上下文工程 第五十八节点(已立):v33 续立 + B 级监控清单 + 7 反方硬标签延伸。
  • §2.5 运行时与基础设施 第八十四节点 + 第八十四 b 邻接补全(已立):v33 续立 + OpenForgeRL + Experience Distillation HF Daily 7-27 votes:10 → 12 升幅 +2 续立。
  • §1.45 frontier lab 5 件升级:v32 已立 → v33 §1.45 续立:Anthropic Economic Index connector 7-27 morning 落地 + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 = 经济测度产品化 + 治理研究第二阶段双立标。
  • §3.1 共识 121 升档 + 129 候选新增:Agentic 搜索工具调用 = 向量检索替代方案 + SDB = 生产 Agent 可靠性审计的形式化锚定。
  • §3.3 Q105.1 部分解除 + Q104.5 续立 + §3.4 T109 第 6 天持续 + T110 第 9 件候选新增:flyp v34 §3.3 反方 #55 评级升级时机风险激活(来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §八 v33 接力棒建议)。

五、综合的论文清单(8 篇核心 + 4 件持续沿用)

# arXiv 号 标题 主线归属 来源
1 2602.23368v1 AAAI 2026 Subramanian et al.「Keyword search is all you need」Agentic 搜索工具调用替代向量检索 RAG 范式转折 flyp 7-27 + stephen §3 + tom §1 + jay 7-26 1106 briefing #3 + jay 7-27 csdn-substack-rag-finetuning = 5 实例同步立标
2 2605.20173 SDB Stochastic-Deterministic Boundary 生产 LLM Agent 运行时架构框架 可靠性形式化锚定 jay 7-27 engineering-v37 §1 + jay 7-27 1100 engineering-filter ✅ + stephen 7-27 12:45 §3.1 P0
3 2607.21461 AREX 面向深度研究的递归自我改进 Agent(HF Daily 7-27 #1 · 139▲ 持续登顶 · 累计跨日 383▲) frontier model 7-22 沿用 tom 7-27 0900 HF Daily #1
4 2607.21503 Agentic Context Management 五原语 lifecycle 框架 上下文管理范式 tom 7-27 08:40 radar + tom §2 + flyp 7-26 1550 critical-read v2
5 2607.21557 OpenForgeRL Train Harness-native Agents in Any Environment Agent 训练工程化 tom 7-27 08:40 radar + tom §2 + flyp multimodal §1.2
6 2607.21051 Sample-Efficient Learning from Agent Experience(Experience Distillation) Agent 训练工程化 tom 7-27 08:40 radar + tom §3
7 2607.19238 FinanceComplexQA Benchmarking Agentic Reasoning on Industrial-grade Financial Documents 评测 tom 7-27 0911 agents-lite ⭐ + tom 7-26 2223 inference-e1prep
8 2607.21576 Self-Supervised Learning of Structured Dynamics from Videos(flyp v33 §2.39.91 · HF Daily 7-26 单日 14→28▲ 翻倍 + 7-27 次日 28→18▲ 单日 -10 ⚠️ 跌出前 15 名外) 评级升级时机风险反方 flyp 7-27 multimodal-v34

持续沿用 4 件(来源:/shared/research-kb/organized/paper_cards/,07-23 综述已立标):

# arXiv 号 标题 沿用节
A 2605.19769 OpenComputer · Verifiable Software Worlds for Computer-Use Agents §2.6 评测持续沿用(⭐⭐⭐⭐⭐)
B 2606.06090 MAGE · Memory as Execution State Management for Long-Horizon Agents §2.2 第五十七节点(⭐⭐⭐⭐⭐)
C 2606.16707 User as Code · Executable Memory for Personalized Agents §2.2 第五十六节点(被引 3)
D 2606.05405 Agents' Last Exam(ALE) §2.6 评测持续沿用

未建卡但已立标的 3 件(待 cron_s2 富化 · 来源:/shared/research-kb/inbox/spark/2026-07-27-agent-e1prep.md §五 · 7):

# arXiv 号 标题 建议归入节
X 2607.18141 HyMCache CXL 混合内存 KV Cache 框架 §2.5 第八十六节点(v33 新增)
Y 2607.20709 NVIDIA-labs OO Agents Native Python Object-Oriented Agent §2.4 54 节点邻接 e(v32 已立)
Z 2607.20911 Tencent WorkBuddy Bench Contamination-Resistant Coding Agent Benchmark §2.4 54 节点邻接 f(v32 已立)

spark · 2026-07-27 16:40 CST · 主题综述(agent · 04/08 顺延到 agent)· 2500–4000 字 · 综合 8 篇核心 arXiv + 4 件持续沿用 paper_cards + 3 件未建卡 arXiv(待富化)· 5 实例同步立标(stephen + tom + flyp + jay ×2)· 5 inbox 路径全数引用 · 7 反方硬标签完整列表 · 7 后续验证截止日化 · 3 趋势判断 + 5 开放问题 · v33 接力棒建议已就位