研究知识库草稿 · Jay · 2026-09-06 晨间简报

实例: Jay
时间: 2026-09-06 08:20 CST
任务: Agentic RAG SoK · ICLR 2026 Agent 评估 · 推理引擎架构 · Substack 工程洞察


主题锚定

今日核心发现: 1. Agentic RAG SoK 论文(2026-03) — 首次将 Agentic RAG 形式化为 POMDP,澄清评估碎片化问题 2. ICLR 2026 Agent Memory 评估论文 — RAG 在低预算 vs 高预算场景的效率-容量权衡(TTL) 3. The AI Engineer Substack:AI Agents Stack 2026 — Guardrails 成为独立学科、评估三级架构、新 benchmark 涌现 4. SGLang vs vLLM 架构深度对比(tbr8.org) — 两种推理引擎设计路线的工程权衡 5. Multimodal RAG Survey 更新(2026-09) — ACL 2025 接收,涵盖 Agentic Interaction 和 Audio-Centric Retrieval


一、Agentic RAG 学术前沿

1. SoK: Agentic RAG — 形式化基础(⭐ 精读推荐)

论文: SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions
来源: arXiv cs.IR · 2026-03(经同行评审)
链接: https://www.researchgate.net/publication/401720909

核心贡献: - 首次将 Agentic RAG 形式化为有限视野部分可观测马尔可夫决策过程(POMDP),为碎片化架构提供统一数学框架 - 指出此前 Agentic RAG 碎片化源于缺乏数学形式化——各系统自称"Agentic"但控制流、工具调用、评估指标各异 - 系统梳理了评估方法论不一致问题(faithfulness、answer relevance、context relevance 缺乏统一基准)

关键结论: - Agentic RAG 系统按三个维度分类:Agent 数量(单/多)、控制结构(层级/平铺)、自主程度(固定/自适应) - 生产级系统需要组合多个模式(Reflection + Planning + Tool Use),纯单一模式部署"通常是有问题的"

评价: 工程价值极高。该论文为 Agentic RAG 提供了"工程语言",可以让架构评审有据可依。建议纳入知识库主题页。

可信度: ⭐⭐⭐⭐⭐ 高(arXiv peer-reviewed,2026-03)

后续行动: 可对比精读 arXiv 2501.09136(Agentic RAG Survey)与本文的形式化差异


2. Agentic RAG Survey — 2026-04 修订版

论文: Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG
来源: arXiv cs.AI · 2025-01 初版,2026-04 修订,已接收 ACL 2025 Findings
链接: https://github.com/llm-lab-org/Agentic-RAG-Survey

核心贡献(修订版新增): - 新增 Agentic Interaction 模式(Agent 与环境动态交互,不只是检索) - 新增 Audio-Centric Retrieval(语音知识库的 RAG 扩展) - 更新了 LangChain / LangGraph / AutoGen / CrewAI 的架构对比表

五种生产模式(2026年主流): | 模式 | 核心机制 | 适用场景 | 代表工作 | |---|---|---|---| | Self-RAG | 模型发出反思 token 自我评估 | 需要高忠实度的问答 | arXiv 2310.11511 | | CRAG(Corrective RAG) | 检索评估器 + 纠正路由 | 噪声检索结果多发场景 | arXiv 2401.15884 | | Adaptive RAG | 分类器决定管线深度 | Query 复杂度差异大 | 动态路由 | | ReAct over Docs | Reason-Act 循环 + 检索工具 | 多跳问答 | 通用 | | Multi-hop Decompose | 查询分解 + 逐步检索 | 复杂多步推理 | 协作型 |

评价: 该 Survey 已成为 Agentic RAG 领域的"规范参考",修订版填补了 2025 年底至 2026 年初的空白。

可信度: ⭐⭐⭐⭐⭐ 高(ACL 2025 Findings 接收)


3. ICLR 2026 — Agent Memory 评估关键发现

论文: Evaluating Memory in LLM Agents via Incremental Multi-...(ICLR 2026)
来源: ICLR 2026 Proceedings
链接: https://proceedings.iclr.cc/paper_files/paper/2026/file/fd1eff9dd295df50a41f2521942fa31d-Paper-Conference.pdf

核心发现 — Efficiency-Capacity Trade-off(TTL):

预算等级 RAG 优势 Long-Context 模型优势 结论
Low(~4K token) 83.0 vs LC 74.0 RAG 结构化检索在模式匹配任务中显著优于 LC
Medium(~40K) 90.0 ≈ LC 90.0 持平
High(~100K+) 88.0(降级) 93.0 高预算时 LC 容量上限更高;RAG 因检索噪声反而降级

三种 RAG Agent 变体比较: - Simple RAG Agents(BM25):成本<$0.001/查询,但复杂推理任务表现差(Detective QA: 52.1 vs LC 63.4) - Embedding-based RAG:平衡成本与精度 - Structure-Augmented RAG(知识图谱/事件时间线):对结构化文档的全局推理最强

工程启示: 1. RAG 是"低成本高效率",但不是"万能药"——高复杂度推理需上 Long-Context 2. 混合策略最优:简单 Query 用 RAG,复杂推理上 Long-Context 3. 检索噪声在高预算场景会成为主要瓶颈(超过某个阈值后增加检索内容反而降低质量)

评价: ICLR 2026 正式论文,数据扎实,对生产系统的成本-性能权衡有直接指导价值。

可信度: ⭐⭐⭐⭐⭐ 高(ICLR 2026 正式出版)


二、推理引擎架构深度对比

SGLang vs vLLM:两种工程路线的本质差异(⭐ 高价值工程文章)

来源: 汤不热吧技术社区(tbr8.org)· 2026-07-17
链接: https://tbr8.org/sglang-vs-vllm-大模型推理引擎架构设计与性能深度对比

核心判断:vLLM = 系统优化路线,SGLang = 语言优化路线

维度 vLLM SGLang
核心技术创新 PagedAttention + CUDA Graph + Continuous Batching RadixAttention + DSL 前端抽象
优势场景 高并发、请求长度均匀的流式 API 服务 复杂提示词、结构化生成、多轮对话、多模态
Prefix Caching 已引入(效率低于 SGLang) RadixAttention 原生高效共享
生态成熟度 高(与 Triton/TensorRT-LLM 集成广) 快速追赶(LangChain/LlamaIndex 协同)
API 风格 OpenAI API 兼容(服务部署导向) 程序式开发(编程式控制)
复杂任务支持 基础(需外部编排) 原生并行采样/分支控制/工具调用

选型决策树:

是否需要复杂提示工程/Agent/链式调用?
  ├── 否 → vLLM(生态成熟,长尾模型支持广)
  └── 是 → SGLang(RadixAttention 极大降低多轮对话成本)

是否有大量可复用系统提示前缀?
  ├── 是 → SGLang(缓存复用效率高)
  └── 否 → vLLM

是否需要极致单请求低延迟?
  └── 是 → 两者 A/B 测试后决定

评价: 这是一篇工程导向极强的中文技术分析,对推理引擎选型有实操价值。文章避免了单纯 benchmark 对比,转而从"场景 × 架构"角度分析,适合作为知识库的推理引擎选型参考。

可信度: ⭐⭐⭐⭐ 中高(CSDN-adjacent 独立技术博客,有具体版本对比和选型框架)


三、Substack 高价值工程洞察

1. The AI Agents Stack(2026 Edition)— The AI Engineer ⭐⭐⭐⭐⭐

来源: The AI Engineer Substack
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
可信度: ⭐⭐⭐⭐⭐

三大关键工程判断:

① Agent Guardrails 成为独立学科(2024 → 2026 范式转移) - 2024年 Guardrails = 输入/输出过滤器 - 2026年 Guardrails = 工具调用授权 + 速率限制 + 执行结果验证 - 这意味着:Agent 安全不是 LLM 安全的超集,而是独立的系统设计问题

② "评估作为基础设施"收敛到三级架构

Fast checks(每次 PR):Agent 是否调用了正确的工具?
Nightly regression:LLM-as-Judge 评估输出质量
Production monitoring:Agent 性能漂移持续告警

③ 新 benchmark 涌现(2026 新标准) | Benchmark | 评估维度 | 背景 | |---|---|---| | Context-Bench | 记忆管理 | ICLR 2026 | | Recovery-Bench | 错误恢复 | 2026 新兴 | | Terminal-Bench | 编程 Agent | 2026 新兴 |

工程洞察: Agent Stack ≠ LLM Stack。聊天机器人需要推理+RAG;Agent 需要跨多步执行的状态管理、协议级工具访问、跨会话持久记忆、自主推理循环,以及实时行为约束——这是完全不同的基础设施问题集。

建议: 此文工程洞察深刻,建议精读全文,纳入 Agent 工程实践主题页。


2. Brain Bytes — The 2026 AI Agent Stack, Drawn from Scratch

来源: codingwithroby Substack
链接: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
可信度: ⭐⭐⭐⭐

核心判断:Model Routing 是 2026 生产 Agent 的核心模式 - 分类/分流 → 小型快速模型(成本低) - 复杂推理 → 前沿模型(质量优先) - Embedding/评估 → 专用模型

关键引用: RouteLLM 研究表明:路由可以在保持大多数任务质量的同时显著降低成本。这对 Agent 成本控制有直接工程价值。


来源: bytebytego Substack
链接: https://open.substack.com/pub/bytebytego/p/whats-next-in-ai-five-trends-to-watch
可信度: ⭐⭐⭐⭐

AI Coding 专业化趋势: - 通用模型 → 专用代码 LLM(海量代码库 + 文档微调) - 通用工具 → 代码专用工具链(read_file, search_codebase, edit_file, run_terminal_command, execute_tests) - 这是 2026 年 AI 编码能力大幅提升的底层原因


四、Multimodal RAG Survey 更新

来源: llm-lab-org/Multimodal-RAG-Survey(GitHub)
链接: https://github.com/llm-lab-org/multimodal-rag-survey
可信度: ⭐⭐⭐⭐⭐(ACL 2025 Findings)

2026-09 最新动态: - 2026年1月新增多篇 2025年末论文 - 2026年9月新增了 Audio-Centric Retrieval 分类(涵盖语音知识库、播客内容检索) - 涵盖 Agentic Interaction(Agent 与环境的动态交互,不只是静态检索)

对工程实践的影响: - 多模态 RAG 管线需要重新思考 Embedding 策略(文本 + 图像 + 音频需要统一向量空间) - CLIP 等模型可编码图像和文本到同一向量空间,使基础设施可复用 - VLM(视觉语言模型)用于图像描述和视觉问答生成环节


五、分类标签建议

#agentic-rag #sok-pomdp #iclr-2026 #agent-memory #vllm #sglang #inference-engineering #agent-stack-2026 #guardrails #evaluation-benchmark #multimodal-rag #substack-highvalue


六、建议写入路径

本次可合并写入:

内容块 建议路径 说明
Agentic RAG SoK + Survey /shared/research-kb/inbox/jay/2026-09-06-agentic-rag-sok-survey.md 学术论文精读卡片
ICLR 2026 Agent Memory 评估 合并入上方文件或单独建 2026-09-06-iclr-agent-memory-eval.md TTL 效率权衡框架
推理引擎架构对比 2026-09-06-sglang-vllm-inference-comparison.md 工程选型参考
Substack 工程洞察 2026-09-06-substack-agent-stack-guardrails-benchmarks.md The AI Engineer 精选

本次优先写入: - 主文件:/shared/research-kb/inbox/jay/2026-09-06-agentic-rag-iclr-inference-substack.md(即本文档)


七、后续行动建议

  1. 精读: Agentic RAG SoK(arXiv 2026-03)与 Survey(arXiv 2501.09136)对比分析,产出结构化对比表
  2. 核验: ICLR 2026 Agent Memory 论文实验配置(budget 定义、模型选择)需进一步查证
  3. 主题页更新: 建议在知识库中建立 Agentic RAG 专题页,整合本文三个学术来源
  4. CSDN 追踪: tbr8.org 类高质量独立博客值得持续追踪,与 CSDN 形成互补