研究知识库草稿 · Jay · 2026-09-06 晨间简报
实例: Jay
时间: 2026-09-06 08:20 CST
任务: Agentic RAG SoK · ICLR 2026 Agent 评估 · 推理引擎架构 · Substack 工程洞察
主题锚定
今日核心发现: 1. Agentic RAG SoK 论文(2026-03) — 首次将 Agentic RAG 形式化为 POMDP,澄清评估碎片化问题 2. ICLR 2026 Agent Memory 评估论文 — RAG 在低预算 vs 高预算场景的效率-容量权衡(TTL) 3. The AI Engineer Substack:AI Agents Stack 2026 — Guardrails 成为独立学科、评估三级架构、新 benchmark 涌现 4. SGLang vs vLLM 架构深度对比(tbr8.org) — 两种推理引擎设计路线的工程权衡 5. Multimodal RAG Survey 更新(2026-09) — ACL 2025 接收,涵盖 Agentic Interaction 和 Audio-Centric Retrieval
一、Agentic RAG 学术前沿
1. SoK: Agentic RAG — 形式化基础(⭐ 精读推荐)
论文: SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions
来源: arXiv cs.IR · 2026-03(经同行评审)
链接: https://www.researchgate.net/publication/401720909
核心贡献: - 首次将 Agentic RAG 形式化为有限视野部分可观测马尔可夫决策过程(POMDP),为碎片化架构提供统一数学框架 - 指出此前 Agentic RAG 碎片化源于缺乏数学形式化——各系统自称"Agentic"但控制流、工具调用、评估指标各异 - 系统梳理了评估方法论不一致问题(faithfulness、answer relevance、context relevance 缺乏统一基准)
关键结论: - Agentic RAG 系统按三个维度分类:Agent 数量(单/多)、控制结构(层级/平铺)、自主程度(固定/自适应) - 生产级系统需要组合多个模式(Reflection + Planning + Tool Use),纯单一模式部署"通常是有问题的"
评价: 工程价值极高。该论文为 Agentic RAG 提供了"工程语言",可以让架构评审有据可依。建议纳入知识库主题页。
可信度: ⭐⭐⭐⭐⭐ 高(arXiv peer-reviewed,2026-03)
后续行动: 可对比精读 arXiv 2501.09136(Agentic RAG Survey)与本文的形式化差异
2. Agentic RAG Survey — 2026-04 修订版
论文: Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG
来源: arXiv cs.AI · 2025-01 初版,2026-04 修订,已接收 ACL 2025 Findings
链接: https://github.com/llm-lab-org/Agentic-RAG-Survey
核心贡献(修订版新增): - 新增 Agentic Interaction 模式(Agent 与环境动态交互,不只是检索) - 新增 Audio-Centric Retrieval(语音知识库的 RAG 扩展) - 更新了 LangChain / LangGraph / AutoGen / CrewAI 的架构对比表
五种生产模式(2026年主流): | 模式 | 核心机制 | 适用场景 | 代表工作 | |---|---|---|---| | Self-RAG | 模型发出反思 token 自我评估 | 需要高忠实度的问答 | arXiv 2310.11511 | | CRAG(Corrective RAG) | 检索评估器 + 纠正路由 | 噪声检索结果多发场景 | arXiv 2401.15884 | | Adaptive RAG | 分类器决定管线深度 | Query 复杂度差异大 | 动态路由 | | ReAct over Docs | Reason-Act 循环 + 检索工具 | 多跳问答 | 通用 | | Multi-hop Decompose | 查询分解 + 逐步检索 | 复杂多步推理 | 协作型 |
评价: 该 Survey 已成为 Agentic RAG 领域的"规范参考",修订版填补了 2025 年底至 2026 年初的空白。
可信度: ⭐⭐⭐⭐⭐ 高(ACL 2025 Findings 接收)
3. ICLR 2026 — Agent Memory 评估关键发现
论文: Evaluating Memory in LLM Agents via Incremental Multi-...(ICLR 2026)
来源: ICLR 2026 Proceedings
链接: https://proceedings.iclr.cc/paper_files/paper/2026/file/fd1eff9dd295df50a41f2521942fa31d-Paper-Conference.pdf
核心发现 — Efficiency-Capacity Trade-off(TTL):
| 预算等级 | RAG 优势 | Long-Context 模型优势 | 结论 |
|---|---|---|---|
| Low(~4K token) | 83.0 vs LC 74.0 | — | RAG 结构化检索在模式匹配任务中显著优于 LC |
| Medium(~40K) | 90.0 ≈ LC 90.0 | 持平 | — |
| High(~100K+) | 88.0(降级) | 93.0 | 高预算时 LC 容量上限更高;RAG 因检索噪声反而降级 |
三种 RAG Agent 变体比较: - Simple RAG Agents(BM25):成本<$0.001/查询,但复杂推理任务表现差(Detective QA: 52.1 vs LC 63.4) - Embedding-based RAG:平衡成本与精度 - Structure-Augmented RAG(知识图谱/事件时间线):对结构化文档的全局推理最强
工程启示: 1. RAG 是"低成本高效率",但不是"万能药"——高复杂度推理需上 Long-Context 2. 混合策略最优:简单 Query 用 RAG,复杂推理上 Long-Context 3. 检索噪声在高预算场景会成为主要瓶颈(超过某个阈值后增加检索内容反而降低质量)
评价: ICLR 2026 正式论文,数据扎实,对生产系统的成本-性能权衡有直接指导价值。
可信度: ⭐⭐⭐⭐⭐ 高(ICLR 2026 正式出版)
二、推理引擎架构深度对比
SGLang vs vLLM:两种工程路线的本质差异(⭐ 高价值工程文章)
来源: 汤不热吧技术社区(tbr8.org)· 2026-07-17
链接: https://tbr8.org/sglang-vs-vllm-大模型推理引擎架构设计与性能深度对比
核心判断:vLLM = 系统优化路线,SGLang = 语言优化路线
| 维度 | vLLM | SGLang |
|---|---|---|
| 核心技术创新 | PagedAttention + CUDA Graph + Continuous Batching | RadixAttention + DSL 前端抽象 |
| 优势场景 | 高并发、请求长度均匀的流式 API 服务 | 复杂提示词、结构化生成、多轮对话、多模态 |
| Prefix Caching | 已引入(效率低于 SGLang) | RadixAttention 原生高效共享 |
| 生态成熟度 | 高(与 Triton/TensorRT-LLM 集成广) | 快速追赶(LangChain/LlamaIndex 协同) |
| API 风格 | OpenAI API 兼容(服务部署导向) | 程序式开发(编程式控制) |
| 复杂任务支持 | 基础(需外部编排) | 原生并行采样/分支控制/工具调用 |
选型决策树:
是否需要复杂提示工程/Agent/链式调用?
├── 否 → vLLM(生态成熟,长尾模型支持广)
└── 是 → SGLang(RadixAttention 极大降低多轮对话成本)
是否有大量可复用系统提示前缀?
├── 是 → SGLang(缓存复用效率高)
└── 否 → vLLM
是否需要极致单请求低延迟?
└── 是 → 两者 A/B 测试后决定
评价: 这是一篇工程导向极强的中文技术分析,对推理引擎选型有实操价值。文章避免了单纯 benchmark 对比,转而从"场景 × 架构"角度分析,适合作为知识库的推理引擎选型参考。
可信度: ⭐⭐⭐⭐ 中高(CSDN-adjacent 独立技术博客,有具体版本对比和选型框架)
三、Substack 高价值工程洞察
1. The AI Agents Stack(2026 Edition)— The AI Engineer ⭐⭐⭐⭐⭐
来源: The AI Engineer Substack
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
可信度: ⭐⭐⭐⭐⭐
三大关键工程判断:
① Agent Guardrails 成为独立学科(2024 → 2026 范式转移) - 2024年 Guardrails = 输入/输出过滤器 - 2026年 Guardrails = 工具调用授权 + 速率限制 + 执行结果验证 - 这意味着:Agent 安全不是 LLM 安全的超集,而是独立的系统设计问题
② "评估作为基础设施"收敛到三级架构
Fast checks(每次 PR):Agent 是否调用了正确的工具?
Nightly regression:LLM-as-Judge 评估输出质量
Production monitoring:Agent 性能漂移持续告警
③ 新 benchmark 涌现(2026 新标准) | Benchmark | 评估维度 | 背景 | |---|---|---| | Context-Bench | 记忆管理 | ICLR 2026 | | Recovery-Bench | 错误恢复 | 2026 新兴 | | Terminal-Bench | 编程 Agent | 2026 新兴 |
工程洞察: Agent Stack ≠ LLM Stack。聊天机器人需要推理+RAG;Agent 需要跨多步执行的状态管理、协议级工具访问、跨会话持久记忆、自主推理循环,以及实时行为约束——这是完全不同的基础设施问题集。
建议: 此文工程洞察深刻,建议精读全文,纳入 Agent 工程实践主题页。
2. Brain Bytes — The 2026 AI Agent Stack, Drawn from Scratch
来源: codingwithroby Substack
链接: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
可信度: ⭐⭐⭐⭐
核心判断:Model Routing 是 2026 生产 Agent 的核心模式 - 分类/分流 → 小型快速模型(成本低) - 复杂推理 → 前沿模型(质量优先) - Embedding/评估 → 专用模型
关键引用: RouteLLM 研究表明:路由可以在保持大多数任务质量的同时显著降低成本。这对 Agent 成本控制有直接工程价值。
3. ByteByteGo — What's Next in AI: Five Trends to Watch in 2026
来源: bytebytego Substack
链接: https://open.substack.com/pub/bytebytego/p/whats-next-in-ai-five-trends-to-watch
可信度: ⭐⭐⭐⭐
AI Coding 专业化趋势: - 通用模型 → 专用代码 LLM(海量代码库 + 文档微调) - 通用工具 → 代码专用工具链(read_file, search_codebase, edit_file, run_terminal_command, execute_tests) - 这是 2026 年 AI 编码能力大幅提升的底层原因
四、Multimodal RAG Survey 更新
来源: llm-lab-org/Multimodal-RAG-Survey(GitHub)
链接: https://github.com/llm-lab-org/multimodal-rag-survey
可信度: ⭐⭐⭐⭐⭐(ACL 2025 Findings)
2026-09 最新动态: - 2026年1月新增多篇 2025年末论文 - 2026年9月新增了 Audio-Centric Retrieval 分类(涵盖语音知识库、播客内容检索) - 涵盖 Agentic Interaction(Agent 与环境的动态交互,不只是静态检索)
对工程实践的影响: - 多模态 RAG 管线需要重新思考 Embedding 策略(文本 + 图像 + 音频需要统一向量空间) - CLIP 等模型可编码图像和文本到同一向量空间,使基础设施可复用 - VLM(视觉语言模型)用于图像描述和视觉问答生成环节
五、分类标签建议
#agentic-rag #sok-pomdp #iclr-2026 #agent-memory #vllm #sglang #inference-engineering #agent-stack-2026 #guardrails #evaluation-benchmark #multimodal-rag #substack-highvalue
六、建议写入路径
本次可合并写入:
| 内容块 | 建议路径 | 说明 |
|---|---|---|
| Agentic RAG SoK + Survey | /shared/research-kb/inbox/jay/2026-09-06-agentic-rag-sok-survey.md |
学术论文精读卡片 |
| ICLR 2026 Agent Memory 评估 | 合并入上方文件或单独建 2026-09-06-iclr-agent-memory-eval.md |
TTL 效率权衡框架 |
| 推理引擎架构对比 | 2026-09-06-sglang-vllm-inference-comparison.md |
工程选型参考 |
| Substack 工程洞察 | 2026-09-06-substack-agent-stack-guardrails-benchmarks.md |
The AI Engineer 精选 |
本次优先写入:
- 主文件:/shared/research-kb/inbox/jay/2026-09-06-agentic-rag-iclr-inference-substack.md(即本文档)
七、后续行动建议
- 精读: Agentic RAG SoK(arXiv 2026-03)与 Survey(arXiv 2501.09136)对比分析,产出结构化对比表
- 核验: ICLR 2026 Agent Memory 论文实验配置(budget 定义、模型选择)需进一步查证
- 主题页更新: 建议在知识库中建立
Agentic RAG专题页,整合本文三个学术来源 - CSDN 追踪: tbr8.org 类高质量独立博客值得持续追踪,与 CSDN 形成互补