Jay 工程实践筛选草稿 · 2026-09-17
本次主题
Agentic RAG / LLM Agent 生产工程 · 2026 Q3 工程实践精选
检索范围
- Tavily 搜索:agentic RAG production 2026、LLM agent engineering 2026、multimodal LLM evaluation 2026
- GitHub Topics:agentic-rag
- arXiv:agentic RAG、benchmark
- Substack:AI engineering、LLM systems
- HuggingFace datasets
✅ 保留条目
1. LangChain《State of Agent Engineering 2026》
| 字段 | 内容 |
|---|---|
| 来源 | LangChain 第一方 (langchain.com) |
| 链接 | https://www.langchain.com/state-of-agent-engineering |
| 发布时间 | 2026-06-12 |
| 核心数据 | 57% 组织已有 agent 在生产;30.4% 正在开发;集成是最大痛点(46%) |
| 关键洞察 | 行业从 POC 向生产迁移;质量是 #1 阻塞因素,延迟 #2 |
| 可信度 | 高(第一方行业调查) |
| 后续行动 | 建议纳入 agent 生产状态页;核验原文完整报告 |
| 标签 | agent production survey 2026 |
保留理由:第一方数据,行业基准,集成痛点数据对工程决策有直接价值。
2. The AI Engineer Substack《AI Agents Stack 2026 Edition》
| 字段 | 内容 |
|---|---|
| 来源 | The AI Engineer (substack) |
| 链接 | https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition |
| 发布时间 | 2026 |
| 核心观点 | Agent guardrails 已独立于 LLM guardrails;eval-as-infrastructure 三层架构;新 benchmark:Context-Bench/Recovery-Bench/Terminal-Bench |
| 可信度 | 高(高质量工程 newsletter) |
| 后续行动 | 核验 benchmark 论文出处;关注 eval 三层架构图 |
| 标签 | agent stack evaluation 2026 substack |
保留理由:Substack 高质量工程洞察;guardrails 分离是重要工程演进;benchmark 追踪价值高。
3. Awesome-RAG-Production (GitHub)
| 字段 | 内容 |
|---|---|
| 来源 | GitHub (Yigtwxx/Awesome-RAG-Production) |
| 链接 | https://github.com/Yigtwxx/Awesome-RAG-Production |
| 更新时间 | 2026 活跃维护 |
| 核心内容 | 生产级工具精选;OpenAI Responses API 迁移指南(Assistants API 2026-08-26 停用);Vanna 已 archive,推荐 WrenAI;Anthropic Prompt Caching 10% 读价格 |
| 可信度 | 高(社区维护,精选列表) |
| 后续行动 | 核验 OpenAI Responses API 迁移细节;WrenAI 替代 Vanna 实际表现 |
| 标签 | RAG production tools github |
保留理由:生产工具精选库,API 迁移时间节点实用,Prompt Caching 定价数据具体。
4. microsoft/ai-agents-for-beginners (GitHub)
| 字段 | 内容 |
|---|---|
| 来源 | GitHub (microsoft/ai-agents-for-beginners) |
| 链接 | https://github.com/microsoft/ai-agents-for-beginners |
| Stars | 74.4k |
| 核心内容 | 18 节 AI agent 入门课程;覆盖 AutoGen、Semantic Kernel、Foundry |
| 可信度 | 高(Microsoft 第一方) |
| 后续行动 | 核验 2026 内容更新;判断是否适合作为工程新人学习路径参考 |
| 标签 | agent tutorial microsoft github |
保留理由:Microsoft 官方教程,star 量说明受欢迎程度,可作学习路径质量参考。
5. agentic-rag-patterns (GitHub)
| 字段 | 内容 |
|---|---|
| 来源 | GitHub (vishalmysore/agentic-rag-patterns) |
| 链接 | https://github.com/vishalmysore/agentic-rag-patterns |
| 核心内容 | 实现 arXiv:2501.09136 Agentic RAG Survey;A2AJava 框架;routing/tool-use/reflection/planning/multi-agent |
| 可信度 | 高(引用权威 survey) |
| 后续行动 | 核验框架活跃度;判断 A2AJava 实际生产使用情况 |
| 标签 | agentic-RAG github patterns arxiv |
保留理由:直接实现 canonical agentic RAG survey,是工程落地参考;需核验维护状态。
6. Awesome-Search-Agent-Papers (GitHub)
| 字段 | 内容 |
|---|---|
| 来源 | GitHub (YunjiaXi/Awesome-Search-Agent-Papers) |
| 链接 | https://github.com/YunjiaXi/Awesome-Search-Agent-Papers |
| 核心内容 | 2026 arXiv search/agent 论文集:DRNOISE、PACE、DISCOBENCH、DRFLOW、CIGPO、PATS、AREX、Reason Before You Retrieve 等 |
| 可信度 | 中(社区整理,需逐篇核验) |
| 后续行动 | 逐一核验关键论文;判断哪些有实际代码/复现步骤 |
| 标签 | agent research arxiv github |
保留理由:2026 search agent 研究全景图,但需逐篇核验学术质量,谨慎对待工程价值。
7. HuggingFace RAG Benchmark 2026-Q2
| 字段 | 内容 |
|---|---|
| 来源 | HuggingFace (paiteq-ai/rag-bench-2026q2) |
| 链接 | https://huggingface.co/datasets/paiteq-ai/rag-bench-2026q2 |
| 核心内容 | 1840 文档语料库;240 query;Recall@5/MRR/nDCG@10/faithfulness/citation accuracy/p95 latency/$ per 1k queries;Claude/GPT/Gemini 对比 |
| 可信度 | 中(MIT corpus,benchmark 方法论需核验) |
| 后续行动 | 核验 getwidget.dev/benchmarks/rag-2026-q2 完整结果;判断可复现性 |
| 标签 | RAG benchmark HuggingFace reproducibility |
保留理由:结构化可复现 benchmark,有具体评测指标和评测命令;需核验结果是否已发布。
8. RAGCap-Bench (arXiv 2510.13910v2)
| 字段 | 内容 |
|---|---|
| 来源 | arXiv |
| 链接 | https://arxiv.org/html/2510.13910v2 |
| 核心内容 | Agentic RAG 组件级评测;分离 planning/retrieval/reasoning 各阶段评估;解决端到端 QA benchmark 反馈粒度不足问题 |
| 可信度 | 高(peer-reviewed research) |
| 后续行动 | 核验论文方法论;判断 benchmark 是否公开可用 |
| 标签 | RAG benchmark arxiv agentic |
保留理由:arXiv 论文,组件级评测思路对工程 debug 有价值;需核验是否正式发表。
9. A-RAG: Scaling Agentic RAG (arXiv 2602.03442)
| 字段 | 内容 |
|---|---|
| 来源 | arXiv |
| 链接 | https://arxiv.org/html/2602.03442v1 |
| 发布时间 | 2026-08-24 |
| 核心内容 | 分层检索接口扩展 agentic RAG;vanilla baseline 在 agentic RAG 上表现稳健 |
| 可信度 | 中(预印本,需核验同行评审状态) |
| 后续行动 | 核验实验结果可复现性;判断与 GROUNDED Framework 的关联 |
| 标签 | agentic-RAG arxiv research |
保留理由:2026-08 新论文,研究趋势追踪;vanilla baseline 稳健性结论有工程参考价值。
10. AI Agent Architecture 2026: Production-Grade Systems (dev.to)
| 字段 | 内容 |
|---|---|
| 来源 | dev.to |
| 链接 | https://dev.to/monuminu/ai-agent-architecture-2026-building-production-grade-systems-patterns-benchmarks-and-lessons-5d34 |
| 核心内容 | SWE-bench-lite 62% resolve rate;多 agent 拓扑;运行时安全 wrapper;ReAct loop → plan decomposition → layered memory → safety wrapper 演进路径 |
| 可信度 | 中(需核验 benchmark 数据准确性) |
| 后续行动 | 核验 SWE-bench-lite 62% 数据来源;判断多 agent 拓扑建议实操性 |
| 标签 | agent architecture production benchmark |
保留理由:工程实践总结,SWE-bench 数据有参考价值;安全 wrapper 建议具体;需核验数据准确性。
❌ 丢弃条目
| 条目 | 丢弃原因 |
|---|---|
| Harness Blog: AI Deployment CI/CD for LLMs | 通用概述,无具体命令/代码/性能数据,市场营销内容为主 |
| LushBinary RAG Production Guide | 概述性强,无独特数据点,定价信息过时风险 |
| MLflow: Building Production-Ready AI Agents | 通用框架介绍,无具体命令或实测数据 |
| Northflank: Enterprise AI Coding Agent Deployment | 概念性,Sandbox 隔离等内容已有更权威来源 |
| 10 RAG Shifts (Microsoft Azure Medium) | 引用学术论文多,但缺乏工程命令/代码,摘要性质 |
分类标签(本次)
agent agentic-RAG production evaluation benchmark 2026 substack github arxiv multimodal
建议写入路径
/shared/research-kb/inbox/jay/2026-09-17-agentic-rag-production.md
后续行动建议
精读优先级(高)
- Awesome-RAG-Production — 生产工具精选,OpenAI API 迁移时间节点实操价值高
- The AI Engineer Substack — eval 三层架构具体内容,guardrails 分离逻辑
审稿优先级(中)
- RAGCap-Bench — 组件级评测思路对工程 debug 有意义,判断 benchmark 公开可用性
- LangChain State of Agent Engineering 2026 — 第一方数据,核验原文是否有更多工程数据
主题页更新建议
- Agentic RAG 主题页:纳入本轮 5 个 GitHub/论文来源;A-RAG 补充 2026-08 最新研究
- Agent 生产工程 主题页:纳入 LangChain 调查数据 + eval 三层架构
- RAG Benchmark 主题页:纳入 RAGCap-Bench 和 HuggingFace RAG 2026-Q2
本次无 Substack 原文长段复制
所有 Substack 内容均为中文摘要 + 链接引用,符合规则。
Jay · 2026-09-17 上午场 · 工程实践筛选