Jay 工程实践筛选草稿 · 2026-09-17

本次主题

Agentic RAG / LLM Agent 生产工程 · 2026 Q3 工程实践精选

检索范围

  • Tavily 搜索:agentic RAG production 2026、LLM agent engineering 2026、multimodal LLM evaluation 2026
  • GitHub Topics:agentic-rag
  • arXiv:agentic RAG、benchmark
  • Substack:AI engineering、LLM systems
  • HuggingFace datasets

✅ 保留条目

1. LangChain《State of Agent Engineering 2026》

字段 内容
来源 LangChain 第一方 (langchain.com)
链接 https://www.langchain.com/state-of-agent-engineering
发布时间 2026-06-12
核心数据 57% 组织已有 agent 在生产;30.4% 正在开发;集成是最大痛点(46%)
关键洞察 行业从 POC 向生产迁移;质量是 #1 阻塞因素,延迟 #2
可信度 高(第一方行业调查)
后续行动 建议纳入 agent 生产状态页;核验原文完整报告
标签 agent production survey 2026

保留理由:第一方数据,行业基准,集成痛点数据对工程决策有直接价值。


2. The AI Engineer Substack《AI Agents Stack 2026 Edition》

字段 内容
来源 The AI Engineer (substack)
链接 https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
发布时间 2026
核心观点 Agent guardrails 已独立于 LLM guardrails;eval-as-infrastructure 三层架构;新 benchmark:Context-Bench/Recovery-Bench/Terminal-Bench
可信度 高(高质量工程 newsletter)
后续行动 核验 benchmark 论文出处;关注 eval 三层架构图
标签 agent stack evaluation 2026 substack

保留理由:Substack 高质量工程洞察;guardrails 分离是重要工程演进;benchmark 追踪价值高。


3. Awesome-RAG-Production (GitHub)

字段 内容
来源 GitHub (Yigtwxx/Awesome-RAG-Production)
链接 https://github.com/Yigtwxx/Awesome-RAG-Production
更新时间 2026 活跃维护
核心内容 生产级工具精选;OpenAI Responses API 迁移指南(Assistants API 2026-08-26 停用);Vanna 已 archive,推荐 WrenAI;Anthropic Prompt Caching 10% 读价格
可信度 高(社区维护,精选列表)
后续行动 核验 OpenAI Responses API 迁移细节;WrenAI 替代 Vanna 实际表现
标签 RAG production tools github

保留理由:生产工具精选库,API 迁移时间节点实用,Prompt Caching 定价数据具体。


4. microsoft/ai-agents-for-beginners (GitHub)

字段 内容
来源 GitHub (microsoft/ai-agents-for-beginners)
链接 https://github.com/microsoft/ai-agents-for-beginners
Stars 74.4k
核心内容 18 节 AI agent 入门课程;覆盖 AutoGen、Semantic Kernel、Foundry
可信度 高(Microsoft 第一方)
后续行动 核验 2026 内容更新;判断是否适合作为工程新人学习路径参考
标签 agent tutorial microsoft github

保留理由:Microsoft 官方教程,star 量说明受欢迎程度,可作学习路径质量参考。


5. agentic-rag-patterns (GitHub)

字段 内容
来源 GitHub (vishalmysore/agentic-rag-patterns)
链接 https://github.com/vishalmysore/agentic-rag-patterns
核心内容 实现 arXiv:2501.09136 Agentic RAG Survey;A2AJava 框架;routing/tool-use/reflection/planning/multi-agent
可信度 高(引用权威 survey)
后续行动 核验框架活跃度;判断 A2AJava 实际生产使用情况
标签 agentic-RAG github patterns arxiv

保留理由:直接实现 canonical agentic RAG survey,是工程落地参考;需核验维护状态。


6. Awesome-Search-Agent-Papers (GitHub)

字段 内容
来源 GitHub (YunjiaXi/Awesome-Search-Agent-Papers)
链接 https://github.com/YunjiaXi/Awesome-Search-Agent-Papers
核心内容 2026 arXiv search/agent 论文集:DRNOISE、PACE、DISCOBENCH、DRFLOW、CIGPO、PATS、AREX、Reason Before You Retrieve 等
可信度 中(社区整理,需逐篇核验)
后续行动 逐一核验关键论文;判断哪些有实际代码/复现步骤
标签 agent research arxiv github

保留理由:2026 search agent 研究全景图,但需逐篇核验学术质量,谨慎对待工程价值。


7. HuggingFace RAG Benchmark 2026-Q2

字段 内容
来源 HuggingFace (paiteq-ai/rag-bench-2026q2)
链接 https://huggingface.co/datasets/paiteq-ai/rag-bench-2026q2
核心内容 1840 文档语料库;240 query;Recall@5/MRR/nDCG@10/faithfulness/citation accuracy/p95 latency/$ per 1k queries;Claude/GPT/Gemini 对比
可信度 中(MIT corpus,benchmark 方法论需核验)
后续行动 核验 getwidget.dev/benchmarks/rag-2026-q2 完整结果;判断可复现性
标签 RAG benchmark HuggingFace reproducibility

保留理由:结构化可复现 benchmark,有具体评测指标和评测命令;需核验结果是否已发布。


8. RAGCap-Bench (arXiv 2510.13910v2)

字段 内容
来源 arXiv
链接 https://arxiv.org/html/2510.13910v2
核心内容 Agentic RAG 组件级评测;分离 planning/retrieval/reasoning 各阶段评估;解决端到端 QA benchmark 反馈粒度不足问题
可信度 高(peer-reviewed research)
后续行动 核验论文方法论;判断 benchmark 是否公开可用
标签 RAG benchmark arxiv agentic

保留理由:arXiv 论文,组件级评测思路对工程 debug 有价值;需核验是否正式发表。


9. A-RAG: Scaling Agentic RAG (arXiv 2602.03442)

字段 内容
来源 arXiv
链接 https://arxiv.org/html/2602.03442v1
发布时间 2026-08-24
核心内容 分层检索接口扩展 agentic RAG;vanilla baseline 在 agentic RAG 上表现稳健
可信度 中(预印本,需核验同行评审状态)
后续行动 核验实验结果可复现性;判断与 GROUNDED Framework 的关联
标签 agentic-RAG arxiv research

保留理由:2026-08 新论文,研究趋势追踪;vanilla baseline 稳健性结论有工程参考价值。


10. AI Agent Architecture 2026: Production-Grade Systems (dev.to)

字段 内容
来源 dev.to
链接 https://dev.to/monuminu/ai-agent-architecture-2026-building-production-grade-systems-patterns-benchmarks-and-lessons-5d34
核心内容 SWE-bench-lite 62% resolve rate;多 agent 拓扑;运行时安全 wrapper;ReAct loop → plan decomposition → layered memory → safety wrapper 演进路径
可信度 中(需核验 benchmark 数据准确性)
后续行动 核验 SWE-bench-lite 62% 数据来源;判断多 agent 拓扑建议实操性
标签 agent architecture production benchmark

保留理由:工程实践总结,SWE-bench 数据有参考价值;安全 wrapper 建议具体;需核验数据准确性。


❌ 丢弃条目

条目 丢弃原因
Harness Blog: AI Deployment CI/CD for LLMs 通用概述,无具体命令/代码/性能数据,市场营销内容为主
LushBinary RAG Production Guide 概述性强,无独特数据点,定价信息过时风险
MLflow: Building Production-Ready AI Agents 通用框架介绍,无具体命令或实测数据
Northflank: Enterprise AI Coding Agent Deployment 概念性,Sandbox 隔离等内容已有更权威来源
10 RAG Shifts (Microsoft Azure Medium) 引用学术论文多,但缺乏工程命令/代码,摘要性质

分类标签(本次)

agent agentic-RAG production evaluation benchmark 2026 substack github arxiv multimodal


建议写入路径

/shared/research-kb/inbox/jay/2026-09-17-agentic-rag-production.md


后续行动建议

精读优先级(高)

  1. Awesome-RAG-Production — 生产工具精选,OpenAI API 迁移时间节点实操价值高
  2. The AI Engineer Substack — eval 三层架构具体内容,guardrails 分离逻辑

审稿优先级(中)

  1. RAGCap-Bench — 组件级评测思路对工程 debug 有意义,判断 benchmark 公开可用性
  2. LangChain State of Agent Engineering 2026 — 第一方数据,核验原文是否有更多工程数据

主题页更新建议

  • Agentic RAG 主题页:纳入本轮 5 个 GitHub/论文来源;A-RAG 补充 2026-08 最新研究
  • Agent 生产工程 主题页:纳入 LangChain 调查数据 + eval 三层架构
  • RAG Benchmark 主题页:纳入 RAGCap-Bench 和 HuggingFace RAG 2026-Q2

本次无 Substack 原文长段复制

所有 Substack 内容均为中文摘要 + 链接引用,符合规则。


Jay · 2026-09-17 上午场 · 工程实践筛选