下午简报 · 2026-06-29 · Jay

RAG · Vector DB · Cloud-Native · Backend · Substack · 学术追踪

检索时间: 2026-06-29 15:05 CST 检索范围: Tavily 深度检索(LLM RAG Agent 2026 · Vector DB 2026 · Cloud-Native K8s 2026 · arXiv · Substack · Backend PostgreSQL/MySQL 2026) 本次主题: RAG 2026 工程范式 · Vector DB 横向评测 · Kubernetes 2026 新动态 · AI Engineer 角色定义


一、RAG 系统工程 · Agentic RAG 2026(⭐⭐⭐⭐ 高价值)

1.1 RAG 2026 演进全景

维度 2024–2025 2026
架构范式 retrieve-then-generate 单轮 Agentic RAG 多轮推理 + 工具调用
检索粒度 固定 chunk top-k 自适应检索 + 图增强 + 多模态
上下文窗口 128k–1M 混合 RAG + 长上下文
向量数据库 专用向量 DB pgvector / Qdrant / Milvus / 云服务
评估方式 Hit@K / RAGAS LLM-as-Judge + 端到端质量

关键结论: RAG 在 2026 仍是 enterprise AI 基础,但已演化为「知识运行时」——管理检索、推理、验证、治理的统一编排层,类比 Kubernetes 对应用负载的定位。

来源: EITT Academy(2026 AI Agents Guide)| score: 0.81


1.2 Agentic RAG 核心工程模式(⭐⭐⭐⭐⭐ 必读)

Pattern 3 — Agentic RAG(复杂查询): - LLM 充当 planner,将查询分解为子查询,分别检索,评估是否需要继续检索 - ReAct 模式应用于检索本身 - 适用场景:跨多文档、需对比、条件逻辑("if X then look for Y") - 避用场景:简单 lookup,Agentic RAG 增加 2–4× 延迟和成本

Pattern 4 — GraphRAG(高关联知识): - 知识图谱 + 向量检索结合 - 适用:法律推理、研究综述、根因分析、技术排障

2026 新增:Adaptive RAG - LLM 判断是否需要检索、选择哪个检索器、动态停止检索 - 解决 over-retrieval、token 浪费、不必要延迟

Latency 常见陷阱:

LLM 不是瓶颈。向量搜索 + rerank + 生成 + 引文解析,全链路可达 4–6 秒。 解法:流式响应、two-stage 检索、popular query 缓存、reranker 模型小型化

来源: AgileInfoways(Production-Ready RAG 2026)| score: 0.80


1.3 LangGraph Agentic RAG 2026 实现要点

关键 LangGraph 2026 特性: - StateGraph 共享类型状态 - add_conditional_edges 动态路由 - MemorySaver / AsyncSqliteSaver / PostgresSaver 检查点 - Interrupt gates 人类介入节点 - Subgraphs 多 Agent 模块化协作

Graph-of-Thought 推理:多路径探索、测试想法、合并结果,而非单链式。

来源: Vinod Rane(Medium,2026-03-31)| score: 0.79


1.4 20 种 Advanced RAG 分类(Turing Post 精选)

2026-05-29 发布的系统梳理,重点关注: - Agentic RAG:多步决策而非单轮 pipeline - A-RAG:Adaptive RAG,动态检索策略 - HGMem:长文档记忆增强 - Graph-O1:图推理 + O1 式推理链 - Multimodal RAG:图像、图表、表格检索进入生产 - Multilingual RAG:跨语言检索 - Security RAG:安全感知检索

来源: Turing Post | score: 0.79


1.5 学术追踪:arXiv 2026 RAG/Agent 论文

a. SoK: Agentic RAG(⭐⭐⭐⭐⭐ 系统化论文)

arXiv:2603.07379v1 - Agentic RAG = RAG + 自住 AI Agent 嵌入 pipeline - Memory 分 short-term / long-term - Planning = Reflection + Self-Critique + Query Routing - Graph-Based Agentic RAG:结构化知识图谱 + 非结构化文档结合 - GeAR(Graph-Enhanced Agent for RAG)

b. Experience-Based Multi-Agent RAG

arXiv:2603.18272v1 - 从经验中学习:多 Agent RAG + 动态编排 - ExpRAG 框架:动态经验检索

c. Verified Multi-Agent Orchestration

arXiv:2603.11445v1 - Plan-Execute-Verify-Replan 框架

d. MEMO: Memory-Augmented Model Context Optimization

arXiv:2603.09022v1 - 多轮多 Agent LLM 游戏记忆增强

e. A-RAG: Scaling Agentic RAG

arXiv:2602.03442v1 - 主要贡献:从 Workflow RAG(预定义 agent-workflow)进化到真正 Agentic RAG - 评估基于 GPT-4o-mini 和 GPT-5-mini - LinearRAG 等基线对比

f. Fine-tuning with RAG for Improving LLM Learning(⭐⭐⭐⭐ ICLR 2026 投稿)

arXiv:2510.01375 - RAG 辅助微调:让 LLM 通过 RAG 上下文学习新技能 - 方向:RAG 不是替代微调,而是协同


二、Vector DB 横向评测 2026(⭐⭐⭐⭐⭐ 高价值数据库工程)

2.1 2026 QPS / Latency 真实评测对比

Database p99 Latency(100M向量) QPS@95% recall 特色
Redis 10–15ms N/A 最小延迟但非专用
pgvectorscale 28ms 471 @50M ACID + SQL,生态成熟
Qdrant 30–40ms 100+ 图内过滤最快 2–3x
Milvus 40–60ms 90+ 十亿级
Pinecone 50–100ms 80+ 全托管
Weaviate 50–70ms 60+ 混合搜索
Chroma 100–200ms 原型

关键数据: - pgvectorscale:471 QPS @ 50M vectors(99% recall),28ms p95 latency - Qdrant:in-graph filtering 比 post-search filtering 快 2–3x - 50M vectors 成本:pgvector 自托管 ~$300/月 vs Pinecone $3000/月

来源: Karthikeyan Rathinam(Medium,2026)| score: 0.87


2.2 Vector DB 选型决策树(2026 Production Guide)

pgvector 适用:< 100M 向量、已有 PostgreSQL、需 ACID + 关系型、减少系统复杂度 Qdrant 适用: 高 QPS + 过滤混合负载、需自托管、P99 延迟敏感(实测 180ms→32ms 迁移案例) Milvus 适用: >10 亿向量、P395 延迟可接受 Pinecone 适用: 小团队、开发者速度优先、需全托管 MySQL Vector: 8.x 已支持向量,但非专用 MongoDB Atlas: 1500 万向量 sub-50ms,混合文档+向量场景

Benchmark 陷阱警示(⭐⭐⭐⭐⭐):

"The best vector database is the one you already have." — Simon Frey 供应商基准往往针对自身架构优化。真正生产测试: 1. 72 小时连续写入+查询(而非静默索引后测试) 2. Tail latency under load(P95/P99) 3. 过滤查询性能随数据增长的变化 4. 实时数据刷新延迟

来源: Actian(Vector DB Benchmarks are Misleading)| score: 0.77


2.3 Vector DB 2026 新动态

Agent 时代的新问题: - AI Agent 2026 年查询量是人类 10 倍 - Agent 系统:并发隔离 PostgreSQL < 500ms、heavy parallelism、连续大数据摄取 - 低延迟 DB 不够,throughput 也必须scale

AWS S3 Vectors 反趋势: - embeddings 存在 S3,而非索引到 DB 内 - 20 亿向量/索引,90% TCO 降低,但延迟 > 100ms - 交易:低延迟换成本

来源: DEV Community(Actian Dev)| score: 0.85


三、Kubernetes 2026 工程动态(⭐⭐⭐⭐ 高价值 Cloud-Native)

3.1 KubeCon India 2026 要点(2026-06-18/19,Mumbai)

CNCF 统计: - Cloud-Native 采纳率:98% 的组织 - Kubernetes 生产使用:93% - AI 工作负载推动 Kubernetes 采纳

KubeCon India 2026 重点: - Kubernetes 已成为 AI 的默认底座 - 多 Agent 安全平台在 K8s 上的实践 - 平台工程与 AI 系统运维结合

来源: CNCF 官方博客(2026-03-26)| score: 0.82


3.2 Kubernetes 2026 五大趋势

Trend 1: Kubernetes as AI Backbone(⭐⭐⭐⭐⭐) - AI 工作负载最重的是 MLOps:bursty 训练 Job + 高流量推理 Service 同构 - Kubernetes 提供统一控制平面调度 AI 组件(训练和推理不再分离)

Trend 2: Ingress NGINX 落幕 + Gateway API 强制迁移(2026-03 已停更) - 2026 年 3 月 Ingress NGINX 社区版停止维护 - Gateway API 成为唯一选择(安全紧急切换)

Trend 3: KubeVirt 爆发 - VM 与容器混合运行,传统虚拟化成本压力大 - K8s 统一虚拟机和容器管理

Trend 4: WebAssembly(Wasm)成为补充运行时 - 冷启动快、安全沙箱、多语言 - Envoy 代理过滤器可写 Wasm,K8s 更多 Wasm 扩展点 - CNCF Wasm 工作组活跃

Trend 5: GitOps 全面落地 - Argo CD 和 Flux 为标准 - Git 为唯一真相来源

来源: Loginline(Kubernetes Migration 2026 Guide)| score: 0.86 | Platform Engineering Trends 2026(Medium)| score: 0.85


3.3 Kubernetes 平台工程 2026

核心转变: 2026 年不是 K8s 本身大改版,而是组织学会更「有意地」使用它。

IDP(Internal Developer Portal)+ Backstage 整合: - 统一开发者入口 - 跨平台自服务 - SLO/SLI 可观测性

Telemetry 2026 趋势: - OpenTelemetry 标准化(vendor-neutral) - 从「采集一切」转向「采集有助于业务结果的数据」 - 自适应采样、热/冷数据分层摄取

来源: USDSI + Fairwinds Playbook 2026 | score: 0.80


四、PostgreSQL vs MySQL 2026 工程对比(⭐⭐⭐⭐ Backend)

4.1 基准测试数据(2026-01 BinaryIgor,实测)

操作 MySQL 9.5 QPS PG 18.1 QPS PG vs MySQL
单行 INSERT 4,383 21,338 4.87x
批量 INSERT 100行 200 211 ~1x
批量 INSERT 100行(orders) 1,883 3,535 1.88x

PG 18(beta)新特性: - 异步 I/O(AIO):顺序扫描、bitmap heap scan、vacuum 操作 2–3x 提升 - 并行查询性能 +35%

来源: CommandLinux 统计 | score: 0.84


4.2 PostgreSQL vs MySQL 2026 全面对比

DB-Engines 排名(2026-03): - MySQL:858(YoY -129) - PostgreSQL:680(YoY +16.66) - 趋势:差距迅速收窄

JSON 处理: - PostgreSQL:3.7x 速度快于 MySQL - PostgreSQL:JSONB 原生支持 + GIN 索引 - MySQL:JSON 函数有限

扩展生态: - PostgreSQL:300+ 扩展(PostGIS、pgvector、TimescaleDB、pg_cron 等) - MySQL:生产级扩展极少

向量搜索: - PostgreSQL:pgvector(49M vectors 99% recall,471 QPS) - MySQL:8.x 开始有向量支持,但不成熟

选型建议(2026): - ✅ 新项目选 PostgreSQL(默认) - ⚠️ 传统 LAMP / WordPress / 团队 MySQL 深度专家 → MySQL - ❌ 新项目选 MySQL 几乎没有理由

来源: Kunal Ganglani 博客 | score: 0.85 | Tech Insider 对比 | score: 0.80


五、Substack 高价值内容(⭐⭐⭐⭐ 研究洞察)

5.1 AI Engineer 2026 角色定义(⭐⭐⭐⭐⭐ 必读)

来源: Alexey On Data(substack,2026-02-13) URL: https://alexeyondata.substack.com/p/what-is-an-ai-engineer-in-2026-join

核心观点: - 分析 1000+ 职位描述后,AI Engineer 分三类: - AI-first(约70%): 直接构建 LLM/GenAI 系统(RAG、Agent、评估、生产部署) - AI-support(约28.5%): 基础设施和平台(GPU/inference 基础设施、数据管道、部署监控) - 传统 ML/DL(<2%): 标准 ML/DL 但被标为 AI Engineer

  • 核心职责:构建端到端 LLM 应用(RAG、Agent),API 生产化,评估和 guardrails
  • 次要职责:检索、私有数据管道、内部 AI 平台、Agent 工作流

评价: 目前看到最系统的 AI Engineer 2026 职位分析。


5.2 Deep|LLM 2026:从模型停滞幻觉到大规模真实 Agent 部署

来源: FundaAI(substack) URL: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of

核心观点: - 2025 不是停滞,而是范式转变 - 2026 是拐点:AI 从「能思考」到「能执行」 - 关键瓶颈迁移:从 per-inference FLOPS → 连续执行系统能力 - 并发 session 管理 - 长寿 KV cache 常驻 - 多轮推理上下文累积 - 工具调用外部状态管理 - Claude Code(基于 Claude Opus 4.5)长时任务表现亮眼 - Anthropic ARR 2026 年预计超 300 亿美元


5.3 LLM AI Engineering 书籍推荐 Top 5(2026)

来源: ReactJava Substack URL: https://reactjava.substack.com/p/i-have-read-20-books-on-ai-and-llm

  1. AI Engineering(Chip Huyen) — 最推荐 AI 工程入门
  2. Building Large Language Models from Scratch(Sebastian Raschka) — LLM 内部机制
  3. Designing Machine Learning Systems(Chip Huyen) — 系统设计
  4. Building Agentic AI Systems — Agent 架构
  5. Hands-On LLM Applications — 实践

六、分类标签汇总

#RAG #Agentic-RAG #GraphRAG #Adaptive-RAG #RAG-Engineering
#VectorDB #pgvector #Qdrant #Milvus #Pinecone #Benchmark
#Kubernetes #KubeCon #Gateway-API #Wasm #GitOps #Platform-Engineering
#PostgreSQL #MySQL #Backend #OLTP #Benchmark
#AI-Engineer #Role-Definition #Career
#Multi-Agent #LLM-Systems #RAG-Architecture
#Sebastian-Raschka #Ahead-of-AI #LLM-Research-2026

七、建议写入路径

草稿路径: /shared/research-kb/inbox/jay/2026-06-29-1505-afternoon-briefing-llm-vecdb-cloudnative-substack.md


八、精读/审稿/主题页更新建议

🔍 建议精读(需原文深读)

  1. arXiv:2603.07379 — SoK: Agentic RAG(系统化梳理,建议更新主题页)
  2. arXiv:2602.03442 — A-RAG(从 Workflow RAG 到 Agentic RAG 的范式转变)
  3. arXiv:2510.01375 — Fine-tuning with RAG(ICLR 2026 投稿,RAG+Fine-tune 协同)
  4. Actian Blog — Vector DB Benchmarks are Misleading(生产评估方法论)

📝 建议更新主题页

  1. RAG 系统工程 2026 — Agentic RAG + Adaptive RAG + GraphRAG 模式补充
  2. Vector DB 选型 — 2026 基准数据 + pgvector 生产竞争力数据补充
  3. AI Engineer 角色定义 — Substack 1000+ 职位分析补充

⚠️ 需进一步核验

  • pgvectorscale 471 QPS 数据来源(需官方 benchmark 对比)
  • PostgreSQL 18 beta 新特性(2026 年正式版尚未发布)
  • KubeCon India 2026 具体新发布(待 KubeCon NA 2026 确认)

本简报由 Jay 实例生成 · 2026-06-29 15:05 CST · 请勿直接提交 GitHub