AI 工程·推理引擎·向量库·MCP 追踪简报
Jay · 2026-09-28 09:35 (Asia/Shanghai) 检索范围: Tavily 搜索 · Substack · 技术博客 · GitHub Trending · Hugging Face
主题概览
本次覆盖四大方向: 1. 推理引擎格局: vLLM / SGLang / LMDeploy 2026 Q3 基准对比 2. Agent 框架演进: MCP 2026 路线图 · Agent 栈治理层 · 框架选型 3. 向量数据库选型: Qdrant / Milvus / Weaviate 2026 中期对比 4. 后端与数据库: PostgreSQL / ClickHouse / Redis / Qdrant 自托管栈角色定位
一、推理引擎基准格局(2026 年 9 月)
核心数据
| 引擎 | H100 吞吐量 | GitHub Stars | 核心机制 | 适用场景 |
|---|---|---|---|---|
| SGLang | ~16,200 tok/s | 36,400 | RadixAttention(前缀缓存) | 前缀共享负载、多轮 Agent |
| LMDeploy | ~16,200 tok/s | — | — | 前缀共享负载 |
| vLLM | ~12,500 tok/s | 92,700 | PagedAttention | 通用 GPU Serving、最大生态 |
关键结论(SGLang vs vLLM): - 前缀密集型负载(共享系统 prompt + 短用户输入):SGLang 快约 29% - 独立请求负载:两者性能差距缩小至 1-4%,vLLM 生态优势显现 - vLLM 拥有更大的生态和第三方集成面;SGLang 在 Agent 结构和结构化输出场景更强 - SGLang 的 RadixAttention 将前缀 KV-cache 复用做到极致,前缀越大优势越明显
Benchmark 来源(September 25, 2026, H100 80GB, RunPod):
"Every figure below comes from one RunPod H100 SXM 80GB... Qwen3.8-27B ran at 8 bits on every engine." — Winder.ai
AutoGen 状态: - Microsoft 已将活跃开发移至 Microsoft Agent Framework 1.0,AutoGen 本身进入维护模式 - 企业若仍在 AutoGen 上应开始规划迁移路径
MCP 服务器基准: - 100 个生产 MCP 服务器可靠性测试:pass rate、错误类别、延迟、tool-call 成功率均有记录 - 来源:Digital Applied "MCP Adoption Statistics 2026"(2026-04)
二、MCP 2026 路线图与 Agent 栈治理
MCP 最新数据(2026 年 9 月)
- SDK 月下载量:9700 万次(2026-03),110M+(2026-04)
- 活跃公共服务器:10,000+(Anthropic 官方);目录索引 17,000+
- 财富 500 强:80% 在生产环境部署 AI Agent,28% 已实现 MCP 服务器
- Gartner 预测:2026 年底 75% API 网关厂商将具备 MCP 功能
- 2026-07-28 规范更新(关键):
- 转为无状态、全远程规范,面向 Web 规模
- 引入 MRTR(Multi-Round-Trip Requests):服务器可中途请求额外输入,无需维护长连接流
- 安全更新:要求 issuer authorization metadata
- 废弃 Roots、Logging、采样等遗留功能
2026 路线图核心优先级(The New Stack 报道): 1. 生产级可用性:修复当前 MCP 在真实生产部署中的痛点 2. 多 Agent 模式支持:当前 MCP 定义单一模型与工具的交互,路线图扩展至多 Agent 协作工作流 3. 长时任务(Tasks 原语):支持自主工作的 Agent 间通信
安全威胁(2026 年上半年): - 30+ CVEs 瞄准 MCP 服务器/客户端/工具 - 43% 为 shell 注入攻击 - 来源:The AI Engineer Substack "2026 AI Agent Stack"
治理层是 2026 新增: - 2024 年指南中几乎没有这个分层;2026 年它是"试点"与"生产部署"的本质区别 - EU AI Act 2026 年 8 月对高风险系统全面可执行 - Grant Thornton 调查:950 名高管中 78% 认为无法在 90 天内通过独立 AI 治理审计
三、向量数据库 2026 中期对比
关键指标
| 数据库 | GitHub Stars | 语言 | 核心优势 | 适用场景 |
|---|---|---|---|---|
| Milvus | 42,000+ | Go+C++ | 十亿级水平扩展、K8s 原生 | 超大规模、生产级 |
| Qdrant | — | Rust | 过滤效率最高、成本最低自托管 | 过滤密集型、自托管团队 |
| Weaviate | — | Go | 原生 BM25+向量混合搜索、知识图谱 | 关键词+语义融合检索 |
| Chroma | — | Python | 最简本地开发 | 原型、Small Scale |
选型建议(按决策树):
RAG / 向量检索需求
├── 追求零运维托管 → Pinecone
├── 自托管 + 成本优先 → Qdrant(最佳性价比)
├── 十亿向量规模 → Milvus
└── 关键词+语义混合 → Weaviate(原生 BM25,无需外接)
混合搜索重要性:在 2026 年,如果检索质量取决于关键词和语义信号的融合(法律检索、患者数据、多轮 Agent 工作流),混合搜索不是可选项而是必选项。Weaviate 原生支持,Qdrant 通过 payload filter + named vector 实现。
市场增长:向量数据库市场预计从 2024 年 17.3 亿美元增长至 2032 年 106 亿美元(CAGR ~25%)。
四、自托管数据库栈角色定位(PostgreSQL / ClickHouse / Redis / Qdrant)
角色分工
推荐叠放顺序(从核心到专用): 1. PostgreSQL → 默认关系型:内部工具、操作数据、默认值 2. Redis → 缓存/队列/临时状态: ephemeral state、消息队列 3. ClickHouse → 分析型:事件密集型、报表扫描大数据集 4. Qdrant → 向量检索:语义搜索、RAG、Agent 记忆
PostgreSQL vs MySQL:除非有明确的 CMS 类兼容性需求,默认选 PostgreSQL。PostgreSQL 的 JSON 支持、扩展生态(pgvector)、和 CloudNativePG Kubernetes Operator 在 2026 年优势明显。
ClickHouse 何时开始有意义: - 工作负载事件密集 - 报表查询扫描大数据集 - 分析读性能重要 - 报表层值得独立部署
CloudNativePG:Kubernetes 原生 PostgreSQL 操作员,覆盖部署→维护全生命周期,支持自动故障转移、灾难恢复、滚动升级。
五、Substack 高价值文章追踪
1. The AI Engineer — "The AI Agents Stack (2026 Edition)"
- 作者/专栏: The AI Engineer(专业 AI 工程Newsletter)
- 链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 核心观点:
- Agent 栈 ≠ LLM 栈:Chatbot 需要推理+可能 RAG;Agent 需要跨多步执行的状态管理、协议控制的工具访问、持久化记忆、自主推理循环、实时护栏
- Agent 护栏 2026 年已成为独立于 LLM 护栏的学科:现在包括工具调用授权、速率限制、Agent 实际行为验证
- LangGraph v1.0(2025-10)已在 Uber、JP Morgan、LinkedIn、Klarna 生产部署
- 每个主流 AI 实验室现都发布了自己的 Agent SDK:OpenAI Agents SDK、Google ADK、Microsoft Semantic Kernel、HuggingFace smolagents
- 可信度: 高 — 署名专业工程 Newsletter,有具体客户案例
- 后续行动: 建议精读全文,关注护栏层实现细节
2. Brain Bytes (Coding with Roby) — "The 2026 AI Agent Stack"
- 作者/专栏: codingwithroby.substack.com
- 链接: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
- 核心观点:
- 运行时层商品化快于预期:2026 年选择 Agent 运行时越来越变成实用问题而非架构决策
- 多 Agent 模式四种标准风格:Graph-based (LangGraph)、Role-based (CrewAI)、Handoff-based (OpenAI Agents SDK)、Hierarchical (Google ADK)
- 模型路由模式(Model Routing):用最便宜的模型处理能处理的任务,RouteLLM 证明可大幅降低成本同时保持质量
- 治理层在 2025 年指南几乎不存在,2026 年是生产部署的决定性分层;早期 2026 年 MCP 相关 CVEs 已超 30 个
- EU AI Act 2026 年 8 月全面可执行
- 可信度: 高 — 来自 Agent 开发者视角,引用具体数据源
- 后续行动: 关注治理层和模型路由实现
标签
推理引擎 vLLM SGLang LMDeploy MCP Agent框架 LangGraph CrewAI 向量数据库 Qdrant Milvus Weaviate PostgreSQL ClickHouse Redis CloudNativePG EU-AI-Act Agent-Governance
建议写入路径
/shared/research-kb/inbox/jay/2026-09-28T0935-jay-ai-engineering-inference-vecdb-mcp-trending.md✅(本文)
是否需要精读/审稿/主题页更新
- 精读建议: The AI Engineer "The AI Agents Stack (2026 Edition)" — 建议补充至 Agent 框架主题页
- 审稿建议: Q3 推理引擎基准数据 — 建议与独立 Benchmark 源交叉验证(如 LMSYS Chatbot Arena)
- 主题页更新建议: 新增 "MCP 2026 路线图与安全" 作为独立词条;更新 "向量数据库选型图谱"