AI 工程 · 后端 · 数据库 · 部署 — 研究简报
Jay · 2026-08-20 第3次(17:35 UTC+8)
主题:AI 推理工程 / LLM 部署 / Agent 框架 / Vector DB / 后端部署平台
一、LLM 推理与部署(Inference Engineering)
核心框架格局(2026)
| 框架 | 定位 | 优势 | 适用场景 |
|---|---|---|---|
| vLLM | 开源事实标准 | PagedAttention、连续批处理、20k+ stars、OpenAI 兼容 API | 通用 LLM 服务、自托管入门 |
| TensorRT-LLM | NVIDIA 官方栈 | H100/H200/B200 硬件最高吞吐 | 追求极致性能、有 NVIDIA 部署预算 |
| SGLang | 新兴高效框架 | 结构化输出优化、RadixAttention | Agent 场景、结构化输出密集型 |
| NVIDIA Dynamo | 新框架 | 与 TRT-LLM 协同 | 新项目评估 |
关键技术栈(vLLM 为主线)
核心技术: - PagedAttention:KV Cache 管理,节省 2-4x GPU 显存 - 连续批处理(Continuous Batching):动态聚合请求,最大化 GPU 利用率 - 前缀缓存(Prefix Caching):重复系统 prompt 复用 - 投机解码(Speculative Decoding):预测+验证,降低延迟 - 分块预填充(Chunked Prefill):V1 引擎默认特性,解决内存峰值
量化支持: GPTQ、AWQ、SqueezeLLM、FP8 KV Cache、INT4/INT8
多模态: LLaVA、Qwen-VL、Pixtral(vLLM 原生支持 200+ 模型架构)
精选高价值条目
-
vLLM 官方文档
https://github.com/vllm-project/vllm
- 89k stars,UC Berkeley Sky Computing Lab 起家 - 支持 Decoder-only、MoE、混合注意力(SSM/Mamba)、多模态、Embedding、Reward 模型 - 值得精读:V1 引擎架构变更、分块预填充调度逻辑 -
flex-nano-vllm(轻量实验)
https://github.com/changjonathanc/flex-nano-vllm
- 基于 PyTorch FlexAttention 的极简 vLLM 风格推理引擎 - 无 flash-attn 依赖、无自定义 Triton kernel - 适合学习 PagedAttention 原理 -
Pragmatic Engineer — 什么是推理工程
https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
作者:Gergely Orosz
- AI 工程岗位定义,推理工程≠模型训练 - 适合作为团队内部 AI 工程能力矩阵参考 -
Spheron — 2026 GPU Cloud Inference Guide
https://www.spheron.network/blog/inference-engineering-guide-2026
- H100 性价比最优、H200 141GB 适合大模型、B200 下代吞吐量 - GPU 选型决策框架 -
jamwithai Substack — LLM 推理延迟 10 大技术
https://jamwithai.substack.com/p/ml-and-llm-inference-latency-10-techniques
作者:Shirin Khosravi
- PagedAttention、Continuous Batching、KV Cache 量化、投机解码等逐一图解 - 推荐作为团队内部培训材料
二、AI Agent 框架格局(2026)
框架选型矩阵
| 框架 | GitHub Stars | 定位 | 许可证 |
|---|---|---|---|
| LangChain | ~134k | 全栈 LLM 应用框架 | MIT |
| Hermes Agent(Nous Research) | ~140k(2026年2月发布) | 自主改进型 AI Agent | MIT |
| MetaGPT | ~62k | 多 Agent 软件公司模拟 | MIT |
| AutoGen(Microsoft) | ~53k | 多 Agent 对话系统 | CC-BY-4.0 |
| LlamaIndex | ~46k | 数据密集型 RAG 应用 | MIT |
| CrewAI | ~22k | 角色型团队 Agent | — |
| LangGraph | ~12k | 状态化图工作流 | MIT |
| OpenAI Agents SDK | ~18k | OpenAI 亲儿子 | MIT |
| Claude Agent SDK | ~14k | Anthropic 安全导向 | MIT |
重要趋势
- Hermes Agent:2026 年现象级项目,3 个月内 140k stars,主打"自我改进"能力
- OpenClaw:60 天内从 9k 增至 188k stars(与本实例同名巧合)
- 多 Agent 协作:CrewAI、MetaGPT、AutoGen 形成"团队 Agent"范式
- LangGraph:图结构工作流成为生产级 Agent 编排主流
- n8n:拖拽式 AI 自动化,3000+ 集成,企业自托管首选
精选高价值条目
-
Analytics Vidhya — 2026年7月 GitHub Trending AI/ML 项目
https://www.analyticsvidhya.com/blog/2026/07/trending-ai-github-repositories
- Agent 框架、MCP servers、AI gateways 全景图 - 主流 GenAI 模型清单(Llama 4、DeepSeek V3、Qwen 2.5 VL 等) -
ByteByteGo — 2026 Top AI GitHub Repos
https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026
- LangChain 生态深度分析、LlamaIndex vs LangChain 选型 - 本地运行趋势(Ollama)、视觉化 AI 构建(Dify/n8n) -
awesome-ai-agents-2026(ARUNAGIRINATHAN-K)
https://github.com/ARUNAGIRINATHAN-K/awesome-ai-agents-2026
- 精选合集,含 LightAgent(轻量 MCP)、Letta(长期记忆)、Haystack(生产级 RAG) -
Pickaxe — Top 15 AI Agent Frameworks 2026
https://pickaxe.co/post/top-ai-agent-frameworks
- Hermes Agent 深度介绍(Nous Research) - OpenClaw 列入表格(188k stars),与本实例同名值得关注 -
LangChain 官方 — AI Agent Frameworks 资源页
https://www.langchain.com/resources/ai-agent-frameworks
- 134k stars,1000+ 预构建集成 - LlamaIndex Workflows(事件驱动)正在替代 LangChain 的一部分场景
三、Vector Database 格局(2026 RAG 基础设施)
选型决策框架
| 场景 | 推荐 | 理由 |
|---|---|---|
| <10M 向量、无特殊运维 | Pinecone | 零运维、sub-20ms p95 |
| 开源自托管、过滤密集 | Qdrant | Rust 实现、4ms p50、成本最低 |
| 混合搜索(关键词+向量) | Weaviate | 原生 BM25+向量、2026.04 MCP Server |
| >100M 向量、需 GPU 加速 | Milvus | 唯一成熟方案、Kubernetes 原生 |
| <50M 向量、Postgres 现有栈 | pgvector | 无新服务、2M 向量无需调优 |
| 本地开发、快速原型 | Chroma | 最简路径 |
关键更新
- Weaviate v1.37(2026年4月):全球首个原生 MCP Server 的向量数据库,Agent 可直接查询/写入
- Qdrant 1.17(2026年7月):量化效率提升、过滤性能优化
- pgvector:22k+ stars,RAG 事实标准,MySQL 9.0 的 VECTOR 类型对比仍显初级
精选高价值条目
-
Kalvium Labs — pgvector vs Pinecone vs Qdrant vs Weaviate 生产对比
https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate
- 10+ 生产系统实测:pgvector 默认首选(2M 向量无需调优) - Pinecone 5M+ 向量时 sub-20ms p95,但成本高 3-8x -
DEV Community — Pinecone vs Weaviate vs Milvus vs Qdrant 2026
https://dev.to/krunalkanojiya/pinecone-vs-weaviate-vs-milvus-vs-qdrant-which-vector-db-in-2026-26dc
- 各数据库架构图对比、过滤能力分析 -
iternal.ai — Best Vector Databases 2026
https://iternal.ai/insights/best-vector-databases-2026
- 完整对比表、自托管能力评估 -
Alphacorp — Best Vector DB for RAG 2026 Top 7
https://alphacorp.ai/blog/best-vector-databases-for-rag-2026-top-7-picks
- Qdrant 自托管成本最优、Weaviate 混合搜索最佳
四、后端部署平台(2026)
PaaS 选型
| 平台 | 定位 | 特色 |
|---|---|---|
| Railway | 全栈产品后端 | Postgres/MySQL/Redis 一体化、Agent 驱动部署 |
| Northflank | 复杂生产负载 | BYOC(多云 GPU)、K8s 灵活性+PaaS 简便性 |
| Render | 标准 Web 服务 | managed DB、自动 SSL、background workers |
| Fly.io | 全球低延迟 | Anycast 路由、但运维成本较高 |
2026 后端工程师技能矩阵
- Serverless 事件驱动:按需扩缩容,适合突发负载(电商秒杀、数据处理任务)
- 跨领域能力:后端 + 云 + DevOps 边界模糊,DevOps 工程师薪资溢价显著
- 性能工程:Redis 缓存、CDN、数据库索引调优、EXPLAIN ANALYZE、负载均衡
- PostgreSQL 17/18:简单查询性能提升;MySQL 9.6 JSON Duality Views(关系-文档双视图)
- PostgreSQL 19 Beta 2(2026-07-16):最新测试版
精选高价值条目
-
Railway Blog — Best Cloud Deployment Platforms 2026
https://blog.railway.com/p/best-cloud-application-deployment-platforms-2026
- Railway 创始人自述:Vercel(纯前端)、Railway(后端+DB 全家桶)、Northflank(K8s) -
Northflank — Best Tools to Deploy Backends 2026
https://northflank.com/blog/best-tools-to-deploy-backends
- GPU 实例、AI 工作负载支持、Per-second 计费 -
Hungry Coders — Backend Engineer Roadmap 2026
https://www.hungrycoders.com/blog/backend-roadmap-2026-complete-guide
- Virtual Threads(10K 并发)、PostgreSQL 索引调优、Spring AI + LLMs -
Platform Engineering Tools 2026
https://platformengineering.org/blog/platform-engineering-tools-2026
- GitOps 工作流、Humanitec/Kratix 平台编排器
五、MLOps / LLMOps 现状(2026)
核心趋势
- LLMOps ≠ MLOps:传统 MLOps 监控预测精度/数据漂移;LLMOps 额外关注 prompt 版本化管理、幻觉监控、RAG 检索质量、护栏、成本控制
- LLMOps 市场:2024年 $1.97B → 2028年 $4.9B(42% CAGR)
- RAG 在 65% 的 LLM 应用职位中出现
- EU AI Act 强制合规:2024-2027 分阶段实施,审计溯源成核心需求
工具生态
- W&B(Weights & Biases):LLM evaluation + prompt tracking
- Databricks:Lakehouse 上的微调流水线
- Vertex AI GenAI Studio:Google Cloud 模型评估工具
- MLflow:实验追踪、模型注册
- Datatalks Club MLOps Zoomcamp:免费课程,AI Dev Tools Zoomcamp 2026 新增
精选高价值条目
-
MLOps Zoomcamp(DataTalks.Club)
https://datatalks.club/blog/mlops-zoomcamp.html
- 免费课程,含 AI Dev Tools Zoomcamp 2026 -
kernshell — MLOps Best Practices 2026
https://www.kernshell.com/best-practices-for-scalable-machine-learning-deployment
- LLMOps vs MLOps 区别精讲、RAG retrieval quality 监控方法 -
MachineLearningMastery — LLMOps Roadmap 2026
https://machinelearningmastery.com/the-roadmap-for-mastering-llmops-in-2026
- vLLM 推理优化、护栏、RAG 流水线完整路径 -
Winder.ai — MLOps Consulting Companies 2026
https://winder.ai/top-mlops-consulting-companies-2026
- LLMOps 已成为 MLOps 的自然延伸,选咨询公司标准
六、数据库领域动态
PostgreSQL 生态
- PostgreSQL 19 Beta 2(2026-07-16):最新测试版
- PostgreSQL 14(2026-11-12 EOS):需尽快升级
- SynchDB 1.4:Oracle 容器数据库支持、TLS 安全 FDW 快照
- DB-Engines 排名:PostgreSQL 唯一正增长 top-4 数据库(+6.92),MySQL 下降 94 点
MySQL 生态
- MySQL 9.6(2026-01):JSON Duality Views(关系-文档双视图)、模块化审计日志、原子 DDL
- MySQL 9.7.1(2026-06-16):最新稳定版
- VECTOR 类型:MySQL 9.0 已引入,但 pgvector 生态(22k+ stars)仍主导生产 RAG
精选高价值条目
-
Kunal Ganglani — PostgreSQL vs MySQL 2026
https://www.kunalganglani.com/blog/postgresql-vs-mysql-2026
- DB-Engines 分数对比、AI 功能对比、pgvector vs MySQL VECTOR -
DEV Community — MySQL vs PostgreSQL 7 Key Differences
https://dev.to/piteradyson/mysql-vs-postgresql-in-2026-7-key-differences-you-should-know-before-choosing-4l9d
- OLTP/OLAP 场景对比、MVCC、JSON 处理差异
分类标签
#LLM推理 #vLLM #TensorRT-LLM #AI-Agent #LangChain #LlamaIndex #LangGraph #CrewAI #Hermes-Agent #VectorDB #Qdrant #Weaviate #Milvus #pgvector #RAG #MLOps #LLMOps #后端部署 #Railway #Northflank #PostgreSQL19 #MySQL96 #2026技术栈
建议写入路径
/shared/research-kb/inbox/jay/2026-08-20-ai-engineering.md
后续行动建议
- 精读:vLLM V1 引擎架构变更文档(分块预填充调度逻辑)
- 审稿:Weaviate MCP Server 集成验证(首个 Agent 原生 Vector DB)
- 关注:PostgreSQL 19 正式版发布计划(Beta 2 已出)
- 跟踪:Hermes Agent(Nous Research)生产落地案例
- 评估:Qdrant 1.17 量化效率提升是否值得升级
本简报基于公开信息整理,仅作为研究线索,不构成技术选型建议。所有链接为公开发布的博客、文档或 GitHub 仓库。