AI 工程 · 后端 · 数据库 · 部署 — 研究简报

Jay · 2026-08-20 第3次(17:35 UTC+8)


主题:AI 推理工程 / LLM 部署 / Agent 框架 / Vector DB / 后端部署平台


一、LLM 推理与部署(Inference Engineering)

核心框架格局(2026)

框架 定位 优势 适用场景
vLLM 开源事实标准 PagedAttention、连续批处理、20k+ stars、OpenAI 兼容 API 通用 LLM 服务、自托管入门
TensorRT-LLM NVIDIA 官方栈 H100/H200/B200 硬件最高吞吐 追求极致性能、有 NVIDIA 部署预算
SGLang 新兴高效框架 结构化输出优化、RadixAttention Agent 场景、结构化输出密集型
NVIDIA Dynamo 新框架 与 TRT-LLM 协同 新项目评估

关键技术栈(vLLM 为主线)

核心技术: - PagedAttention:KV Cache 管理,节省 2-4x GPU 显存 - 连续批处理(Continuous Batching):动态聚合请求,最大化 GPU 利用率 - 前缀缓存(Prefix Caching):重复系统 prompt 复用 - 投机解码(Speculative Decoding):预测+验证,降低延迟 - 分块预填充(Chunked Prefill):V1 引擎默认特性,解决内存峰值

量化支持: GPTQ、AWQ、SqueezeLLM、FP8 KV Cache、INT4/INT8

多模态: LLaVA、Qwen-VL、Pixtral(vLLM 原生支持 200+ 模型架构)

精选高价值条目

  1. vLLM 官方文档
    https://github.com/vllm-project/vllm
    - 89k stars,UC Berkeley Sky Computing Lab 起家 - 支持 Decoder-only、MoE、混合注意力(SSM/Mamba)、多模态、Embedding、Reward 模型 - 值得精读:V1 引擎架构变更、分块预填充调度逻辑

  2. flex-nano-vllm(轻量实验)
    https://github.com/changjonathanc/flex-nano-vllm
    - 基于 PyTorch FlexAttention 的极简 vLLM 风格推理引擎 - 无 flash-attn 依赖、无自定义 Triton kernel - 适合学习 PagedAttention 原理

  3. Pragmatic Engineer — 什么是推理工程
    https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
    作者:Gergely Orosz
    - AI 工程岗位定义,推理工程≠模型训练 - 适合作为团队内部 AI 工程能力矩阵参考

  4. Spheron — 2026 GPU Cloud Inference Guide
    https://www.spheron.network/blog/inference-engineering-guide-2026
    - H100 性价比最优、H200 141GB 适合大模型、B200 下代吞吐量 - GPU 选型决策框架

  5. jamwithai Substack — LLM 推理延迟 10 大技术
    https://jamwithai.substack.com/p/ml-and-llm-inference-latency-10-techniques
    作者:Shirin Khosravi
    - PagedAttention、Continuous Batching、KV Cache 量化、投机解码等逐一图解 - 推荐作为团队内部培训材料


二、AI Agent 框架格局(2026)

框架选型矩阵

框架 GitHub Stars 定位 许可证
LangChain ~134k 全栈 LLM 应用框架 MIT
Hermes Agent(Nous Research) ~140k(2026年2月发布) 自主改进型 AI Agent MIT
MetaGPT ~62k 多 Agent 软件公司模拟 MIT
AutoGen(Microsoft) ~53k 多 Agent 对话系统 CC-BY-4.0
LlamaIndex ~46k 数据密集型 RAG 应用 MIT
CrewAI ~22k 角色型团队 Agent
LangGraph ~12k 状态化图工作流 MIT
OpenAI Agents SDK ~18k OpenAI 亲儿子 MIT
Claude Agent SDK ~14k Anthropic 安全导向 MIT

重要趋势

  • Hermes Agent:2026 年现象级项目,3 个月内 140k stars,主打"自我改进"能力
  • OpenClaw:60 天内从 9k 增至 188k stars(与本实例同名巧合)
  • 多 Agent 协作:CrewAI、MetaGPT、AutoGen 形成"团队 Agent"范式
  • LangGraph:图结构工作流成为生产级 Agent 编排主流
  • n8n:拖拽式 AI 自动化,3000+ 集成,企业自托管首选

精选高价值条目

  1. Analytics Vidhya — 2026年7月 GitHub Trending AI/ML 项目
    https://www.analyticsvidhya.com/blog/2026/07/trending-ai-github-repositories
    - Agent 框架、MCP servers、AI gateways 全景图 - 主流 GenAI 模型清单(Llama 4、DeepSeek V3、Qwen 2.5 VL 等)

  2. ByteByteGo — 2026 Top AI GitHub Repos
    https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026
    - LangChain 生态深度分析、LlamaIndex vs LangChain 选型 - 本地运行趋势(Ollama)、视觉化 AI 构建(Dify/n8n)

  3. awesome-ai-agents-2026(ARUNAGIRINATHAN-K)
    https://github.com/ARUNAGIRINATHAN-K/awesome-ai-agents-2026
    - 精选合集,含 LightAgent(轻量 MCP)、Letta(长期记忆)、Haystack(生产级 RAG)

  4. Pickaxe — Top 15 AI Agent Frameworks 2026
    https://pickaxe.co/post/top-ai-agent-frameworks
    - Hermes Agent 深度介绍(Nous Research) - OpenClaw 列入表格(188k stars),与本实例同名值得关注

  5. LangChain 官方 — AI Agent Frameworks 资源页
    https://www.langchain.com/resources/ai-agent-frameworks
    - 134k stars,1000+ 预构建集成 - LlamaIndex Workflows(事件驱动)正在替代 LangChain 的一部分场景


三、Vector Database 格局(2026 RAG 基础设施)

选型决策框架

场景 推荐 理由
<10M 向量、无特殊运维 Pinecone 零运维、sub-20ms p95
开源自托管、过滤密集 Qdrant Rust 实现、4ms p50、成本最低
混合搜索(关键词+向量) Weaviate 原生 BM25+向量、2026.04 MCP Server
>100M 向量、需 GPU 加速 Milvus 唯一成熟方案、Kubernetes 原生
<50M 向量、Postgres 现有栈 pgvector 无新服务、2M 向量无需调优
本地开发、快速原型 Chroma 最简路径

关键更新

  • Weaviate v1.37(2026年4月):全球首个原生 MCP Server 的向量数据库,Agent 可直接查询/写入
  • Qdrant 1.17(2026年7月):量化效率提升、过滤性能优化
  • pgvector:22k+ stars,RAG 事实标准,MySQL 9.0 的 VECTOR 类型对比仍显初级

精选高价值条目

  1. Kalvium Labs — pgvector vs Pinecone vs Qdrant vs Weaviate 生产对比
    https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate
    - 10+ 生产系统实测:pgvector 默认首选(2M 向量无需调优) - Pinecone 5M+ 向量时 sub-20ms p95,但成本高 3-8x

  2. DEV Community — Pinecone vs Weaviate vs Milvus vs Qdrant 2026
    https://dev.to/krunalkanojiya/pinecone-vs-weaviate-vs-milvus-vs-qdrant-which-vector-db-in-2026-26dc
    - 各数据库架构图对比、过滤能力分析

  3. iternal.ai — Best Vector Databases 2026
    https://iternal.ai/insights/best-vector-databases-2026
    - 完整对比表、自托管能力评估

  4. Alphacorp — Best Vector DB for RAG 2026 Top 7
    https://alphacorp.ai/blog/best-vector-databases-for-rag-2026-top-7-picks
    - Qdrant 自托管成本最优、Weaviate 混合搜索最佳


四、后端部署平台(2026)

PaaS 选型

平台 定位 特色
Railway 全栈产品后端 Postgres/MySQL/Redis 一体化、Agent 驱动部署
Northflank 复杂生产负载 BYOC(多云 GPU)、K8s 灵活性+PaaS 简便性
Render 标准 Web 服务 managed DB、自动 SSL、background workers
Fly.io 全球低延迟 Anycast 路由、但运维成本较高

2026 后端工程师技能矩阵

  • Serverless 事件驱动:按需扩缩容,适合突发负载(电商秒杀、数据处理任务)
  • 跨领域能力:后端 + 云 + DevOps 边界模糊,DevOps 工程师薪资溢价显著
  • 性能工程:Redis 缓存、CDN、数据库索引调优、EXPLAIN ANALYZE、负载均衡
  • PostgreSQL 17/18:简单查询性能提升;MySQL 9.6 JSON Duality Views(关系-文档双视图)
  • PostgreSQL 19 Beta 2(2026-07-16):最新测试版

精选高价值条目

  1. Railway Blog — Best Cloud Deployment Platforms 2026
    https://blog.railway.com/p/best-cloud-application-deployment-platforms-2026
    - Railway 创始人自述:Vercel(纯前端)、Railway(后端+DB 全家桶)、Northflank(K8s)

  2. Northflank — Best Tools to Deploy Backends 2026
    https://northflank.com/blog/best-tools-to-deploy-backends
    - GPU 实例、AI 工作负载支持、Per-second 计费

  3. Hungry Coders — Backend Engineer Roadmap 2026
    https://www.hungrycoders.com/blog/backend-roadmap-2026-complete-guide
    - Virtual Threads(10K 并发)、PostgreSQL 索引调优、Spring AI + LLMs

  4. Platform Engineering Tools 2026
    https://platformengineering.org/blog/platform-engineering-tools-2026
    - GitOps 工作流、Humanitec/Kratix 平台编排器


五、MLOps / LLMOps 现状(2026)

核心趋势

  • LLMOps ≠ MLOps:传统 MLOps 监控预测精度/数据漂移;LLMOps 额外关注 prompt 版本化管理、幻觉监控、RAG 检索质量、护栏、成本控制
  • LLMOps 市场:2024年 $1.97B → 2028年 $4.9B(42% CAGR)
  • RAG 在 65% 的 LLM 应用职位中出现
  • EU AI Act 强制合规:2024-2027 分阶段实施,审计溯源成核心需求

工具生态

  • W&B(Weights & Biases):LLM evaluation + prompt tracking
  • Databricks:Lakehouse 上的微调流水线
  • Vertex AI GenAI Studio:Google Cloud 模型评估工具
  • MLflow:实验追踪、模型注册
  • Datatalks Club MLOps Zoomcamp:免费课程,AI Dev Tools Zoomcamp 2026 新增

精选高价值条目

  1. MLOps Zoomcamp(DataTalks.Club)
    https://datatalks.club/blog/mlops-zoomcamp.html
    - 免费课程,含 AI Dev Tools Zoomcamp 2026

  2. kernshell — MLOps Best Practices 2026
    https://www.kernshell.com/best-practices-for-scalable-machine-learning-deployment
    - LLMOps vs MLOps 区别精讲、RAG retrieval quality 监控方法

  3. MachineLearningMastery — LLMOps Roadmap 2026
    https://machinelearningmastery.com/the-roadmap-for-mastering-llmops-in-2026
    - vLLM 推理优化、护栏、RAG 流水线完整路径

  4. Winder.ai — MLOps Consulting Companies 2026
    https://winder.ai/top-mlops-consulting-companies-2026
    - LLMOps 已成为 MLOps 的自然延伸,选咨询公司标准


六、数据库领域动态

PostgreSQL 生态

  • PostgreSQL 19 Beta 2(2026-07-16):最新测试版
  • PostgreSQL 14(2026-11-12 EOS):需尽快升级
  • SynchDB 1.4:Oracle 容器数据库支持、TLS 安全 FDW 快照
  • DB-Engines 排名:PostgreSQL 唯一正增长 top-4 数据库(+6.92),MySQL 下降 94 点

MySQL 生态

  • MySQL 9.6(2026-01):JSON Duality Views(关系-文档双视图)、模块化审计日志、原子 DDL
  • MySQL 9.7.1(2026-06-16):最新稳定版
  • VECTOR 类型:MySQL 9.0 已引入,但 pgvector 生态(22k+ stars)仍主导生产 RAG

精选高价值条目

  1. Kunal Ganglani — PostgreSQL vs MySQL 2026
    https://www.kunalganglani.com/blog/postgresql-vs-mysql-2026
    - DB-Engines 分数对比、AI 功能对比、pgvector vs MySQL VECTOR

  2. DEV Community — MySQL vs PostgreSQL 7 Key Differences
    https://dev.to/piteradyson/mysql-vs-postgresql-in-2026-7-key-differences-you-should-know-before-choosing-4l9d
    - OLTP/OLAP 场景对比、MVCC、JSON 处理差异


分类标签

#LLM推理 #vLLM #TensorRT-LLM #AI-Agent #LangChain #LlamaIndex #LangGraph #CrewAI #Hermes-Agent #VectorDB #Qdrant #Weaviate #Milvus #pgvector #RAG #MLOps #LLMOps #后端部署 #Railway #Northflank #PostgreSQL19 #MySQL96 #2026技术栈


建议写入路径

/shared/research-kb/inbox/jay/2026-08-20-ai-engineering.md


后续行动建议

  1. 精读:vLLM V1 引擎架构变更文档(分块预填充调度逻辑)
  2. 审稿:Weaviate MCP Server 集成验证(首个 Agent 原生 Vector DB)
  3. 关注:PostgreSQL 19 正式版发布计划(Beta 2 已出)
  4. 跟踪:Hermes Agent(Nous Research)生产落地案例
  5. 评估:Qdrant 1.17 量化效率提升是否值得升级

本简报基于公开信息整理,仅作为研究线索,不构成技术选型建议。所有链接为公开发布的博客、文档或 GitHub 仓库。