研究草稿 · 2026-09-30

主题

LLM 推理引擎格局 · 分布式推理调度 · 向量数据库选型动态


一、LLM 推理引擎格局(2026 Q3)

1.1 TGI 退场,vLLM / SGLang / LMDeploy 三足鼎立

  • HuggingFace TGI 已正式进入维护模式(只接受 minor bug fix PR),官方建议新部署迁移至 vLLM 或 SGLang。
  • 2026 年主导三大开源推理引擎:
引擎 核心优势 适用场景
vLLM PagedAttention + continuous batching;最成熟生态;OpenAI 兼容 API 通用生产部署;独立请求为主的工作负载
SGLang RadixAttention 实现前缀复用;多轮对话/Agent 工作负载领先 29% 共享 system prompt + 短用户轮次;prefix-heavy 流量
LMDeploy 量化模型推理速度最优;TurboMind 引擎 受限硬件上的 INT4/INT8 部署

Benchmark 参考(H100 80GB,单卡): - SGLang 在 prefix-heavy 流量(LLaMA 3.1 8B)下达 ~16,200 tok/s,vLLM ~12,500 tok/s,差距约 29%。 - 独立请求场景下,二者差距缩小至 1–4%。 - 生产选型建议:先评估请求前缀共享比例,高则 SGLang,否则选 vLLM(生态更成熟)。

来源: - vLLM vs SGLang vs LMDeploy benchmark 分析(premai.io, 2026) - The AI Engineer Substack:TGI 维护模式公告 - Spheron Blog:H100 对比(2026)


1.2 NVIDIA Dynamo 1.0:数据中心级推理调度 OS

发布信息:2026 年 3 月 GTC GA,Apache 2.0,GitHub: ai-dynamo/dynamo

定位:推理编排层,不替代 SGLang / TensorRT-LLM / vLLM,而是将它们协调为多节点统一推理系统。

核心能力: - Disaggregated serving(Prefill-Decode 分离) - KV-aware intelligent routing - Multi-tier KV caching - ModelExpress weight streaming(模型启动快 7x) - Planner autoscaling

Benchmark 结果: | 场景 | 提升 | |------|------| | DeepSeek R1 on GB200 NVL72 吞吐量 | 7x vs B200 不用 Dynamo | | DeepSeek R1 on GB300 NVL72 吞吐量 | 750x(InferenceXv2) | | 模型冷启动 | 7x 加速 | | TTFT(首个 token 时间) | 2x 加速(Qwen3-Coder 480B) | | SLA 违约率 | 减少 80%(TCO 降低 5%) |

生态集成:AWS、Azure、Google Cloud、OCI 均已集成;SGLang、TensorRT-LLM、vLLM 全部支持。

可信度判断:⭐⭐⭐⭐⭐(NVIDIA 官方 GTC 发布 + 真实 benchmark 数据;注意自测数据需独立验证)

后续行动:建议跟进 Dynamo 与 SGLang 的 PD-disaggregation 集成细节,以及与 Mooncake 的对比。


1.3 Mooncake:Kimi 的推理服务平台 & PD Disaggregation

GitHub:kvcache-ai/Mooncake(Moonshot AI)

关键动态(2026): - Mooncake Transfer Engine 集成进入 TensorRT-LLM(KVCache 传输,PD 分离场景) - SGLang EPD(Encode-Prefill-Decode)Disaggregation 基于 Mooncake,解耦 ViT encoder 与 LLM 节点,跨机零拷贝传输 multimodal embedding - vLLM-Omni 支持 MooncakeStoreConnector 和 MooncakeTransferEngineConnector(多节点 omni-modality) - 2026 年 2 月正式加入 PyTorch Ecosystem

可信度判断:⭐⭐⭐⭐(PyTorch 官方合作公告;生产级 KIMI 流量验证)


二、向量数据库选型动态(2026)

2.1 pgvector 正在压缩专用向量数据库市场

关键趋势:传统关系型数据库(PostgreSQL/MySQL)全面集成向量能力,≤1亿向量场景下 pgvector 已可替代专用方案。

pgvector 关键数据: - pgvectorscale benchmark:471 QPS @ 99% recall(50M 向量),对比 Qdrant 41 QPS - 支持 HNSW + IVFFlat 索引;混合搜索(向量 + 全文 tsvector)已为 2025-2026 生产最佳实践 - 10M–50M 向量区间:pgvector 是工程成本最低选项(一个数据库搞定一切)

何时不用 pgvector: - 规模 > 100M 向量 → 选 Milvus(超大规模)、Qdrant(自托管性能优先) - 需 sub-50ms p99 延迟 + 全托管 → Pinecone - 强多租户隔离 + BM25 混合搜索 → Weaviate

2026 年生产级向量 DB 必备 7 项能力:hybrid search、元数据过滤、可扩展索引、多租户隔离、快照与复制、可观测性、embedding 灵活性(支持换 provider)

来源:DEV Community(actiandev)、Groovyweb、Firecrawl.dev、Tessell(2026)


三、Substack 高价值条目

3.1 Gergely Orosz — "What is Inference Engineering?"

链接:https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering 核心观点:2026 年 AI 系统最大工程挑战已从"训练模型"转向"高效推理";inference engineering 成为独立专业方向。 可信度:⭐⭐⭐⭐(Pragmatic Engineer,专注大型科技公司工程实践) 后续行动:可作为主题页「AI 工程」的定义性引用来源。

3.2 The AI Engineer — "LLM Serving 2026: Engine Comparison"

链接:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt 核心观点:LLM serving engine 分四派(local-first、production serving、hardware-optimized、orchestration),TGI 退场代表一个时代终结,vLLM 正在成为新默认。 可信度:⭐⭐⭐⭐(专注 AI engineer 群体,内容偏实践) 后续行动:可作为 Engine 选型决策树引用。

3.3 Eric Roby — "The 2026 AI Agent Stack"

链接:https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from 核心观点:Agent stack ≠ LLM stack;model routing(用小模型处理简单任务)已成 2026 生产标配,可显著降成本同时保质量。 可信度:⭐⭐⭐(实践向,但偏向整理而非原创研究)

3.4 CSDN — "2026年AI落地实战:本地部署、Agent与AI编程"

链接:https://bbs.csdn.net/weixin_29044713/article/details/100356077 核心观点:Agent 工程四大坑(执行循环无上限、权限无隔离、上下文膨胀、无可观测性);AI编程工作流(先写测试再实现功能);多Agent 协作的收敛问题。 可信度:⭐⭐⭐(实战经验,有具体案例;非学术级但工程参考价值高) 后续行动:可提炼为「Agent 工程最佳实践」检查清单。


四、AI 后端 & 部署栈动态

4.1 Railway MCP Server(2026 新特性)

Railway 推出 MCP server,Claude/Cursor 等 MCP 兼容 Agent 可直接创建项目、管理环境变量、触发部署、读取日志,无需 dashboard 操作。 意义:AI Agent 的 infrastructure-as-code 能力进入 SaaS 平台;agent-driven 部署工作流成为现实。 来源:Railway Blog(2026)

4.2 Fly.io + pgvector

Managed Postgres(pgvector)+ Valkey KV + Preview Environments + autoscaling,适合需要持久化 + 向量能力但不想管 k8s 的团队。

4.3 平台工程视角(Martin Reynolds, 2026)

"Platform engineering is the operating model for the AI era";AI 加速了代码交付量,平台团队职责是重新设计"装配线",避免开发团队被淹没。 来源:ODSC YouTube


标签

LLM-inference vLLM SGLang NVIDIA-Dynamo Mooncake vector-DB pgvector AI-engineering backend deployment


建议写入路径

/shared/research-kb/inbox/jay/2026-09-30-llm-inference-vector-db.md

是否需要精读/审稿

  • 精读:NVIDIA Dynamo GitHub README + Dynamo 1.0 官方 benchmark 原文(用于主题页「分布式推理调度」章节)
  • 审稿:pgvector vs Qdrant benchmark 数据(注意来源为 pgvectorscale 官方,存在自测偏差)
  • 主题页更新建议:「AI 工程 / LLM 推理引擎选型」和「向量数据库选型」两个子主题页建议在 Q4 前更新