Jay 研究知识库草稿 · 2026-09-26 下午

主题:LLM 推理引擎选型决策框架 + 向量数据库生产 RAG 决策矩阵 + HF 开放生态动态


一、LLM 推理引擎 2026:三足鼎立决策框架

来源: - Inference Engineering Tech — vLLM vs SGLang vs TensorRT-LLM(2026-06 更新) - DeployBase — Best LLM Inference Engines 2026 - AIMultiple — LLM Inference Engines: vLLM vs LMDeploy vs SGLang(2026-04,实测基准) - Spheron — LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang(2026-08)

核心实测数据(H100,Llama 3.1 8B / 3.3 70B)

指标 SGLang vLLM TensorRT-LLM TGI llama.cpp
吞吐量(tok/s) ~16,200 ~12,500 编译后最优 较低 最低
TTFT(ms) 80 150 150 250 800
前缀缓存收益 RadixAttention,+29% 支持 不适用 不适用 不适用
结构化输出 约束解码集成调度层 需外部 需外部 基础 不支持
多轮/Agent负载 最佳 良好 一般 一般 差
MoE/大并发 EP+RadixAttention最优 良好 良好 一般 差
硬件覆盖 NVIDIA为主 NVIDIA+AMD ROCm+TPU+Intel Gaudi 仅NVIDIA NVIDIA 全平台

决策树(inferenceengineering.tech 2026-06)

你的工作负载是?
├─ 多轮对话 / Agent / 共享系统前缀
│   └─ SGLang(RadixAttention 前缀复用,+29% 吞吐)
├─ 大型 MoE 模型 / 高并发
│   └─ SGLang(EP + RadixAttention 组合最优)
├─ 稳定大流量 NVIDIA 部署 / 有工程带宽维护编译管线
│   └─ TensorRT-LLM(编译后峰值最优)
└─ 其他 80% 场景
    └─ vLLM(pip install,400+ 模型,开箱即用)

AIMultiple 实测关键结论(2026-04): - SGLang vs vLLM 在前缀密集型工作负载差距约 29%;独立请求场景两者差距 1-4% - TensorRT-LLM 编译后性能最优,但维护成本最高 - 不要基于合成基准做选择:用真实流量 profiling 后再迁移

量化收益: prefix caching 在 100 并发、每日百万请求场景下,SGLang 相比 vLLM 月省 GPU 费用约 $15,000

NVIDIA Dynamo 1.0(2026-06): 解耦式 LLM 推理架构,支持 Prefill/Decode 分离部署,是 2026 高吞吐场景的新选项

评价

Inference Engineering 的决策框架是目前最实用的工程视角总结。强调"不要基于合成基准优化",这对生产决策有重要警示意义。Benchmark 数据来自 H100 5,980 请求实测,可信度高。

建议: 可精读原文,结合团队实际流量特征做选型验证。


二、向量数据库生产 RAG 决策矩阵 2026

来源: - Engineers Guide(Zenith AI Substack)— Best vector databases for production RAG in 2026(2026-06,10M 向量基准) - AlphaCorp — Best Vector Databases for RAG 2026: Top 7 Picks - Braintrust — Best vector databases for RAG in 2026 - GroovyWeb — Top 10 AI Vector Databases in 2026 - Medium — Top 15 Vector Databases in 2026: A Production Decision Guide

生产 RAG 决策矩阵(Engineers Guide 2026-06)

场景 推荐 理由
MVP / <500万向量 pgvector 无新增系统,集成现有 Postgres,单机可达生产级
生产 RAG / 需弹性扩缩 Pinecone Serverless 架构,零运维,SLA 保障,p50 ~4.2ms
混合检索(向量+关键词) Weaviate 原生混合检索,GraphQL,Multi-tenant 隔离
复杂元数据过滤 / 边缘部署 Qdrant Rust 实现,强过滤性能,开源可控
100M+ 向量 / on-prem Milvus / Zilliz Cloud 分布式,向量规模最大
已有 Elasticsearch 栈 Elasticsearch 向量插件,适合遗留系统迁移

关键生产陷阱(Engineers Guide 2026)

  1. 混合检索必须是原生支持,不能是插件拼接——否则延迟不可控
  2. 预过滤(pre-filtering)要选单阶段,否则低选择性查询时延迟爆炸
  3. "开源"实际成本 = 3x HA 副本 + 闲置容量 + DevOps 人力,managed 有时更便宜
  4. Pinecone 2026 新增:sparse-dense hybrid、namespace quotas、inference layer(embedding 模型共置)

2026 向量数据库五大趋势

  1. learned sparse retrieval 成默认
  2. quantization 从研究进入生产
  3. multi-vector records 成一级公民
  4. in-place re-embedding 成基线
  5. embedded 向量引擎抢占边缘场景

评价

Engineers Guide 的 10M 向量基准测试方法论值得参考,区分了 ingestion vs query 的 tradeoff,并附了开源可复现的测试脚本。决策矩阵针对不同规模阶段给出明确推荐,有实战价值。


三、Hugging Face 开放生态动态:Spring 2026

来源: Hugging Face 官方博客 — State of Open Source on Hugging Face: Spring 2026

关键数据

  • 下载模型平均参数量:2023年 827M → 2025年 20.8B(主要驱动力:量化 + MoE)
  • 但中位数仅从 326M → 406M,说明小模型使用量稳定,大模型拉高了均值
  • 地区分布:美中领先,英德法次之;无明确地理归属的社区模型贡献约一半下载量
  • 韩国国家主权 AI 计划(2025 中启动):命名 LG AI Research、SK Telecom、Naver Cloud 等为国家级模型,2026 年 2 月三个韩国模型同时登上 HF Trending
  • 硬件多样化:NVIDIA 主导但 AMD ROCm 支持持续扩展;阿里等中国厂商针对国产芯片做开源模型显式优化

评价

这是 Hugging Face 官方发布的系统性生态报告,数据权威。模型规模两极分化趋势值得关注——大多数实际部署仍在中小参数区间,"大即是好"的叙事与实际使用存在落差。


四、Substack 高价值专栏

4.1 AI Engineering Insider — From Software Engineer to AI Engineer: The Complete Roadmap

作者: AI Engineering Insider(Substack) 发布时间: 持续更新,2026

核心观点摘要: 软件工程师转型 AI 工程师的 2026 路线图,核心栈: - RAG: Embeddings + Vector DB + BM25 + Reranking - Agents: LangGraph / ADK / native tool calling / MCP - Backend: FastAPI + PostgreSQL + Redis - Infrastructure: Docker + Kubernetes + Cloud

Portfolio 项目建议: 1. Production RAG:FastAPI + Hybrid Retrieval + Reranking + Vector DB + Evaluation + Observability 2. Agentic System:Planner → Executor → Tools → Verifier → Memory(含轨迹评估) 3. LLM Evaluation Platform

评价: 路线图覆盖面广但偏入门,对已有基础的工程师参考价值有限。Portfolio 项目设计有参考性,可借鉴评估指标设计。

链接: https://aiengineeringinsider.substack.com/p/from-software-engineer-to-ai-engineer

4.2 state-of-mlops weekly — state-of-mlops 2026.Jun.1

作者: state-of-mlops(Substack,周更) 发布时间: 2026-06-01

本期精选: - Building self-improving tax agents with Codex — OpenAI,2026-05-27,Practice - What Held Up at 3 AM: One Engineer's RAG Case Study — Comet,2026-05-20,Practice - The Best AI Observability Tools for Agentic Systems in 2026 — Comet,2026-05-27,Review - The Agent Harness: Why the LLM Is the Smallest Part of Your Agent System — MongoDB,2026-05-11,Blog - DeepSWE — Benchmark,2026-05-26

核心洞察:

Agent 系统的评估重点从模型能力转向 harness 质量——LLM 只是最小部分,真实生产瓶颈在 orchestrator、tool interface 和 memory 管理。

评价: state-of-mlops 的周更精选质量稳定,每个条目附公司/标签分类,便于按需追踪。"What Held Up at 3 AM" 这类实战复盘文章对工程团队有直接参考价值。

链接: https://stateofmlops.substack.com/p/state-of-mlops-2026jun1

4.3 Zenith AI — Best vector databases for production RAG in 2026: Performance and cost guide

作者: Aditya Somani,Zenith AI Substack 发布时间: 2026

TL;DR: - pgvector 适合 MVP(<500-1000万向量) - Pinecone 适合生产 RAG(serverless + 低运维) - Milvus/Weaviate 适合 on-prem/气隙环境 - Qdrant 适合复杂过滤/边缘 - Elasticsearch 适合已有关键词检索栈的团队

评价: 与 Engineers Guide 结论高度一致,可交叉印证。


本期值得关注的 Repo

Repo Stars 类型 亮点
nanochat (Andrej Karpathy) ~57.5K LLM 全流程教学 从 tokenization → pretraining → finetuning → 推理 → UI 全链路透明,适合学习而非生产
Bumblebee (Perplexity AI) 新兴 供应链安全 扫描依赖/MCP server/编辑器扩展中的可疑包,Read-only,生产集成安全基线
codebase-memory-mcp ~32K AI Agent Memory 为 AI Agent 提供持久化代码库上下文记忆
mattpocock/skills ~269K AI Engineer 技能集 Matt Pocock 的 .agents 目录分享,Real Engineers 风格
dream-num/univer 高 办公套件 多功能办公套件,AI 集成

注意: kelseyhightower/kubernetes-the-hard-way 仍在 trending(~50K stars),说明 K8s 基础仍有持续关注度。


六、分类标签

LLM推理 vLLM SGLang TensorRT-LLM 向量数据库 RAG Pinecone Qdrant pgvector HuggingFace Substack AI Engineering MLOps Agent 生产部署 Benchmark


建议写入路径

/shared/research-kb/inbox/jay/2026-09-26-1735-jay-inference-vecdb-substack-hf-trending.md


是否需要精读 / 审稿 / 主题页更新

  • 精读建议: Inference Engineering 的 vLLM vs SGLang vs TRT-LLM 决策框架原文(工程实操价值高);Engineers Guide 向量库基准测试方法论部分
  • 审稿建议: 可将"LLM 推理引擎选型"和"向量数据库生产决策"合并为一个主题页,适合长期维护
  • 主题页更新候选: 新建 LLM-Inference-Engineering 主题页(或更新现有),合并推理引擎选型、KV Cache、NVIDIA Dynamo 等内容