Jay 研究知识库草稿 · 2026-09-26 下午
主题:LLM 推理引擎选型决策框架 + 向量数据库生产 RAG 决策矩阵 + HF 开放生态动态
一、LLM 推理引擎 2026:三足鼎立决策框架
来源: - Inference Engineering Tech — vLLM vs SGLang vs TensorRT-LLM(2026-06 更新) - DeployBase — Best LLM Inference Engines 2026 - AIMultiple — LLM Inference Engines: vLLM vs LMDeploy vs SGLang(2026-04,实测基准) - Spheron — LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang(2026-08)
核心实测数据(H100,Llama 3.1 8B / 3.3 70B)
| 指标 | SGLang | vLLM | TensorRT-LLM | TGI | llama.cpp |
|---|---|---|---|---|---|
| 吞吐量(tok/s) | ~16,200 | ~12,500 | 编译后最优 | 较低 | 最低 |
| TTFT(ms) | 80 | 150 | 150 | 250 | 800 |
| 前缀缓存收益 | RadixAttention,+29% | 支持 | 不适用 | 不适用 | 不适用 |
| 结构化输出 | 约束解码集成调度层 | 需外部 | 需外部 | 基础 | 不支持 |
| 多轮/Agent负载 | 最佳 | 良好 | 一般 | 一般 | 差 |
| MoE/大并发 | EP+RadixAttention最优 | 良好 | 良好 | 一般 | 差 |
| 硬件覆盖 | NVIDIA为主 | NVIDIA+AMD ROCm+TPU+Intel Gaudi | 仅NVIDIA | NVIDIA | 全平台 |
决策树(inferenceengineering.tech 2026-06)
你的工作负载是?
├─ 多轮对话 / Agent / 共享系统前缀
│ └─ SGLang(RadixAttention 前缀复用,+29% 吞吐)
├─ 大型 MoE 模型 / 高并发
│ └─ SGLang(EP + RadixAttention 组合最优)
├─ 稳定大流量 NVIDIA 部署 / 有工程带宽维护编译管线
│ └─ TensorRT-LLM(编译后峰值最优)
└─ 其他 80% 场景
└─ vLLM(pip install,400+ 模型,开箱即用)
AIMultiple 实测关键结论(2026-04): - SGLang vs vLLM 在前缀密集型工作负载差距约 29%;独立请求场景两者差距 1-4% - TensorRT-LLM 编译后性能最优,但维护成本最高 - 不要基于合成基准做选择:用真实流量 profiling 后再迁移
量化收益: prefix caching 在 100 并发、每日百万请求场景下,SGLang 相比 vLLM 月省 GPU 费用约 $15,000
NVIDIA Dynamo 1.0(2026-06): 解耦式 LLM 推理架构,支持 Prefill/Decode 分离部署,是 2026 高吞吐场景的新选项
评价
Inference Engineering 的决策框架是目前最实用的工程视角总结。强调"不要基于合成基准优化",这对生产决策有重要警示意义。Benchmark 数据来自 H100 5,980 请求实测,可信度高。
建议: 可精读原文,结合团队实际流量特征做选型验证。
二、向量数据库生产 RAG 决策矩阵 2026
来源: - Engineers Guide(Zenith AI Substack)— Best vector databases for production RAG in 2026(2026-06,10M 向量基准) - AlphaCorp — Best Vector Databases for RAG 2026: Top 7 Picks - Braintrust — Best vector databases for RAG in 2026 - GroovyWeb — Top 10 AI Vector Databases in 2026 - Medium — Top 15 Vector Databases in 2026: A Production Decision Guide
生产 RAG 决策矩阵(Engineers Guide 2026-06)
| 场景 | 推荐 | 理由 |
|---|---|---|
| MVP / <500万向量 | pgvector | 无新增系统,集成现有 Postgres,单机可达生产级 |
| 生产 RAG / 需弹性扩缩 | Pinecone | Serverless 架构,零运维,SLA 保障,p50 ~4.2ms |
| 混合检索(向量+关键词) | Weaviate | 原生混合检索,GraphQL,Multi-tenant 隔离 |
| 复杂元数据过滤 / 边缘部署 | Qdrant | Rust 实现,强过滤性能,开源可控 |
| 100M+ 向量 / on-prem | Milvus / Zilliz Cloud | 分布式,向量规模最大 |
| 已有 Elasticsearch 栈 | Elasticsearch | 向量插件,适合遗留系统迁移 |
关键生产陷阱(Engineers Guide 2026)
- 混合检索必须是原生支持,不能是插件拼接——否则延迟不可控
- 预过滤(pre-filtering)要选单阶段,否则低选择性查询时延迟爆炸
- "开源"实际成本 = 3x HA 副本 + 闲置容量 + DevOps 人力,managed 有时更便宜
- Pinecone 2026 新增:sparse-dense hybrid、namespace quotas、inference layer(embedding 模型共置)
2026 向量数据库五大趋势
- learned sparse retrieval 成默认
- quantization 从研究进入生产
- multi-vector records 成一级公民
- in-place re-embedding 成基线
- embedded 向量引擎抢占边缘场景
评价
Engineers Guide 的 10M 向量基准测试方法论值得参考,区分了 ingestion vs query 的 tradeoff,并附了开源可复现的测试脚本。决策矩阵针对不同规模阶段给出明确推荐,有实战价值。
三、Hugging Face 开放生态动态:Spring 2026
来源: Hugging Face 官方博客 — State of Open Source on Hugging Face: Spring 2026
关键数据
- 下载模型平均参数量:2023年 827M → 2025年 20.8B(主要驱动力:量化 + MoE)
- 但中位数仅从 326M → 406M,说明小模型使用量稳定,大模型拉高了均值
- 地区分布:美中领先,英德法次之;无明确地理归属的社区模型贡献约一半下载量
- 韩国国家主权 AI 计划(2025 中启动):命名 LG AI Research、SK Telecom、Naver Cloud 等为国家级模型,2026 年 2 月三个韩国模型同时登上 HF Trending
- 硬件多样化:NVIDIA 主导但 AMD ROCm 支持持续扩展;阿里等中国厂商针对国产芯片做开源模型显式优化
评价
这是 Hugging Face 官方发布的系统性生态报告,数据权威。模型规模两极分化趋势值得关注——大多数实际部署仍在中小参数区间,"大即是好"的叙事与实际使用存在落差。
四、Substack 高价值专栏
4.1 AI Engineering Insider — From Software Engineer to AI Engineer: The Complete Roadmap
作者: AI Engineering Insider(Substack) 发布时间: 持续更新,2026
核心观点摘要: 软件工程师转型 AI 工程师的 2026 路线图,核心栈: - RAG: Embeddings + Vector DB + BM25 + Reranking - Agents: LangGraph / ADK / native tool calling / MCP - Backend: FastAPI + PostgreSQL + Redis - Infrastructure: Docker + Kubernetes + Cloud
Portfolio 项目建议: 1. Production RAG:FastAPI + Hybrid Retrieval + Reranking + Vector DB + Evaluation + Observability 2. Agentic System:Planner → Executor → Tools → Verifier → Memory(含轨迹评估) 3. LLM Evaluation Platform
评价: 路线图覆盖面广但偏入门,对已有基础的工程师参考价值有限。Portfolio 项目设计有参考性,可借鉴评估指标设计。
链接: https://aiengineeringinsider.substack.com/p/from-software-engineer-to-ai-engineer
4.2 state-of-mlops weekly — state-of-mlops 2026.Jun.1
作者: state-of-mlops(Substack,周更) 发布时间: 2026-06-01
本期精选: - Building self-improving tax agents with Codex — OpenAI,2026-05-27,Practice - What Held Up at 3 AM: One Engineer's RAG Case Study — Comet,2026-05-20,Practice - The Best AI Observability Tools for Agentic Systems in 2026 — Comet,2026-05-27,Review - The Agent Harness: Why the LLM Is the Smallest Part of Your Agent System — MongoDB,2026-05-11,Blog - DeepSWE — Benchmark,2026-05-26
核心洞察:
Agent 系统的评估重点从模型能力转向 harness 质量——LLM 只是最小部分,真实生产瓶颈在 orchestrator、tool interface 和 memory 管理。
评价: state-of-mlops 的周更精选质量稳定,每个条目附公司/标签分类,便于按需追踪。"What Held Up at 3 AM" 这类实战复盘文章对工程团队有直接参考价值。
链接: https://stateofmlops.substack.com/p/state-of-mlops-2026jun1
4.3 Zenith AI — Best vector databases for production RAG in 2026: Performance and cost guide
作者: Aditya Somani,Zenith AI Substack 发布时间: 2026
TL;DR: - pgvector 适合 MVP(<500-1000万向量) - Pinecone 适合生产 RAG(serverless + 低运维) - Milvus/Weaviate 适合 on-prem/气隙环境 - Qdrant 适合复杂过滤/边缘 - Elasticsearch 适合已有关键词检索栈的团队
评价: 与 Engineers Guide 结论高度一致,可交叉印证。
五、GitHub Trending 与新兴 Repo
本期值得关注的 Repo
| Repo | Stars | 类型 | 亮点 |
|---|---|---|---|
| nanochat (Andrej Karpathy) | ~57.5K | LLM 全流程教学 | 从 tokenization → pretraining → finetuning → 推理 → UI 全链路透明,适合学习而非生产 |
| Bumblebee (Perplexity AI) | 新兴 | 供应链安全 | 扫描依赖/MCP server/编辑器扩展中的可疑包,Read-only,生产集成安全基线 |
| codebase-memory-mcp | ~32K | AI Agent Memory | 为 AI Agent 提供持久化代码库上下文记忆 |
| mattpocock/skills | ~269K | AI Engineer 技能集 | Matt Pocock 的 .agents 目录分享,Real Engineers 风格 |
| dream-num/univer | 高 | 办公套件 | 多功能办公套件,AI 集成 |
注意: kelseyhightower/kubernetes-the-hard-way 仍在 trending(~50K stars),说明 K8s 基础仍有持续关注度。
六、分类标签
LLM推理 vLLM SGLang TensorRT-LLM 向量数据库 RAG Pinecone Qdrant pgvector HuggingFace Substack AI Engineering MLOps Agent 生产部署 Benchmark
建议写入路径
/shared/research-kb/inbox/jay/2026-09-26-1735-jay-inference-vecdb-substack-hf-trending.md
是否需要精读 / 审稿 / 主题页更新
- 精读建议: Inference Engineering 的 vLLM vs SGLang vs TRT-LLM 决策框架原文(工程实操价值高);Engineers Guide 向量库基准测试方法论部分
- 审稿建议: 可将"LLM 推理引擎选型"和"向量数据库生产决策"合并为一个主题页,适合长期维护
- 主题页更新候选: 新建
LLM-Inference-Engineering主题页(或更新现有),合并推理引擎选型、KV Cache、NVIDIA Dynamo 等内容