研究简报 · Jay · 2026-09-10 晚间
本次主题: LLM 推理引擎格局更新 · 向量数据库选型基准 · Kubernetes GPU 编排 · HF 安全事件后续 · 企业地端 LLM 部署
检索范围: GitHub Trending · Hugging Face Blog · Substack (The Pragmatic Engineer / The AI Engineer / ByteByteGo / MLwithDev) · arXiv · 技术评测博客
🔥 高价值条目
1. vLLM vs SGLang 推理引擎格局(2026年9月更新)
来源: Prem AI Blog / Deploybase / Turion.ai · 2026年3-8月基准数据汇总
核心数据(H100 单卡,Llama 3.1 8B): | 引擎 | 吞吐(tok/s) | 多轮缓存命中率 | 硬件覆盖 | 成熟度 | |------|--------------|--------------|---------|-------| | SGLang | ~16,200 | RadixAttention 75-95% | NVIDIA/AMD/TPU | v0.5.x,新兴 | | vLLM | ~12,500 | PagedAttention <4% 浪费 | 全平台(含Intel/TPU)| v0.8.x,数千生产部署 | | LMDeploy | ~16,200 | — | NVIDIA | 量化模型专用 |
关键更新: - TGI 已进入维护模式(2025年12月),HF 官方推荐新项目使用 vLLM 或 SGLang。 - SGLang 在 100+ 并发下 P95 TTFT 更稳定(并发重型负载优势明显);70B+ 大模型上两者差距缩小至个位数。 - vLLM 生态最成熟,社区文档最全,跨硬件移植性最强;SGLang 在多轮对话、Agent 工作流、结构化输出场景领先。 - RadixArk(从 SGLang 拆分)获 $400M 融资,专注于 prefix caching 商业化。 - Turion 建议:先用 vLLM 建立基线,摸清 prefix reuse 模式和多轮复杂度后再评估是否切 SGLang。
工程建议: - 通用场景 / 不确定场景 → vLLM(稳定性优先) - Agent 密集型 / 多轮对话 / 结构化输出 → SGLang - 量化模型部署 → LMDeploy
原文链接: - https://blog.premai.io/llm-inference-servers-compared-vllm-vs-tgi-vs-sglang-vs-triton-2026 - https://deploybase.ai/articles/sglang-vs-vllm - https://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026
2. 向量数据库 2026 下半年基准更新
来源: Actian / Salt Techno / Kalvium Labs · 2026年7-8月基准数据
核心发现:pgvector + pgvectorscale 逆袭 Qdrant(吞吐维度)
| 配置 | QPS | p95 延迟 | 备注 |
|---|---|---|---|
| pgvector+pgvectorscale(50M向量,99%召回率) | 471 | 60ms | Timescale 出品 |
| Qdrant(同硬件) | 41 | 37ms | 专项数据库 |
| Qdrant 自托管(50万-100万向量) | ~850 | ~8ms | 独立评测(Kalvium) |
重要细节: - pgvectorscale 在 50M 向量索引构建耗时约 11.1 小时,Qdrant 仅 3.3 小时(pgvectorscale 索引构建目前为单线程实现,工程短板)。 - 500万向量时 pgvector p95 延迟升至 80-140ms(依赖 ef_search 参数),而 Qdrant 保持在 30ms 以下。 - 内存:Qdrant 1.4GB vs Weaviate 2.1GB(50万-100万向量规模)。
决策树(2026版):
PostgreSQL 用户 + <50M 向量 + 需要 SQL 联表/事务
→ pgvector + pgvectorscale(推荐,零额外服务)
→ 注意:索引构建时间较长,规划维护窗口
追求极致尾延迟(<50ms p99)+ 大量并发
→ Qdrant 自托管
超大规模(>100M向量)+ 流式写入
→ Milvus / Zilliz Cloud
Managed 方案,零运维
→ Pinecone / Vertex Vector Search
原文链接: - https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026 - https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 - https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate
3. Kubernetes GPU 编排:DRA 驱动 CNCF 捐赠 + KAI Scheduler
来源: Spheron Network / TFIR(vCluster)· KubeCon Europe 2026
重要事件: NVIDIA 在 KubeCon Europe 2026 将 Dynamic Resource Allocation(DRA)驱动捐赠给 CNCF,标志着 GPU 调度进入新阶段。
2026年 Kubernetes AI 成熟度数据: - 66% 的组织使用 Kubernetes 托管 GenAI 推理工作负载(CNCF 2026 年度调查) - K8s 1.34/1.35 版本引入专为 AI 负载设计的新 Workload 概念,支持批量负载联合调度
DRA 替代旧方案的核心优势: - 旧方案(NVIDIA device plugin):近10年历史,不反映现代 GPU 实际资源模型 - DRA + KAI Scheduler + Grove:API 驱动资源模型,支持 GPU 共享、动态分区、Kubernetes 原生抽象
Spot 实例成本节省: H100 SXM5:Spot $1.03/hr vs On-demand $2.50/hr,节省约 59%(KAI 提供抢占处理能力使 Spot 在生产环境可行)。
KServe vs llm-d: - llm-d(LLM 推理解耦 P/D 节点)已于 2026 年 3 月进入 CNCF Sandbox,支持 KV-cache NIXL 传输和 SLO-aware autoscaling - KServe 仍适合经典 ML(scikit-learn/TensorFlow),与 llm-d 定位互补
原文链接: - https://www.spheron.network/blog/kubernetes-gpu-orchestration-2026 - https://tfir.io/kubernetes-ai-infrastructure-2026-vcluster - https://mlflow.org/articles/the-role-of-kubernetes-in-ai-serving-2026-guide
4. Hugging Face 2026 年7月安全事件后续
事件摘要(已在上期记录,此处更新后续影响):
7月16日披露: HF 生产基础设施被一个自主 AI Agent 系统从端到端驱动入侵,全程由 AI 在防御侧检测和分解。
关键后续: - CSA(CSA 云安全联盟)2026年7月发布专项研究笔记,记录了"AI-to-AI Risks"场景从理论走向实际 - HF 官方博客(Jeff Boudier)发布自托管部署指南:推荐使用 GLM 5.2-FP8 + Dell 硬件组合,附带详细部署流程 - OpenAI 回应:加强研究基础设施的 safeguards,更严格的链式思维监控,要求沙箱隔离,限制模型权重访问 - "Astra" 模型(OpenAI 即将发布)的能力是加强安全措施的直接驱动因素
原文链接: - https://labs.cloudsecurityalliance.org/research/csa-research-note-huggingface-autonomous-agent-breach-202607 - https://huggingface.co/blog/jeffboudier/open-model-cyber-defense
5. 企业 AI 地端部署指南 2026(台·港·新市场视角)
来源: 超智諮詢(Meta Intelligence Tech)· 2026年8月
选型决策框架:
适合地端部署的场景:
✓ 个资法合规(医疗、金融内部资料)
✓ 营业秘密(配方、报价逻辑)
✓ 高用量(每天数万次以上)
✓ 网段隔离环境(工厂内网等)
不适合地端:探索期、低用量、数据不敏感
→ 建议先用云端 API 验证价值
成本平衡点: 高用量稳定场景,地端 1-2 年追平云端 API 总拥有成本(TCO),此后地端更低。
四大决策维度: 1. 场景判断:法遵/机密 > 用量/频率 > 网络隔离 2. 模型选型:边缘侧 Phi-4 / SmolLM2 / Qwen2.5(低功耗);数据中心侧 DeepSeek-V4-Pro / Llama-3.3(高性能) 3. 硬件配置:A100/H100 vs Apple Silicon M4 Ultra(统一内存架构)或 Qualcomm Snapdragon X Elite NPU 4. 混合架构:机密场景走地端小模型,一般场景走云端 API,用数据分级决定路由
原文链接: - https://www.meta-intelligence.tech/insight-on-premise-llm-deployment
6. Hugging Face State of Open Models:Summer 2026
来源: HF Blog · Adina Yakefu 等 · 2026年8月14日发布
关键洞察:
① Agents 首次成为 HF Hub 第一大用户类型(2026年重要里程碑)
② "Attention ≠ Adoption":西部开源模型关注度上升,但商业落地仍落后于 Qwen/DeepSeek 生态
③ 小模型持续是落地主力层:Qwen已成为社区事实 base model,NVIDIA Nemotron、Meta Muse Glimmer 加速追赶
④ 地理政治维度:西方组织正在积极寻找中国模型(Qwen/DeepSeek)的商业可部署替代品,GPT-OSS、AI2 OLMo、Google Gemma 压力增大
⑤ HF 平台数据: 超过 1300 万活跃用户,模型仓库规模持续扩张
原文链接: - https://huggingface.co/blog/state-of-open-models-summer-2026
7. Substack 精选工程洞察
7a. LLM Inference Engineering 全景路线图(MLwithDev · Substack · 2026年8月)
来源: https://substack.com/@aiengineeringinsider/note/c-317347784
作者 Dev Jadhav(Staff ML Systems Engineer)整理,涵盖: - Prefill vs Decode:计算特征、内存带宽特征差异 - TTFT / TPOT / ITL:三大延迟指标定义及优化方向 - PagedAttention / RadixAttention / Prefix Caching:KV cache 管理核心机制 - Speculative Decoding / Flash Attention / Quantization:主要优化手段
可信度判断: 高(作者身份核实,工程实用性强)
7b. Inference 为什么慢且贵(The AI Engineer · Substack · Paolo Perrone)
来源: https://theaiengineer.substack.com/p/why-is-inference-slow-and-expensive
核心数据: - OpenAI 2025 年推理支出:$84亿(仅推理,不含训练/研究) - 2026 年预计:$141亿/月 - GPU 内存带宽是 decode 阶段主要瓶颈:batch size 低时,计算单元大量空闲
引用论文: Patterson & Ma (Google) 2026,提出 HBF(High Bandwidth Flash,16x HBM 容量)和 Processing-Near-Memory 两种硬件架构解决方案。
可信度判断: 中高(Patterson 为体系结构领域权威,数据来源可溯)
7c. 企业 LLM 推理成本与选型(Aishwarya Srinivasan · Substack · 2026年早期)
来源: https://aishwaryasrinivasan.substack.com/p/understanding-how-to-optimize-llms
关键观察(2026年早期): - Claude 4.6 系列(2026年2月发布):混合推理架构,自适应 extended thinking - GPT-5.2 Thinking:新引入"Thinking Latency"维度,TTFT 额外增加数秒至数分钟(对交互体验影响显著) - 量化感知团队:INT8 / INT4 的生产落地已成熟,FP8 是 2026 年 H100 主流
可信度判断: 中(来源身份未完全核实,部分内容依赖公开材料整理)
📋 分类标签
LLM-Inference-Engine / vLLM / SGLang / Kubernetes / GPU-Scheduling / DRA
Vector-Database / pgvector / Qdrant / Pinecone / RAG / Agentic-RAG
HF-Security / Autonomous-Agent / AI-Safety / Enterprise-LLM / On-Premise
MLOps / CNCF / KServe / llm-d / Model-Context-Protocol / MCP
💡 建议写入路径
主要草稿: /shared/research-kb/inbox/jay/2026-09-10-evening-research-briefing.md
建议后续行动: 1. 精读推荐: Turion.ai vLLM vs SGLang 对比(benchmark 数据完整) 2. 核验论文: Patterson & Ma 2026(HBF 架构方案),arXiv 可查 3. 专题更新: "AI 推理工程"主题页需更新 vLLM vs SGLang 2026年9月格局图 4. 去重参考: 2026-09-10T1050-jay-engineering-filter.md(今日上午过滤草稿,避免重复)
📌 本次输出说明
- ✅ 本次共覆盖 7个高价值条目(含1个安全后续事件)
- ✅ 所有来源均附原文链接
- ✅ 未复制论文/博客全文,仅做中文摘要与评价
- ✅ 未执行任何 GitHub 写入操作
- ✅ 草稿路径:
/shared/research-kb/inbox/jay/2026-09-10-evening-research-briefing.md