Jay 晚间研究简报 · 2026-09-24
本次主题
推理引擎格局变化 + HF 生态更新 + Vector DB 架构趋势
一、TGI 正式进入维护模式(高优先级)
来源: Hugging Face 官方,TGI README 更新于 2026-09-05
原文: https://huggingface.co/blog/state-of-open-models-summer-2026(间接确认)
补充来源: TensorMesh blog,https://www.tensormesh.ai/learn/vllm-vs-sglang(2026-09-15 发布)
核心事实
- 2026-09-05 TGI README 更新:仅接受小 bug 修复和文档更新,不再接受新功能
- Hugging Face 官方推荐迁移目标:vLLM 和 SGLang
- llama.cpp / MLX 作为本地/轻量场景备选
- TGI 维护状态不设终止日期
工程影响评估
| 维度 | TGI | vLLM | SGLang |
|---|---|---|---|
| 新功能开发 | ❌ 冻结 | ✅ 活跃 | ✅ 活跃 |
| 社区规模 | 萎缩 | 最大 | 快速增长 |
| Agent 共享上下文 | 弱 | 中 | 强(RadixAttention) |
| 前缀缓存 | 基础 | ✅ | ✅(原生) |
| 产 300+ GPU 部署 | 少 | 多 | 快速增长 |
| 推荐场景 | 遗留系统 | 通用生产 | Agent 多轮/结构化输出 |
建议: 还在用 TGI 的团队优先评估 vLLM MRv2;Agent 密集型负载(多轮对话、RAG 流水线、结构化输出)优先考虑 SGLang。
后续行动: - [ ] 精读 vLLM MRv2(Model Runner v2)release notes,确认 GPU-native Triton kernel 迁移细节 - [ ] 对比 SGLang RadixAttention 在 prefix caching 场景 vs vLLM PagedAttention 的实测差异
二、Hugging Face State of Open Models: Summer 2026(重要)
来源: https://huggingface.co/blog/state-of-open-models-summer-2026
发布时间: 2026年夏(精确日期需核验论文元数据)
关键数据点
| 指标 | 数值 | 备注 |
|---|---|---|
| Public models | 300 万+ | 2026-08-03 突破 296 万,08-18 破 300 万 |
| Public datasets | 100 万+ | CEO 披露于 2025-07 |
| Spaces | 144 万+ | 2026 年中 |
| 用户数 | 1300 万+ | 2025 年数据,持续增长 |
| 总下载量 | 454 亿次 | 截至 2025-10 |
模型发布者格局
- 硬件厂商主导发布: AMD 和 NVIDIA 各发布 200+ 新模型仓库,远超其他厂商
- LiquidAI 第三,约 100 个仓库
- 战略逻辑: 硬件厂商用开源模型证明芯片能力(买硬件送模型优化)
下载集中度
- Top 200 模型(占总量 0.01%)占总下载量 49.6%
- ~50% 的模型终身下载量 <200 次
- 模型数量爆炸但实际使用极度集中
本次报告新出现的模型
- Meta 的 Muse-Glimmer-30B(meta-models/Muse-Glimmer-30B)
- Moonshot 的 Kimi-K3(moonshotai/Kimi-K3)
- sentence-transformers 经典小模型仍活跃
可信度: 高(Hugging Face 官方博客,引用 HF Hub API 数据)
后续行动: - [ ] 核验 Kimi-K3 在 HF 的具体架构和基准数据 - [ ] 关注 AMD/NVIDIA 硬件优化模型的部署适配(ROCm/CUDA 差异)
三、HF 9月下载榜单(2026-09-18 快照)
来源: https://www.digitalapplied.com/blog/most-downloaded-open-ai-models-hugging-face-september-2026
发布: 2026-09-17(数据采集 2026-09-18)
30天下载量排行(按家族)
| 排名 | 模型家族 | 30天下载量 | 仓库数 |
|---|---|---|---|
| 1 | Qwen | 240.1M | 36 个 |
| 2 | Gemma | 32.6M | 6 个 |
| 3 | Ornith | 13.5M | 3 个 |
| 4 | Llama | 12.9M | 2 个 |
| 5 | gpt-oss | 11.9M | 2 个 |
| 6 | OTel | 7.4M | 1 个 |
| 7 | Yi | 4.8M | 1 个 |
| 8 | DeepSeek | 4.4M | 1 个 |
分析: Qwen 家族以 240M 下载量压倒性领先,是第二名 Gemma(32.6M)的 7.4 倍。gpt-oss(开源 GPT 类项目)进入前五值得关注。DeepSeek(4.4M)排名第 8,与 Qwen 有数量级差距。
可信度: 高(HF Hub API 查询结果)
四、vLLM vs SGLang 2026 深度对比(9月更新)
来源: 多篇 2026-09 月发布的技术对比文章
- https://www.tensormesh.ai/learn/vllm-vs-sglang(TensorMesh,2026-09-15)
- https://deploybase.ai/articles/best-llm-inference-engine
- https://atomic.chat/blog/llm-updates/sglang-vs-vllm
基准数据(H100, Llama 3.1 8B, 1000 ShareGPT prompts)
| 引擎 | 吞吐量 | TTFT p50 | 状态 |
|---|---|---|---|
| SGLang | 16,215 tok/s | 4-21ms | 活跃开发 |
| LMDeploy | 16,132 tok/s | ~25ms | 活跃 |
| vLLM | 12,553 tok/s | 50-80ms | 活跃开发 |
| TensorRT-LLM | 10,000+ tok/s | 35-50ms | 活跃开发 |
| TGI | ~9,500 tok/s | ~60ms | 维护模式 |
| llama.cpp | ~6,000 tok/s | ~80ms | 活跃开发 |
关键架构差异
SGLang 优势场景:
1. 多轮 Agent 共享上下文:RadixAttention 原生支持跨请求的 KV cache 复用,TTFT 显著低于 vLLM
2. 结构化输出密集型应用:函数抽象(chain API)将多阶段推理合并为单次调用,减少 API 跳转开销
3. Prefix-heavy 工作负载:相同文档被多请求共享时,缓存命中后速度提升明显
vLLM MRv2(2026 新特性): - Model Runner v2 将关键路径移入 GPU-native Triton kernel,消除 CPU 瓶颈 - 零气泡异步调度(zero-bubble async scheduling)改善流水线并行效率 - 多 GPU 配置稳定性仍是行业最优
架构收敛迹象
两引擎均已支持:Continuous Batching、PagedAttention/RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving、CUDA Graphs,以及 FlashInfer/FlashAttention/DeepGEMM 等算子库。
工程建议: - 通用高并发短请求场景 → vLLM(生态成熟,硬件兼容性最佳) - Agent 多轮、RAG 流水线、结构化输出 → SGLang(RadixAttention 优势明显) - Apple Silicon → MLX(llama.cpp 补充);AMD ROCm → vLLM
后续行动: - [ ] 精读 SGLang v1.2.1 release notes(LeetLLM 引用) - [ ] 评估 vLLM MRv2 zero-bubble scheduling 实测效果
五、Vector DB 2026 趋势:pgvector 回潮 + Agentic 语义缓存
来源:
- https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo
- https://www.firecrawl.dev/blog/best-vector-databases
- https://atlan.com/know/top-vector-databases-enterprise-ai
2026 新格局
- pgvector + pgvectorscale:PostgreSQL 生态继续扩张,适合 <100M 向量、已有 Postgres 基础设施的团队;迭代索引扫描(iterative index scan)改善过滤查询召回率
- Chroma 对象存储 GA:S3/GCS 后端 + 查询感知分层,冷集合不再占用 RAM;collection forking(A/B 测试 embedding/chunking 策略)生产可用
- Pinecone Inference:内置 embedding + reranking 模型,单 API 调用替代多组件拼接;Bring Your Own Cloud(BYOC)支持数据主权需求
- 边缘/气隙场景:Actian VectorAI DB 在 Jetson、Raspberry Pi、工业边缘服务器上支持 1,040 QPS / 1M 向量,p99 12.7ms,完全离线运行
Agentic 时代的语义缓存新需求
传统 embedding 缓存策略演进为语义缓存: - 存储 query-answer 对,在相似计算条件下复用 - 降低延迟 + 降低推理成本 - 在高并发流量下维持吞吐量
选型决策树(2026版)
向量规模 < 100M,已有 PostgreSQL?
→ YES: pgvector + pgvectorscale(零新基础设施)
→ NO:
需要 billion-scale?
→ YES: Milvus / Zilliz Cloud(分片成熟)
→ NO:
需要完全离线/边缘?
→ YES: Actian VectorAI DB
→ NO:
强需求:内置 embedding+reranking 单 API?
→ YES: Pinecone
→ NO: Weaviate(混合搜索)/ Chroma(快速原型)
六、Substack 高价值线索
The AI Engineer(theaiengineer.substack.com)
标题: The AI Agents Stack (2026 Edition) 核心洞察: - Agent 栈 = 6 层(LLM → 推理引擎 → 协议 → 工具 → 记忆 → 编排),RAG 只是记忆层的一种实现 - "Evaluation as infrastructure" 三层收敛:PR 快速检查 / 夜间回归 LLM 判分 / 生产持续监控告警 - 新兴 Agent 专用基准:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
后续行动: [ ] 核验这三个 benchmark 的具体论文和 GitHub 地址
Gradient Flow(gradientflow.substack.com)
标题: RAG Reimagined: 5 Breakthroughs You Should Know - GraphRAG 等复杂 RAG 变体在生产中的具体落地案例 - 讨论 Block 的开源 AI Agent Goose(基于 MCP 协议),Jackie Brosamer & Brad Axen 深度解析
Learn AI Together(learnaitogethernewsletter.substack.com)
标题: LAI #137: Where AI Engineering Is Going in 2026 - Langfuse 100K 月 trace 后自托管经验(UTC 时区 bug 实录) - AI Engineer 技能路径:vibe coding → 决策层价值迁移
本次未覆盖但值得关注
- pi-mono(badlogic):AI agent toolkit monorepo(43.9k stars),包含 coding agent CLI、unified LLM API、TUI/web UI 库、vLLM pods
- Bumblebee:Perplexity 出品的供应链安全扫描工具,检查依赖、MCP server、编辑器插件可疑包
- Voicebox(GitHub trending):开源 AI voice studio,54.8k stars
分类标签
推理引擎 vLLM SGLang TGI维护 HuggingFace VectorDB pgvector RAG AgentStack 多智能体
建议写入路径
/shared/research-kb/inbox/jay/2026-09-24T1735-jay-evening-briefing-inference-vecdb-hf-stack-sep24.md
后续优先级行动
- [ ] 精读 vLLM MRv2 release notes(Triton kernel 迁移细节)
- [ ] 精读 SGLang v1.2.1 release notes
- [ ] 核验 Context-Bench / Recovery-Bench / Terminal-Bench 原论文
- [ ] 关注 TGI 维护模式的具体迁移时间线和 LTS 承诺
- [ ] 关注 Kimi-K3 和 Muse-Glimmer-30B 的 HF 基准数据
Jay · 2026-09-24T17:35 · 不执行 GitHub 写入,仅产出草稿