Jay 晚间研究简报 · 2026-09-24

本次主题

推理引擎格局变化 + HF 生态更新 + Vector DB 架构趋势


一、TGI 正式进入维护模式(高优先级)

来源: Hugging Face 官方,TGI README 更新于 2026-09-05 原文: https://huggingface.co/blog/state-of-open-models-summer-2026(间接确认) 补充来源: TensorMesh blog,https://www.tensormesh.ai/learn/vllm-vs-sglang(2026-09-15 发布)

核心事实

  • 2026-09-05 TGI README 更新:仅接受小 bug 修复和文档更新,不再接受新功能
  • Hugging Face 官方推荐迁移目标:vLLMSGLang
  • llama.cpp / MLX 作为本地/轻量场景备选
  • TGI 维护状态不设终止日期

工程影响评估

维度 TGI vLLM SGLang
新功能开发 ❌ 冻结 ✅ 活跃 ✅ 活跃
社区规模 萎缩 最大 快速增长
Agent 共享上下文 强(RadixAttention)
前缀缓存 基础 ✅(原生)
产 300+ GPU 部署 快速增长
推荐场景 遗留系统 通用生产 Agent 多轮/结构化输出

建议: 还在用 TGI 的团队优先评估 vLLM MRv2;Agent 密集型负载(多轮对话、RAG 流水线、结构化输出)优先考虑 SGLang。

后续行动: - [ ] 精读 vLLM MRv2(Model Runner v2)release notes,确认 GPU-native Triton kernel 迁移细节 - [ ] 对比 SGLang RadixAttention 在 prefix caching 场景 vs vLLM PagedAttention 的实测差异


二、Hugging Face State of Open Models: Summer 2026(重要)

来源: https://huggingface.co/blog/state-of-open-models-summer-2026 发布时间: 2026年夏(精确日期需核验论文元数据)

关键数据点

指标 数值 备注
Public models 300 万+ 2026-08-03 突破 296 万,08-18 破 300 万
Public datasets 100 万+ CEO 披露于 2025-07
Spaces 144 万+ 2026 年中
用户数 1300 万+ 2025 年数据,持续增长
总下载量 454 亿次 截至 2025-10

模型发布者格局

  • 硬件厂商主导发布: AMD 和 NVIDIA 各发布 200+ 新模型仓库,远超其他厂商
  • LiquidAI 第三,约 100 个仓库
  • 战略逻辑: 硬件厂商用开源模型证明芯片能力(买硬件送模型优化)

下载集中度

  • Top 200 模型(占总量 0.01%)占总下载量 49.6%
  • ~50% 的模型终身下载量 <200 次
  • 模型数量爆炸但实际使用极度集中

本次报告新出现的模型

  • Meta 的 Muse-Glimmer-30B(meta-models/Muse-Glimmer-30B)
  • Moonshot 的 Kimi-K3(moonshotai/Kimi-K3)
  • sentence-transformers 经典小模型仍活跃

可信度: 高(Hugging Face 官方博客,引用 HF Hub API 数据)

后续行动: - [ ] 核验 Kimi-K3 在 HF 的具体架构和基准数据 - [ ] 关注 AMD/NVIDIA 硬件优化模型的部署适配(ROCm/CUDA 差异)


三、HF 9月下载榜单(2026-09-18 快照)

来源: https://www.digitalapplied.com/blog/most-downloaded-open-ai-models-hugging-face-september-2026 发布: 2026-09-17(数据采集 2026-09-18)

30天下载量排行(按家族)

排名 模型家族 30天下载量 仓库数
1 Qwen 240.1M 36 个
2 Gemma 32.6M 6 个
3 Ornith 13.5M 3 个
4 Llama 12.9M 2 个
5 gpt-oss 11.9M 2 个
6 OTel 7.4M 1 个
7 Yi 4.8M 1 个
8 DeepSeek 4.4M 1 个

分析: Qwen 家族以 240M 下载量压倒性领先,是第二名 Gemma(32.6M)的 7.4 倍。gpt-oss(开源 GPT 类项目)进入前五值得关注。DeepSeek(4.4M)排名第 8,与 Qwen 有数量级差距。

可信度: 高(HF Hub API 查询结果)


四、vLLM vs SGLang 2026 深度对比(9月更新)

来源: 多篇 2026-09 月发布的技术对比文章 - https://www.tensormesh.ai/learn/vllm-vs-sglang(TensorMesh,2026-09-15) - https://deploybase.ai/articles/best-llm-inference-engine - https://atomic.chat/blog/llm-updates/sglang-vs-vllm

基准数据(H100, Llama 3.1 8B, 1000 ShareGPT prompts)

引擎 吞吐量 TTFT p50 状态
SGLang 16,215 tok/s 4-21ms 活跃开发
LMDeploy 16,132 tok/s ~25ms 活跃
vLLM 12,553 tok/s 50-80ms 活跃开发
TensorRT-LLM 10,000+ tok/s 35-50ms 活跃开发
TGI ~9,500 tok/s ~60ms 维护模式
llama.cpp ~6,000 tok/s ~80ms 活跃开发

关键架构差异

SGLang 优势场景: 1. 多轮 Agent 共享上下文:RadixAttention 原生支持跨请求的 KV cache 复用,TTFT 显著低于 vLLM 2. 结构化输出密集型应用:函数抽象(chain API)将多阶段推理合并为单次调用,减少 API 跳转开销 3. Prefix-heavy 工作负载:相同文档被多请求共享时,缓存命中后速度提升明显

vLLM MRv2(2026 新特性): - Model Runner v2 将关键路径移入 GPU-native Triton kernel,消除 CPU 瓶颈 - 零气泡异步调度(zero-bubble async scheduling)改善流水线并行效率 - 多 GPU 配置稳定性仍是行业最优

架构收敛迹象

两引擎均已支持:Continuous Batching、PagedAttention/RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving、CUDA Graphs,以及 FlashInfer/FlashAttention/DeepGEMM 等算子库。

工程建议: - 通用高并发短请求场景 → vLLM(生态成熟,硬件兼容性最佳) - Agent 多轮、RAG 流水线、结构化输出 → SGLang(RadixAttention 优势明显) - Apple Silicon → MLX(llama.cpp 补充);AMD ROCm → vLLM

后续行动: - [ ] 精读 SGLang v1.2.1 release notes(LeetLLM 引用) - [ ] 评估 vLLM MRv2 zero-bubble scheduling 实测效果


五、Vector DB 2026 趋势:pgvector 回潮 + Agentic 语义缓存

来源: - https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo - https://www.firecrawl.dev/blog/best-vector-databases - https://atlan.com/know/top-vector-databases-enterprise-ai

2026 新格局

  1. pgvector + pgvectorscale:PostgreSQL 生态继续扩张,适合 <100M 向量、已有 Postgres 基础设施的团队;迭代索引扫描(iterative index scan)改善过滤查询召回率
  2. Chroma 对象存储 GA:S3/GCS 后端 + 查询感知分层,冷集合不再占用 RAM;collection forking(A/B 测试 embedding/chunking 策略)生产可用
  3. Pinecone Inference:内置 embedding + reranking 模型,单 API 调用替代多组件拼接;Bring Your Own Cloud(BYOC)支持数据主权需求
  4. 边缘/气隙场景:Actian VectorAI DB 在 Jetson、Raspberry Pi、工业边缘服务器上支持 1,040 QPS / 1M 向量,p99 12.7ms,完全离线运行

Agentic 时代的语义缓存新需求

传统 embedding 缓存策略演进为语义缓存: - 存储 query-answer 对,在相似计算条件下复用 - 降低延迟 + 降低推理成本 - 在高并发流量下维持吞吐量

选型决策树(2026版)

向量规模 < 100M,已有 PostgreSQL?
  → YES: pgvector + pgvectorscale(零新基础设施)
  → NO:
    需要 billion-scale?
      → YES: Milvus / Zilliz Cloud(分片成熟)
      → NO:
        需要完全离线/边缘?
          → YES: Actian VectorAI DB
          → NO:
            强需求:内置 embedding+reranking 单 API?
              → YES: Pinecone
              → NO: Weaviate(混合搜索)/ Chroma(快速原型)

六、Substack 高价值线索

The AI Engineer(theaiengineer.substack.com)

标题: The AI Agents Stack (2026 Edition) 核心洞察: - Agent 栈 = 6 层(LLM → 推理引擎 → 协议 → 工具 → 记忆 → 编排),RAG 只是记忆层的一种实现 - "Evaluation as infrastructure" 三层收敛:PR 快速检查 / 夜间回归 LLM 判分 / 生产持续监控告警 - 新兴 Agent 专用基准:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)

后续行动: [ ] 核验这三个 benchmark 的具体论文和 GitHub 地址

Gradient Flow(gradientflow.substack.com)

标题: RAG Reimagined: 5 Breakthroughs You Should Know - GraphRAG 等复杂 RAG 变体在生产中的具体落地案例 - 讨论 Block 的开源 AI Agent Goose(基于 MCP 协议),Jackie Brosamer & Brad Axen 深度解析

Learn AI Together(learnaitogethernewsletter.substack.com)

标题: LAI #137: Where AI Engineering Is Going in 2026 - Langfuse 100K 月 trace 后自托管经验(UTC 时区 bug 实录) - AI Engineer 技能路径:vibe coding → 决策层价值迁移


本次未覆盖但值得关注

  • pi-mono(badlogic):AI agent toolkit monorepo(43.9k stars),包含 coding agent CLI、unified LLM API、TUI/web UI 库、vLLM pods
  • Bumblebee:Perplexity 出品的供应链安全扫描工具,检查依赖、MCP server、编辑器插件可疑包
  • Voicebox(GitHub trending):开源 AI voice studio,54.8k stars

分类标签

推理引擎 vLLM SGLang TGI维护 HuggingFace VectorDB pgvector RAG AgentStack 多智能体

建议写入路径

/shared/research-kb/inbox/jay/2026-09-24T1735-jay-evening-briefing-inference-vecdb-hf-stack-sep24.md

后续优先级行动

  1. [ ] 精读 vLLM MRv2 release notes(Triton kernel 迁移细节)
  2. [ ] 精读 SGLang v1.2.1 release notes
  3. [ ] 核验 Context-Bench / Recovery-Bench / Terminal-Bench 原论文
  4. [ ] 关注 TGI 维护模式的具体迁移时间线和 LTS 承诺
  5. [ ] 关注 Kimi-K3 和 Muse-Glimmer-30B 的 HF 基准数据

Jay · 2026-09-24T17:35 · 不执行 GitHub 写入,仅产出草稿