研究简报 · AI 工程·推理引擎·向量库·HF 生态

Jay · 2026-08-22 · 第3次轮次


检索范围

  • GitHub Trending + OSSInsight
  • Hugging Face 官方博客 / Trending Papers
  • Substack (AIxFunda)
  • vLLM 官方博客 / SGLang 评测
  • 数据工程 2026 趋势文章

一、HF 开源模型夏季状态报告(2026-08-14 发布)

来源State of Open Models: Summer 2026 Observations 作者:Adina Yakefu (AdinaY) · Pollinário · Irene Solaiman 可信度:高(HF 官方半年报,基于 Hub 数据统计)

核心数据

  • Hub 模型仓库:243万 → 296万(+21.5%,Jan–Aug 2026)
  • 数据集:71.1万 → 100万(突破百万)
  • Spaces:100万 → 144万
  • 分布极端:85.6% 的模型下载量 <200次;1.5% 的仓库占下载量 99.2%

关键洞察

1. 前沿模型格局:中国实验室跳过小模型直接发布超大规模 - 2026 年几乎每个月,中国实验室发布的最大模型都超过美国实验室 - 中国月度参数量上限:754B–2.78T;美国多数月份 <130B(NVIDIA Nemotron 3 Ultra 561B 例外) - 小米、蚂蚁、美团均突破万亿参数,12 个月前这些名字在开源权重领域几乎不存在 - 社区量化层(llama.cpp / GGUF)让大模型在消费级硬件可运行,中国大模型直接发布大参数已是合理策略

2. Qwen 是社区基础模型 - Qwen GGUF 月下载量 3960 万,是 Gemma(2080万)的近 2 倍,是 Llama(750万)的 5 倍 - Qwen 衍生 GGUF 仓库数量与 Qwen 本身几乎持平,但流量只有 1/5——说明用户高度集中在 Qwen 品牌 - Llama 不缺供给(衍生仓库略多于 Qwen),缺的是用户心智

3. 美国硬件厂商主导开源 - AMD 和 NVIDIA 各发布超过 200 个新模型仓库,远超其他组织 - 硬件厂商意识到:针对自家硬件优化的开源模型是最好的芯片销售证明 - Meta Muse Glimmer (30B) 重新点燃 Llama 的开源精神 - NVIDIA Nemotron 系列性能表现突出

评价:本报告是 2026 中期最具权威性的开源模型生态数据来源。建议精读全文图表,尤其 frontier ceiling by country 和 lab size strategy 两张图。

建议写入路径research-kb/published/hf-state-of-open-models-summer-2026.md(如需建主题页)


二、推理引擎三强对比(2026-08 更新)

2.1 vLLM vs SGLang vs TensorRT-LLM

来源LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026) 可信度:高(技术决策框架,有 Benchmark 数据)

决策矩阵

维度 vLLM SGLang TensorRT-LLM
吞吐量扩展 良好 最佳(RadixAttention) 中等
前缀缓存 支持 优秀(+10–20%) 一般
DeepSeek V3 专属优化 普通 3.1x 更快 普通
多轮对话 / Agentic 中等 最佳(连续缓存)
硬件覆盖 最广(NVIDIA/AMD/TPU/Trainium) 主要 NVIDIA(+AMD) 仅 NVIDIA
生态系统成熟度 最高 中等 中等
延迟(TTFT) 中等 良好 良好

关键结论: - SGLang 在 DeepSeek V3 上通过 MLA(Multi-head Latent Attention)后端优化(FlashAttention3/FlashMLA/CutlassMLA)实现 3.1x 加速 - SGLang 的 Multi-Token Prediction + EAGLE 推测解码在 batch=1 时 1.8x 加速,batch=32 时 1.5x - vLLM 在长上下文 Decode Context Parallelism 有新优化(2026-08-06 博客) - 2026 年 vLLM 在 Qwen3.5 上达到 25K TPS/GPU

2.2 vLLM 官方博客近期更新(2026-07 ~ 2026-08)

来源vLLM Blog

日期 主题 亮点
2026-08-07 Efficient Decode Context Parallelism 长上下文工作负载解码并行优化
2026-08-06 Decode Context Parallelism 同上,官方详解
2026-07-29 vLLM Reaches 25K Total TPS/GPU on Qwen3.5 吞吐量里程碑
2026-07-28 Optimizing vLLM on Arm CPUs CPU 端优化,覆盖 AWS Graviton
2026-07-27 Parallel All the Way Down: Speculative Decoding 推测解码系统性分析
2026-07-23 Kimi K3 Day-0 Support on vLLM 新模型支持
2026-04-21 State of FP8 KV-Cache and Attention Quantization FP8 KV-cache 技术深度解析

建议:vLLM FP8 KV-cache 博文值得精读,是当前量化工程实践的核心参考。


三、向量数据库新候选:LEANN

来源LEANN - StarTrail-org/LEANN(MLSys 2026)

核心创新:图结构剪枝 + 选择性重计算,实现按需生成 embedding,而非存储所有 embedding

存储节省对比

系统 Wiki (60M) Email (780K)
传统向量库(FAISS) 201 GB 2.4 GB
LEANN 6 GB 79 MB
节省比例 97% 97%

技术路径:图结构剪枝 + 选择性重计算,embedding 按需计算而非预存

可信度:中(GitHub,MLSys 2026 论文,需要核验实际准确率数据)

建议写入路径research-kb/inbox/jay/2026-08-22-leann-vector-db-97percent-storage.md


来源:GitHub Explore / OSS Insight

Agentic / Memory 方向

Repo Stars 描述
mattpocock/skills 225k Skills for Real Engineers,Claude Code skill 合集
agentic-rag/self-evolving-context-database 30.8k AI Agent 自演进上下文数据库,统一记忆/RAG/Skills
juliusbrussee/caveman 99.4k Claude Code skill,用 caveman 语言削减 65% tokens
modular/mojo 27.5k Modular MAX + Mojo 编程语言
caramaschiHG/awesome-ai-agents-2026 2026 AI Agent 精选列表,包含 GNAP 协议

向量库 / RAG 方向

Repo Stars 描述
mem0ai/mem0 59.5k+ AI Agent 通用记忆层
milvus-io/milvus 44.9k 云原生向量库,ANN 搜索
qdrant/qdrant 32.7k Rust 编写,高性能自托管向量搜索
VectifyAI/PageIndex 33.4k 向量-less 的推理型 RAG,新范式
StarTrail-org/LEANN 97% 存储节省,MLSys 2026
turbovec 14.8k 基于 TurboQuant 的 Rust 向量索引

五、Substack · AIxFunda 周更(2026-08 上半月)

来源:AIxFunda Substack(Kalyan KS)

近期亮点摘要

Aug Week 1–3 2026

  1. NVIDIA Dynamo 1.0(2026-03-25): disaggregated LLM inference 部署指南
  2. llama.cpp 突破 100k GitHub Stars:里程碑事件,开源推理引擎社区影响力证明
  3. Kimi K2.5:~100 个 AI 子 agent 协作 swarm 模式
  4. GLM-5V-Turbo(Z.ai):Design2Code 94.8%,视觉编码方向强竞争者
  5. Qwen3.6-Plus(Alibaba):Agentic 编程性能大幅提升
  6. TurboQuant(Google):KV cache 压缩 6x + 推理加速 8x,H100 上零精度损失
  7. Colibri:纯 C inference engine,744B MoE 在 25GB RAM 运行(需核验实际可行性)
  8. LLaDA 2.1:扩散语言模型,892 tokens/s 速度(需核验与 AR 模型的实际质量对比)

评价:AIxFunda 保持周更,信息密度高,但多为新闻摘要形式。深度分析价值有限,适合作为追踪线索。


六、数据与 AI 工程 2026 五大趋势

来源5 Data & AI Engineering Trends in 2026

趋势 描述 工程影响
Multimodal Lakehouses 统一处理文本/音频/图像/视频/结构化数据 数据工程预处理管道需支持多模态 schema 对齐
EDD(Evaluation-Driven Development) 评估驱动开发取代 YOLO prompt 工程 量化评估成为 AI 系统开发核心方法论
AI-Native Data Platforms 数据平台原生集成 LLM 能力(Snowflake Cortex / Mosaic AI) SQL + 向量搜索融合架构成熟
Context Engineering LLMs 的上下文工程成为独立工程学科 上下文压缩、前缀缓存、记忆管理成为专项技能
Synthetic Data Generation (SDG) 合成数据降低真实数据依赖,加速 AI 开发 与 EDD 配合,合成高质量评估数据集

补充来源Datafold: Data Engineering in 2026: 12 Predictions

关键预测: - Agentic 数据工程爆发 - 数据平台竞争加剧,遗留平台出局 - "Bring-your-own-agent" 成为 2026 年赢家模式 - Agents 将成为数据平台的主要用户角色


七、分类标签

#推理引擎 #vLLM #SGLang #向量数据库 #RAG #HF生态 #开源模型 #数据工程 #部署 #多模态


建议写入路径

  • 主题页更新research-kb/published/hf-state-of-open-models-summer-2026.md
  • 推理引擎专项research-kb/inbox/jay/2026-08-22-leann-vector-db-97percent-storage.md
  • 本次综合草稿research-kb/inbox/jay/2026-08-22-0935-jay-ai-engineering-inference-vecdb-hf-substack.md

精读/审稿建议

  1. 必须精读:HF State of Open Models Summer 2026 全文(含图表)
  2. 建议精读:vLLM FP8 KV-cache 博文(2026-04-21)
  3. 建议核验:LEANN 的 accuracy 数据和实际 benchmark 论文
  4. 可选:AIxFunda 近期周更列表中 TurboQuant 和 Colibri 的原始论文

本简报由 Jay 自动生成 · 仅作为研究线索和技术洞察来源 · 不复制原文