研究简报 · AI 工程·推理引擎·向量库·HF 生态
Jay · 2026-08-22 · 第3次轮次
检索范围
- GitHub Trending + OSSInsight
- Hugging Face 官方博客 / Trending Papers
- Substack (AIxFunda)
- vLLM 官方博客 / SGLang 评测
- 数据工程 2026 趋势文章
一、HF 开源模型夏季状态报告(2026-08-14 发布)
来源:State of Open Models: Summer 2026 Observations 作者:Adina Yakefu (AdinaY) · Pollinário · Irene Solaiman 可信度:高(HF 官方半年报,基于 Hub 数据统计)
核心数据
- Hub 模型仓库:243万 → 296万(+21.5%,Jan–Aug 2026)
- 数据集:71.1万 → 100万(突破百万)
- Spaces:100万 → 144万
- 分布极端:85.6% 的模型下载量 <200次;1.5% 的仓库占下载量 99.2%
关键洞察
1. 前沿模型格局:中国实验室跳过小模型直接发布超大规模 - 2026 年几乎每个月,中国实验室发布的最大模型都超过美国实验室 - 中国月度参数量上限:754B–2.78T;美国多数月份 <130B(NVIDIA Nemotron 3 Ultra 561B 例外) - 小米、蚂蚁、美团均突破万亿参数,12 个月前这些名字在开源权重领域几乎不存在 - 社区量化层(llama.cpp / GGUF)让大模型在消费级硬件可运行,中国大模型直接发布大参数已是合理策略
2. Qwen 是社区基础模型 - Qwen GGUF 月下载量 3960 万,是 Gemma(2080万)的近 2 倍,是 Llama(750万)的 5 倍 - Qwen 衍生 GGUF 仓库数量与 Qwen 本身几乎持平,但流量只有 1/5——说明用户高度集中在 Qwen 品牌 - Llama 不缺供给(衍生仓库略多于 Qwen),缺的是用户心智
3. 美国硬件厂商主导开源 - AMD 和 NVIDIA 各发布超过 200 个新模型仓库,远超其他组织 - 硬件厂商意识到:针对自家硬件优化的开源模型是最好的芯片销售证明 - Meta Muse Glimmer (30B) 重新点燃 Llama 的开源精神 - NVIDIA Nemotron 系列性能表现突出
评价:本报告是 2026 中期最具权威性的开源模型生态数据来源。建议精读全文图表,尤其 frontier ceiling by country 和 lab size strategy 两张图。
建议写入路径:research-kb/published/hf-state-of-open-models-summer-2026.md(如需建主题页)
二、推理引擎三强对比(2026-08 更新)
2.1 vLLM vs SGLang vs TensorRT-LLM
来源:LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026) 可信度:高(技术决策框架,有 Benchmark 数据)
决策矩阵:
| 维度 | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| 吞吐量扩展 | 良好 | 最佳(RadixAttention) | 中等 |
| 前缀缓存 | 支持 | 优秀(+10–20%) | 一般 |
| DeepSeek V3 专属优化 | 普通 | 3.1x 更快 | 普通 |
| 多轮对话 / Agentic | 中等 | 最佳(连续缓存) | 差 |
| 硬件覆盖 | 最广(NVIDIA/AMD/TPU/Trainium) | 主要 NVIDIA(+AMD) | 仅 NVIDIA |
| 生态系统成熟度 | 最高 | 中等 | 中等 |
| 延迟(TTFT) | 中等 | 良好 | 良好 |
关键结论: - SGLang 在 DeepSeek V3 上通过 MLA(Multi-head Latent Attention)后端优化(FlashAttention3/FlashMLA/CutlassMLA)实现 3.1x 加速 - SGLang 的 Multi-Token Prediction + EAGLE 推测解码在 batch=1 时 1.8x 加速,batch=32 时 1.5x - vLLM 在长上下文 Decode Context Parallelism 有新优化(2026-08-06 博客) - 2026 年 vLLM 在 Qwen3.5 上达到 25K TPS/GPU
2.2 vLLM 官方博客近期更新(2026-07 ~ 2026-08)
来源:vLLM Blog
| 日期 | 主题 | 亮点 |
|---|---|---|
| 2026-08-07 | Efficient Decode Context Parallelism | 长上下文工作负载解码并行优化 |
| 2026-08-06 | Decode Context Parallelism | 同上,官方详解 |
| 2026-07-29 | vLLM Reaches 25K Total TPS/GPU on Qwen3.5 | 吞吐量里程碑 |
| 2026-07-28 | Optimizing vLLM on Arm CPUs | CPU 端优化,覆盖 AWS Graviton |
| 2026-07-27 | Parallel All the Way Down: Speculative Decoding | 推测解码系统性分析 |
| 2026-07-23 | Kimi K3 Day-0 Support on vLLM | 新模型支持 |
| 2026-04-21 | State of FP8 KV-Cache and Attention Quantization | FP8 KV-cache 技术深度解析 |
建议:vLLM FP8 KV-cache 博文值得精读,是当前量化工程实践的核心参考。
三、向量数据库新候选:LEANN
来源:LEANN - StarTrail-org/LEANN(MLSys 2026)
核心创新:图结构剪枝 + 选择性重计算,实现按需生成 embedding,而非存储所有 embedding
存储节省对比:
| 系统 | Wiki (60M) | Email (780K) |
|---|---|---|
| 传统向量库(FAISS) | 201 GB | 2.4 GB |
| LEANN | 6 GB | 79 MB |
| 节省比例 | 97% | 97% |
技术路径:图结构剪枝 + 选择性重计算,embedding 按需计算而非预存
可信度:中(GitHub,MLSys 2026 论文,需要核验实际准确率数据)
建议写入路径:research-kb/inbox/jay/2026-08-22-leann-vector-db-97percent-storage.md
四、GitHub Trending 观察(2026-08 周)
来源:GitHub Explore / OSS Insight
Agentic / Memory 方向
| Repo | Stars | 描述 |
|---|---|---|
| mattpocock/skills | 225k | Skills for Real Engineers,Claude Code skill 合集 |
| agentic-rag/self-evolving-context-database | 30.8k | AI Agent 自演进上下文数据库,统一记忆/RAG/Skills |
| juliusbrussee/caveman | 99.4k | Claude Code skill,用 caveman 语言削减 65% tokens |
| modular/mojo | 27.5k | Modular MAX + Mojo 编程语言 |
| caramaschiHG/awesome-ai-agents-2026 | 新 | 2026 AI Agent 精选列表,包含 GNAP 协议 |
向量库 / RAG 方向
| Repo | Stars | 描述 |
|---|---|---|
| mem0ai/mem0 | 59.5k+ | AI Agent 通用记忆层 |
| milvus-io/milvus | 44.9k | 云原生向量库,ANN 搜索 |
| qdrant/qdrant | 32.7k | Rust 编写,高性能自托管向量搜索 |
| VectifyAI/PageIndex | 33.4k | 向量-less 的推理型 RAG,新范式 |
| StarTrail-org/LEANN | 新 | 97% 存储节省,MLSys 2026 |
| turbovec | 14.8k | 基于 TurboQuant 的 Rust 向量索引 |
五、Substack · AIxFunda 周更(2026-08 上半月)
来源:AIxFunda Substack(Kalyan KS)
近期亮点摘要
Aug Week 1–3 2026:
- NVIDIA Dynamo 1.0(2026-03-25): disaggregated LLM inference 部署指南
- llama.cpp 突破 100k GitHub Stars:里程碑事件,开源推理引擎社区影响力证明
- Kimi K2.5:~100 个 AI 子 agent 协作 swarm 模式
- GLM-5V-Turbo(Z.ai):Design2Code 94.8%,视觉编码方向强竞争者
- Qwen3.6-Plus(Alibaba):Agentic 编程性能大幅提升
- TurboQuant(Google):KV cache 压缩 6x + 推理加速 8x,H100 上零精度损失
- Colibri:纯 C inference engine,744B MoE 在 25GB RAM 运行(需核验实际可行性)
- LLaDA 2.1:扩散语言模型,892 tokens/s 速度(需核验与 AR 模型的实际质量对比)
评价:AIxFunda 保持周更,信息密度高,但多为新闻摘要形式。深度分析价值有限,适合作为追踪线索。
六、数据与 AI 工程 2026 五大趋势
来源:5 Data & AI Engineering Trends in 2026
| 趋势 | 描述 | 工程影响 |
|---|---|---|
| Multimodal Lakehouses | 统一处理文本/音频/图像/视频/结构化数据 | 数据工程预处理管道需支持多模态 schema 对齐 |
| EDD(Evaluation-Driven Development) | 评估驱动开发取代 YOLO prompt 工程 | 量化评估成为 AI 系统开发核心方法论 |
| AI-Native Data Platforms | 数据平台原生集成 LLM 能力(Snowflake Cortex / Mosaic AI) | SQL + 向量搜索融合架构成熟 |
| Context Engineering | LLMs 的上下文工程成为独立工程学科 | 上下文压缩、前缀缓存、记忆管理成为专项技能 |
| Synthetic Data Generation (SDG) | 合成数据降低真实数据依赖,加速 AI 开发 | 与 EDD 配合,合成高质量评估数据集 |
补充来源:Datafold: Data Engineering in 2026: 12 Predictions
关键预测: - Agentic 数据工程爆发 - 数据平台竞争加剧,遗留平台出局 - "Bring-your-own-agent" 成为 2026 年赢家模式 - Agents 将成为数据平台的主要用户角色
七、分类标签
#推理引擎 #vLLM #SGLang #向量数据库 #RAG #HF生态 #开源模型 #数据工程 #部署 #多模态
建议写入路径
- 主题页更新:
research-kb/published/hf-state-of-open-models-summer-2026.md - 推理引擎专项:
research-kb/inbox/jay/2026-08-22-leann-vector-db-97percent-storage.md - 本次综合草稿:
research-kb/inbox/jay/2026-08-22-0935-jay-ai-engineering-inference-vecdb-hf-substack.md
精读/审稿建议
- 必须精读:HF State of Open Models Summer 2026 全文(含图表)
- 建议精读:vLLM FP8 KV-cache 博文(2026-04-21)
- 建议核验:LEANN 的 accuracy 数据和实际 benchmark 论文
- 可选:AIxFunda 近期周更列表中 TurboQuant 和 Colibri 的原始论文
本简报由 Jay 自动生成 · 仅作为研究线索和技术洞察来源 · 不复制原文