研究简报:AI 工程・GitHub Trending・HF 生态・推理引擎・KV Cache

Jay · 2026-10-10 09:35 (Asia/Shanghai)


检索范围

  • GitHub Trending(chipuyen/awesome-llm-repos、GitHub Topics: llm-inference)
  • Hugging Face(Trending Models、Datasets 里程碑、HF Blog)
  • arXiv(Inference Systems、KV Cache 优化)
  • Substack(state-of-mlops、nextbigteng、jamwithai、theaiengineer)
  • 技术博客(vLLM vs SGLang 对比、推理引擎横向评测)

推理引擎 & 部署

Repo Stars 最近更新 亮点
vllm-project/vllm — — PagedAttention,OpenAI 兼容 API,Blackwell 原生支持
ollama/ollama 182,296 Oct 6, 2026 支持 Kimi/GLM/MiniMax/DeepSeek/Qwen/Gemma,本地推理一键运行
NVIDIA/TensorRT-LLM 14,764 Oct 6, 2026 生产级推理,优化 NVIDIA GPU 流水线
huggingface/candle 21,139 Oct 5, 2026 Rust 实现极简 ML 框架,适合嵌入式/性能敏感场景
mistralai/mistral.rs — — 高性能 Rust 推理库
SillyTavern/SillyTavern — — LLM UI 前端,支持多后端

ML 工程工具

Repo Stars 最近更新 亮点
stas00/ml-engineering 19,309 Oct 5, 2026 ML 工程开源书,工程实践深度好
ColossalAI/ColossalAI 41,438 Oct 5, 2026 分布式训练&推理,降低大模型成本
LocalAI/LocalAI 49,405 Oct 6, 2026 本地推理引擎,CPU 友好,多模态
embeddings-benchmark/mteb 3,446 Oct 5, 2026 嵌入模型评测 SOTA,多语言多模态基准
open-compass/opencompass — — 开源模型评测平台

Agent 相关

Repo Stars 最近更新 亮点
NousResearch/hermes-agent — — 可成长的 Agent 框架
Significant-Gravitas/AutoGPT — — 经典 Agent 项目
mlabonne/llm-course — — LLM 学习课程

可信度: ★★★★★(官方活跃 Repo,均有近期提交) 引用: - chiphuyen/cool-llm-repos: https://github.com/stars/chiphuyen/lists/cool-llm-repos - GitHub Topics llm-inference: https://github.com/topics/llm-inference


2. Hugging Face 生态动态(2026-10)

里程碑

  • HF Hub 突破 100 万公开数据集(2026-05-12 官方公告)
  • Hub 现拥有 240 万+模型、100 万+数据集、~100 万 Spaces
模型 下载量(30天) 亮点
nvidia/Qwen3.6-35B-A3B-NVFP4 6.7M NVIDIA FP4 量化,专为 H 系列优化
prism-ml/Ternary-Bonsai-2-27B-gguf 3.7M 三进制量化,1-bit LLM 变体
deepseek-ai/DeepSeek-V4-Flash-0731 4.5M DeepSeek 高效变体
deepseek-ai/DeepSeek-V4-Pro 441K Pro 版本高性能
Qwen/Qwen3-Coder-Next 596K Qwen 代码专项

HF Blog 重要报告

  • State of Open Source on Hugging Face: Spring 2026
  • 生态高度集中:前 200 个模型占全部下载量 49.6%
  • 模型数量接近翻倍,用户达 1300 万
  • 引用:https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
  1. Ultralytics YOLO26 — 统一实时端到端视觉模型,NMS-free,多任务(检测/分割/姿态)
  2. AI Agent Harness 自适应设计 — 跨域 Long-horizon Agent 的 Harness 自动构建

可信度: ★★★★★ 引用: HF Models 页面、HF Papers trending


3. 推理引擎横向对比(2026-10 实测数据)

核心结论

引擎 高并发吞吐 TTFT(中位数) 成本(50并发) 最适场景
vLLM 3,688 tok/s 0.68s $0.26/M 通用生产、Blackwell 支持、Eagle3 推测解码
SGLang 3,617 tok/s 0.73s $0.27/M 前缀复用多轮 Agent、RAG、结构化输出
TensorRT-LLM 3,219 tok/s 0.54s $0.30/M 最低 TTFT,NVIDIA 优化最深
llama.cpp 703 tok/s 0.98s $1.38/M CPU/本地推理,无 GPU 场景
Ollama 277 tok/s 1.7s $3.50/M 最易用,本地快速原型

SGLang vs vLLM 详细数据(来源:Spheron Blog,Jun 2026)

  • 唯一 prompt 批处理:两者差距 <4%(在误差范围内)
  • 前缀复用场景(>60% 重叠):SGLang 领先可达 5x(原始 LMSYS 数据,第三方未完全复现)
  • 结构化输出/多轮 Agent:SGLang RadixAttention 优势明显
  • 生产部署建议:
  • 选 vLLM:最广模型支持、Blackwell 原生、Eagle3 推测解码
  • 选 SGLang:多轮 Agent、RAG、前缀复用高、AMD 生态

LMDeploy 补充

  • H100 上实测:~16,200 tok/s(最快)
  • vLLM H100:~12,500 tok/s(LMDeploy 快 29%)
  • 适合量化模型+约束硬件场景

可信度: ★★★★☆(第三方实测,数据较新) 引用: - https://www.spheron.network/blog/vllm-vs-sglang-2026 - https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison


4. KV Cache 研究动态(arXiv 2026)

重要论文

🔴 高价值:OSDI 2026 — KV Cache Disaggregation

  • "An Internet for the KV Cache" (arXiv:2608.01526, Aug 2026)
  • 核心观点:KV Cache 正从"推理优化技巧"演变为存储/通信/调度基础原语
  • 提出:跨模型共享 KV Cache、持久化存储、跨引擎暴露接口
  • 引用项目:LMCache、TensorRT、NVIDIA Dynamo、llm-d
  • 评价: 基础设施层面重新思考,方向性意义重大,需跟踪

🟡 中高价值:KV Cache Optimization Survey(arXiv:2603.20397,Mar 2026)

  • ACL 2026 相关工作
  • 系统梳理五类 KV Cache 优化方向: 1. Cache Eviction(缓存淘汰) 2. Cache Compression(压缩) 3. Hybrid Memory(混合内存) 4. Novel Attention(新型注意力) 5. Combination Strategies(组合策略)
  • Q-Hitter:基于量化的稀疏 KV Cache 方案
  • 评价: 综述全面,适合建立技术地图

🟡 中高价值:LMCache(arXiv:2510.09665,Oct 2025)

  • 首个生产级 KV Cache 层
  • 核心接口:extract KV → store → reload on demand
  • 支持分布式持久化和传输
  • 已成为行业事实标准(被 vLLM/SGLang/TensorRT 引用)
  • 评价: 工程价值高,生产必知

🟡 学术:Online Scheduling for KV Cache Constraints(MIT,Jan 2026)

  • 形式化模型:在线 batching + KV Cache 约束调度
  • 提出 MC-SF 算法,常数竞争比
  • 评价: 理论深度强,工程落地需转化

可信度: ★★★★☆ 引用: Awesome-KV-Cache-Optimization(GitHub,ACL 2026 相关):https://github.com/jjiantong/Awesome-KV-Cache-Optimization


5. Substack 高价值条目

🔴 state-of-mlops weekly(Jun 2026)

  • 专栏:每周 MLOps OSS 推荐
  • 亮点内容:
  • "A Guide to AI Inference Engineering"(Jun 16, 2026)— 实践性强
  • CoT Monitoring 安全问题分析(Stanford)
  • Andrew Ng 论 AI Agent 未来(Interrupt 26)
  • 可信度: ★★★★☆
  • 引用: https://stateofmlops.substack.com/p/state-of-mlops-2026jun29

🟡 nextbigteng — "AI Infrastructure Roadmap: Five Frontiers for 2026"

  • 核心洞察:
  • 推理取代训练成为算力消耗中心
  • 推理基础设施五前沿:1) 模型部署/推理优化 2) Agent 调度 3) Edge 推理 4) 成本优化 5) 可观测性
  • 专门提到:LMCache(TensorMesh)、SGLang 路由(RadixArk)、vLLM 优化(Inferact)
  • 可信度: ★★★★☆
  • 引用: https://nextbigteng.substack.com/p/ai-infrastructure-roadmap-five-frontiers-for-2026

🟡 theaiengineer — "Should You Self-Host LLM Inference?"

  • 关键数据:
  • MLOps 工程师年薪 ~16 万美元(美国市场)
  • 混合部署节省 40-70% 成本
  • 敏感高频任务本地,复杂推理任务调用 API
  • 可信度: ★★★☆☆(博客文章,观点性)
  • 引用: https://theaiengineer.substack.com/p/should-you-self-host-inference

🟢 jamwithai — Agent Memory 专题

  • 7 类 Agent Memory 分类(区别于 RAG/向量数据库)
  • 实践指南:什么该记、记多久、什么时候遗忘
  • 可信度: ★★★★☆
  • 引用: https://jamwithai.substack.com/archive

分类标签

推理引擎 vLLM SGLang KVCache GitHub-Trending HuggingFace MLOps AI-Agent 量化 部署 Benchmark


建议写入路径

/shared/research-kb/inbox/jay/2026-10-10-ai-engineering-trending-oct.md

后续行动建议

  1. 精读:「An Internet for the KV Cache」(OSDI 2026) — 基础设施范式转变
  2. 跟踪:SGLang v0.5.x 更新日志,关注 RadixAttention 新特性
  3. 核实:vLLM Blackwell 官方支持进度(TensorRT-LLM 对比数据)
  4. 审稿:本文档建议发布前由有推理引擎生产经验者审阅

Jay · 2026-10-10 · 知识库草稿