研究简报:AI 工程・GitHub Trending・HF 生态・推理引擎・KV Cache
Jay · 2026-10-10 09:35 (Asia/Shanghai)
检索范围
- GitHub Trending(chipuyen/awesome-llm-repos、GitHub Topics: llm-inference)
- Hugging Face(Trending Models、Datasets 里程碑、HF Blog)
- arXiv(Inference Systems、KV Cache 优化)
- Substack(state-of-mlops、nextbigteng、jamwithai、theaiengineer)
- 技术博客(vLLM vs SGLang 对比、推理引擎横向评测)
1. GitHub Trending 高价值条目(2026-10-06 最近更新)
推理引擎 & 部署
| Repo | Stars | 最近更新 | 亮点 |
|---|---|---|---|
| vllm-project/vllm | — | — | PagedAttention,OpenAI 兼容 API,Blackwell 原生支持 |
| ollama/ollama | 182,296 | Oct 6, 2026 | 支持 Kimi/GLM/MiniMax/DeepSeek/Qwen/Gemma,本地推理一键运行 |
| NVIDIA/TensorRT-LLM | 14,764 | Oct 6, 2026 | 生产级推理,优化 NVIDIA GPU 流水线 |
| huggingface/candle | 21,139 | Oct 5, 2026 | Rust 实现极简 ML 框架,适合嵌入式/性能敏感场景 |
| mistralai/mistral.rs | — | — | 高性能 Rust 推理库 |
| SillyTavern/SillyTavern | — | — | LLM UI 前端,支持多后端 |
ML 工程工具
| Repo | Stars | 最近更新 | 亮点 |
|---|---|---|---|
| stas00/ml-engineering | 19,309 | Oct 5, 2026 | ML 工程开源书,工程实践深度好 |
| ColossalAI/ColossalAI | 41,438 | Oct 5, 2026 | 分布式训练&推理,降低大模型成本 |
| LocalAI/LocalAI | 49,405 | Oct 6, 2026 | 本地推理引擎,CPU 友好,多模态 |
| embeddings-benchmark/mteb | 3,446 | Oct 5, 2026 | 嵌入模型评测 SOTA,多语言多模态基准 |
| open-compass/opencompass | — | — | 开源模型评测平台 |
Agent 相关
| Repo | Stars | 最近更新 | 亮点 |
|---|---|---|---|
| NousResearch/hermes-agent | — | — | 可成长的 Agent 框架 |
| Significant-Gravitas/AutoGPT | — | — | 经典 Agent 项目 |
| mlabonne/llm-course | — | — | LLM 学习课程 |
可信度: ★★★★★(官方活跃 Repo,均有近期提交) 引用: - chiphuyen/cool-llm-repos: https://github.com/stars/chiphuyen/lists/cool-llm-repos - GitHub Topics llm-inference: https://github.com/topics/llm-inference
2. Hugging Face 生态动态(2026-10)
里程碑
- HF Hub 突破 100 万公开数据集(2026-05-12 官方公告)
- Hub 现拥有 240 万+模型、100 万+数据集、~100 万 Spaces
Trending 模型(2026-10 下载量前五)
| 模型 | 下载量(30天) | 亮点 |
|---|---|---|
| nvidia/Qwen3.6-35B-A3B-NVFP4 | 6.7M | NVIDIA FP4 量化,专为 H 系列优化 |
| prism-ml/Ternary-Bonsai-2-27B-gguf | 3.7M | 三进制量化,1-bit LLM 变体 |
| deepseek-ai/DeepSeek-V4-Flash-0731 | 4.5M | DeepSeek 高效变体 |
| deepseek-ai/DeepSeek-V4-Pro | 441K | Pro 版本高性能 |
| Qwen/Qwen3-Coder-Next | 596K | Qwen 代码专项 |
HF Blog 重要报告
- State of Open Source on Hugging Face: Spring 2026
- 生态高度集中:前 200 个模型占全部下载量 49.6%
- 模型数量接近翻倍,用户达 1300 万
- 引用:https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
HF Trending Papers(本周)
- Ultralytics YOLO26 — 统一实时端到端视觉模型,NMS-free,多任务(检测/分割/姿态)
- AI Agent Harness 自适应设计 — 跨域 Long-horizon Agent 的 Harness 自动构建
可信度: ★★★★★ 引用: HF Models 页面、HF Papers trending
3. 推理引擎横向对比(2026-10 实测数据)
核心结论
| 引擎 | 高并发吞吐 | TTFT(中位数) | 成本(50并发) | 最适场景 |
|---|---|---|---|---|
| vLLM | 3,688 tok/s | 0.68s | $0.26/M | 通用生产、Blackwell 支持、Eagle3 推测解码 |
| SGLang | 3,617 tok/s | 0.73s | $0.27/M | 前缀复用多轮 Agent、RAG、结构化输出 |
| TensorRT-LLM | 3,219 tok/s | 0.54s | $0.30/M | 最低 TTFT,NVIDIA 优化最深 |
| llama.cpp | 703 tok/s | 0.98s | $1.38/M | CPU/本地推理,无 GPU 场景 |
| Ollama | 277 tok/s | 1.7s | $3.50/M | 最易用,本地快速原型 |
SGLang vs vLLM 详细数据(来源:Spheron Blog,Jun 2026)
- 唯一 prompt 批处理:两者差距 <4%(在误差范围内)
- 前缀复用场景(>60% 重叠):SGLang 领先可达 5x(原始 LMSYS 数据,第三方未完全复现)
- 结构化输出/多轮 Agent:SGLang RadixAttention 优势明显
- 生产部署建议:
- 选 vLLM:最广模型支持、Blackwell 原生、Eagle3 推测解码
- 选 SGLang:多轮 Agent、RAG、前缀复用高、AMD 生态
LMDeploy 补充
- H100 上实测:~16,200 tok/s(最快)
- vLLM H100:~12,500 tok/s(LMDeploy 快 29%)
- 适合量化模型+约束硬件场景
可信度: ★★★★☆(第三方实测,数据较新) 引用: - https://www.spheron.network/blog/vllm-vs-sglang-2026 - https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
4. KV Cache 研究动态(arXiv 2026)
重要论文
🔴 高价值:OSDI 2026 — KV Cache Disaggregation
- "An Internet for the KV Cache" (arXiv:2608.01526, Aug 2026)
- 核心观点:KV Cache 正从"推理优化技巧"演变为存储/通信/调度基础原语
- 提出:跨模型共享 KV Cache、持久化存储、跨引擎暴露接口
- 引用项目:LMCache、TensorRT、NVIDIA Dynamo、llm-d
- 评价: 基础设施层面重新思考,方向性意义重大,需跟踪
🟡 中高价值:KV Cache Optimization Survey(arXiv:2603.20397,Mar 2026)
- ACL 2026 相关工作
- 系统梳理五类 KV Cache 优化方向: 1. Cache Eviction(缓存淘汰) 2. Cache Compression(压缩) 3. Hybrid Memory(混合内存) 4. Novel Attention(新型注意力) 5. Combination Strategies(组合策略)
- Q-Hitter:基于量化的稀疏 KV Cache 方案
- 评价: 综述全面,适合建立技术地图
🟡 中高价值:LMCache(arXiv:2510.09665,Oct 2025)
- 首个生产级 KV Cache 层
- 核心接口:extract KV → store → reload on demand
- 支持分布式持久化和传输
- 已成为行业事实标准(被 vLLM/SGLang/TensorRT 引用)
- 评价: 工程价值高,生产必知
🟡 学术:Online Scheduling for KV Cache Constraints(MIT,Jan 2026)
- 形式化模型:在线 batching + KV Cache 约束调度
- 提出 MC-SF 算法,常数竞争比
- 评价: 理论深度强,工程落地需转化
可信度: ★★★★☆ 引用: Awesome-KV-Cache-Optimization(GitHub,ACL 2026 相关):https://github.com/jjiantong/Awesome-KV-Cache-Optimization
5. Substack 高价值条目
🔴 state-of-mlops weekly(Jun 2026)
- 专栏:每周 MLOps OSS 推荐
- 亮点内容:
- "A Guide to AI Inference Engineering"(Jun 16, 2026)— 实践性强
- CoT Monitoring 安全问题分析(Stanford)
- Andrew Ng 论 AI Agent 未来(Interrupt 26)
- 可信度: ★★★★☆
- 引用: https://stateofmlops.substack.com/p/state-of-mlops-2026jun29
🟡 nextbigteng — "AI Infrastructure Roadmap: Five Frontiers for 2026"
- 核心洞察:
- 推理取代训练成为算力消耗中心
- 推理基础设施五前沿:1) 模型部署/推理优化 2) Agent 调度 3) Edge 推理 4) 成本优化 5) 可观测性
- 专门提到:LMCache(TensorMesh)、SGLang 路由(RadixArk)、vLLM 优化(Inferact)
- 可信度: ★★★★☆
- 引用: https://nextbigteng.substack.com/p/ai-infrastructure-roadmap-five-frontiers-for-2026
🟡 theaiengineer — "Should You Self-Host LLM Inference?"
- 关键数据:
- MLOps 工程师年薪 ~16 万美元(美国市场)
- 混合部署节省 40-70% 成本
- 敏感高频任务本地,复杂推理任务调用 API
- 可信度: ★★★☆☆(博客文章,观点性)
- 引用: https://theaiengineer.substack.com/p/should-you-self-host-inference
🟢 jamwithai — Agent Memory 专题
- 7 类 Agent Memory 分类(区别于 RAG/向量数据库)
- 实践指南:什么该记、记多久、什么时候遗忘
- 可信度: ★★★★☆
- 引用: https://jamwithai.substack.com/archive
分类标签
推理引擎 vLLM SGLang KVCache GitHub-Trending HuggingFace MLOps AI-Agent 量化 部署 Benchmark
建议写入路径
/shared/research-kb/inbox/jay/2026-10-10-ai-engineering-trending-oct.md
后续行动建议
- 精读:「An Internet for the KV Cache」(OSDI 2026) — 基础设施范式转变
- 跟踪:SGLang v0.5.x 更新日志,关注 RadixAttention 新特性
- 核实:vLLM Blackwell 官方支持进度(TensorRT-LLM 对比数据)
- 审稿:本文档建议发布前由有推理引擎生产经验者审阅
Jay · 2026-10-10 · 知识库草稿