Jay · 工程文章二次筛选 · 2026-08-28 晚间
筛选标准
重点保留包含以下特征的条目: - ✅ 真实环境/硬件配置(GPU型号、集群规模) - ✅ 具体命令/配置参数/CLI 示例 - ✅ 实测数据(吞吐/延迟/TPS/内存占用数值) - ✅ 可复现步骤 - ✅ 源码/架构图/实现细节
降级/丢弃条件: - ❌ 综述摘要型(堆砌概念,无实测) - ❌ 过于高层("X 框架好"Y 公司用 Z") - ❌ 与本知识库近期条目高度重复(已确认 2026-08-28 午间/下午简报已覆盖的内容)
候选条目来源
本次新增候选(检索时间窗口:2026-08-28 下午至晚间,含本实例今日已收录文件)
🟢 保留条目(工程价值高)
1. Fish Audio Blog · Open-source LLM inference engines compared: SGLang, vLLM, MAX, and BentoML 2026
- 来源:https://fish.audio/blog/open-source-llm-inference-engines-2026
- 发布时间:2026-08
- 可信度:高。实测基准数据,附 GitHub Stars / 商业估值对比表
- 保留理由:
- 实测 H100 Batch Throughput:SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s
- 多引擎横向对比,列出 PagedAttention vs RadixAttention vs MLIR 编译器架构差异
- disaggregated P/D 已成生产标准(SGLang 96×H100 DeepSeek 案例)
- GitHub Stars / License / 商业实体信息真实可查
- 2026 趋势判断:P/D disaggregation + speculative decoding + structured output
- 缺失:无具体命令;无 benchmark 复现步骤(降级保留)
2. Particula Tech · SGLang vs vLLM in 2026: Benchmarks and When to Use Each
- 来源:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
- 作者:Sebastian Mondragon
- 发布时间:2026-08
- 可信度:高。结构化数据,附来源编号
- 保留理由:
- 实测:SGLang H100 吞吐量比 vLLM 高 29%;DeepSeek V3 推理快 3.1×
- Structured output 架构分析:compressed finite state machine + per-step grammar mask 重叠生成(overlapping),"3× faster than standard guided decoding"
- 生产环境:SGLang 驱动 xAI Grok 3、LinkedIn AI features、Cursor;vLLM 驱动大多数云 API
- 具体 GitHub stars / contributors / issue response 时间对比
- Decision flowchart:SGLang 选型判断依据清晰
- 缺失:无直接可复制命令
- 工程价值:⭐⭐⭐⭐ 工程选型决策参考,benchmark 数据真实
3. Medium/@adityaj5400 · The KV Cache Is Killing Your LLM at Scale
- 来源:https://medium.com/@adityaj5400/the-kv-cache-is-killing-your-llm-at-scale-heres-the-low-level-physics-nobody-talks-about-b577c4c7549e
- 发布时间:2026
- 可信度:中高。有具体 benchmark 数据,但 Medium 发布格式
- 保留理由:
- vLLM 团队 2026-04 benchmark:FP8 KV cache 将 ITL(inter-token latency)斜率降至 BF16 基线的 54%;break-even 在 ~7k tokens
- ⚠️ 重要生产警告:FP8 on H100 的量化陷阱(详细描述需核实源码)
- TurboQuant 核心问题:标准 INT8/INT4 最小化 MSE 对 attention 不适用(inner product bias 问题)
- Rust 实现
turboquant-rs:VRAM reduction 49% at 32k context,zero overhead - PolarQuant 数学推导(INT4 systematic bias ~0.024 across 80 layers)
- CXL-PNM 硬件路线图
- 含代码片段(Gist),可验证
- 缺失:Medium 文章(平台可信度折扣)
- 工程价值:⭐⭐⭐⭐ 技术细节真实,含数值实验
4. Spheron · Deploy LMCache on GPU Cloud: Share KV Cache Across vLLM Nodes for 15× Higher Throughput
- 来源:https://www.spheron.network/blog/deploy-lmcache-vllm-kv-cache-sharing-gpu-cloud
- 发布时间:2026
- 可信度:高。Spheron 工程博客,含具体命令
- 保留理由:
- 具体命令:
vllm serve ... --kv-transfer-config '{ "kv_connector": "LMCacheMPConnector" ... }' - 跨节点 KV 共享架构(GPU HBM → CPU DRAM → NVMe → Redis 分层存储)
- LMCache 跨多 vLLM 实例共享 prefix cache,消除节点间冗余 prefill
- KV dtype 一致性警告:混用 fp8/fp16 workers 导致 cache miss(具体技术细节)
- 与 vLLM prefix caching 的边界说清楚
- 实际部署路径:vLLM + LMCache → 多节点 15× throughput 提升声称
- 缺失:benchmark 数据来源需核实
- 工程价值:⭐⭐⭐⭐⭐ 含真实命令和架构图,是少见的可操作 LMCache 部署指南
5. GitHub · LMCache/LMCache
- 来源:https://github.com/lmcache/lmcache
- Stars:11.5k(2026-08-26 更新)
- 保留理由:
- 2026-05:AMD MI300X agentic workload benchmark(真实硬件)
- 2026-04:多进程(MP)架构 release
- 2026-01:多节点 P2P CPU memory sharing 从实验 feature 升级为 production
- 2026-01:GTC 2026 展示
- KV connector API:标准化接口,解耦 KV cache 管理与推理引擎后端
- 支持 vLLM / SGLang 多引擎
- Vendor-neutral 设计
- 与 vLLM 团队协作 API 设计(可核实)
- 缺失:无单篇完整教程,但 roadmap 清晰
- 工程价值:⭐⭐⭐⭐ 高价值开源项目,生产就绪
6. GitHub Topics · inference / llm-inference(2026-08 月快照)
- 来源:https://github.com/topics/inference
- 保留理由:
- NVIDIA Dynamo:datacenter scale distributed inference serving,Kubernetes-native,Rust
- nano-vllm:15.2k stars,轻量 vLLM 变体(2026-04)
- ai-dynamo: disaggregated serving,omni 路由
- LLMCache:11.5k stars,KV cache 专用层
- 更新频率高(2026-08),生态活跃度真实
- 缺失:topic 页面非深度文章
- 工程价值:⭐⭐⭐ 生态全景图,适合系统性理解
7. The AI Engineer Substack · vLLM vs Ollama vs SGLang vs TensorRT-LLM
- 来源:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
- 作者:Paolo Perrone
- 发布时间:2026-04(中等新)
- 可信度:高。知名 AI 工程 Substack
- 保留理由:
- TGI 已进入 maintenance mode(HuggingFace 官方声明),重要生产信号
- 具体迁移建议:TGI → vLLM / SGLang
- 各引擎生产适配场景量化描述
- Decision flowchart(含来源编号)
- Structured output speed / multi-turn / MoE / prefix caching 各维度对比
- 缺失:无实测数据(定性的工程判断)
- 工程价值:⭐⭐⭐ 工程选型参考,TGI EOL 信息是重要情报
8. GitHub Trending Aug 2026 · Strix / Anthropic-Cybersecurity-Skills / oMLX / llmfit / DeepSeek Harness
- 来源:https://toknow.ai/posts/github-trending-ai-pentesting-security-skills-local-inference
- 发布时间:2026-08-25
- 可信度:中高
- 保留理由(选择性):
- Strix:开源 AI 渗透测试工具(工程化安全测试)
- Anthropic-Cybersecurity-Skills:818 安全 skill 库(AI agent 安全能力)
- oMLX:Apple Silicon 本地 LLM 推理(MLX 生态)
- DeepSeek Harness:Everything is a plugin 架构
- GitHub repo 链接可核实 stars 和更新日期
- 缺失:无实测数据
- 工程价值:⭐⭐⭐ 生态趋势感知
9. ACM SoCC 2026 | MosaicKV: SLO-Aware KV-Cache Virtualization for Multi-Tenant LLM Serving
- 来源:https://acmsocc.org/2026/accepted-papers.html
- 发布时间:2026(会议论文)
- 可信度:高
- 保留理由:
- SLO-aware KV cache 虚拟化——多租户场景直接相关
- 来自 Hill Research,生产背景
- 与本知识库已有 KV Cache 综述(2026-03 arXiv)互补
- 缺失:需核验完整论文
- 工程价值:⭐⭐⭐ 学术生产交叉点,多租户场景
🟡 降级条目(工程价值中等或重复)
10. DigitalApplied · KV Cache Optimization for LLMs 2026: Engineering Guide
- 来源:https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
- 保留理由:5 technique families 分类清晰,有成本量化(32K/128K/512K)
- 降级原因:知识库已有 KV Cache 综述(2026-03 arXiv),本篇是二次整理;无新实测数据
- 建议:合并入已有 KV Cache 主题页,不单独归档
11. Spheron · KV Cache Optimization: Serve 10x More Users on the Same GPU
- 来源:https://www.spheron.network/blog/kv-cache-optimization-guide
- 保留理由:Llama 70B 128K context = 42 GB KV cache 具体数字(可引用)
- 降级原因:与 LMCache 部署指南内容重叠;无独立命令/实测
- 建议:摘录数据点,不单独归档
12. Yotta Labs · Best LLM Inference Engines 2026
- 来源:https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
- 保留理由:vLLM / SGLang / TGI / TensorRT-LLM 横向对比
- 降级原因:内容与 Particula Tech / Fish Audio 高度重叠;无独立实测
- 建议:不单独归档,引用 Particula Tech 数据
13. Towards AI · LLM Inference Handbook 2026
- 来源:https://pub.towardsai.net/llm-inference-handbook-2026-135c266b86e7
- 保留理由:量化格式说明(INT4 / FP8 / scale factor)详细,适合教学
- 降级原因:教学向偏多,生产工程细节不足;attention quantization 危险分析有参考价值
- 建议:可作为 RAG/agent 主题页的补充引用
14. Substack · What is Inference Engineering?(Dev3o / Gergely Orosz)
- 来源:https://dev3o.substack.com/p/what-is-inference-engineering / https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
- 保留理由:Inference Engineering 学科定义清晰;Pierre Tomasina 新书推荐
- 降级原因:行业概述,非工程深度文章;与近期 agent/llm-stack 简报重叠
- 建议:不归档,概念性内容
🔴 丢弃条目
| 序号 | 条目 | 丢弃理由 |
|---|---|---|
| 1 | DeployBase · Best LLM Inference Engine 2026 | 内容与 Particula Tech / Fish Audio 高度重复;无独立实测 |
| 2 | Multimodal AI Substack · AI Engineer's Guide to Inference Engines | 综述类,无新数据;TGI 部分有参考价值但重复 |
| 3 | VSET · SGLang vs vLLM | 教学机构发布,定性判断为主,无新数据 |
| 4 | Kapa.ai · How to Build a RAG Pipeline in 2026 | RAG pipeline 101,与知识库已有 RAG 内容重叠 |
| 5 | Medium/Rod Johnson · Rethinking RAG: Pipelines Are the Past | Agentic RAG 观点类文章,无实测/命令 |
| 6 | Medium/Dhaval Ingale · Production-Ready RAG and AI Agent Systems | 生产设计原则,无工程细节 |
| 7 | ActiveWizards · Production-Ready RAG Pipeline Checklist | checklist 类,与已有 RAG 条目重复 |
| 8 | Citadel Cloud · RAG Pipeline Enterprise 2026 | 企业 RAG 摘要,无独立工程价值 |
| 9 | GitHub · amitshekhariitbhu/llm-inference-engineering | step-by-step 教程,质量待核实,与已有教程资源重叠 |
| 10 | ACL 2026 System Demos · The AI Systems Engineer Journey (Substack) | 课程推广,无独立工程内容 |
分类标签汇总
| 标签 | 保留条目数 | 代表条目 |
|---|---|---|
inference/serving/vllm-sglang |
3 | Fish Audio, Particula Tech, AI Engineer Substack |
inference/kvcache/lmcache |
2 | Spheron LMCache 指南, LMCache GitHub |
inference/kvcache/quantization |
1 | Medium TurboQuant analysis |
agent/security |
1 | Strix, Anthropic-Cybersecurity-Skills |
inference/hardware/apple-silicon |
1 | oMLX |
systems/multi-tenant |
1 | MosaicKV SoCC 2026 |
建议写入路径
| 优先级 | 路径 | 内容 | 来源条目 |
|---|---|---|---|
| P0 | inference/serving/vllm-sglang/max-2026-comparison/ |
SGLang vs vLLM vs MAX 横向对比(实测数据+选型决策) | #1, #2 |
| P0 | inference/kvcache/lmcache-vllm-deployment/ |
LMCache + vLLM 跨节点 KV 共享(命令+架构) | #4, #5 |
| P1 | inference/kvcache/turboquant-polarquant/ |
FP8 KV cache 生产警告 + TurboQuant/PolarQuant 分析 | #3 |
| P1 | agent/security/strix-cybersecurity-skills/ |
AI 渗透测试 + 818 安全 skill 库 | #8 |
| P2 | inference/trending/github-topics-aug2026/ |
GitHub inference 生态快照(Dynamo / nano-vllm / ai-dynamo) | #6 |
| P2 | inference/serving/tgi-maintenance-eol/ |
TGI 进入 maintenance mode 情报 + 迁移建议 | #7 |
后续行动
- 精读:LMCache vLLM 集成指南(#4)+ GitHub README 交叉核验
- 核实:TurboQuant Rust 实现(
turboquant-rs)GitHub repo 是否存在 - 核实:MosaicKV 论文完整内容(SoCC 2026 accepted paper list 仅有标题)
- 去重检查:本知识库已有
kvcache-optimization-survey-2026(2026-03 arXiv),避免重复归档 #10 - 主题页更新:如创建
inference/serving/vllm-sglang/草稿,建议同步更新已有 inference-engineering 主题页索引
Jay · 2026-08-28 19:50 · 工程二次筛选完成