Jay · 工程文章二次筛选 · 2026-08-28 晚间

筛选标准

重点保留包含以下特征的条目: - ✅ 真实环境/硬件配置(GPU型号、集群规模) - ✅ 具体命令/配置参数/CLI 示例 - ✅ 实测数据(吞吐/延迟/TPS/内存占用数值) - ✅ 可复现步骤 - ✅ 源码/架构图/实现细节

降级/丢弃条件: - ❌ 综述摘要型(堆砌概念,无实测) - ❌ 过于高层("X 框架好"Y 公司用 Z") - ❌ 与本知识库近期条目高度重复(已确认 2026-08-28 午间/下午简报已覆盖的内容)


候选条目来源

本次新增候选(检索时间窗口:2026-08-28 下午至晚间,含本实例今日已收录文件)


🟢 保留条目(工程价值高)

1. Fish Audio Blog · Open-source LLM inference engines compared: SGLang, vLLM, MAX, and BentoML 2026

  • 来源:https://fish.audio/blog/open-source-llm-inference-engines-2026
  • 发布时间:2026-08
  • 可信度:高。实测基准数据,附 GitHub Stars / 商业估值对比表
  • 保留理由
  • 实测 H100 Batch Throughput:SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s
  • 多引擎横向对比,列出 PagedAttention vs RadixAttention vs MLIR 编译器架构差异
  • disaggregated P/D 已成生产标准(SGLang 96×H100 DeepSeek 案例)
  • GitHub Stars / License / 商业实体信息真实可查
  • 2026 趋势判断:P/D disaggregation + speculative decoding + structured output
  • 缺失:无具体命令;无 benchmark 复现步骤(降级保留)

2. Particula Tech · SGLang vs vLLM in 2026: Benchmarks and When to Use Each

  • 来源:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
  • 作者:Sebastian Mondragon
  • 发布时间:2026-08
  • 可信度:高。结构化数据,附来源编号
  • 保留理由
  • 实测:SGLang H100 吞吐量比 vLLM 高 29%;DeepSeek V3 推理快 3.1×
  • Structured output 架构分析:compressed finite state machine + per-step grammar mask 重叠生成(overlapping),"3× faster than standard guided decoding"
  • 生产环境:SGLang 驱动 xAI Grok 3、LinkedIn AI features、Cursor;vLLM 驱动大多数云 API
  • 具体 GitHub stars / contributors / issue response 时间对比
  • Decision flowchart:SGLang 选型判断依据清晰
  • 缺失:无直接可复制命令
  • 工程价值:⭐⭐⭐⭐ 工程选型决策参考,benchmark 数据真实

3. Medium/@adityaj5400 · The KV Cache Is Killing Your LLM at Scale

  • 来源:https://medium.com/@adityaj5400/the-kv-cache-is-killing-your-llm-at-scale-heres-the-low-level-physics-nobody-talks-about-b577c4c7549e
  • 发布时间:2026
  • 可信度:中高。有具体 benchmark 数据,但 Medium 发布格式
  • 保留理由
  • vLLM 团队 2026-04 benchmark:FP8 KV cache 将 ITL(inter-token latency)斜率降至 BF16 基线的 54%;break-even 在 ~7k tokens
  • ⚠️ 重要生产警告:FP8 on H100 的量化陷阱(详细描述需核实源码)
  • TurboQuant 核心问题:标准 INT8/INT4 最小化 MSE 对 attention 不适用(inner product bias 问题)
  • Rust 实现 turboquant-rs:VRAM reduction 49% at 32k context,zero overhead
  • PolarQuant 数学推导(INT4 systematic bias ~0.024 across 80 layers)
  • CXL-PNM 硬件路线图
  • 含代码片段(Gist),可验证
  • 缺失:Medium 文章(平台可信度折扣)
  • 工程价值:⭐⭐⭐⭐ 技术细节真实,含数值实验

4. Spheron · Deploy LMCache on GPU Cloud: Share KV Cache Across vLLM Nodes for 15× Higher Throughput

  • 来源:https://www.spheron.network/blog/deploy-lmcache-vllm-kv-cache-sharing-gpu-cloud
  • 发布时间:2026
  • 可信度:高。Spheron 工程博客,含具体命令
  • 保留理由
  • 具体命令vllm serve ... --kv-transfer-config '{ "kv_connector": "LMCacheMPConnector" ... }'
  • 跨节点 KV 共享架构(GPU HBM → CPU DRAM → NVMe → Redis 分层存储)
  • LMCache 跨多 vLLM 实例共享 prefix cache,消除节点间冗余 prefill
  • KV dtype 一致性警告:混用 fp8/fp16 workers 导致 cache miss(具体技术细节)
  • 与 vLLM prefix caching 的边界说清楚
  • 实际部署路径:vLLM + LMCache → 多节点 15× throughput 提升声称
  • 缺失:benchmark 数据来源需核实
  • 工程价值:⭐⭐⭐⭐⭐ 含真实命令和架构图,是少见的可操作 LMCache 部署指南

5. GitHub · LMCache/LMCache

  • 来源:https://github.com/lmcache/lmcache
  • Stars:11.5k(2026-08-26 更新)
  • 保留理由
  • 2026-05:AMD MI300X agentic workload benchmark(真实硬件)
  • 2026-04:多进程(MP)架构 release
  • 2026-01:多节点 P2P CPU memory sharing 从实验 feature 升级为 production
  • 2026-01:GTC 2026 展示
  • KV connector API:标准化接口,解耦 KV cache 管理与推理引擎后端
  • 支持 vLLM / SGLang 多引擎
  • Vendor-neutral 设计
  • 与 vLLM 团队协作 API 设计(可核实)
  • 缺失:无单篇完整教程,但 roadmap 清晰
  • 工程价值:⭐⭐⭐⭐ 高价值开源项目,生产就绪

6. GitHub Topics · inference / llm-inference(2026-08 月快照)

  • 来源:https://github.com/topics/inference
  • 保留理由
  • NVIDIA Dynamo:datacenter scale distributed inference serving,Kubernetes-native,Rust
  • nano-vllm:15.2k stars,轻量 vLLM 变体(2026-04)
  • ai-dynamo: disaggregated serving,omni 路由
  • LLMCache:11.5k stars,KV cache 专用层
  • 更新频率高(2026-08),生态活跃度真实
  • 缺失:topic 页面非深度文章
  • 工程价值:⭐⭐⭐ 生态全景图,适合系统性理解

7. The AI Engineer Substack · vLLM vs Ollama vs SGLang vs TensorRT-LLM

  • 来源:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
  • 作者:Paolo Perrone
  • 发布时间:2026-04(中等新)
  • 可信度:高。知名 AI 工程 Substack
  • 保留理由
  • TGI 已进入 maintenance mode(HuggingFace 官方声明),重要生产信号
  • 具体迁移建议:TGI → vLLM / SGLang
  • 各引擎生产适配场景量化描述
  • Decision flowchart(含来源编号)
  • Structured output speed / multi-turn / MoE / prefix caching 各维度对比
  • 缺失:无实测数据(定性的工程判断)
  • 工程价值:⭐⭐⭐ 工程选型参考,TGI EOL 信息是重要情报

  • 来源:https://toknow.ai/posts/github-trending-ai-pentesting-security-skills-local-inference
  • 发布时间:2026-08-25
  • 可信度:中高
  • 保留理由(选择性)
  • Strix:开源 AI 渗透测试工具(工程化安全测试)
  • Anthropic-Cybersecurity-Skills:818 安全 skill 库(AI agent 安全能力)
  • oMLX:Apple Silicon 本地 LLM 推理(MLX 生态)
  • DeepSeek Harness:Everything is a plugin 架构
  • GitHub repo 链接可核实 stars 和更新日期
  • 缺失:无实测数据
  • 工程价值:⭐⭐⭐ 生态趋势感知

9. ACM SoCC 2026 | MosaicKV: SLO-Aware KV-Cache Virtualization for Multi-Tenant LLM Serving

  • 来源:https://acmsocc.org/2026/accepted-papers.html
  • 发布时间:2026(会议论文)
  • 可信度:高
  • 保留理由
  • SLO-aware KV cache 虚拟化——多租户场景直接相关
  • 来自 Hill Research,生产背景
  • 与本知识库已有 KV Cache 综述(2026-03 arXiv)互补
  • 缺失:需核验完整论文
  • 工程价值:⭐⭐⭐ 学术生产交叉点,多租户场景

🟡 降级条目(工程价值中等或重复)

10. DigitalApplied · KV Cache Optimization for LLMs 2026: Engineering Guide

  • 来源:https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
  • 保留理由:5 technique families 分类清晰,有成本量化(32K/128K/512K)
  • 降级原因:知识库已有 KV Cache 综述(2026-03 arXiv),本篇是二次整理;无新实测数据
  • 建议:合并入已有 KV Cache 主题页,不单独归档

11. Spheron · KV Cache Optimization: Serve 10x More Users on the Same GPU

  • 来源:https://www.spheron.network/blog/kv-cache-optimization-guide
  • 保留理由:Llama 70B 128K context = 42 GB KV cache 具体数字(可引用)
  • 降级原因:与 LMCache 部署指南内容重叠;无独立命令/实测
  • 建议:摘录数据点,不单独归档

12. Yotta Labs · Best LLM Inference Engines 2026

  • 来源:https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
  • 保留理由:vLLM / SGLang / TGI / TensorRT-LLM 横向对比
  • 降级原因:内容与 Particula Tech / Fish Audio 高度重叠;无独立实测
  • 建议:不单独归档,引用 Particula Tech 数据

13. Towards AI · LLM Inference Handbook 2026

  • 来源:https://pub.towardsai.net/llm-inference-handbook-2026-135c266b86e7
  • 保留理由:量化格式说明(INT4 / FP8 / scale factor)详细,适合教学
  • 降级原因:教学向偏多,生产工程细节不足;attention quantization 危险分析有参考价值
  • 建议:可作为 RAG/agent 主题页的补充引用

14. Substack · What is Inference Engineering?(Dev3o / Gergely Orosz)

  • 来源:https://dev3o.substack.com/p/what-is-inference-engineering / https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
  • 保留理由:Inference Engineering 学科定义清晰;Pierre Tomasina 新书推荐
  • 降级原因:行业概述,非工程深度文章;与近期 agent/llm-stack 简报重叠
  • 建议:不归档,概念性内容

🔴 丢弃条目

序号 条目 丢弃理由
1 DeployBase · Best LLM Inference Engine 2026 内容与 Particula Tech / Fish Audio 高度重复;无独立实测
2 Multimodal AI Substack · AI Engineer's Guide to Inference Engines 综述类,无新数据;TGI 部分有参考价值但重复
3 VSET · SGLang vs vLLM 教学机构发布,定性判断为主,无新数据
4 Kapa.ai · How to Build a RAG Pipeline in 2026 RAG pipeline 101,与知识库已有 RAG 内容重叠
5 Medium/Rod Johnson · Rethinking RAG: Pipelines Are the Past Agentic RAG 观点类文章,无实测/命令
6 Medium/Dhaval Ingale · Production-Ready RAG and AI Agent Systems 生产设计原则,无工程细节
7 ActiveWizards · Production-Ready RAG Pipeline Checklist checklist 类,与已有 RAG 条目重复
8 Citadel Cloud · RAG Pipeline Enterprise 2026 企业 RAG 摘要,无独立工程价值
9 GitHub · amitshekhariitbhu/llm-inference-engineering step-by-step 教程,质量待核实,与已有教程资源重叠
10 ACL 2026 System Demos · The AI Systems Engineer Journey (Substack) 课程推广,无独立工程内容

分类标签汇总

标签 保留条目数 代表条目
inference/serving/vllm-sglang 3 Fish Audio, Particula Tech, AI Engineer Substack
inference/kvcache/lmcache 2 Spheron LMCache 指南, LMCache GitHub
inference/kvcache/quantization 1 Medium TurboQuant analysis
agent/security 1 Strix, Anthropic-Cybersecurity-Skills
inference/hardware/apple-silicon 1 oMLX
systems/multi-tenant 1 MosaicKV SoCC 2026

建议写入路径

优先级 路径 内容 来源条目
P0 inference/serving/vllm-sglang/max-2026-comparison/ SGLang vs vLLM vs MAX 横向对比(实测数据+选型决策) #1, #2
P0 inference/kvcache/lmcache-vllm-deployment/ LMCache + vLLM 跨节点 KV 共享(命令+架构) #4, #5
P1 inference/kvcache/turboquant-polarquant/ FP8 KV cache 生产警告 + TurboQuant/PolarQuant 分析 #3
P1 agent/security/strix-cybersecurity-skills/ AI 渗透测试 + 818 安全 skill 库 #8
P2 inference/trending/github-topics-aug2026/ GitHub inference 生态快照(Dynamo / nano-vllm / ai-dynamo) #6
P2 inference/serving/tgi-maintenance-eol/ TGI 进入 maintenance mode 情报 + 迁移建议 #7

后续行动

  1. 精读:LMCache vLLM 集成指南(#4)+ GitHub README 交叉核验
  2. 核实:TurboQuant Rust 实现(turboquant-rs)GitHub repo 是否存在
  3. 核实:MosaicKV 论文完整内容(SoCC 2026 accepted paper list 仅有标题)
  4. 去重检查:本知识库已有 kvcache-optimization-survey-2026(2026-03 arXiv),避免重复归档 #10
  5. 主题页更新:如创建 inference/serving/vllm-sglang/ 草稿,建议同步更新已有 inference-engineering 主题页索引

Jay · 2026-08-28 19:50 · 工程二次筛选完成