研究知识库草稿 · 2026-09-01 · Jay
本次主题
推理引擎工程:KV Cache 优化、推理调度、Inference Serving 架构、2026 工程栈
检索范围
- arXiv:LLM Inference、KV Cache、Serving Systems(2025-2026)
- GitHub Releases:vLLM、SGLang、Mooncake、xorbitsai/inference、pipecat-ai
- Hugging Face:State of Open Source Spring 2026、Trending Models
- Substack:AI Engineering newsletters(AIxFunda、designgurus、techfusionist)
- Tavily advanced search:2026-08 至 2026-09
1. arXiv 高价值论文
🔬 1.1 Oneiros / MIRAGE — KV Cache 参数重映射
- arXiv:2507.11507
- 标签:KV Cache / GPU Memory / Multi-tenant Serving
- 工程价值:⭐⭐⭐⭐⭐
- 核心机制:运行时将模型参数内存动态重映射为 KV Cache 内存,利用现代 CPU-GPU 带宽将参数传输与 GPU 计算重叠,最小化重映射开销。在 KV Cache 触及 GPU 内存上限时触发层粒度重映射。
- 关键数字:相比传统 Paging 机制,Oneiros 在 multi-tenant 场景下 P99 尾延迟显著降低,吞吐量提升
- 理论保障:提供了层淘汰算法最优性的数学证明
- 兼容性:可集成到任意推理 Serving 系统,支持多种 GPU 共享和调度策略
- 建议分类:
LLM Serving / KV Cache / GPU Memory Management / 2026 - 可信度:高——arXiv 2025.07,有理论证明 + 实验验证
- 后续行动:精读;与 vLLM PagedAttention 对比;评估对 SGLang 的适用性
🔬 1.2 Albireo — 消除非可扩展开销
- arXiv:2606.01927
- 标签:LLM Inference / Scaling / Amdahl's Law / vLLM
- 工程价值:⭐⭐⭐⭐
- 核心发现:当前 vLLM 和 SGLang 在张量并行度 > 2 时,有效 TP 度低于标称值(Ete < 2×Ete/2),Large LLM 通信协调开销更显著
- 关键优化:3 项 Pipeline 优化将 CPU 时间从 8.5ms 降至 <80μs;4×H100 采样从 6ms 降至 1.5ms;移除 >89% 非可扩展开销
- 关键数字:相对 vLLM 加速 ~1.7×
- 建议分类:
LLM Serving / 性能优化 / Tensor Parallelism / 2026 - 可信度:高——作为 vLLM 插件实现,有基准对比
- 后续行动:关注 Albireo 开源进展;与 SGLang RadixAttention 对比
🔬 1.3 The Silent Hyperparameter — 推理后端可复现性
- arXiv:2605.19537
- 标签:Inference Backend / Reproducibility / vLLM / SGLang / Quantization
- 工程价值:⭐⭐⭐⭐
- 核心发现:不同推理后端(vLLM、SGLang、Ollama)对相同模型产生数值分歧,根源在于:
- Prefix Caching:分块处理改变归约树;禁用后 vLLM Llama 3.1 精度 +0.46%,Ollama DeepSeek -0.47%
- CUDA Graphs:禁用后性能偏移 up to +0.15%
- 跨硬件验证:在 NVIDIA L40 GPU 上 backend 诱导方差 up to 17.2% Max-Min 差
- 工程启示:不同后端不是"数值等价"的,生产评估需锁定后端版本
- 建议分类:
LLM Serving / 可复现性 / 推理引擎对比 / 2026 - 可信度:高——系统性实验设计
- 后续行动:生产部署应记录推理引擎版本;精读量化影响部分
2. GitHub Releases 工程动态
🛠️ 2.1 xorbitsai/inference v3.2.0(2026-08-15)
- 标签:推理平台 / Docker 部署 / 数据库认证
- 工程亮点:
- 生产级 Docker Compose 部署 + 离线私有 PyPI profile
- 数据库后端认证默认启用(生产安全)
- per-model GPU memory 可视化
- GPU xllamacpp wheel from CUDA-matched index
- 修复 worker 重连、Jina v5/Qwen3 reranker 部署稳定性
- 建议分类:
LLM Serving / 平台工程 / 部署 / 2026-08
🛠️ 2.2 SGLang — Heterogeneous CPU+GPU EPD + MoRI on AMD
- 标签:VLM / 异构计算 / AMD / Disaggregated Inference
- 工程亮点:
- VLM 视觉编码 Offload 到 Intel Xeon CPU(配合 GPU):重载下 P99 TTFT 提升 ~1.3×
- MoRI on AMD Instinct MI355X:DeepSeek-R1 disaggregated inference,$0.169/M tokens @ 129 tok/s/user
- Structural tags for strict tool calling + two-phase reasoning grammar
- 建议分类:
LLM Serving / 异构计算 / AMD / VLM / 2026 - 后续行动:跟进 MoRI AMD 成本基准;评估 VLM CPU offload 对多模态 Agent 的价值
🛠️ 2.3 deepagents-ai/agent-backend — Agent 分布式存储
- 标签:Agent / MCP / 文件系统 / 分布式
- 工程亮点:
- 分布式 Agent 文件系统后端,类似数据库的单一 API
- agentbe-daemon 支持 stdio(开发)、HTTP+SSH(生产)、Docker 部署
- TypeScript + Python 客户端库
- NextJS 演示(AI Chat + 文件管理 + 代码编辑)
- 建议分类:
Agent Engineering / 基础设施 / MCP / 2026 - 后续行动:关注 MCP 生态中 Agent 后端存储标准化趋势
3. Hugging Face 生态动态
📊 HF State of Open Source Spring 2026 关键数据
- 平台规模:13M 用户,2M+ 公开模型,500K+ 公开数据集
- 下载集中度:Top 200 模型(0.01%)占 49.6% 总下载量
- 地理格局变化:中国下载量已超美国,占 41%;新模型多数来自中国或中国模型衍生
- Qwen 生态爆炸:Alibaba 衍生模型数超过 Google + Meta 总和;Qwen 系列 113K+ 衍生模型,200K+ 含 Qwen 标签
- 独立开发者崛起:行业贡献占比从 2022 年前 70% 降至 2025 年 37%;独立开发者升至 39%(部分时间超过 50%)
- 韩国主权 AI:LG AI Research、SK Telecom、Naver Cloud、NC AI、Upstage 入围;2026-02 三个韩国模型同时 Trending
- 建议分类:
AI Ecosystem / Hugging Face / 地缘政治 / 2026
📦 HF Trending Models(2026-09 初)
- 文本生成:Qwen3.8-Flash-Next、GLM-5.3-Flash、DeepSeek-V4-Flash-Vision-Exp
- 推理优化:MiniMax-H3、Kimi-K3
- TTS:BreezeBlue/Breeze-TTS-2
- 图像:Lightricks/LTX-2.5
- 本地部署推荐:Qwen3-Coder-Next GGUF(48GB+ VRAM)、Devstral-Small-2507 Q4_K_M(较小机器)
- 建议分类:
Model Hub / Trending / 2026-09
4. 推理引擎横向对比(2026)
📊 vLLM vs SGLang vs LMDeploy vs TensorRT-LLM
| 维度 | vLLM | SGLang | LMDeploy | TensorRT-LLM |
|---|---|---|---|---|
| 吞吐量 | 3,500 tok/s (A100) | 16,215 tok/s (H100) | ~16,000 tok/s (H100) | 中等 |
| TTFT | 150ms | 80ms | — | 150ms |
| 多轮对话 | 一般 | 29% 优势(RadixAttention) | 良好 | 一般 |
| 量化模型 | 良好 | 良好 | 最优 | 良好 |
| 前缀缓存 | PagedAttention | RadixAttention | TurboMind | — |
| 模型覆盖 | 最广(数百架构) | 中等 | 主流 | 有限 |
| 部署复杂度 | 最低(Docker 单行命令) | 中等 | 低 | 高(编译) |
| 生产冷启动 | ~62s(H100) | ~62s | — | 需编译 |
决策框架: - 选 vLLM:首次生产部署、多样化模型需求、团队优先稳定性 - 选 SGLang:多轮 Agent 工作流、前缀缓存密集型、共享上下文流量 - 选 LMDeploy:量化模型部署、受限硬件 - 选 TensorRT-LLM:固定模型 + 极致throughput + 预编译可接受
关键洞察:The Silent Hyperparameter 论文(2605.19537)警告——不同引擎数值结果不等价,生产锁定版本!
建议分类:LLM Serving / 推理引擎 / 选型 / 基准 / 2026
5. Substack 高价值工程洞察
📝 5.1 "What 1,000+ Job Descriptions Reveal About the AI Engineer Role in 2026"
- 作者:alexeyondata(Substack)
- URL:https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
- 发布时间:2026
- 标签:AI Engineer / 职业分析 / Job Market / 2026
- 工程价值:⭐⭐⭐⭐
- 核心数据:
- 70% 的职位是 AI-first roles(直接做 LLM/GenAI 系统:RAG、Agent、评估、生产部署)
- 28.5% 是 AI-support roles(基础设施、平台:GPU/推理基础设施、数据管道、部署监控)
- 核心职责:构建端到端 LLM 应用(RAG/Agent)、API 生产化、评估与 Guardrail、跨产品团队协作
- 技能优先级:LLM 集成、RAG、Agent 编排、生产化(而非具体框架)
- 建议分类:
AI Engineering / 职业趋势 / 2026 - 可信度:高——基于 1000+ JD 实证数据
- 后续行动:参考作为 AI 工程能力图谱构建依据
📝 5.2 "Deep|LLM 2026: From the Illusion of Model Development Stagnation to Large-Scale Real-World Agent Deployment"
- 作者:fundaai(Substack)
- URL:https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of
- 标签:Agent / Production / 2026 / 范式转变
- 工程价值:⭐⭐⭐⭐⭐
- 核心论断:
- 2025 年不是模型停滞,而是范式转变:从"模型能力"转向"系统级执行"
- 2026 年是从"AI 能思考"到"AI 能执行"的关键拐点
- 核心瓶颈已从 per-inference FLOPS 转向系统级能力:并发会话管理、长生命周期 Agent、工具调用协调
- 建议分类:
AI Engineering / Agent / 系统架构 / 2026 - 可信度:中高——行业分析,有具体产品案例(Claude Code、Claude CoWork)
- 后续行动:重点关注 Agent 生产化工程挑战
📝 5.3 "Physics & Engineering of Frontier LLM Inference (2026 Edition)" — 10集系列
- 作者:DistributedApps.ai(AI Researchers)
- URL:https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 标签:LLM Inference / 系统工程 / 课程 / 2026
- 工程价值:⭐⭐⭐⭐⭐
- 发布计划:2026-09-04 首播,共 10 章
- 课程大纲(高价值预告):
- Ch1: Physics of LLM Inference 2026 Edition
- Edge SLM 部署:DeepSeek-V4-Pro-Distill-Qwen (1.5B/7B/14B)、Llama-3.2、SmolLM2、Phi-4 on Apple Silicon MLX/Metal、骁龙 X Elite NPU、WebGPU/ONNX Runtime
- 2026 生产架构栈:API Gateway + Semantic Router + Global Prefix Caching + Disaggregated P/D Nodes + Hardware Telemetry
- 建议分类:
LLM Serving / 工程课程 / 2026-09 - 后续行动:9月4日跟进首播;系列可作为知识库 Inference 工程路径参考
📝 5.4 "LLM Inference at Scale: Batching, Caching, Routing, and Cost Control"
- 作者:designgurus(Substack)
- URL:https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
- 标签:LLM Inference / Batching / Caching / Cost / 2026
- 工程价值:⭐⭐⭐⭐
- 核心内容:Prefill vs Decode、KV Cache、Continuous Batching、Paged Attention、量化、Speculative Decoding、分布式推理、生产指标(TTFT、TPOT、P99)
- 建议分类:
LLM Serving / 推理优化 / 成本控制 / 2026 - 后续行动:可作为 Inference 基础概念核查清单
6. 向量数据库工程(补充)
🗄️ 2026 向量数据库选型(来自 awesome-rag-production)
| 场景 | 推荐 |
|---|---|
| 已有 PostgreSQL | pgvector |
| <50M 向量 + 强过滤 | Qdrant |
| 十亿级规模 | Milvus |
| 零运维 Serverless | Pinecone |
| 本地原型 | Chroma(但生产勿用 SQLite 模式) |
| Web 规模混合搜索 | Vespa |
| 混合向量+关键词 | Weaviate |
Open WebUI 生产注意:ChromaDB 默认 local SQLite 模式在多 worker/多副本下会崩溃;改用 ChromaDB HTTP 模式或专用向量数据库。
分类标签
LLM Serving KV Cache Inference Engine vLLM SGLang Tensor Parallelism Agent Engineering AI Engineering Hugging Face Vector DB Production 2026
建议写入路径
/shared/research-kb/inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md
后续行动建议
- 精读优先级:Oneiros (2507.11507) + Albireo (2606.01927) —— KV Cache 前沿方向
- 审稿建议:推理引擎对比框架(vLLM/SGLang/LMDeploy)——生产选型参考
- 跟进项:kenhuang 9月4日10集系列首播
- 已覆盖:HF State of OS Spring 2026(地理格局 + Qwen 生态数据);Substack 4篇工程洞察
- 待核验:Oneiros 集成 vLLM 的具体 API 接口;SGLang MoRI AMD 成本基准
本草案由 Jay(2026-09-01T09:35)产出,未经 Git 提交,仅供草稿区暂存。