Backend · LLM Inference Stack 2026:引擎、调度与成本
检索时间: 2026-07-13 21:00 实例: Jay 来源: Tavily → Substack (WTF In Tech / DesignGurus / Deep|LLM) / GitHub Trending / arXiv
📊 高价值条目
1. Inference Engine 成本差距:5x ~ 10x(⭐⭐⭐⭐⭐)
- 来源: WTF In Tech Substack, "The Model Is Free. The Inference Is the Business."
- 作者: Bhavishya Pandit
- URL: https://bhavishyapandit9.substack.com/p/the-model-is-free-the-inference-is
- 发布时间: 2026(推测 Q2)
- 可信度: ⭐⭐⭐⭐⭐ 工程一手数据,带图表
- 核心数据:
- 推理成本构成:GPU 70%、网络 8%、编排 7%、缓存 6%、存储 5%、可观测性 4%
- 医疗场景:每百万 token 成本 $0.73 → $0.28,延迟 142ms → 47ms(优化后)
- vLLM / SGLang / TensorRT-LLM 在相同模型上可产生 5-10x 成本差异
- 瓶颈是内存而非算力,所有优化都围绕"喂饱饥饿的GPU"
- 评价: 必读。 基础设施视角的推理成本拆解,对系统设计者极具参考价值
2. LLM Inference at Scale:批处理、缓存、路由、成本控制
- 来源: DesignGurus Substack
- URL: https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
- 可信度: ⭐⭐⭐⭐ 体系化工程总结
- 核心内容:
- Prefill 阶段(计算密集)与 Decode 阶段(内存密集)的本质差异
- 连续批处理(Continuous Batching)使 GPU 利用率从 30% 提升至 75%+
- KV Cache 分层策略(L1 GPU / L2 CPU / L3 NVMe)节省 40% 算力
- AI Gateway 路由:小型开源模型处理简单查询,前沿 API 处理复杂任务,节省 60% 成本
- 评价: 工程落地手册级别,适合作为推理架构师面试/方案设计参考
3. Deep|LLM 2026:从模型迭代到大规模 Agent 部署
- 来源: FundaAI Substack
- URL: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of
- 发布时间: 2026
- 可信度: ⭐⭐⭐⭐ 产业资本视角
- 核心观点:
- 2026 是 AI 从"能思考"到"能执行"的拐点
- Agentic Workflow + 长时间跨度推理推高了算力需求(而非缩减)
- 基础设施(计算/网络/存储)正在被系统性重新定价
- 评价: 战略视角,帮助理解推理需求增长的底层驱动力
4. AI Infrastructure Roadmap:2026 五大前沿
- 来源: NextBigTeng Substack
- URL: https://nextbigteng.substack.com/p/ai-infrastructure-roadmap-five-frontiers-for-2026
- 可信度: ⭐⭐⭐ 行业综述
- 核心观点:
- 第一代 AI 基础设施(模型为产品)→ 第二代(AI 接入现实世界运营场景)
- 关键缺口:从"模型很强"到"AI 能在真实环境持续学习+操作"的工程层
- 评价: 投资视角,适合产品/战略规划参考
5. llm-d:Kubernetes 原生 disaggregated LLM 推理
- 来源: Spheron Blog + CNCF
- URL: https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide
- URL2: https://github.com/llm-d/llm-d
- 发布时间: 2026年3月24日进入 CNCF Sandbox
- 可信度: ⭐⭐⭐⭐⭐ 官方 + CNCF 双重背书
- 核心内容:
- llm-d scheduler:缓存感知的路由进程,最大化 prefix cache 命中率
- Gateway API Inference Extension 集成,替代 round-robin 调度
- 解决单体型 vLLM 在高并发 decode 时 prefill GPU 饱和的问题
- 支持 vLLM disaggregation,是 Kubernetes 原生方案(非 NVIDIA Dynamo 那种编排层方案)
- 评价: 云原生推理 2026 核心项目,K8s 环境必关注
🔍 分类标签
backend llm-inference vllm sglang tensorrt-llm kubernetes disaggregation kv-cache
💡 后续行动建议
- [ ] 精读 WTF In Tech 那篇(最强工程数据,建议加入 inference 主题页引用源)
- [ ] 追踪 llm-d 0.3+ 版本更新(进入 CNCF 后功能迭代加速)
- [ ] 审稿:Inference Engine 选型决策树(vLLM vs SGLang vs TensorRT-LLM)
- [ ] 考虑更新 infrastructure 主题页,加入 disaggregated inference 最新进展
本条为草稿 · Jay · 2026-07-13 · 请勿直接引用