Backend · LLM Inference Stack 2026:引擎、调度与成本

检索时间: 2026-07-13 21:00 实例: Jay 来源: Tavily → Substack (WTF In Tech / DesignGurus / Deep|LLM) / GitHub Trending / arXiv


📊 高价值条目

1. Inference Engine 成本差距:5x ~ 10x(⭐⭐⭐⭐⭐)

  • 来源: WTF In Tech Substack, "The Model Is Free. The Inference Is the Business."
  • 作者: Bhavishya Pandit
  • URL: https://bhavishyapandit9.substack.com/p/the-model-is-free-the-inference-is
  • 发布时间: 2026(推测 Q2)
  • 可信度: ⭐⭐⭐⭐⭐ 工程一手数据,带图表
  • 核心数据:
  • 推理成本构成:GPU 70%、网络 8%、编排 7%、缓存 6%、存储 5%、可观测性 4%
  • 医疗场景:每百万 token 成本 $0.73 → $0.28,延迟 142ms → 47ms(优化后)
  • vLLM / SGLang / TensorRT-LLM 在相同模型上可产生 5-10x 成本差异
  • 瓶颈是内存而非算力,所有优化都围绕"喂饱饥饿的GPU"
  • 评价: 必读。 基础设施视角的推理成本拆解,对系统设计者极具参考价值

2. LLM Inference at Scale:批处理、缓存、路由、成本控制

  • 来源: DesignGurus Substack
  • URL: https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
  • 可信度: ⭐⭐⭐⭐ 体系化工程总结
  • 核心内容:
  • Prefill 阶段(计算密集)与 Decode 阶段(内存密集)的本质差异
  • 连续批处理(Continuous Batching)使 GPU 利用率从 30% 提升至 75%+
  • KV Cache 分层策略(L1 GPU / L2 CPU / L3 NVMe)节省 40% 算力
  • AI Gateway 路由:小型开源模型处理简单查询,前沿 API 处理复杂任务,节省 60% 成本
  • 评价: 工程落地手册级别,适合作为推理架构师面试/方案设计参考

3. Deep|LLM 2026:从模型迭代到大规模 Agent 部署

  • 来源: FundaAI Substack
  • URL: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of
  • 发布时间: 2026
  • 可信度: ⭐⭐⭐⭐ 产业资本视角
  • 核心观点:
  • 2026 是 AI 从"能思考"到"能执行"的拐点
  • Agentic Workflow + 长时间跨度推理推高了算力需求(而非缩减)
  • 基础设施(计算/网络/存储)正在被系统性重新定价
  • 评价: 战略视角,帮助理解推理需求增长的底层驱动力

4. AI Infrastructure Roadmap:2026 五大前沿

  • 来源: NextBigTeng Substack
  • URL: https://nextbigteng.substack.com/p/ai-infrastructure-roadmap-five-frontiers-for-2026
  • 可信度: ⭐⭐⭐ 行业综述
  • 核心观点:
  • 第一代 AI 基础设施(模型为产品)→ 第二代(AI 接入现实世界运营场景)
  • 关键缺口:从"模型很强"到"AI 能在真实环境持续学习+操作"的工程层
  • 评价: 投资视角,适合产品/战略规划参考

5. llm-d:Kubernetes 原生 disaggregated LLM 推理

  • 来源: Spheron Blog + CNCF
  • URL: https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide
  • URL2: https://github.com/llm-d/llm-d
  • 发布时间: 2026年3月24日进入 CNCF Sandbox
  • 可信度: ⭐⭐⭐⭐⭐ 官方 + CNCF 双重背书
  • 核心内容:
  • llm-d scheduler:缓存感知的路由进程,最大化 prefix cache 命中率
  • Gateway API Inference Extension 集成,替代 round-robin 调度
  • 解决单体型 vLLM 在高并发 decode 时 prefill GPU 饱和的问题
  • 支持 vLLM disaggregation,是 Kubernetes 原生方案(非 NVIDIA Dynamo 那种编排层方案)
  • 评价: 云原生推理 2026 核心项目,K8s 环境必关注

🔍 分类标签

backend llm-inference vllm sglang tensorrt-llm kubernetes disaggregation kv-cache


💡 后续行动建议

  • [ ] 精读 WTF In Tech 那篇(最强工程数据,建议加入 inference 主题页引用源)
  • [ ] 追踪 llm-d 0.3+ 版本更新(进入 CNCF 后功能迭代加速)
  • [ ] 审稿:Inference Engine 选型决策树(vLLM vs SGLang vs TensorRT-LLM)
  • [ ] 考虑更新 infrastructure 主题页,加入 disaggregated inference 最新进展

本条为草稿 · Jay · 2026-07-13 · 请勿直接引用