Jay 工程筛选 · LLM 推理工程(2026-08-18)
筛选批次
- 时间:2026-08-18 10:50 (UTC+8)
- 主题:LLM 推理优化 · vLLM 生产部署 · Agent 架构栈
- 检索范围:Tavily 搜索 · Substack · GitHub agents-radar · 技术博客
✅ 保留条目(高工程价值)
1. vLLM 生产部署完整指南(Spheron)
来源:vLLM Production Deployment 2026: Multi-GPU Tensor Parallelism
类型:技术博客 · 工程实操
保留理由:含真实 Docker 部署命令、FP8 量化参数、GPU 利用率调优、H200 优化、Prometheus 监控指标解读。
核心工程内容:
docker run --gpus all \
--ipc=host \
-p 8000:8000 \
-e HUGGING_FACE_HUB_TOKEN=your_token_here \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--dtype fp8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.92 \
--max-num-seqs 128
- FP8 量化:VRAM 140GB → 70GB(单卡 H100 可跑 70B),吞吐量提升 1.5–2x
- 关键监控指标:
/metrics端点,关注vllm:num_requests_waiting(队列深度)、vllm:kv_cache_usage_perc(KV Cache 压力)、TTFT - Tensor Parallelism:
--tensor-parallel-size N自动分片,配合--ipc=host
评价:生产级命令参考,H100/H200 云成本计算有具体数字($2.01/hr PCIe),可直接用于成本评估。
2. vLLM 优化技术 5 种方法(Jarvis Labs)
来源:vLLM Optimization Techniques: 5 Practical Methods to Improve Performance
类型:技术博客 · 基准测试
保留理由:有 Prefix Caching 开关对比命令、CPU Offloading 真实开关参数、A/B 性能对比数据。
核心工程内容:
# 无 prefix caching
vllm serve Qwen/Qwen3-32B \
--no-enable-prefix-caching \
--dtype bfloat16 \
--max-model-len 32768 \
--gpu-memory-utilization 0.95
# 有 prefix caching(2000-token system prompt × 1000 用户 = 节省 20 亿 token)
vllm serve Qwen/Qwen3-32B \
--enable-prefix-caching \
--dtype bfloat16 \
--max-model-len 32768 \
--gpu-memory-utilization 0.95
- Prefix Caching 命中时:RAG 管道中相同检索文档多次出现场景收益最大
- CPU Offloading:新 CLI 参数,适合 memory pressure 模拟环境
评价:命令级对比,对理解 prefix caching 开关效果有直接帮助,适合做 runbook 参考。
3. LLM 推理优化 5-10x 成本降低技术栈(jobsbyculture)
来源:LLM Inference Optimization: The 5 Techniques That Cut Cost 5-10x and Latency 3-5x (2026)
类型:工程综述
保留理由:Prefix Caching(GQA 配合)、Continuous Batching、PagedAttention 组合效果量化,含 70B 模型 naive vs optimized 成本对比($100+/hr → $15-20/hr)。
核心数据: - 优化后 GPU 利用率:80-90%(naive 为 30-40%) - Naive 70B on A100s:$100+/hr → 优化后 $15-20/hr - Batching 机制:静态 → 连续,吞吐量提升 2-4x
评价:概览性文章但数字有说服力,适合作为工程决策的量化背景。
4. The AI Agents Stack 2026 Edition(The AI Engineer · Substack)
来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者:Paolo Perrone
发布时间:2026(Issue 整理)
类型:Substack 行业研究
保留理由:6 层 Agent 架构体系图(2024 → 2026 变化:MCP 新工具层、Memory 成第一等公民、推理模型改变单/多步决策)。含真实生产案例(Cursor 的 90 分钟 eval 循环、sandboxed 执行)。
核心工程洞察: - Layer 1 (Models):多模型路由(Claude/GPT-4/自微调) - Layer 2 (Protocols & Tools):MCP 服务器连接编辑器/终端/文件系统 - Layer 3 (Memory):reranking + 代码库感知检索 - Layer 4 (Frameworks):自定义 RL 编排(非 LangGraph) - Layer 5 (Eval):Cursor 每 90 分钟重新训练接受率模型 - Layer 6 (Guardrails):沙箱执行防止失控
2024 → 2026 三大事实: 1. MCP 标准化工具连接(新工具层) 2. 推理模型改变自主能力(单步 agent 替代部分多步 chain) 3. Memory 成第一等架构原语
评价:架构思维清晰,Eval 和 Guardrails 层常被初学者低估,本文给出了具体案例。适合作为工程团队内部对齐材料。
5. Java/Python AI 生产技术栈 2026(Substack)
来源:https://substack.com/home/post/p-186623936
发布时间:2026-02
类型:Substack · 工程栈对比
保留理由:含 Spring AI 2.0 + LangChain4j 真实版本号、GraphRAG 量化数据(85-95% 准确率)、Semantic Caching 成本降低 60-80%、JVM 并发原语(Virtual Threads/Project Panama)用于 AI 编排的工程可行性评估。
核心数据:
- Semantic Caching:LLM 运营成本降低 60-80%
- GraphRAG 多跳推理:85-95% 准确率
- Spring AI 2.0 + Neo4j 5.x:Phase 1-4 迁移路径(12 周计划)
- Vector API(JEP 529):仍处孵化阶段,需 --add-modules jdk.incubator.vector
评价:JVM 生态做 AI 的工程可行性分析,GraphRAG 数据有参考价值。注意 Vector API 生产状态说明。
6. 多 Agent vs 单 Agent 性能研究
来源:YouTube - Enterprise AI Ecosystem 2026
类型:视频 · 研究数据
保留理由:有具体数字——多 Agent 编排解决 IT 故障:100% 可操作推荐质量 vs 单 Agent 1.7%;延迟相同(约 40 秒);工程类比生动(单厨师 vs 餐厅团队)。
核心数据: - 348 次控制实验(模拟 IT 故障响应) - 多 Agent:100% 可操作质量 - 单 Agent:1.7%(统计上接近零) - 延迟:两者均为 ~40 秒(关键洞察) - 80x 特异性提升,140x 正确性提升
评价:工程团队说服材料有力,但需注意这是模拟环境。生产编排的 state/memory 管理挑战(Agent 4 崩溃恢复)也被提到。
7. SGLang vs vLLM vs LMDeploy vs TensorRT-LLM 基准(Prem AI)
来源:10 Best vLLM Alternatives for LLM Inference in Production 2026
类型:技术博客 · 基准对比
保留理由:2026 年主流推理引擎吞吐量实测对比表格,H200 新硬件数据,TGI 进入维护模式(2025-12)需迁移。
核心数据: | Engine | Throughput (tok/s) | Latency p50 | Status | |--------|-------------------|-------------|--------| | SGLang | 16,215 | 4-21ms | Active | | LMDeploy | 16,132 | ~25ms | Active | | vLLM | 12,553 | 50-80ms | Active | | TensorRT-LLM | 10,000+ | 35-50ms | Active | | TGI | ~9,500 | ~60ms | Maintenance |
- TGI 2025-12 进入维护,仅接受 bugfix,新项目建议 SGLang 或 vLLM
- SGLang 部署 40 万+ GPU,成为 agentic workload 事实标准
- vLLM v0.15.1 (2026-02):PyTorch 2.10,Blackwell SM120 支持,H200 优化
评价:2026 推理引擎选型必读,数字新鲜,有工程决策价值。
❌ 丢弃条目(低工程价值)
| 条目 | 丢弃理由 |
|---|---|
| LLM Engineering Full Course (YouTube) | 课程介绍,无具体命令/代码/性能数据 |
| AI Engineering Checklist 2026 (LinkedIn) | 清单汇总,缺少可执行步骤 |
| LLMOps Guide 2026 (Redis blog) | 偏概念,RouterBench 引用无实测数字 |
| MLOps/LLMOps Roadmap 2026 (MachineLearningMastery) | 路线图,无工程细节 |
| Javarevisited AI Engineer Roadmap 2026 (Substack) | 课程推广,核心内容需付费 |
| "What 1000+ Job Descriptions Reveal" (Substack) | 招聘分析,非工程实操 |
| AI Engineer Roadmap (Opinion AI · Substack) | 付费锁定,无免费内容 |
| The AI Systems Engineer Journey (Substack) | RAG 入门分析,无新数据 |
📋 分类标签
LLM推理 vLLM SGLang Agent架构 MCP GraphRAG 推理引擎对比 生产部署 Benchmark PrefixCaching
💾 建议写入路径
/shared/research-kb/inbox/jay/2026-08-18-llm-inference-engineering.md
🔬 后续行动建议
- 精读:
The AI Agents Stack 2026 Edition(Paolo Perrone)— 6 层框架适合工程团队内部分享 - 核验:vLLM vs SGLang 基准数字(Prem AI)— 建议对照 arXiv 论文 2511.17593 交叉验证
- 主题页更新:建议在知识库增加"推理引擎选型 2026"专页,汇总 SGLang/vLLM/LMDeploy/TensorRT-LLM 对比
- 代码仓库:agents-radar(duanyytop)GitHub Issues 的 AI 周报格式值得参考,可用于后续周报标准化