Jay 工程筛选 · LLM 推理工程(2026-08-18)

筛选批次

  • 时间:2026-08-18 10:50 (UTC+8)
  • 主题:LLM 推理优化 · vLLM 生产部署 · Agent 架构栈
  • 检索范围:Tavily 搜索 · Substack · GitHub agents-radar · 技术博客

✅ 保留条目(高工程价值)

1. vLLM 生产部署完整指南(Spheron)

来源vLLM Production Deployment 2026: Multi-GPU Tensor Parallelism
类型:技术博客 · 工程实操
保留理由:含真实 Docker 部署命令、FP8 量化参数、GPU 利用率调优、H200 优化、Prometheus 监控指标解读。

核心工程内容

docker run --gpus all \
  --ipc=host \
  -p 8000:8000 \
  -e HUGGING_FACE_HUB_TOKEN=your_token_here \
  vllm/vllm-openai:latest \
  --model meta-llama/Llama-3.3-70B-Instruct \
  --dtype fp8 \
  --max-model-len 16384 \
  --gpu-memory-utilization 0.92 \
  --max-num-seqs 128
  • FP8 量化:VRAM 140GB → 70GB(单卡 H100 可跑 70B),吞吐量提升 1.5–2x
  • 关键监控指标:/metrics 端点,关注 vllm:num_requests_waiting(队列深度)、vllm:kv_cache_usage_perc(KV Cache 压力)、TTFT
  • Tensor Parallelism:--tensor-parallel-size N 自动分片,配合 --ipc=host

评价:生产级命令参考,H100/H200 云成本计算有具体数字($2.01/hr PCIe),可直接用于成本评估。


2. vLLM 优化技术 5 种方法(Jarvis Labs)

来源vLLM Optimization Techniques: 5 Practical Methods to Improve Performance
类型:技术博客 · 基准测试
保留理由:有 Prefix Caching 开关对比命令、CPU Offloading 真实开关参数、A/B 性能对比数据。

核心工程内容

# 无 prefix caching
vllm serve Qwen/Qwen3-32B \
  --no-enable-prefix-caching \
  --dtype bfloat16 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.95

# 有 prefix caching(2000-token system prompt × 1000 用户 = 节省 20 亿 token)
vllm serve Qwen/Qwen3-32B \
  --enable-prefix-caching \
  --dtype bfloat16 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.95
  • Prefix Caching 命中时:RAG 管道中相同检索文档多次出现场景收益最大
  • CPU Offloading:新 CLI 参数,适合 memory pressure 模拟环境

评价:命令级对比,对理解 prefix caching 开关效果有直接帮助,适合做 runbook 参考。


3. LLM 推理优化 5-10x 成本降低技术栈(jobsbyculture)

来源LLM Inference Optimization: The 5 Techniques That Cut Cost 5-10x and Latency 3-5x (2026)
类型:工程综述
保留理由:Prefix Caching(GQA 配合)、Continuous Batching、PagedAttention 组合效果量化,含 70B 模型 naive vs optimized 成本对比($100+/hr → $15-20/hr)。

核心数据: - 优化后 GPU 利用率:80-90%(naive 为 30-40%) - Naive 70B on A100s:$100+/hr → 优化后 $15-20/hr - Batching 机制:静态 → 连续,吞吐量提升 2-4x

评价:概览性文章但数字有说服力,适合作为工程决策的量化背景。


4. The AI Agents Stack 2026 Edition(The AI Engineer · Substack)

来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者:Paolo Perrone
发布时间:2026(Issue 整理)
类型:Substack 行业研究
保留理由:6 层 Agent 架构体系图(2024 → 2026 变化:MCP 新工具层、Memory 成第一等公民、推理模型改变单/多步决策)。含真实生产案例(Cursor 的 90 分钟 eval 循环、sandboxed 执行)。

核心工程洞察: - Layer 1 (Models):多模型路由(Claude/GPT-4/自微调) - Layer 2 (Protocols & Tools):MCP 服务器连接编辑器/终端/文件系统 - Layer 3 (Memory):reranking + 代码库感知检索 - Layer 4 (Frameworks):自定义 RL 编排(非 LangGraph) - Layer 5 (Eval):Cursor 每 90 分钟重新训练接受率模型 - Layer 6 (Guardrails):沙箱执行防止失控

2024 → 2026 三大事实: 1. MCP 标准化工具连接(新工具层) 2. 推理模型改变自主能力(单步 agent 替代部分多步 chain) 3. Memory 成第一等架构原语

评价:架构思维清晰,Eval 和 Guardrails 层常被初学者低估,本文给出了具体案例。适合作为工程团队内部对齐材料。


5. Java/Python AI 生产技术栈 2026(Substack)

来源:https://substack.com/home/post/p-186623936
发布时间:2026-02
类型:Substack · 工程栈对比
保留理由:含 Spring AI 2.0 + LangChain4j 真实版本号、GraphRAG 量化数据(85-95% 准确率)、Semantic Caching 成本降低 60-80%、JVM 并发原语(Virtual Threads/Project Panama)用于 AI 编排的工程可行性评估。

核心数据: - Semantic Caching:LLM 运营成本降低 60-80% - GraphRAG 多跳推理:85-95% 准确率 - Spring AI 2.0 + Neo4j 5.x:Phase 1-4 迁移路径(12 周计划) - Vector API(JEP 529):仍处孵化阶段,需 --add-modules jdk.incubator.vector

评价:JVM 生态做 AI 的工程可行性分析,GraphRAG 数据有参考价值。注意 Vector API 生产状态说明。


6. 多 Agent vs 单 Agent 性能研究

来源YouTube - Enterprise AI Ecosystem 2026
类型:视频 · 研究数据
保留理由:有具体数字——多 Agent 编排解决 IT 故障:100% 可操作推荐质量 vs 单 Agent 1.7%;延迟相同(约 40 秒);工程类比生动(单厨师 vs 餐厅团队)。

核心数据: - 348 次控制实验(模拟 IT 故障响应) - 多 Agent:100% 可操作质量 - 单 Agent:1.7%(统计上接近零) - 延迟:两者均为 ~40 秒(关键洞察) - 80x 特异性提升,140x 正确性提升

评价:工程团队说服材料有力,但需注意这是模拟环境。生产编排的 state/memory 管理挑战(Agent 4 崩溃恢复)也被提到。


7. SGLang vs vLLM vs LMDeploy vs TensorRT-LLM 基准(Prem AI)

来源10 Best vLLM Alternatives for LLM Inference in Production 2026
类型:技术博客 · 基准对比
保留理由:2026 年主流推理引擎吞吐量实测对比表格,H200 新硬件数据,TGI 进入维护模式(2025-12)需迁移。

核心数据: | Engine | Throughput (tok/s) | Latency p50 | Status | |--------|-------------------|-------------|--------| | SGLang | 16,215 | 4-21ms | Active | | LMDeploy | 16,132 | ~25ms | Active | | vLLM | 12,553 | 50-80ms | Active | | TensorRT-LLM | 10,000+ | 35-50ms | Active | | TGI | ~9,500 | ~60ms | Maintenance |

  • TGI 2025-12 进入维护,仅接受 bugfix,新项目建议 SGLang 或 vLLM
  • SGLang 部署 40 万+ GPU,成为 agentic workload 事实标准
  • vLLM v0.15.1 (2026-02):PyTorch 2.10,Blackwell SM120 支持,H200 优化

评价:2026 推理引擎选型必读,数字新鲜,有工程决策价值。


❌ 丢弃条目(低工程价值)

条目 丢弃理由
LLM Engineering Full Course (YouTube) 课程介绍,无具体命令/代码/性能数据
AI Engineering Checklist 2026 (LinkedIn) 清单汇总,缺少可执行步骤
LLMOps Guide 2026 (Redis blog) 偏概念,RouterBench 引用无实测数字
MLOps/LLMOps Roadmap 2026 (MachineLearningMastery) 路线图,无工程细节
Javarevisited AI Engineer Roadmap 2026 (Substack) 课程推广,核心内容需付费
"What 1000+ Job Descriptions Reveal" (Substack) 招聘分析,非工程实操
AI Engineer Roadmap (Opinion AI · Substack) 付费锁定,无免费内容
The AI Systems Engineer Journey (Substack) RAG 入门分析,无新数据

📋 分类标签

LLM推理 vLLM SGLang Agent架构 MCP GraphRAG 推理引擎对比 生产部署 Benchmark PrefixCaching


💾 建议写入路径

/shared/research-kb/inbox/jay/2026-08-18-llm-inference-engineering.md

🔬 后续行动建议

  1. 精读The AI Agents Stack 2026 Edition(Paolo Perrone)— 6 层框架适合工程团队内部分享
  2. 核验:vLLM vs SGLang 基准数字(Prem AI)— 建议对照 arXiv 论文 2511.17593 交叉验证
  3. 主题页更新:建议在知识库增加"推理引擎选型 2026"专页,汇总 SGLang/vLLM/LMDeploy/TensorRT-LLM 对比
  4. 代码仓库:agents-radar(duanyytop)GitHub Issues 的 AI 周报格式值得参考,可用于后续周报标准化