工程知识库草稿 · Jay · 2026-09-25

主题

LLM 推理引擎性能优化 & Agent 工程生态月度扫描


一、高价值条目(保留)

条目 1:vLLM 延迟优化实战 — 含真实 benchmark 数据

来源: Google Developer Forums / vLLM 官方文档
URL: https://discuss.google.dev/t/optimizing-llm-inference-for-minimal-latency-with-vllm/289241
可信度: 高(官方文档 + 实测数据)
工程含量: ⭐⭐⭐⭐⭐

核心内容摘要:
提供针对 vLLM 低延迟推理的参数调优指南,包含真实命令和 benchmark 数据。

关键参数:

--max-num-batched-tokens   # 控制每批 token 数
--max-num-seqs             # 最大并发序列数
--request-rate             # 请求速率 (vllm bench serve)

实测数据(Llama 3-1-70B,A3 Mega 8×H100):

max-num-seqs max_num_batched_tokens req-rate TTFT (ms) TPOT (ms) e2e (s)
512 2048 5 17.71 16.6 1.48
256 2048 5 29.67 12.70 1.06
128 2048 5 30.86 12.97 1.04

1000 并发请求 benchmark 输出(部分):

Successful requests: 1000
Request rate (RPS): 5.00
Total input tokens: 1,498,021 / output tokens: 79,901
Output token throughput: 397.09 tok/s
Mean TTFT: 30.88 ms (P99: 40.34 ms)
Mean TPOT: 12.94 ms (P99: 14.11 ms)
Mean ITL: 12.92 ms (P99: 16.48 ms)

结论: max-num-seqs 越低,端到端延迟越低,但吞吐下降。存在 latency-throughput trade-off。

保留理由: 极少数有完整 benchmark 命令、参数含义解释、实测数据的 vLLM 调优文档。可直接用于生产环境参数配置决策。


条目 2:2026 年主流推理引擎对比(vLLM / SGLang / TGI / TensorRT-LLM)

来源: DeployBase / 行业对比分析
URL: https://deploybase.ai/articles/best-llm-inference-engine
可信度: 中高(综合评测,标注了测试条件)
工程含量: ⭐⭐⭐⭐

性能对比(Llama 70B on A100 80GB):

引擎 吞吐量 (tok/s) TTFT (ms) 内存效率
vLLM 3,500 150 高(PagedAttention)
SGLang 2,800 80 相似 via 缓存
TGI 2,500 250 略低(更多特性)
TensorRT-LLM 4,500* 150-200 最高(编译优化)
Baseline 1,800 — 低
llama.cpp 20 800 CPU 级别

*TensorRT-LLM 需要针对特定 GPU 类型编译,不适合需要快速迭代的生产环境。

各引擎优化命令片段:

SGLang 状态图 API:

sgl.gen(name="reasoning", max_tokens=500)
sgl.gen(name="final_answer", max_tokens=200)
# 一次调用代替两次,降低延迟
backend.init_batch_state = True  # 启用调度缓存

TGI bfloat16 加速:

docker run -e HF_MODEL_QUANTIZE=bfloat16 ...
# A100/H100 上可获得 10-15% 吞吐提升

llama.cpp GPU 卸载:

./main -m model.gguf -ngl 80 -p "Your prompt"
# GPU 卸载 80 层到 GPU
./main -m model.gguf -t 16 -p "Your prompt"
# CPU 多线程模式,16 线程

保留理由: 覆盖主流引擎,测试条件明确,代码片段可直接使用。对选型决策有直接参考价值。


条目 3:vLLM 2026 博客生态 — 近期工程更新扫描

来源: vLLM Project Blog (vllm-project.github.io)
可信度: 高(官方博客)
工程含量: ⭐⭐⭐⭐

近期值得关注的博文(2026 年 9 月):

日期 标题 关键词
2026-09-18 Scaling Multi-GPU Video Captioning with PyNvVideoCodec and vLLM 多 GPU 视频字幕,vLLM-Omni
2026-09-15 vLLM x Novita AI: Chord, Faster INT4 MoE for Kimi K2.x INT4 MoE 优化,H200 1.3× / B300 2.15×
2026-09-13 Kimi K3 Performance Optimizations: The Road to 2.8× Throughput Kimi K3,vLLM 内核优化
2026-09-10 Tiered KV Cache Offloading in vLLM KV 缓存分层卸载
2026-09-08 vLLM x AgentX: Optimizing for Real-World Agentic Serving Agent 场景服务优化
2026-09-07 GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading GLM 5.3,HiSparse offloading
2026-09-01 MiniMax H3 on vLLM-Omni: Real-Time Serving with FastVideo 视频模型实时推理

保留理由: vLLM 已成 LLM 服务标准栈,这些博文揭示了 2026 下半年工程优化方向:MoE 稀疏化、KV 卸载、Agent 场景优化、多模态(视频)推理。适合作为主题页更新线索。


条目 4:AI Agent 开源生态扫描(2026-09 月)

来源: duanyytop/agents-radar (GitHub Trending Report)
URL: https://github.com/duanyytop/agents-radar/issues/2401
可信度: 中(社区数据,stars 追踪)
工程含量: ⭐⭐⭐

近期上升趋势项目:

项目 语言 趋势 说明
affaan-m/ECC JavaScript +857/天, 235K stars Agent harness 性能优化系统
obra/superpowers Shell +616/天 agentic skills 框架,CLI 工作流
different-ai/openwork TypeScript +97/天 opencode 驱动的开源 Agent 工作区
alibaba/open-code-review Go +359/天 确定性 pipeline + LLM Agent 代码审查
headroom — +3,142/天 token 压缩库,减少 60-95% 输入同时保持精度,可作库/proxy/MCP server

持续高热项目(长期参考): - rasbt/LLMs-from-scratch: 100K+ stars,PyTorch 从零实现 ChatGPT - ollama/ollama: 174K+ stars,本地 LLM 事实标准运行时 - vllm-project/vllm: 81K+ stars,业界标准推理引擎 - mem0 / claude-mem / headroom: Agent 记忆/上下文压缩三件套

保留理由: 提供了 2026 年 9 月 Agent 工程生态的实时快照,适合知识库生态图谱更新。headroom 的 token 压缩数据(60-95% 减少)值得重点关注。


条目 5:RAG 评估框架 — RAGXplain 与 RAG 系统评估综述

来源: arXiv (2505.13538v2, 2504.14891v1)
URL: https://arxiv.org/html/2505.13538v2
可信度: 中高(arXiv 同行评审)
工程含量: ⭐⭐⭐

RAGXplain 的 "Metric Diamond" 框架:
连接用户输入、检索上下文、生成答案和标准答案(若有),通过 6 个诊断维度评估 RAG pipeline:

  1. Context Relevancy — 检索片段相关性
  2. Context Recall — 检索召回率
  3. Answer Faithfulness — 生成对上下文的忠实度
  4. Answer Relevancy — 生成答案与问题的相关性
  5. Resilience Rate — 检索增强前后答案准确性稳定性
  6. Boost Rate — 初始错误通过 RAG 修正的比例

RAG vs GraphRAG 系统评估(arXiv 2502.11371v3,2026-03 更新):
在 NQ、HotPotQA、MultiHop-RAG、NovelQA 上对比 RAG 与 GraphRAG,使用 Precision/Recall/F1 和 Accuracy 作为指标。结论:GraphRAG 在多跳问答上优于普通 RAG,但普通 RAG 在单跳检索任务上更快且成本更低。

保留理由: 提供了 RAG 评估的标准化维度,对构建生产 RAG pipeline 的质量监控有直接指导意义。


二、丢弃条目

条目 丢弃理由
"AI Engineer Roadmap 2026" 系列(多篇 Substack) 高度重复的道路图/学习指南内容,无新工程数据,来源间互相复制
"Generative AI System Design: Complete Architecture Guide" 付费 Substack,仅有摘要;缺乏可复现步骤
LLM-Engineering Roadmap (GitHub) 汇总性质,无原创工程内容,信息密度低
awesome-open-source-llmops (GitHub) 列表型资源聚合,非一手工程内容

三、分类标签

#LLM-Inference #vLLM #SGLang #TGI #Performance-Optimization #Benchmark
#Agent-Engineering #Memory #Context-Compression #RAG #RAG-Evaluation
#MoE #Token-Compression #Production-Systems #2026-Q3

四、建议写入路径

/shared/research-kb/inbox/jay/2026-09-25-llm-inference-agent-engineering.md

五、后续行动建议

  1. 精读: vLLM 官方博客 "Tiered KV Cache Offloading"(2026-09-10)和 "Kimi K3 Performance Optimizations"(2026-09-13)—— 工程细节丰富,值得单独条目
  2. 审稿: RAGXplain paper(2505.13538)—— 建议补充该框架在实际 RAG pipeline 中的使用示例
  3. 主题页更新: 添加 vLLM-Operations 和 Agent-Memory-Systems 两个子主题页,串联本次发现的高价值资源
  4. 核验: headroom 项目(token 压缩 60-95%)的实际精度损失数据需进一步核实

Jay · 2026-09-25 · 工程知识库筛选 · 第 3 次/天