工程知识库草稿 · Jay · 2026-09-25
主题
LLM 推理引擎性能优化 & Agent 工程生态月度扫描
一、高价值条目(保留)
条目 1:vLLM 延迟优化实战 — 含真实 benchmark 数据
来源: Google Developer Forums / vLLM 官方文档
URL: https://discuss.google.dev/t/optimizing-llm-inference-for-minimal-latency-with-vllm/289241
可信度: 高(官方文档 + 实测数据)
工程含量: ⭐⭐⭐⭐⭐
核心内容摘要:
提供针对 vLLM 低延迟推理的参数调优指南,包含真实命令和 benchmark 数据。
关键参数:
--max-num-batched-tokens # 控制每批 token 数
--max-num-seqs # 最大并发序列数
--request-rate # 请求速率 (vllm bench serve)
实测数据(Llama 3-1-70B,A3 Mega 8×H100):
| max-num-seqs | max_num_batched_tokens | req-rate | TTFT (ms) | TPOT (ms) | e2e (s) |
|---|---|---|---|---|---|
| 512 | 2048 | 5 | 17.71 | 16.6 | 1.48 |
| 256 | 2048 | 5 | 29.67 | 12.70 | 1.06 |
| 128 | 2048 | 5 | 30.86 | 12.97 | 1.04 |
1000 并发请求 benchmark 输出(部分):
Successful requests: 1000
Request rate (RPS): 5.00
Total input tokens: 1,498,021 / output tokens: 79,901
Output token throughput: 397.09 tok/s
Mean TTFT: 30.88 ms (P99: 40.34 ms)
Mean TPOT: 12.94 ms (P99: 14.11 ms)
Mean ITL: 12.92 ms (P99: 16.48 ms)
结论: max-num-seqs 越低,端到端延迟越低,但吞吐下降。存在 latency-throughput trade-off。
保留理由: 极少数有完整 benchmark 命令、参数含义解释、实测数据的 vLLM 调优文档。可直接用于生产环境参数配置决策。
条目 2:2026 年主流推理引擎对比(vLLM / SGLang / TGI / TensorRT-LLM)
来源: DeployBase / 行业对比分析
URL: https://deploybase.ai/articles/best-llm-inference-engine
可信度: 中高(综合评测,标注了测试条件)
工程含量: ⭐⭐⭐⭐
性能对比(Llama 70B on A100 80GB):
| 引擎 | 吞吐量 (tok/s) | TTFT (ms) | 内存效率 |
|---|---|---|---|
| vLLM | 3,500 | 150 | 高(PagedAttention) |
| SGLang | 2,800 | 80 | 相似 via 缓存 |
| TGI | 2,500 | 250 | 略低(更多特性) |
| TensorRT-LLM | 4,500* | 150-200 | 最高(编译优化) |
| Baseline | 1,800 | — | 低 |
| llama.cpp | 20 | 800 | CPU 级别 |
*TensorRT-LLM 需要针对特定 GPU 类型编译,不适合需要快速迭代的生产环境。
各引擎优化命令片段:
SGLang 状态图 API:
sgl.gen(name="reasoning", max_tokens=500)
sgl.gen(name="final_answer", max_tokens=200)
# 一次调用代替两次,降低延迟
backend.init_batch_state = True # 启用调度缓存
TGI bfloat16 加速:
docker run -e HF_MODEL_QUANTIZE=bfloat16 ...
# A100/H100 上可获得 10-15% 吞吐提升
llama.cpp GPU 卸载:
./main -m model.gguf -ngl 80 -p "Your prompt"
# GPU 卸载 80 层到 GPU
./main -m model.gguf -t 16 -p "Your prompt"
# CPU 多线程模式,16 线程
保留理由: 覆盖主流引擎,测试条件明确,代码片段可直接使用。对选型决策有直接参考价值。
条目 3:vLLM 2026 博客生态 — 近期工程更新扫描
来源: vLLM Project Blog (vllm-project.github.io)
可信度: 高(官方博客)
工程含量: ⭐⭐⭐⭐
近期值得关注的博文(2026 年 9 月):
| 日期 | 标题 | 关键词 |
|---|---|---|
| 2026-09-18 | Scaling Multi-GPU Video Captioning with PyNvVideoCodec and vLLM | 多 GPU 视频字幕,vLLM-Omni |
| 2026-09-15 | vLLM x Novita AI: Chord, Faster INT4 MoE for Kimi K2.x | INT4 MoE 优化,H200 1.3× / B300 2.15× |
| 2026-09-13 | Kimi K3 Performance Optimizations: The Road to 2.8× Throughput | Kimi K3,vLLM 内核优化 |
| 2026-09-10 | Tiered KV Cache Offloading in vLLM | KV 缓存分层卸载 |
| 2026-09-08 | vLLM x AgentX: Optimizing for Real-World Agentic Serving | Agent 场景服务优化 |
| 2026-09-07 | GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading | GLM 5.3,HiSparse offloading |
| 2026-09-01 | MiniMax H3 on vLLM-Omni: Real-Time Serving with FastVideo | 视频模型实时推理 |
保留理由: vLLM 已成 LLM 服务标准栈,这些博文揭示了 2026 下半年工程优化方向:MoE 稀疏化、KV 卸载、Agent 场景优化、多模态(视频)推理。适合作为主题页更新线索。
条目 4:AI Agent 开源生态扫描(2026-09 月)
来源: duanyytop/agents-radar (GitHub Trending Report)
URL: https://github.com/duanyytop/agents-radar/issues/2401
可信度: 中(社区数据,stars 追踪)
工程含量: ⭐⭐⭐
近期上升趋势项目:
| 项目 | 语言 | 趋势 | 说明 |
|---|---|---|---|
| affaan-m/ECC | JavaScript | +857/天, 235K stars | Agent harness 性能优化系统 |
| obra/superpowers | Shell | +616/天 | agentic skills 框架,CLI 工作流 |
| different-ai/openwork | TypeScript | +97/天 | opencode 驱动的开源 Agent 工作区 |
| alibaba/open-code-review | Go | +359/天 | 确定性 pipeline + LLM Agent 代码审查 |
| headroom | — | +3,142/天 | token 压缩库,减少 60-95% 输入同时保持精度,可作库/proxy/MCP server |
持续高热项目(长期参考):
- rasbt/LLMs-from-scratch: 100K+ stars,PyTorch 从零实现 ChatGPT
- ollama/ollama: 174K+ stars,本地 LLM 事实标准运行时
- vllm-project/vllm: 81K+ stars,业界标准推理引擎
- mem0 / claude-mem / headroom: Agent 记忆/上下文压缩三件套
保留理由: 提供了 2026 年 9 月 Agent 工程生态的实时快照,适合知识库生态图谱更新。headroom 的 token 压缩数据(60-95% 减少)值得重点关注。
条目 5:RAG 评估框架 — RAGXplain 与 RAG 系统评估综述
来源: arXiv (2505.13538v2, 2504.14891v1)
URL: https://arxiv.org/html/2505.13538v2
可信度: 中高(arXiv 同行评审)
工程含量: ⭐⭐⭐
RAGXplain 的 "Metric Diamond" 框架:
连接用户输入、检索上下文、生成答案和标准答案(若有),通过 6 个诊断维度评估 RAG pipeline:
- Context Relevancy — 检索片段相关性
- Context Recall — 检索召回率
- Answer Faithfulness — 生成对上下文的忠实度
- Answer Relevancy — 生成答案与问题的相关性
- Resilience Rate — 检索增强前后答案准确性稳定性
- Boost Rate — 初始错误通过 RAG 修正的比例
RAG vs GraphRAG 系统评估(arXiv 2502.11371v3,2026-03 更新):
在 NQ、HotPotQA、MultiHop-RAG、NovelQA 上对比 RAG 与 GraphRAG,使用 Precision/Recall/F1 和 Accuracy 作为指标。结论:GraphRAG 在多跳问答上优于普通 RAG,但普通 RAG 在单跳检索任务上更快且成本更低。
保留理由: 提供了 RAG 评估的标准化维度,对构建生产 RAG pipeline 的质量监控有直接指导意义。
二、丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| "AI Engineer Roadmap 2026" 系列(多篇 Substack) | 高度重复的道路图/学习指南内容,无新工程数据,来源间互相复制 |
| "Generative AI System Design: Complete Architecture Guide" | 付费 Substack,仅有摘要;缺乏可复现步骤 |
| LLM-Engineering Roadmap (GitHub) | 汇总性质,无原创工程内容,信息密度低 |
| awesome-open-source-llmops (GitHub) | 列表型资源聚合,非一手工程内容 |
三、分类标签
#LLM-Inference #vLLM #SGLang #TGI #Performance-Optimization #Benchmark
#Agent-Engineering #Memory #Context-Compression #RAG #RAG-Evaluation
#MoE #Token-Compression #Production-Systems #2026-Q3
四、建议写入路径
/shared/research-kb/inbox/jay/2026-09-25-llm-inference-agent-engineering.md
五、后续行动建议
- 精读: vLLM 官方博客 "Tiered KV Cache Offloading"(2026-09-10)和 "Kimi K3 Performance Optimizations"(2026-09-13)—— 工程细节丰富,值得单独条目
- 审稿: RAGXplain paper(2505.13538)—— 建议补充该框架在实际 RAG pipeline 中的使用示例
- 主题页更新: 添加
vLLM-Operations和Agent-Memory-Systems两个子主题页,串联本次发现的高价值资源 - 核验: headroom 项目(token 压缩 60-95%)的实际精度损失数据需进一步核实
Jay · 2026-09-25 · 工程知识库筛选 · 第 3 次/天