工程实践筛选报告 · 2026-07-07

主题

LLM Inference Optimization · Agent Memory Systems · RAG Engineering

检索范围

  • 引擎/框架对比: vLLM v0.7.3 / SGLang v0.4.3 / TensorRT-LLM / LMDeploy
  • 学术平台: arXiv (cs.CL, cs.LG, cs.DC), ACL Anthology, IEEE
  • 行业媒体: Lyceum Technology, Spheron Network, Zylos Research, MorphLLM, RankSquire
  • Substack: The Agentic Engineer, The Sequence, Faradawn's AI/ML, MultimodalAI
  • 硬件基准: H100 80GB (FP8), A100, B200

高价值条目

1. Spheron Network: vLLM vs TensorRT-LLM vs SGLang H100 Benchmarks (2026)

来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
可信度: 高 — 同一硬件环境、统一模型(Llama 3.3 70B)、并发压力测试
保留理由: 唯一提供完整 Docker 启动命令的主流对比文章,含实际参数(--quantization fp8--max-model-len 8192--gpu-memory-utilization 0.92

关键工程数据(H100 80GB, Llama 3.3 70B FP8):

引擎 Throughput (50 req) TTFT p50 Cold Start
vLLM v0.18 1,850 tok/s 120 ms ~62 sec
TensorRT-LLM 2,100 tok/s 105 ms ~28 min
SGLang v0.5 1,920 tok/s 112 ms ~58 sec

建议行动: ✅ 收录 — 可作为推理引擎选型的基准参考,命令可直接复现


2. Zylos Research: LLM Inference Optimization and Quantization 2026

来源: https://zylos.ai/research/2026-01-15-llm-inference-optimization
可信度: 高 — 量化数据来自框架官方文档+实测
保留理由: 提供完整的优化栈排序和 H100 vs A100 决策矩阵,含真实 benchmark 代码段

关键工程数据: - 优化栈排序(按影响力): Continuous Batching (23x) > PagedAttention (2-4x) > FP8 (30%) > FlashAttention-3 (1.5-2x) > Speculative Decoding (2-3x) - H100 vs A100 (TensorRT-LLM): 4.6x 整体性能,2x 固定 batch 吞吐,3x 动态 batch 吞吐

建议行动: ✅ 收录 — 决策框架实用,适合工程选型文档引用


3. arXiv 2605.01280: LLM Serving Needs Mathematical Optimization (ICML 2026)

来源: https://arxiv.org/pdf/2605.01280
可信度: 高 — 学术同行评审论文(ICML 2026)
保留理由: 首次将 LLM serving 的调度问题形式化为多阶段在线调度问题,挑战生产中普遍使用的简单启发式(JSQ routing、FIFO scheduling、LRU eviction)

核心洞察: - 现有生产系统使用 join-shortest-queue routing、fifo scheduling、LRU eviction,忽略 LLM inference 独特结构(prefill-decode asymmetry、动态内存增长、不确定输出长度) - 提出 WAIT 算法(Waiting for Accumulated Inference Threshold):基于阈值的 admission control,防止 eviction cascade,接近 fluid equilibrium

建议行动: ✅ 收录 — 理论深度高,对理解生产推理调度系统设计有长期价值


4. arXiv 2606.24775: Are We Ready For An Agent-Native Memory System?

来源: https://arxiv.org/html/2606.24775v1
可信度: 高 — arXiv 学术论文
保留理由: 系统性挑战现有 agent memory 评估框架(LoCoMo、LongMemEval),指出只测端到端任务成功率而忽略系统层问题(运营成本、架构权衡、动态知识更新的鲁棒性)

核心洞察: - 现有 benchmark 缺陷:将 memory 视为黑盒,忽略内部系统架构差异 - Agent-native memory 必须处理:persistent storage、update、consolidation、dynamic lifecycle governance - 关键区分:Agent memory ≠ RAG(前者持久+可更新,后者无状态只读)

建议行动: ✅ 收录 — 适合作为 agent memory 主题页的方法论引用


5. RankSquire: Agent Memory vs RAG — What Breaks at Scale 2026

来源: https://ranksquire.com/2026/03/31/agent-memory-vs-rag-what-breaks-at-scale-2026
可信度: 中 — 单一来源生产测试(50,000 sessions, DigitalOcean Frankfurt),非同行评审
保留理由: 提供 RAG 在 agent pipeline 中的延迟叠加真实数据

关键工程数据: - 单次 retrieval: 50-200ms - 20-step agent chain: 3,000ms 纯 retrieval 开销(每步 150ms with reranker) - 200 sessions/day 的 pipeline 中 overhead 复合效应明显

建议行动: ⚠️ 参考收录 — 数据来源单一,需交叉验证;但 latency compounding 的工程问题描述准确,可作为假设引用


6. MorphLLM / JarvisLabs: LLM Inference Engines Compared (2026)

来源: https://www.morphllm.com/llm-inference-optimization | https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
可信度: 中高 — 多个来源交叉印证
保留理由: SGLang v0.4.3 + LMDeploy 同测 16,200 tok/s(H100),与 Spheron 数据相互印证

关键数据: - SGLang/LMDeploy: ~16,200 tok/s(H100) - vLLM v0.7.3: ~12,500 tok/s - SGLang 优势场景:prefix-heavy workloads(RAG、multi-turn chat)— RadixAttention prefix caching

建议行动: ✅ 收录 — 与 Spheron 互为印证,数据一致性好


7. Substack: The Agentic Engineer — AI Tech Daily 2026-06-16

来源: https://theagenticengineer.substack.com/p/ai-tech-daily-2026-06-16
可信度: 中 — 行业资讯汇编
保留理由: 近期 inference engine 更新动态:vLLM v0.23.0 支持 DeepSeek-V4;LMSYS DFlash speculation decoding 成为 SGLang 默认,397B 模型上 4.3x throughput

建议行动: ⚠️ 简报收录 — 作为新闻线索,不适合深度工程引用


丢弃条目

条目 丢弃理由
Yotta Labs "vLLM vs TensorRT-LLM Which Should You Use" 内容偏选型建议,无新 benchmark 数据,引用数据来自其他来源二次整理
Faradawn's Substack "Inside TensorRT LLM Deep Dive" 内容稀缺,主要引流到外部链接,无原创工程数据
The Sequence "New Companies That Can Change Inference Landscape" 纯商业/VC 分析,无工程细节
Atlan "RAG Evaluation 2026" 概念性总结为主,无新数据或工程细节

分类标签

#LLM-Inference #vLLM #SGLang #TensorRT-LLM #Agent-Memory #RAG #Benchmark #H100 #Quantization #Scheduling


建议写入路径

/shared/research-kb/inbox/jay/2026-07-07-llm-inference-agent-memory-engineering.md


后续行动建议

  1. 精读: arXiv 2605.01280(WAIT 调度算法)+ arXiv 2606.24775(agent-native memory 评估框架)
  2. 审稿: Spheron benchmark 命令清单 → 验证是否与官方文档一致(vLLM 0.18.0 实际参数)
  3. 主题页更新: 建议在知识库中建立 LLM-Inference-Engine-Comparison 主题页,整合本次多个来源的 H100 基准数据
  4. 交叉验证: RankSquire 的 latency compounding 数据(需 50K sessions 生产测试背书)

Jay · 2026-07-07 19:50 UTC+8 · 工程实践筛选