Jay 工程筛选草稿 · 2026-10-07 晚场

任务信息

  • 筛选时间: 2026-10-07 19:50 CST
  • 本次主题: LLM Inference Engineering + Agentic AI Production Failures
  • 检索范围: Tavily (web), arXiv, GitHub Topics, Substack

一、保留条目(高价值)

1. GPU Insights · vLLM vs SGLang vs TensorRT-LLM 2026 基准对比

  • URL: https://gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026
  • 来源类型: 独立技术博客(有实测数据)
  • 可信度: 高(有具体测试环境/命令/数字)
  • 核心内容:
  • H100 SXM5 80GB · Llama 3.3 70B FP8 实测
  • vLLM v0.18.0 / TensorRT-LLM v1.2.0 / SGLang v0.5.9
  • 单请求: TRT-LLM 领先 vLLM 8%;50并发: TRT-LLM 领先 vLLM 13%
  • SGLang prefix-heavy 负载: 16,200 tok/s vs vLLM 12,500 tok/s(+29%)
  • 云AI PT H100 benchmark suite 数据源
  • 保留理由: 难得的具体版本号+硬件+并发场景实测数据,生产选型直接可参考
  • 标签: inference-engineering vLLM SGLang TensorRT-LLM benchmark
  • 建议写入路径: inference/vllm-sglang-trt-benchmark-2026.md

2. Spheron Blog · vLLM vs TensorRT-LLM vs SGLang H100 Benchmarks

  • URL: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
  • 来源类型: 技术博客
  • 可信度: 高(独立实测)
  • 核心内容:
  • 同 H100 80GB · Llama 3.3 70B FP8
  • TRT-LLM 始终领先,并发越高差距越大
  • SGLang 中等并发略弱于 TRT-LLM
  • 生产选型矩阵:SGLang=prefix共享场景,TRT-LLM=单模型高吞吐,vLLM=快速迭代
  • 测试Setup部分含硬件规格和配置细节
  • 保留理由: 选型决策矩阵清晰,与 GPU Insights 互相印证,实验设计有参考价值
  • 标签: inference-engineering benchmark H100 production
  • 建议写入路径: inference/vllm-sglang-trt-benchmark-2026.md

3. arXiv:2605.16867 · GoodServe: Agentic LLM Inference Serving

  • URL: https://arxiv.org/html/2605.16867v1
  • 来源类型: 学术论文
  • 可信度: 高(arXiv peer-adjacent)
  • 核心内容:
  • Agentic LLM 的关键指标是 TTLT(Time-To-Last-Token),不是 TTFT/TPOT
  • Agentic 场景需 E2E-SLO 约束,与传统 chatbot 推理本质不同
  • GoodServe 调度算法处理异构 GPU 资源上的 agentic 请求
  • KV Cache 容量约束建模(引用 vLLM 2026 项目)
  • 保留理由: 工程视角清晰,E2E-SLO 概念对 agent 部署团队有直接价值;属于前沿研究但有明确工程含义
  • 标签: inference-engineering agentic-AI arXiv E2E-SLO
  • 建议写入路径: agentic-ai/goodserve-agentic-inference-serving.md
  • 后续行动: 建议阅读原文第 3-5 节(调度算法与 E2E-SLO 建模部分)

4. arXiv:2605.01280 · LLM Serving Needs Mathematical Optimization, Not Just Heuristics

  • URL: https://arxiv.org/html/2605.01280v1
  • 来源类型: 学术论文立场文章
  • 可信度: 高
  • 核心内容:
  • LLM 推理调度需要理论保证,不能只靠启发式
  • Chen et al. 2026: barrier-synchronized DP decoding 场景下,数学优化方法比 naive 策略 Ω(√(B log G)) 提升
  • 可证明最坏情况保证,不依赖特定 trace
  • 保留理由: 为推理系统调度提供理论框架,工程价值在于理解为什么启发式有天花板
  • 标签: inference-engineering arXiv scheduling theory
  • 建议写入路径: inference/llm-serving-mathematical-optimization.md
  • 后续行动: 建议审稿,关注其中 DP load balancing formulation 是否可工程落地

5. DEV Community · Agentic AI Fails in Production (MLDS 2026)

  • URL: https://dev.to/theprodsde/agentic-ai-fails-in-production-for-simple-reasons-what-mlds-2026-taught-me-2ec
  • 来源类型: 会议笔记/个人博客
  • 可信度: 中(个人观察,但有具体 Summit 来源)
  • 核心内容:
  • MLDS 2026 (Analytics India Magazine, Bangalore) 真实 conference report
  • 4 大失败根因: stale data、poor validation、lost context、lack of governance
  • 核心观点: enterprise AI = system design problem,不是 model selection problem
  • 需要的: validation-first agents、structural intelligence、strong observability、memory discipline、cost-aware orchestration
  • 保留理由: 工程教训来自真实会议,不是营销内容;stale data 和 lost context 是 agent 生产部署高频痛点
  • 标签: agentic-AI production-failures MLDS2026 observability
  • 建议写入路径: agentic-ai/agentic-ai-production-failures-mlds2026.md

6. Ken Huang Substack · Physics & Engineering of Frontier LLM Inference (2026 Edition)

  • URL: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
  • 来源类型: Substack 专栏(预告 10 篇系列)
  • 可信度: 中(预发布,内容质量待验证)
  • 核心内容:
  • Chapter 6: P/D Disaggregation 深度解析(Prefill/Decode 分离架构)
  • Moonshot AI Mooncake (Kimi K3 2.8T) KVCache-centric 分布式 serving 架构
  • DeepSeek-V4 Native Sparse Attention (NSA) block-sparse kernel
  • LongLoRA context extension 方法
  • 2026 Production Blueprint(含 API Gateway、Semantic Router、Prefix Caching Cluster)
  • 保留理由: P/D Disaggregation 是 2026 基础设施热点,Mooncake 是公开最详细的 KVCache-centric 架构案例;Substack 预告需后续追踪
  • 标签: Substack inference-engineering P/D-disaggregation Mooncake DeepSeek
  • 建议写入路径: inference/llm-inference-physics-engineering-2026-substack.md
  • 后续行动: 等待系列正文发布后核验;建议追踪 Ken Huang 确认章节是否已发布

7. The AI Engineer Substack · The AI Agents Stack 2026 Edition

  • URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 来源类型: Substack 专栏(Paolo Perrone)
  • 可信度: 中高
  • 核心内容:
  • 3-tier memory architecture (2024 vector DB RAG → 2026 first-class architectural primitive)
  • "Context engineering" 取代 "prompt engineering" 作为核心 discipline
  • Memory blocks (named structured fields in context window)
  • Boundary design: 定义 human judgment 边界比选模型更难
  • Agent stack = agent loop (think-act-observe) + state + tools + memory + guardrails
  • 保留理由: memory tier 概念和 context engineering 术语有工程落地价值;Paolo Perrone 是活跃的 AI 工程社区作者
  • 标签: Substack agentic-AI memory context-engineering
  • 建议写入路径: agentic-ai/ai-agents-stack-2026-substack.md

8. CSDN · 2026年LLM推理框架全解析:从vLLM到SGLang

  • URL: https://blog.csdn.net/Gaga246/article/details/155610267
  • 来源类型: CSDN 博客
  • 可信度: 中(营销性质,但含版本/benchmark 数字)
  • 核心内容:
  • SGLang 0.4.3 (2025-02),支持 DeepSeek-R1/DeepSeek-V3 FP8 推理
  • DeepSeek 开源组件: FlashMLA (Hopper, BF16, 分页 KV Cache, H800 ~3000 GB/s bandwidth)
  • DeepEP (MoE communication)
  • SGLang + vLLM backend 实际 benchmark: 1000+ tok/s
  • 保留理由: 汇总了 DeepSeek 开源组件技术参数,对推理优化研究有线索价值;CSDN 中难得的含数据内容
  • 标签: CSDN inference-engineering DeepSeek SGLang vLLM benchmark
  • 建议写入路径: inference/deepseek-open-infra-components-csdn.md
  • 审稿备注: 需对照 DeepSeek GitHub 官方 repo 核验 FlashMLA 规格数字

二、丢弃条目及理由

条目 丢弃理由
Morph · LLM Inference Optimization (2026) 通用优化方法概述,无具体命令/环境/错误信息;engine 对比表格有价值但全文重复其他来源
BentoML · 6 Production-Tested Optimization Strategies 策略分类有价值,但原文 2026-01 已过时;SGLang/TensorRT-LLM 数据缺失
System Design Handbook · LLM Inference Guide 面试向内容,工程实操价值低
Yotta Labs · How LLM Inference Actually Works 概念性内容,无源码/命令,含 SGLang 选型内容但被其他来源覆盖
Towards AI · LLM Inference Handbook 2026 入门级 overview,60min read;与 GPU Insights/Spheron 相比无增量工程数据
Deepchecks · LLM Optimization 评测框架营销文,工程细节不足
McKinsey · Six Lessons from Agentic AI 咨询视角,缺少具体技术/失败案例细节
LinkedIn · Why Agentic AI Systems Fail 观点性文章,无具体命令或数据,MLDS 2026 DEV 文章更优
GitHub kodigitaccount · 2026 Roadmap 汇总列表,无原创工程内容
GitHub Topics · ai-tools 仓库列表聚合,无深度分析
CSDN · 一文读懂大模型推理部署框架(149715343) 版本/环境信息缺失;含多框架对比但无实测数据

三、Substack 追踪备忘

作者/专栏 状态 备注
Ken Huang (kenhuangus) 预告系列,待发布 Physics & Engineering of Frontier LLM Inference 2026
Paolo Perrone (The AI Engineer) 已发布 AI Agents Stack 2026 已收录
Latent Space 未收录 建议加入订阅源(top pick for evals per daily.dev)
Interconnects 未收录 建议加入订阅源(research-to-production judgment)

四、本次写入路径汇总

/shared/research-kb/inbox/jay/
  ├── 2026-10-07-inference-engineering-agentic-ai-screening.md   ← 本草稿
  ├── inference/
  │   ├── vllm-sglang-trt-benchmark-2026.md                     ← 合并保留条#1+#2
  │   ├── llm-serving-mathematical-optimization.md               ← 保留条#4
  │   ├── llm-inference-physics-engineering-2026-substack.md    ← 保留条#6
  │   └── deepseek-open-infra-components-csdn.md                ← 保留条#8
  └── agentic-ai/
      ├── goodserve-agentic-inference-serving.md                 ← 保留条#3
      ├── agentic-ai-production-failures-mlds2026.md            ← 保留条#5
      └── ai-agents-stack-2026-substack.md                      ← 保留条#7

五、建议后续行动

  1. 精读: arXiv:2605.16867 (GoodServe) 第 3-5 节;arXiv:2605.01280 第 2-3 节
  2. 核验: CSDN DeepSeek FlashMLA 数字 → 对应 DeepSeek GitHub 官方 repo
  3. 订阅源补充: Latent Space、Interconnects 加入 Substack 追踪列表
  4. 追踪: Ken Huang 系列正式发布后重新评估完整度
  5. 版本核验: GPU Insights/Spheron 的 vLLM v0.18.0 / SGLang v0.5.9 版本号需对照 GitHub releases 确认真实性

Jay · 2026-10-07 19:50 CST · 工程筛选晚场完成