Jay 工程筛选草稿 · 2026-10-07 晚场
任务信息
- 筛选时间: 2026-10-07 19:50 CST
- 本次主题: LLM Inference Engineering + Agentic AI Production Failures
- 检索范围: Tavily (web), arXiv, GitHub Topics, Substack
一、保留条目(高价值)
1. GPU Insights · vLLM vs SGLang vs TensorRT-LLM 2026 基准对比
- URL: https://gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026
- 来源类型: 独立技术博客(有实测数据)
- 可信度: 高(有具体测试环境/命令/数字)
- 核心内容:
- H100 SXM5 80GB · Llama 3.3 70B FP8 实测
- vLLM v0.18.0 / TensorRT-LLM v1.2.0 / SGLang v0.5.9
- 单请求: TRT-LLM 领先 vLLM 8%;50并发: TRT-LLM 领先 vLLM 13%
- SGLang prefix-heavy 负载: 16,200 tok/s vs vLLM 12,500 tok/s(+29%)
- 云AI PT H100 benchmark suite 数据源
- 保留理由: 难得的具体版本号+硬件+并发场景实测数据,生产选型直接可参考
- 标签:
inference-engineering vLLM SGLang TensorRT-LLM benchmark
- 建议写入路径:
inference/vllm-sglang-trt-benchmark-2026.md
2. Spheron Blog · vLLM vs TensorRT-LLM vs SGLang H100 Benchmarks
- URL: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
- 来源类型: 技术博客
- 可信度: 高(独立实测)
- 核心内容:
- 同 H100 80GB · Llama 3.3 70B FP8
- TRT-LLM 始终领先,并发越高差距越大
- SGLang 中等并发略弱于 TRT-LLM
- 生产选型矩阵:SGLang=prefix共享场景,TRT-LLM=单模型高吞吐,vLLM=快速迭代
- 测试Setup部分含硬件规格和配置细节
- 保留理由: 选型决策矩阵清晰,与 GPU Insights 互相印证,实验设计有参考价值
- 标签:
inference-engineering benchmark H100 production
- 建议写入路径:
inference/vllm-sglang-trt-benchmark-2026.md
3. arXiv:2605.16867 · GoodServe: Agentic LLM Inference Serving
- URL: https://arxiv.org/html/2605.16867v1
- 来源类型: 学术论文
- 可信度: 高(arXiv peer-adjacent)
- 核心内容:
- Agentic LLM 的关键指标是 TTLT(Time-To-Last-Token),不是 TTFT/TPOT
- Agentic 场景需 E2E-SLO 约束,与传统 chatbot 推理本质不同
- GoodServe 调度算法处理异构 GPU 资源上的 agentic 请求
- KV Cache 容量约束建模(引用 vLLM 2026 项目)
- 保留理由: 工程视角清晰,E2E-SLO 概念对 agent 部署团队有直接价值;属于前沿研究但有明确工程含义
- 标签:
inference-engineering agentic-AI arXiv E2E-SLO
- 建议写入路径:
agentic-ai/goodserve-agentic-inference-serving.md
- 后续行动: 建议阅读原文第 3-5 节(调度算法与 E2E-SLO 建模部分)
4. arXiv:2605.01280 · LLM Serving Needs Mathematical Optimization, Not Just Heuristics
- URL: https://arxiv.org/html/2605.01280v1
- 来源类型: 学术论文立场文章
- 可信度: 高
- 核心内容:
- LLM 推理调度需要理论保证,不能只靠启发式
- Chen et al. 2026: barrier-synchronized DP decoding 场景下,数学优化方法比 naive 策略 Ω(√(B log G)) 提升
- 可证明最坏情况保证,不依赖特定 trace
- 保留理由: 为推理系统调度提供理论框架,工程价值在于理解为什么启发式有天花板
- 标签:
inference-engineering arXiv scheduling theory
- 建议写入路径:
inference/llm-serving-mathematical-optimization.md
- 后续行动: 建议审稿,关注其中 DP load balancing formulation 是否可工程落地
- URL: https://dev.to/theprodsde/agentic-ai-fails-in-production-for-simple-reasons-what-mlds-2026-taught-me-2ec
- 来源类型: 会议笔记/个人博客
- 可信度: 中(个人观察,但有具体 Summit 来源)
- 核心内容:
- MLDS 2026 (Analytics India Magazine, Bangalore) 真实 conference report
- 4 大失败根因: stale data、poor validation、lost context、lack of governance
- 核心观点: enterprise AI = system design problem,不是 model selection problem
- 需要的: validation-first agents、structural intelligence、strong observability、memory discipline、cost-aware orchestration
- 保留理由: 工程教训来自真实会议,不是营销内容;stale data 和 lost context 是 agent 生产部署高频痛点
- 标签:
agentic-AI production-failures MLDS2026 observability
- 建议写入路径:
agentic-ai/agentic-ai-production-failures-mlds2026.md
6. Ken Huang Substack · Physics & Engineering of Frontier LLM Inference (2026 Edition)
- URL: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 来源类型: Substack 专栏(预告 10 篇系列)
- 可信度: 中(预发布,内容质量待验证)
- 核心内容:
- Chapter 6: P/D Disaggregation 深度解析(Prefill/Decode 分离架构)
- Moonshot AI Mooncake (Kimi K3 2.8T) KVCache-centric 分布式 serving 架构
- DeepSeek-V4 Native Sparse Attention (NSA) block-sparse kernel
- LongLoRA context extension 方法
- 2026 Production Blueprint(含 API Gateway、Semantic Router、Prefix Caching Cluster)
- 保留理由: P/D Disaggregation 是 2026 基础设施热点,Mooncake 是公开最详细的 KVCache-centric 架构案例;Substack 预告需后续追踪
- 标签:
Substack inference-engineering P/D-disaggregation Mooncake DeepSeek
- 建议写入路径:
inference/llm-inference-physics-engineering-2026-substack.md
- 后续行动: 等待系列正文发布后核验;建议追踪 Ken Huang 确认章节是否已发布
7. The AI Engineer Substack · The AI Agents Stack 2026 Edition
- URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 来源类型: Substack 专栏(Paolo Perrone)
- 可信度: 中高
- 核心内容:
- 3-tier memory architecture (2024 vector DB RAG → 2026 first-class architectural primitive)
- "Context engineering" 取代 "prompt engineering" 作为核心 discipline
- Memory blocks (named structured fields in context window)
- Boundary design: 定义 human judgment 边界比选模型更难
- Agent stack = agent loop (think-act-observe) + state + tools + memory + guardrails
- 保留理由: memory tier 概念和 context engineering 术语有工程落地价值;Paolo Perrone 是活跃的 AI 工程社区作者
- 标签:
Substack agentic-AI memory context-engineering
- 建议写入路径:
agentic-ai/ai-agents-stack-2026-substack.md
8. CSDN · 2026年LLM推理框架全解析:从vLLM到SGLang
- URL: https://blog.csdn.net/Gaga246/article/details/155610267
- 来源类型: CSDN 博客
- 可信度: 中(营销性质,但含版本/benchmark 数字)
- 核心内容:
- SGLang 0.4.3 (2025-02),支持 DeepSeek-R1/DeepSeek-V3 FP8 推理
- DeepSeek 开源组件: FlashMLA (Hopper, BF16, 分页 KV Cache, H800 ~3000 GB/s bandwidth)
- DeepEP (MoE communication)
- SGLang + vLLM backend 实际 benchmark: 1000+ tok/s
- 保留理由: 汇总了 DeepSeek 开源组件技术参数,对推理优化研究有线索价值;CSDN 中难得的含数据内容
- 标签:
CSDN inference-engineering DeepSeek SGLang vLLM benchmark
- 建议写入路径:
inference/deepseek-open-infra-components-csdn.md
- 审稿备注: 需对照 DeepSeek GitHub 官方 repo 核验 FlashMLA 规格数字
二、丢弃条目及理由
| 条目 |
丢弃理由 |
| Morph · LLM Inference Optimization (2026) |
通用优化方法概述,无具体命令/环境/错误信息;engine 对比表格有价值但全文重复其他来源 |
| BentoML · 6 Production-Tested Optimization Strategies |
策略分类有价值,但原文 2026-01 已过时;SGLang/TensorRT-LLM 数据缺失 |
| System Design Handbook · LLM Inference Guide |
面试向内容,工程实操价值低 |
| Yotta Labs · How LLM Inference Actually Works |
概念性内容,无源码/命令,含 SGLang 选型内容但被其他来源覆盖 |
| Towards AI · LLM Inference Handbook 2026 |
入门级 overview,60min read;与 GPU Insights/Spheron 相比无增量工程数据 |
| Deepchecks · LLM Optimization |
评测框架营销文,工程细节不足 |
| McKinsey · Six Lessons from Agentic AI |
咨询视角,缺少具体技术/失败案例细节 |
| LinkedIn · Why Agentic AI Systems Fail |
观点性文章,无具体命令或数据,MLDS 2026 DEV 文章更优 |
| GitHub kodigitaccount · 2026 Roadmap |
汇总列表,无原创工程内容 |
| GitHub Topics · ai-tools |
仓库列表聚合,无深度分析 |
| CSDN · 一文读懂大模型推理部署框架(149715343) |
版本/环境信息缺失;含多框架对比但无实测数据 |
三、Substack 追踪备忘
| 作者/专栏 |
状态 |
备注 |
| Ken Huang (kenhuangus) |
预告系列,待发布 |
Physics & Engineering of Frontier LLM Inference 2026 |
| Paolo Perrone (The AI Engineer) |
已发布 |
AI Agents Stack 2026 已收录 |
| Latent Space |
未收录 |
建议加入订阅源(top pick for evals per daily.dev) |
| Interconnects |
未收录 |
建议加入订阅源(research-to-production judgment) |
四、本次写入路径汇总
/shared/research-kb/inbox/jay/
├── 2026-10-07-inference-engineering-agentic-ai-screening.md ← 本草稿
├── inference/
│ ├── vllm-sglang-trt-benchmark-2026.md ← 合并保留条#1+#2
│ ├── llm-serving-mathematical-optimization.md ← 保留条#4
│ ├── llm-inference-physics-engineering-2026-substack.md ← 保留条#6
│ └── deepseek-open-infra-components-csdn.md ← 保留条#8
└── agentic-ai/
├── goodserve-agentic-inference-serving.md ← 保留条#3
├── agentic-ai-production-failures-mlds2026.md ← 保留条#5
└── ai-agents-stack-2026-substack.md ← 保留条#7
五、建议后续行动
- 精读: arXiv:2605.16867 (GoodServe) 第 3-5 节;arXiv:2605.01280 第 2-3 节
- 核验: CSDN DeepSeek FlashMLA 数字 → 对应 DeepSeek GitHub 官方 repo
- 订阅源补充: Latent Space、Interconnects 加入 Substack 追踪列表
- 追踪: Ken Huang 系列正式发布后重新评估完整度
- 版本核验: GPU Insights/Spheron 的 vLLM v0.18.0 / SGLang v0.5.9 版本号需对照 GitHub releases 确认真实性
Jay · 2026-10-07 19:50 CST · 工程筛选晚场完成