工程文章筛选报告 · Jay · 2026-08-22
任务概述
- 角色: Jay 工程实践二次筛选
- 本次重点: LLM Inference Serving 架构 / PD Disaggregation / 推理引擎对比
- 检索范围: Tavily 高级搜索 · 近一个月 · 学术+工程+Substack
- 日期: 2026-08-22
✅ 保留条目(高工程价值)
1. HLD Blog × 3篇连续深度文(最高优先级)
来源: High Limit Designs (highlimitdesigns.com) 专栏: Lead Infrastructure Architect · 工程深度分析 文章列表:
| 文章 | 发布 | 核心内容 |
|---|---|---|
| The Rise of Prefill-Decode Disaggregation: Scaling Sovereign LLM Serving Beyond Collocation | 2026-08-16 | PD disaggregation 机制详解:vLLM MoRI-IO vs SGLang 动态路由,GQA/MLA KV-cache 传输数学payload,生产部署蓝图 |
| The Disaggregated Frontier: Inside the vLLM V1 Rewrite and SGLang EPD Architectures | 2026-08-18 | vLLM V1 重写架构分析 + SGLang EPD(Encoder-Prefill-Decode) disaggregation,含 Sovereign AI 部署路径 |
| The 2026 LLM Infrastructure Frontier: SGLang vs. vLLM V1, MLA Compression, and EAGLE-3 Speculative Decoding | 2026-08-20 | SGLang vs vLLM V1 横向对比 + MLA 压缩 + EAGLE-3 投机解码 |
保留理由: 连续三日发布,覆盖 PD disaggregation 全栈(机制→架构→横向对比),含具体技术术语(MoRI-IO、MLA、EPD、GQA)、硬件池分离方案(Prefill Pool: H100/B200; Decode Pool: L40S/A100/MI300X)和生产部署路径。有别于表面综述,具备真实工程架构深度。
可信度: 高。工程博客,专注 infra,2026-08 当周新鲜发布。
2. Spheron Network · LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026)
来源: Spheron Network (spheron.network) · Mitrasish(联合创始人兼CTO) 链接: https://www.spheron.network/blog/llm-inference-optimization-2026 发布时间: 2026-08-19(August 2026 标记)
核心数据:
| Engine | Throughput (50 req) | TTFT p50 (50 req) | Cold Start |
|---|---|---|---|
| vLLM | 1,850 tok/s | 380 ms | ~62 sec |
| TensorRT-LLM | 2,100 tok/s | 340 ms | ~28 min |
| SGLang | 1,920 tok/s | 360 ms | ~58 sec |
SGLang Prefix Cache 实测: - 测试条件: 共享系统提示 + RAG context,50 并发请求 - SGLang vs vLLM: TTFT p50 低 37%,TTFT p95 低 41% - RunPod 独立测试: Llama 3.1 8B,prefix-heavy traffic,SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s(差距 29%,归因于 prefix cache reuse)
保留理由: 包含竞品真实 benchmark 数据,冷启动时间对比(TensorRT-LLM 28分钟编译是真实痛点),SGLang prefix cache 在 agent/RAG 场景下的具体收益。适合作为推理引擎选型的工程参考。
可信度: 高。企业 CTO 亲写,带竞品中立性,数据可交叉验证。
3. ServerGurus · Disaggregated Inference: Why Splitting Prefill and Decode Is the 2026 Architecture
来源: LinkedIn / ServerGurus 链接: https://www.linkedin.com/posts/servergurus-india_disaggregated-inference-why-splitting-prefill-activity-7489815467243540480-FGVo 发布时间: 2026-08(近30天内)
核心数据: - PD disaggregation 后: p99 latency 从 2,800ms 降至 310ms(降约 90%) - GPU 成本降低 40%
保留理由: 有具体数字和 SGLang/vLLM 双框架实现对比。LinkedIn post 形式,标注了具体实现框架,可作为架构选型决策数据点。注意:该数字需在其他环境独立验证(ServerGurus 为 GPU 厂商相关方)。
可信度: 中高。数据来源需独立核验,适合记录为线索。
4. arXiv · Token-Operations-Oriented Inference Optimization Techniques for Large Models
来源: arXiv:2606.20295 链接: https://arxiv.org/html/2606.20295 发布时间: 2025-06(近月有更新提及)
核心内容: - DeepGEMM(JIT kernel,支持 FP8/FP4/BF16 GEMM + MoE + MQA + HyperConnection) - 投机解码进展: SpecForge/SpecBundle(EAGLE-3 训练框架)、P-EAGLE(并行 drafting,集成 vLLM)、SPEED-Bench - NanoFlow: nano-batch scheduling + intra-device resource-overlap,1.91x throughput 提升 - Aegaeon: 多模型并发服务,Prefill/Decode 分阶段调度
保留理由: 系统梳理 2025-2026 年 inference optimization 技术全貌,涵盖硬件层面(FlashAttention 演进)和系统层面(投机解码、nanobatch调度),可作为知识库索引型文献。
可信度: 高。arXiv 学术来源,技术描述精确。
5. arXiv · Cloud to Edge: Benchmarking LLM Inference on Hardware-Accelerated Single-Board Computers
来源: arXiv:2604.24785v2 · 2026-08-04 链接: https://arxiv.org/pdf/2604.24785 发布时间: 2026-08-04(极新鲜)
核心贡献: - 提出两个复合指标: throughput density (Tps/m³) 和 energy per million tokens (MJ/Mtok) - 覆盖平台: M5Stack AX630c、Jetson Orin Nano GPU、RPi 5 + Hailo-10H - 关键发现: 硬件加速器 vs CPU-only 可达 40× 能效提升 - 应用场景: OT/Defence 环境的 localized inference(数据不能离境)
保留理由: 极新鲜(2026-08-04),研究问题独特(edge IoT + LLM),提出新评估指标,有真实硬件benchmark。符合知识库对边缘部署工程洞察的补充需求。
可信度: 高。arXiv 学术 preprint,作者来自 CMU 和英国大学。
6. The Half Stack Girl · vLLM vs SGLang Traffic Management
来源: Instagram Reel (thehalfstackgirl) 发布时间: 近期(2026年内)
内容摘要: - PagedAttention(vLLM): 按需分配 KV cache memory,减少碎片 - RadixAttention(SGLang): 复用共享前缀,避免重复计算 - 结论: 模型不变,infra 升级可带来显著收益
保留理由: 虽是短视频平台,但内容清晰区分了两种主流推理引擎的核心机制,适合作为工程科普线索。注意:平台形式为 Instagram reel,非深度技术文档,列为"参考"级别。
可信度: 中。短视频形式,信息精简但正确。
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| GPU Insights: vLLM vs SGLang vs TensorRT-LLM 2026 Guide | 综述性质,无原创数据,主要引用"Reported by The AI Engineer (Substack)"和"Decode the Future",不如直接看原来源 |
| DataAspirant: RAG Evaluation Metrics 2026 | RAGAS 使用教程,无新数据,流程与现有知识库内容高度重叠 |
| Confident AI / DeepEval / RAGAS comparison posts | 产品对比页,非工程实践,含商业推广成分 |
| AI Engineer Playbook 2026 (Facebook) | 社交媒体帖子,无命令、无源码、无数据 |
| The Sequence Radar #901 (Substack) | 资讯聚合,文摘型,无原始工程内容 |
| AI Weekly: Four Frontier Models (Substack) | 模型发布快讯,非工程实践文章 |
| ByteByteGo: Inkling model analysis (Substack) | 模型架构分析,无 serving/inference 实践 |
| productize.life: Andrew Ng's AI Engineering Skills Map | 路线图/技能图型内容,非工程操作实践 |
| Medium: Field Guide to LLM Inference Optimization (Samantha Koduru) | 有 benchmark 数据(93% cache hit rate),但无环境/模型/命令细节,作为工程线索参考价值不足 |
| LinkedIn 各种分享帖 | 社交分发,原文信息损失,无可复现步骤 |
分类标签
#LLM-Inference-Engineering #vLLM #SGLang #TensorRT-LLM #PD-Disaggregation
#Prefill-Decode #KV-Cache #Prefix-Caching #Speculative-Decoding
#Edge-LLM #MLOps #RAG-Evaluation #Benchmark #Sovereign-AI
建议写入路径
/shared/research-kb/inbox/jay/2026-08-22-llm-inference-engineering-screening.md
本次为二次筛选草稿,无需精读,可纳入主题页: - LLM Inference Engineering(主主题页) - PD Disaggregation 专题 - vLLM / SGLang 对比分析页
后续行动建议
- HLD 三篇文 → 可考虑纳入「LLM Infra 2026 架构演进」主题页,需精读 MoRI-IO / EPD 章节
- Spheron benchmark → 可补充到推理引擎对比主题页,建议核验 RunPod 原始数据
- arXiv 2606.20295 → NanoFlow / Aegaeon 部分可作为调度算法文献线索
- arXiv 2604.24785 → 边缘部署主题页补充,尤其是 Tps/m³ 指标
Jay · 2026-08-22 19:50 (Asia/Shanghai)