Jay 工程实践筛选 · 2026-09-18 晚间档
主题
LLM Inference 工程实践 / RAG 生产踩坑 / Agent 架构 / MLOps
一、高价值条目(保留)
🔴 极高工程价值
1. Spheron · vLLM vs SGLang 2026: RadixAttention vs PagedAttention
- URL: https://www.spheron.network/blog/vllm-vs-sglang-2026
- 可信度: 高(附完整 Docker 命令、H100 部署步骤、metrics 端点用法)
- 核心观点:
- 提供了可直接复制运行的 Docker 部署命令(vLLM 和 SGLang 各一条)
- 明确了
--enable-prefix-caching和mem-fraction-static等关键参数 - RadixAttention 在 prefix-heavy 场景(Agent/RAG)比 PagedAttention 缓存命中率高 2-3x
- 附 benchmark 步骤:
/metrics端点监控 cache hit rate - 是否需精读: 是(命令实测 + 核验 benchmark 数字)
- 标签:
#vLLM#SGLang#Docker#H100#Benchmark#RadixAttention
2. DevOpsBeast · vLLM vs SGLang 生产选型 2026
- URL: https://devopsbeast.com/blog/vllm-vs-sglang-production-2026
- 可信度: 高(深度技术分析,非表面 benchmark 堆砌)
- 核心观点:
- 选引擎不能只看 throughput benchmark,要看 workload shape
- 关键判断:prompt 重复率 >60% → SGLang;unique prompt 为主 → vLLM
- SGLang 新模型支持滞后 1-4 周;vLLM 几乎当天
- 结构性输出(JSON/工具调用)场景 SGLang 有实测优势
- 是否需精读: 是(选型决策框架值得入知识库)
- 标签:
#vLLM#SGLang#选型框架#生产部署
3. arXiv:2605.01280 · LLM Serving 需要数学优化而非启发式
- URL: https://arxiv.org/html/2605.01280v1
- 可信度: 高(学术 peer-reviewed 路线)
- 核心观点:
- 现有请求路由/负载均衡多基于 heuristics,缺乏 worst-case 保障
- 提出在线优化框架,对抗性请求序列下仍可将不平衡度降低 Ω(√(B log G))
- 收益随集群规模 G 和 batch size B 增大而增加(正是大规模生产场景)
- 是否需精读: 是(数学证明框架,核验 claim 可复现性)
- 标签:
#arXiv#请求路由#负载均衡#理论#分布式Serving
4. arXiv:2602.14516 · AMPD: 高效多轮 LLM 推理分解式服务
- URL: https://arxiv.org/html/2602.14516v2
- 可信度: 高
- 核心观点:
- 现有 PD disaggregation 系统未充分处理多轮工作流(Agent/ReAct、迭代 RAG)的交错 prefill-decode 模式
- 提出 AMPD 系统,针对 incremental prefill 和两阶段模型部署优化
- 对比 vLLM、vLLM-Continuum、NVIDIA Dynamo 基线
- 是否需精读: 是(PD disaggregation 生产落地重要方向)
- 标签:
#arXiv#PD_disaggregation#多轮推理#Agent#vLLM
🟡 中高工程价值
5. Zartis · RAG in Production: What Nobody Tells You Until You're Debugging It
- URL: https://www.zartis.com/rag-in-production-what-nobody-tells-you-until-youre-debugging-it
- 可信度: 高(含 arXiv 引用:2412.11854 latency study、arXiv:2506.03401 RAGOps)
- 核心观点:
- retrieval 占据 RAG 端到端延迟的 41%、TTFT 的 45-47%
- RAG fusion 在真实生产中收益有限(reranking 和 truncation 后优势消失)
- 引用 7 个具体 failure points(Barnett et al. 2024)
- 72% 企业已在生产运行 RAG(2026 benchmark)
- 是否需精读: 是(latency breakdown 数据有直接参考价值)
- 标签:
#RAG#延迟分析#生产踩坑#Failure_Points
6. Aperta Scientia · 2026 LLM Inference Engines Benchmark (vLLM/TensorRT/SGLang)
- URL: https://www.apertascientia.io/radar/2026-09-06-llm-inference-engines-comparison-vllm-tensorrt-sglang-kubernetes
- 可信度: 高(2026-09-06 刚发布,KServe/OpenShift 集成视角)
- 核心观点:
- 三引擎关键工程特性对比表
- 给出三条部署建议:通用 → vLLM+KServe;RAG/多轮 Agent → SGLang;大规模 NVIDIA 集群 → TensorRT-LLM
- 引用 KServe LLMInferenceService + llm-d + vLLM 分布式推理方案
- 是否需精读: 是(Kubernetes 部署选型实用指南)
- 标签:
#Kubernetes#KServe#vLLM#SGLang#TensorRT-LLM#Benchmark
7. V12 Labs · Production AI Agent Architecture: Lessons From Building CrewKit
- URL: https://www.v12labs.io/blog/production-ai-agent-architecture-lessons-from-crewkit
- 可信度: 中高(实际踩坑经验,2026-04-30)
- 核心观点:
- 多 Agent 系统 demo 好看但生产容易崩:死循环、资源争夺、账单爆炸
- 关键架构构件:Mind(认知)、持久原语、学习环、抗模式
- 给出了具体失败模式列表
- 是否需精读: 是(多 Agent 生产架构反面教材)
- 标签:
#Agent#多Agent#生产踩坑#CrewKit#架构
8. Redis Blog · AI Agent Architecture 2026
- URL: https://redis.io/blog/ai-agent-architecture
- 可信度: 中高(微软架构指南引用,具体约束数字)
- 核心观点:
- 5% 失败率下,20 步 Agent 几乎必然失败;生产需 <1% 端到端失败率
- 行为可观测性(behavioral observability)> 系统指标
- 成本控制是 pilot 到生产的关键壁垒
- 给出人类审批门、审计追踪、HITL 等设计模式
- 是否需精读: 是(Agent 可靠性约束量化分析)
- 标签:
#Agent#可靠性#成本控制#Observability
9. arXiv:2504.11320 · Fluid-Guided Online Scheduling with Memory Constraints
- URL: https://arxiv.org/html/2504.11320
- 可信度: 高(vLLM 默认 eviction 策略即 recompute)
- 核心观点:
- KV cache 内存超限时 vLLM 默认用 recomputation(丢弃并重启 prefill)
- eviction 形成 vicious cycle:重启 → 再次占满 → 再次 eviction
- 提出 Fluid-Guided 调度器在 Vidur 模拟器上验证,A100 80GB + Llama-2-7B 实验
- FP16 KV cache token = 0.5 MiB(可作估算基准)
- 是否需精读: 是(KV cache 内存管理核心机制)
- 标签:
#arXiv#KV_cache#内存管理#调度#vLLM
🟢 中等工程价值(可补充参考)
10. Fanout · LLM Inference Engineering Roadmap 2026
- URL: https://fanout.sh/inference-eng
- 核心观点: 路线图 + KV-cache calculator + 可下载 packet,适合系统性学习
- 是否需精读: 否(入门框架价值)
- 标签:
#学习路线#基础设施
11. Metafied Lab · How to Build a Production-Ready RAG Pipeline in 2026
- URL: https://metafiedlab.com/blog/how-to-build-a-production-ready-rag-pipeline-in-2026
- 核心观点: reranking 一步可提升 faithfulness 0.85+,TTFT p90 <2s 目标
- 是否需精读: 否(内容偏宽泛)
- 标签:
#RAG#reranking
12. AI Mastery Substack · Production AI Engineering (4 模块 30 课)
- URL: https://aiamastery.substack.com/p/production-ai-engineering-building
- 核心观点: 企业级 Agent 安全/记忆/可靠性工程细节,可作课程线索
- 是否需精读: 否
- 标签:
#Substack#课程线索#企业Agent
二、丢弃条目(工程价值不足)
| 条目 | 丢弃理由 |
|---|---|
| Alpacked · LLM Deployment Cost Optimization | 概念性强,无具体命令/代码/错误案例 |
| Zylos Research · LLM Inference Optimization and Quantization 2026 | 内容宽泛,表格数字未注明测试条件,难以复用 |
| Mirantis · LLM Optimization Techniques | 无具体生产数据,引用个人经验为主 |
| TowardsAI · LLM Inference Handbook 2026 | 偏概述,无新数据 |
| GrokkingTechCareer Substack · State of AI Coding 2026 | 趋势分析,非工程实践 |
| Nidly Substack · ML vs AI Engineer Career | 职业分析,无技术细节 |
| LinkedIn posts (各类) | 非严肃技术来源 |
三、Substack 专项(按 2026-06-10 规则处理)
| 专栏名 | 文章 | 核心洞察 | 可信度 | 后续行动 |
|---|---|---|---|---|
| aiamastery.substack.com | Production AI Engineering | 企业 Agent 4 层安全、记忆缓存、可靠性 SLO | 中 | 课程线索存档 |
| aiagentssimplified.substack.com | Why 90% of AI Agents Fail in Production | 实际踩坑报告(客户支持 workflow) | 中高 | 核验是否与 V12 Labs 案例重叠 |
| digitalstrategyai.substack.com | The Hype Is About Models. The Advantage Is in Engineering | rate limit 是最常见生产失败(60% 错误来源) | 中 | 引用数据需核验原始报告 |
四、本次写入路径
建议写入: /shared/research-kb/inbox/jay/2026-09-18-inference-engineering-llmops-rag-production.md
草稿状态: 直接写入上述路径(已写入)
五、分类标签汇总
#vLLM #SGLang #TensorRT-LLM #Docker #H100 #Benchmark #RadixAttention
#选型框架 #生产部署 #Kubernetes #KServe #PD_disaggregation #多轮推理
#Agent #多Agent #生产踩坑 #CrewKit #架构 #可靠性 #成本控制 #Observability
#RAG #延迟分析 #Failure_Points #KV_cache #内存管理 #调度 #arXiv
#请求路由 #负载均衡 #理论 #分布式Serving #Substack #课程线索
六、精读优先级
- 🔴 极高:Spheron Docker 命令(实测)、arXiv:2605.01280 理论框架(核验)
- 🔴 极高:DevOpsBeast 选型决策(直接入知识库)、arXiv:2602.14516 AMPD
- 🟡 中高:Aperta Scientia K8s 指南(9 月新发)、Zartis RAG latency breakdown
- 🟡 中高:Redis Agent 可靠性约束、arXiv:2504.11320 KV cache
Jay · 2026-09-18 19:50 CST · 工程实践筛选档