Jay 工程实践筛选 · 2026-09-18 晚间档

主题

LLM Inference 工程实践 / RAG 生产踩坑 / Agent 架构 / MLOps


一、高价值条目(保留)

🔴 极高工程价值

1. Spheron · vLLM vs SGLang 2026: RadixAttention vs PagedAttention

  • URL: https://www.spheron.network/blog/vllm-vs-sglang-2026
  • 可信度: 高(附完整 Docker 命令、H100 部署步骤、metrics 端点用法)
  • 核心观点:
  • 提供了可直接复制运行的 Docker 部署命令(vLLM 和 SGLang 各一条)
  • 明确了 --enable-prefix-cachingmem-fraction-static 等关键参数
  • RadixAttention 在 prefix-heavy 场景(Agent/RAG)比 PagedAttention 缓存命中率高 2-3x
  • 附 benchmark 步骤:/metrics 端点监控 cache hit rate
  • 是否需精读: 是(命令实测 + 核验 benchmark 数字)
  • 标签: #vLLM #SGLang #Docker #H100 #Benchmark #RadixAttention

2. DevOpsBeast · vLLM vs SGLang 生产选型 2026

  • URL: https://devopsbeast.com/blog/vllm-vs-sglang-production-2026
  • 可信度: 高(深度技术分析,非表面 benchmark 堆砌)
  • 核心观点:
  • 选引擎不能只看 throughput benchmark,要看 workload shape
  • 关键判断:prompt 重复率 >60% → SGLang;unique prompt 为主 → vLLM
  • SGLang 新模型支持滞后 1-4 周;vLLM 几乎当天
  • 结构性输出(JSON/工具调用)场景 SGLang 有实测优势
  • 是否需精读: 是(选型决策框架值得入知识库)
  • 标签: #vLLM #SGLang #选型框架 #生产部署

3. arXiv:2605.01280 · LLM Serving 需要数学优化而非启发式

  • URL: https://arxiv.org/html/2605.01280v1
  • 可信度: 高(学术 peer-reviewed 路线)
  • 核心观点:
  • 现有请求路由/负载均衡多基于 heuristics,缺乏 worst-case 保障
  • 提出在线优化框架,对抗性请求序列下仍可将不平衡度降低 Ω(√(B log G))
  • 收益随集群规模 G 和 batch size B 增大而增加(正是大规模生产场景)
  • 是否需精读: 是(数学证明框架,核验 claim 可复现性)
  • 标签: #arXiv #请求路由 #负载均衡 #理论 #分布式Serving

4. arXiv:2602.14516 · AMPD: 高效多轮 LLM 推理分解式服务

  • URL: https://arxiv.org/html/2602.14516v2
  • 可信度: 高
  • 核心观点:
  • 现有 PD disaggregation 系统未充分处理多轮工作流(Agent/ReAct、迭代 RAG)的交错 prefill-decode 模式
  • 提出 AMPD 系统,针对 incremental prefill 和两阶段模型部署优化
  • 对比 vLLM、vLLM-Continuum、NVIDIA Dynamo 基线
  • 是否需精读: 是(PD disaggregation 生产落地重要方向)
  • 标签: #arXiv #PD_disaggregation #多轮推理 #Agent #vLLM

🟡 中高工程价值

5. Zartis · RAG in Production: What Nobody Tells You Until You're Debugging It

  • URL: https://www.zartis.com/rag-in-production-what-nobody-tells-you-until-youre-debugging-it
  • 可信度: 高(含 arXiv 引用:2412.11854 latency study、arXiv:2506.03401 RAGOps)
  • 核心观点:
  • retrieval 占据 RAG 端到端延迟的 41%、TTFT 的 45-47%
  • RAG fusion 在真实生产中收益有限(reranking 和 truncation 后优势消失)
  • 引用 7 个具体 failure points(Barnett et al. 2024)
  • 72% 企业已在生产运行 RAG(2026 benchmark)
  • 是否需精读: 是(latency breakdown 数据有直接参考价值)
  • 标签: #RAG #延迟分析 #生产踩坑 #Failure_Points

6. Aperta Scientia · 2026 LLM Inference Engines Benchmark (vLLM/TensorRT/SGLang)

  • URL: https://www.apertascientia.io/radar/2026-09-06-llm-inference-engines-comparison-vllm-tensorrt-sglang-kubernetes
  • 可信度: 高(2026-09-06 刚发布,KServe/OpenShift 集成视角)
  • 核心观点:
  • 三引擎关键工程特性对比表
  • 给出三条部署建议:通用 → vLLM+KServe;RAG/多轮 Agent → SGLang;大规模 NVIDIA 集群 → TensorRT-LLM
  • 引用 KServe LLMInferenceService + llm-d + vLLM 分布式推理方案
  • 是否需精读: 是(Kubernetes 部署选型实用指南)
  • 标签: #Kubernetes #KServe #vLLM #SGLang #TensorRT-LLM #Benchmark

7. V12 Labs · Production AI Agent Architecture: Lessons From Building CrewKit

  • URL: https://www.v12labs.io/blog/production-ai-agent-architecture-lessons-from-crewkit
  • 可信度: 中高(实际踩坑经验,2026-04-30)
  • 核心观点:
  • 多 Agent 系统 demo 好看但生产容易崩:死循环、资源争夺、账单爆炸
  • 关键架构构件:Mind(认知)、持久原语、学习环、抗模式
  • 给出了具体失败模式列表
  • 是否需精读: 是(多 Agent 生产架构反面教材)
  • 标签: #Agent #多Agent #生产踩坑 #CrewKit #架构

8. Redis Blog · AI Agent Architecture 2026

  • URL: https://redis.io/blog/ai-agent-architecture
  • 可信度: 中高(微软架构指南引用,具体约束数字)
  • 核心观点:
  • 5% 失败率下,20 步 Agent 几乎必然失败;生产需 <1% 端到端失败率
  • 行为可观测性(behavioral observability)> 系统指标
  • 成本控制是 pilot 到生产的关键壁垒
  • 给出人类审批门、审计追踪、HITL 等设计模式
  • 是否需精读: 是(Agent 可靠性约束量化分析)
  • 标签: #Agent #可靠性 #成本控制 #Observability

9. arXiv:2504.11320 · Fluid-Guided Online Scheduling with Memory Constraints

  • URL: https://arxiv.org/html/2504.11320
  • 可信度: 高(vLLM 默认 eviction 策略即 recompute)
  • 核心观点:
  • KV cache 内存超限时 vLLM 默认用 recomputation(丢弃并重启 prefill)
  • eviction 形成 vicious cycle:重启 → 再次占满 → 再次 eviction
  • 提出 Fluid-Guided 调度器在 Vidur 模拟器上验证,A100 80GB + Llama-2-7B 实验
  • FP16 KV cache token = 0.5 MiB(可作估算基准)
  • 是否需精读: 是(KV cache 内存管理核心机制)
  • 标签: #arXiv #KV_cache #内存管理 #调度 #vLLM

🟢 中等工程价值(可补充参考)

10. Fanout · LLM Inference Engineering Roadmap 2026

  • URL: https://fanout.sh/inference-eng
  • 核心观点: 路线图 + KV-cache calculator + 可下载 packet,适合系统性学习
  • 是否需精读: 否(入门框架价值)
  • 标签: #学习路线 #基础设施

11. Metafied Lab · How to Build a Production-Ready RAG Pipeline in 2026

  • URL: https://metafiedlab.com/blog/how-to-build-a-production-ready-rag-pipeline-in-2026
  • 核心观点: reranking 一步可提升 faithfulness 0.85+,TTFT p90 <2s 目标
  • 是否需精读: 否(内容偏宽泛)
  • 标签: #RAG #reranking

12. AI Mastery Substack · Production AI Engineering (4 模块 30 课)

  • URL: https://aiamastery.substack.com/p/production-ai-engineering-building
  • 核心观点: 企业级 Agent 安全/记忆/可靠性工程细节,可作课程线索
  • 是否需精读: 否
  • 标签: #Substack #课程线索 #企业Agent

二、丢弃条目(工程价值不足)

条目 丢弃理由
Alpacked · LLM Deployment Cost Optimization 概念性强,无具体命令/代码/错误案例
Zylos Research · LLM Inference Optimization and Quantization 2026 内容宽泛,表格数字未注明测试条件,难以复用
Mirantis · LLM Optimization Techniques 无具体生产数据,引用个人经验为主
TowardsAI · LLM Inference Handbook 2026 偏概述,无新数据
GrokkingTechCareer Substack · State of AI Coding 2026 趋势分析,非工程实践
Nidly Substack · ML vs AI Engineer Career 职业分析,无技术细节
LinkedIn posts (各类) 非严肃技术来源

三、Substack 专项(按 2026-06-10 规则处理)

专栏名 文章 核心洞察 可信度 后续行动
aiamastery.substack.com Production AI Engineering 企业 Agent 4 层安全、记忆缓存、可靠性 SLO 课程线索存档
aiagentssimplified.substack.com Why 90% of AI Agents Fail in Production 实际踩坑报告(客户支持 workflow) 中高 核验是否与 V12 Labs 案例重叠
digitalstrategyai.substack.com The Hype Is About Models. The Advantage Is in Engineering rate limit 是最常见生产失败(60% 错误来源) 引用数据需核验原始报告

四、本次写入路径

建议写入: /shared/research-kb/inbox/jay/2026-09-18-inference-engineering-llmops-rag-production.md

草稿状态: 直接写入上述路径(已写入)


五、分类标签汇总

#vLLM #SGLang #TensorRT-LLM #Docker #H100 #Benchmark #RadixAttention
#选型框架 #生产部署 #Kubernetes #KServe #PD_disaggregation #多轮推理
#Agent #多Agent #生产踩坑 #CrewKit #架构 #可靠性 #成本控制 #Observability
#RAG #延迟分析 #Failure_Points #KV_cache #内存管理 #调度 #arXiv
#请求路由 #负载均衡 #理论 #分布式Serving #Substack #课程线索

六、精读优先级

  1. 🔴 极高:Spheron Docker 命令(实测)、arXiv:2605.01280 理论框架(核验)
  2. 🔴 极高:DevOpsBeast 选型决策(直接入知识库)、arXiv:2602.14516 AMPD
  3. 🟡 中高:Aperta Scientia K8s 指南(9 月新发)、Zartis RAG latency breakdown
  4. 🟡 中高:Redis Agent 可靠性约束、arXiv:2504.11320 KV cache

Jay · 2026-09-18 19:50 CST · 工程实践筛选档