AI/ML 系统工程实践 · 筛选草稿 · 2026-09-03

任务概述

  • 执行实例: Jay
  • 执行时间: 2026-09-03 19:50 (Asia/Shanghai)
  • 本次主题: LLM Inference Engine + RAG 工程实践
  • 检索范围: Exa 网页搜索、arXiv、Substack、Red Hat Developers、devops 技术博客
  • 去重参考: 读取 /shared/research-kb/inbox/ 下其他实例草稿(本次为首次扫描,目录可能为空)

候选条目(共 12 条)

分类 A:LLM 推理引擎(6 条)

# 标题 来源 发布日 类型
A1 Optimizing Deployment Configurations for LLM Inference: Challenges and Insights MLSys 2026 2026 论文
A2 RTP-LLM: High-Performance Alibaba LLM Inference Engine arXiv:2605.29639 2026-05-28 论文
A3 Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference arXiv:2606.29708 2026-06-29 论文
A4 Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving arXiv:2608.06557v1 2026-08-06 论文
A5 OpScale: Operator-level Provisioning and Autoscaling for LLM Serving arXiv:2608.13499v1 2026-08 论文
A6 Optimizing Distributed AI Inference: Advanced Deployment Patterns Red Hat Developers 2026-06-24 技术博客

分类 B:RAG 工程实践(4 条)

# 标题 来源 发布日 类型
B1 Building a Production-Ready RAG Architecture in 2026 datastorage.com 2026-07-01 技术博客
B2 Production RAG Pipeline on Kubernetes devops.gheware.com 2026-05-12 技术博客
B3 AI Engineering Blueprint for On-Premises RAG Systems arXiv:2604.01395v1 2026-04 论文
B4 Building Scalable Inference APIs for Production Applications runpod.io 2026 技术博客

分类 C:Agent 系统工程(2 条)

# 标题 来源 发布日 类型
C1 AI Agent Engineer Roadmap: How to Build Production Agents in 2026 opencloudai.substack.com 2026-08-09 Substack
C2 Agentic AI Reasoning Model System Design aiengineeringinsider.substack.com 2026-08-20 Substack

高价值条目(详细摘要)

🔴 A1 · MLSys 2026 · Meta Llama Inference 部署优化

链接: https://proceedings.mlsys.org/paper_files/paper/2026/file/97dc07f1253ab33ee514f395a82fa7cc-Paper-Conference.pdf

核心观点: Meta 团队系统分析了 Llama 模型族(服务近 10 亿月活用户)在生产环境中的推理部署配置空间,涵盖硬件(H100/H200/MI300X)、并行策略(Tensor/Pipeline/Expert/Context/Data)、运行时设计(continuous batching vs. disaggregation)以及 SLO 约束。

关键数据: - 吞吐量提升最高 ~2.5× - Disaggregation 迁移后在线服务节省约 30% 算力容量 - 异构硬件策略(Prefill 用计算型 GPU,Decode 用带宽型 GPU)成本效率提升 15-25% - TP4PP2 vs TP2PP4:前者延迟更低但 QPS 低 20%(通信开销)

工程价值: - 构建了轻量级性能模拟器,基于实测算子基准预测跨百万配置的端到端性能 - 生产经验总结:MoE 架构的系统级影响、平台扩展行为、并行策略的相位特异性 - 提出 runtime 架构决策规则:严格延迟 SLO 用 disaggregated,吞吐量优先用 continuous batching

可信度: ★★★★★(Meta 生产数据,MLSYS 2026 同行评审)

后续行动: 建议精读第 4 节(第 4.2 节 disaggregation trade-offs、第 4.6 节硬件错误选择代价 2-3×),核实论文中 Table 6 的具体配置参数。


🔴 A2 · RTP-LLM · 阿里巴巴推理引擎

链接: https://arxiv.org/html/2605.29639

核心观点: 阿里巴巴基础模型推理团队开源的高性能推理引擎,已在阿里集团部署服务超过 1 亿用户。集成模型加载优化、PD 分离架构、多层 KV 缓存管理、模块化投机解码和自适应量化。

关键数据: - 模型加载速度:比 vLLM 和 SGLang 快 4.7-6.3× - 生产流量 TTFT P95 延迟降低 35-37%,缓存复用提升 215% - 投机解码吞吐量提升 1.12-2.48× - 多模态推理吞吐量提升 1.86-2.52× - 量化推理:批次延迟降低 35-40%,TTFT 改善 1.9-3.0×

工程价值: - 文件顺序驱动 I/O + 并行 I/O-通信重叠 - 四层层级 KV 缓存访问(GPU HBM → 本地 CPU → 远程 CPU via RDMA → 分布式存储 3FS) - 支持 PD-Fusion(同节点)和 PD-Disaggregation(分离节点)两种部署模式 - 已开源:https://github.com(需进一步检索具体仓库名)

可信度: ★★★★★(阿里巴巴生产验证,开源代码已发布)

后续行动: 建议精读第 4 节(模型加载优化)和第 5 节(PD 分离与流量调度),获取 GitHub 仓库链接并核实开源代码质量。


🔴 A4 · Cascade · SLO 感知 LLM 服务系统

链接: https://arxiv.org/abs/2608.06557v1

核心观点: 将每个请求的"延迟预算"(SLO - 预测剩余服务时间)作为运行时调度和 KV 缓存管理的统一协调量,相比 vLLM 默认 FCFS 调度器,好吞吐提升 2.4×,SLO 违规率降低 40%。

关键数据: - 好吞吐提升最高 2.4× - SLO 违规率降低 40% - 基于生产轨迹在三个大语言模型上验证

工程价值: - TTFT 延迟估算器:结合上下文长度、前缀 KV 缓存命中率、系统当前负载 - 多层 KV 预取决策:基于剩余预算决定从哪层缓存恢复数据 - 预算感知抢占:高预算请求(最有余量)优先被抢占用于重新调度 - 基于 vLLM + LMCache 实现,不修改模型权重,无需额外硬件

可信度: ★★★★☆(arXiv 预印本,基于生产轨迹验证,2026-08-06 新发布)

后续行动: 建议审稿,关注 Algorithm 1 的预算计算公式与 vLLM 集成方式。


🔴 A5 · OpScale · 算子级弹性伸缩

链接: https://arxiv.org/html/2608.13499v1

核心观点: 提出将扩缩容单位从"整模型"细化到"单个算子",实现亚秒级弹性。通过 40×A100 和 24×GB200 集群的生产轨迹验证,可在满足 SLO 的同时减少 36.3% GPU 和 28% 电力,或在固定成本下提升 44% 吞吐。

关键数据: - 满足 SLO 前提下减少 36.3% GPU、28% 电力 - 固定成本预算下吞吐提升 44% - Greedy 启发式算法与理论最优差距 < 8%

工程价值: - 算子级弹性的理论基础:刻画工作负载敏感度、资源弹性、算子间通信 - 三个平面:Data Plane(性能 profiling)、Control Plane(placement 计算)、Execution Plane(运行时调度) - 解决了算子级弹性空间爆炸问题

可信度: ★★★★☆(arXiv 预印本,大规模集群验证,2026-08 新发布)

后续行动: 建议审稿,关注第 4 节 Greedy 启发式算法的具体实现复杂度。


🟡 A6 · Red Hat · 分布式推理高级部署模式

链接: https://developers.redhat.com/articles/2026/06/24/optimizing-distributed-ai-inference-advanced-deployment-patterns

核心观点: 三个优化杠杆:Prefill/Decode 分离、KV 缓存策略、投机解码。提供具体决策规则和生产注意事项。

关键数据: - 分离架构在 chat/RAG 流量上降低 25-40% 成本 - Splitwise 报告成本降低约 20%、吞吐量 1.4×;DistServe 好吞吐提升 7.4× - llm-d 的 prefix-cache-hit 路由:TTFT 最高快 57×,高前缀复用场景吞吐翻倍 - EAGLE-3:Dense 模型加速最高 6×;EAGLE 3.1(2026-05 发布):长上下文工作负载,TTAL 比 EAGLE-3 翻倍 - Medusa 接受率通常在 0.55-0.70 - 默认配置提升 25%,配合 prefix-cache-hit 路由后 GPU 每秒 token 数提升 2-3×

工程价值(命令/配置): - 决策规则:测量 prefill GPU秒 / decode GPU秒 比值,对比 decode优化GPU成本 / prefill优化GPU成本 比值 - vLLM KVConnector 接口(LMCache/LMDeploy/Infiniflow 实现) - NIXL 元数据服务器需部署 2 台 + TCP 负载均衡,单点故障风险 - 投机解码在 constrained decoding(JSON mode、tool calls)场景接受率崩溃 - FP8 KV 缓存:内存减半,质量损失可接受;FP4:需用自己数据跑评估验证

可信度: ★★★★☆(Red Hat 开发者文章,生产级细节丰富)

后续行动: 建议精读,关注 EAGLE-3/EAGLE 3.1 的配置差异和 vLLM 集成步骤。


🔴 B1 · 生产级 RAG 架构 2026

链接: https://datastorage.com/articles/building-a-production-ready-rag-architecture-in-2026/

核心观点: 离线索引管道 + 在线查询管道 + 评估 + 可观测性 + 治理 + 访问控制的完整生产 RAG 架构。

关键数据: - 混合搜索 MRR 66.4% vs 纯语义 56.7%(+9.7pp) - GraphRAG 在垂直领域准确率 81%,比传统 RAG 高 6.8pp - 每查询成本:$0.005-$0.02(含检索 + 生成) - 置信度分数 < 0.9 时优先修复检索层

工程价值: - 离线索引管道:CDC 触发增量索引,避免全量重建 - 在线查询管道:HyDE 扩展、混合 BM25+向量检索、Cohere Rerank v3 重排 - "lost in the middle" 问题的工程解法:前重后排 - RAGAS 四指标体系:Context Precision/Recall、Faithfulness、Answer Relevancy - LLM-as-judge 评估模式(1-5 分准确度/完整度/连贯度)

可信度: ★★★★☆(综合行业分析,有具体基准数据)

后续行动: 建议精读评估指标部分和成本计算方法;考虑更新 RAG 主题页。


🔴 B2 · Kubernetes 生产 RAG 管道

链接: https://devops.gheware.com/blog/posts/rag-pipeline-kubernetes-production-enterprise-2026.html

核心观点: Kubernetes 原生的企业级 RAG 部署,包含四个 Scaling Plane、Vector DB 选型矩阵、混合搜索实现和生产失效模式。

关键数据: - 混合搜索在 87% 企业用例中优于纯向量搜索 - pgvector 单节点上限约 5000 万向量;Qdrant DiskANN 支持 10 亿+ - Pinecone 托管成本 $6K-18K/月 vs Qdrant 自托管 $2-4K/月(1 亿向量规模)

工程价值(YAML/命令): - 四个 Scaling Plane:Ingestion(Job+CronJob)、VectorStore(StatefulSet+PDB)、Retrieval(HPA)、Generation(HPA) - 向量库选型矩阵:Qdrant/Weaviate/Pinecone/pgvector/Milvus 全面对比 - 向量 DB p99 超过 200ms 时需立即告警(不能靠 prompt engineering 修复) - 优雅降级:向量库不可用时回退到纯 keyword 搜索 - 查询路由微服务:分类查询类型并路由,增加约 5ms 延迟但消除主要失效源 - Matryoshka 表示学习:3072 维截断至 256 维无需重训

可信度: ★★★★☆(DevOps 实战博客,具体 YAML 和 Kubernetes 原语)

后续行动: 建议精读 Kubernetes YAML 配置示例和 HPA/PDB 设置;适合作为 RAG 部署主题页的代码示例来源。


🟡 B3 · On-Premises 企业 RAG 蓝图

链接: https://arxiv.org/abs/2604.01395v1

核心观点: 基于 4+1 视图模型的企业本地 RAG 参考架构,配有可部署参考应用和 CI/CD 管道。

工程价值: - 4+1 视图(逻辑/进程/开发/物理/场景视图) - 参考应用:https://github.com/aiengineeringblueprints/Enterprise_RAG_Blueprint - OpenTelemetry 监控集成(logs/metrics/traces) - Docker Compose 微服务部署 - 访问控制、Guardrails、Query Refinement、Answer Verification 组件 - 增量式采用:基础 RAG → 企业增强层

可信度: ★★★☆☆(学术蓝图,参考应用在早期开发阶段,需行业伙伴验证)

后续行动: 建议审稿,关注参考应用的完整度和 CI/CD 管道可操作性。


🟡 C1 · AI Agent 工程师路线图

链接: https://opencloudai.substack.com/p/ai-agent-engineer-roadmap-how-to

核心观点: 20 步构建生产 AI Agent 的完整蓝图,覆盖从模型选择到部署的全流程。

20 步概览: 模型选择 → Tools → MCP → Memory → Skills → Loops → Routing → Graphs → Parallel Agents → Verification → Checkpoints → Human Approval → Security → Observability → Evals → Cost Control → Deployment

工程价值: - 强调"模型不再是全部产品",AI Agent 工程师角色兴起 - 给出优先顺序建议:先建什么,后加什么 - 涵盖 MCP(Model Context Protocol)、Agent 记忆、多 Agent 协调

可信度: ★★★☆☆(Substack 文章,非同行评审,内容偏概览但有工程框架)

后续行动: 可作为 Agent 系统主题页的目录索引来源;建议配合其他论文深化每个步骤。


🟡 C2 · Agentic AI 推理模型系统设计

链接: https://aiengineeringinsider.substack.com/p/agentic-ai-reasoning-model-system

核心观点: Agentic 推理架构设计,包括快速路径 vs 深思熟虑路径的决策框架,solve_hybrid() 函数的四阶段编排。

关键数据: - 快速路径(单次 LLM 调用)vs 深思熟虑路径(分解+工具+验证):前者产生幻觉,后者正确 - 测试时计算成本权衡:简单提取类任务不应使用推理开销

工程价值: - solve_hybrid() 函数:规划层(Planning)+ 有界 ReAct 循环 - 四阶段深思熟虑路径:分解、规划、工具求解、验证 - Test-time compute 的决策规则(何时需要推理,何时不需要)

可信度: ★★★☆☆(Substack,AI 工程 insider,实用视角但非学术)

后续行动: 建议审稿,关注 solve_hybrid() 的具体代码结构和 ReAct 循环边界设置。


🟠 B4 · AI Model Serving 架构对比

链接: https://www.runpod.io/articles/guides/ai-model-serving-architecture-building-scalable-inference-apis-for-production-applications

核心观点: 2026 年三大开源推理引擎(vLLM/TensorRT-LLM/SGLang)和 NVIDIA Dynamo 编排层的架构对比与选型指南。

关键数据: - vLLM v0.17.1 在 H100 集群 Llama 3.1 8B 上约 12,500 tokens/sec(batch) - TensorRT-LLM v1.2.0:EAGLE-3, N-gram, MTP 投机解码;FP8 + NVFP4 量化;DeepSeek-R1 优化;Multiblock Attention;NVSwitch MultiShot AllReduce 加速 3× - NVIDIA Dynamo + Blackwell:相比 Hopper 提升 30× 吞吐

可信度: ★★★☆☆(RunPod 托管服务博客,benchmark 数字需核实条件)

后续行动: 作为选型参考;benchmark 数字需与其他来源交叉验证。


🟠 A3 · 异构 LLM 推理设计空间

链接: https://arxiv.org/html/2606.29708

核心观点: 异构 PD 推理的设计空间分析,四个轴:accelerator、precision、interconnect、KV residency。

核心洞察: - 精度策略属于运行时角色而非全局设置(低比特格式在不同阶段缓解不同瓶颈) - KV 传输引擎处理字节而非张量语义,跨厂商时表示兼容性是显式边界问题 - KV 交接有生命周期(预约/释放/故障恢复),需要明确所有权

可信度: ★★★★☆(arXiv,工业部署观察 + 源码审查)

后续行动: 建议审稿,关注与 A1/A2 的互补关系(设计空间 vs 具体生产数据)。


保留/丢弃清单

条目 决定 理由
A1 MLSys Meta 保留 生产数据(10 亿用户),具体性能数字,完整设计空间方法论
A2 RTP-LLM 保留 阿里巴巴开源,生产验证,量化指标详实,开源代码
A3 异构设计空间 保留 设计空间框架,与 A1/A2 互补,源码审查依据
A4 Cascade 保留 SLO 调度新范式,2.4× 好吞吐提升,生产轨迹验证
A5 OpScale 保留 算子级弹性新范式,36.3% GPU 节省,大规模验证
A6 Red Hat 保留 决策规则、EAGLE-3/EAGLE 3.1 对比、vLLM 集成细节
B1 RAG 2026 保留 完整架构图、混合搜索数据、Cohere Rerank、RAGAS 指标
B2 K8s RAG 保留 YAML 示例、4 Scaling Plane、Vector DB 矩阵、生产失败模式
B3 RAG 蓝图 保留(有条件) 架构框架有价值,参考应用早期阶段需验证
B4 RunPod Serving 保留(有条件) 引擎对比有参考价值,benchmark 数字需交叉验证
C1 Agent 路线图 保留(有条件) 框架完整性好,适合作为主题页目录
C2 Agentic 推理 保留(有条件) solve_hybrid() 架构有价值,非学术来源需审稿

分类标签建议

#LLM-Inference #Inference-Engine #vLLM #TensorRT-LLM #SGLang #RTP-LLM
#Prefill-Decode-Disaggregation #Speculative-Decoding #EAGLE #Medusa
#KV-Cache #Continuous-Batching #SLO-Scheduling #Cascade #OpScale
#RAG #Hybrid-Search #BM25 #Reranking #GraphRAG #Agentic-RAG
#Kubernetes #HPA #Vector-Database #Qdrant #Pinecone #pgvector
#Enterprise-RAG #RAGAS #LLM-as-Judge
#AI-Agent #MCP #Agent-Memory #Test-Time-Compute
#MoE #Heterogeneous-Inference #Operator-Level-Autoscaling

建议写入路径

文件路径 内容类型 优先级
/shared/research-kb/inbox/jay/2026-09-03-llm-inference-rag-engineering.md 本次筛选草稿(主文件) P0
/shared/research-kb/inbox/jay/2026-09-03-llm-inference-engineERING-detailed-A1-A2.md A1+A2 精读笔记(建议后续拆分) P1
/shared/research-kb/inbox/jay/2026-09-03-rag-engineering-detailed-B1-B2.md B1+B2 精读笔记(建议后续拆分) P1

后续行动建议

精读优先级(Top 3)

  1. A1(Meta MLSys) → 核实 Table 6 的配置参数表,补充 SLO 约束下最优并行策略量化数据
  2. A2(RTP-LLM) → 获取 GitHub 仓库,验证开源代码与论文描述的一致性
  3. A4(Cascade) → Algorithm 1 伪代码转 Markdown 格式,补充与 vLLM 集成细节

审稿需求

  • C2(Agentic 推理):Substack 来源,需核实 solve_hybrid() 函数的具体实现细节是否可复现
  • B3(RAG 蓝图):参考应用处于早期阶段,需要行业验证结果

主题页更新建议

  • 更新 LLM Inference Engine 主题页:补充 RTP-LLM、Cascade、OpScale 三个新系统
  • 更新 RAG 主题页:补充 Kubernetes 部署模式(来自 B2)、GraphRAG 准确率数据(来自 B1)
  • 新建 AI Agent Engineering 主题页:以 C1 路线图为框架骨架

本次写入文件

实际写入路径:

/shared/research-kb/inbox/jay/2026-09-03-llm-inference-rag-engineering.md

不入库原因说明: - A3、A5、B3、C1、C2、B4 为"保留(有条件)",建议下一轮审稿通过后再写入正式知识库 - 未执行 GitHub 写入操作(符合本次任务约束)