AI/ML 系统工程实践 · 筛选草稿 · 2026-09-03
任务概述
- 执行实例: Jay
- 执行时间: 2026-09-03 19:50 (Asia/Shanghai)
- 本次主题: LLM Inference Engine + RAG 工程实践
- 检索范围: Exa 网页搜索、arXiv、Substack、Red Hat Developers、devops 技术博客
- 去重参考: 读取
/shared/research-kb/inbox/下其他实例草稿(本次为首次扫描,目录可能为空)
候选条目(共 12 条)
分类 A:LLM 推理引擎(6 条)
| # | 标题 | 来源 | 发布日 | 类型 |
|---|---|---|---|---|
| A1 | Optimizing Deployment Configurations for LLM Inference: Challenges and Insights | MLSys 2026 | 2026 | 论文 |
| A2 | RTP-LLM: High-Performance Alibaba LLM Inference Engine | arXiv:2605.29639 | 2026-05-28 | 论文 |
| A3 | Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference | arXiv:2606.29708 | 2026-06-29 | 论文 |
| A4 | Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving | arXiv:2608.06557v1 | 2026-08-06 | 论文 |
| A5 | OpScale: Operator-level Provisioning and Autoscaling for LLM Serving | arXiv:2608.13499v1 | 2026-08 | 论文 |
| A6 | Optimizing Distributed AI Inference: Advanced Deployment Patterns | Red Hat Developers | 2026-06-24 | 技术博客 |
分类 B:RAG 工程实践(4 条)
| # | 标题 | 来源 | 发布日 | 类型 |
|---|---|---|---|---|
| B1 | Building a Production-Ready RAG Architecture in 2026 | datastorage.com | 2026-07-01 | 技术博客 |
| B2 | Production RAG Pipeline on Kubernetes | devops.gheware.com | 2026-05-12 | 技术博客 |
| B3 | AI Engineering Blueprint for On-Premises RAG Systems | arXiv:2604.01395v1 | 2026-04 | 论文 |
| B4 | Building Scalable Inference APIs for Production Applications | runpod.io | 2026 | 技术博客 |
分类 C:Agent 系统工程(2 条)
| # | 标题 | 来源 | 发布日 | 类型 |
|---|---|---|---|---|
| C1 | AI Agent Engineer Roadmap: How to Build Production Agents in 2026 | opencloudai.substack.com | 2026-08-09 | Substack |
| C2 | Agentic AI Reasoning Model System Design | aiengineeringinsider.substack.com | 2026-08-20 | Substack |
高价值条目(详细摘要)
🔴 A1 · MLSys 2026 · Meta Llama Inference 部署优化
链接: https://proceedings.mlsys.org/paper_files/paper/2026/file/97dc07f1253ab33ee514f395a82fa7cc-Paper-Conference.pdf
核心观点: Meta 团队系统分析了 Llama 模型族(服务近 10 亿月活用户)在生产环境中的推理部署配置空间,涵盖硬件(H100/H200/MI300X)、并行策略(Tensor/Pipeline/Expert/Context/Data)、运行时设计(continuous batching vs. disaggregation)以及 SLO 约束。
关键数据: - 吞吐量提升最高 ~2.5× - Disaggregation 迁移后在线服务节省约 30% 算力容量 - 异构硬件策略(Prefill 用计算型 GPU,Decode 用带宽型 GPU)成本效率提升 15-25% - TP4PP2 vs TP2PP4:前者延迟更低但 QPS 低 20%(通信开销)
工程价值: - 构建了轻量级性能模拟器,基于实测算子基准预测跨百万配置的端到端性能 - 生产经验总结:MoE 架构的系统级影响、平台扩展行为、并行策略的相位特异性 - 提出 runtime 架构决策规则:严格延迟 SLO 用 disaggregated,吞吐量优先用 continuous batching
可信度: ★★★★★(Meta 生产数据,MLSYS 2026 同行评审)
后续行动: 建议精读第 4 节(第 4.2 节 disaggregation trade-offs、第 4.6 节硬件错误选择代价 2-3×),核实论文中 Table 6 的具体配置参数。
🔴 A2 · RTP-LLM · 阿里巴巴推理引擎
链接: https://arxiv.org/html/2605.29639
核心观点: 阿里巴巴基础模型推理团队开源的高性能推理引擎,已在阿里集团部署服务超过 1 亿用户。集成模型加载优化、PD 分离架构、多层 KV 缓存管理、模块化投机解码和自适应量化。
关键数据: - 模型加载速度:比 vLLM 和 SGLang 快 4.7-6.3× - 生产流量 TTFT P95 延迟降低 35-37%,缓存复用提升 215% - 投机解码吞吐量提升 1.12-2.48× - 多模态推理吞吐量提升 1.86-2.52× - 量化推理:批次延迟降低 35-40%,TTFT 改善 1.9-3.0×
工程价值: - 文件顺序驱动 I/O + 并行 I/O-通信重叠 - 四层层级 KV 缓存访问(GPU HBM → 本地 CPU → 远程 CPU via RDMA → 分布式存储 3FS) - 支持 PD-Fusion(同节点)和 PD-Disaggregation(分离节点)两种部署模式 - 已开源:https://github.com(需进一步检索具体仓库名)
可信度: ★★★★★(阿里巴巴生产验证,开源代码已发布)
后续行动: 建议精读第 4 节(模型加载优化)和第 5 节(PD 分离与流量调度),获取 GitHub 仓库链接并核实开源代码质量。
🔴 A4 · Cascade · SLO 感知 LLM 服务系统
链接: https://arxiv.org/abs/2608.06557v1
核心观点: 将每个请求的"延迟预算"(SLO - 预测剩余服务时间)作为运行时调度和 KV 缓存管理的统一协调量,相比 vLLM 默认 FCFS 调度器,好吞吐提升 2.4×,SLO 违规率降低 40%。
关键数据: - 好吞吐提升最高 2.4× - SLO 违规率降低 40% - 基于生产轨迹在三个大语言模型上验证
工程价值: - TTFT 延迟估算器:结合上下文长度、前缀 KV 缓存命中率、系统当前负载 - 多层 KV 预取决策:基于剩余预算决定从哪层缓存恢复数据 - 预算感知抢占:高预算请求(最有余量)优先被抢占用于重新调度 - 基于 vLLM + LMCache 实现,不修改模型权重,无需额外硬件
可信度: ★★★★☆(arXiv 预印本,基于生产轨迹验证,2026-08-06 新发布)
后续行动: 建议审稿,关注 Algorithm 1 的预算计算公式与 vLLM 集成方式。
🔴 A5 · OpScale · 算子级弹性伸缩
链接: https://arxiv.org/html/2608.13499v1
核心观点: 提出将扩缩容单位从"整模型"细化到"单个算子",实现亚秒级弹性。通过 40×A100 和 24×GB200 集群的生产轨迹验证,可在满足 SLO 的同时减少 36.3% GPU 和 28% 电力,或在固定成本下提升 44% 吞吐。
关键数据: - 满足 SLO 前提下减少 36.3% GPU、28% 电力 - 固定成本预算下吞吐提升 44% - Greedy 启发式算法与理论最优差距 < 8%
工程价值: - 算子级弹性的理论基础:刻画工作负载敏感度、资源弹性、算子间通信 - 三个平面:Data Plane(性能 profiling)、Control Plane(placement 计算)、Execution Plane(运行时调度) - 解决了算子级弹性空间爆炸问题
可信度: ★★★★☆(arXiv 预印本,大规模集群验证,2026-08 新发布)
后续行动: 建议审稿,关注第 4 节 Greedy 启发式算法的具体实现复杂度。
🟡 A6 · Red Hat · 分布式推理高级部署模式
链接: https://developers.redhat.com/articles/2026/06/24/optimizing-distributed-ai-inference-advanced-deployment-patterns
核心观点: 三个优化杠杆:Prefill/Decode 分离、KV 缓存策略、投机解码。提供具体决策规则和生产注意事项。
关键数据: - 分离架构在 chat/RAG 流量上降低 25-40% 成本 - Splitwise 报告成本降低约 20%、吞吐量 1.4×;DistServe 好吞吐提升 7.4× - llm-d 的 prefix-cache-hit 路由:TTFT 最高快 57×,高前缀复用场景吞吐翻倍 - EAGLE-3:Dense 模型加速最高 6×;EAGLE 3.1(2026-05 发布):长上下文工作负载,TTAL 比 EAGLE-3 翻倍 - Medusa 接受率通常在 0.55-0.70 - 默认配置提升 25%,配合 prefix-cache-hit 路由后 GPU 每秒 token 数提升 2-3×
工程价值(命令/配置): - 决策规则:测量 prefill GPU秒 / decode GPU秒 比值,对比 decode优化GPU成本 / prefill优化GPU成本 比值 - vLLM KVConnector 接口(LMCache/LMDeploy/Infiniflow 实现) - NIXL 元数据服务器需部署 2 台 + TCP 负载均衡,单点故障风险 - 投机解码在 constrained decoding(JSON mode、tool calls)场景接受率崩溃 - FP8 KV 缓存:内存减半,质量损失可接受;FP4:需用自己数据跑评估验证
可信度: ★★★★☆(Red Hat 开发者文章,生产级细节丰富)
后续行动: 建议精读,关注 EAGLE-3/EAGLE 3.1 的配置差异和 vLLM 集成步骤。
🔴 B1 · 生产级 RAG 架构 2026
链接: https://datastorage.com/articles/building-a-production-ready-rag-architecture-in-2026/
核心观点: 离线索引管道 + 在线查询管道 + 评估 + 可观测性 + 治理 + 访问控制的完整生产 RAG 架构。
关键数据: - 混合搜索 MRR 66.4% vs 纯语义 56.7%(+9.7pp) - GraphRAG 在垂直领域准确率 81%,比传统 RAG 高 6.8pp - 每查询成本:$0.005-$0.02(含检索 + 生成) - 置信度分数 < 0.9 时优先修复检索层
工程价值: - 离线索引管道:CDC 触发增量索引,避免全量重建 - 在线查询管道:HyDE 扩展、混合 BM25+向量检索、Cohere Rerank v3 重排 - "lost in the middle" 问题的工程解法:前重后排 - RAGAS 四指标体系:Context Precision/Recall、Faithfulness、Answer Relevancy - LLM-as-judge 评估模式(1-5 分准确度/完整度/连贯度)
可信度: ★★★★☆(综合行业分析,有具体基准数据)
后续行动: 建议精读评估指标部分和成本计算方法;考虑更新 RAG 主题页。
🔴 B2 · Kubernetes 生产 RAG 管道
链接: https://devops.gheware.com/blog/posts/rag-pipeline-kubernetes-production-enterprise-2026.html
核心观点: Kubernetes 原生的企业级 RAG 部署,包含四个 Scaling Plane、Vector DB 选型矩阵、混合搜索实现和生产失效模式。
关键数据: - 混合搜索在 87% 企业用例中优于纯向量搜索 - pgvector 单节点上限约 5000 万向量;Qdrant DiskANN 支持 10 亿+ - Pinecone 托管成本 $6K-18K/月 vs Qdrant 自托管 $2-4K/月(1 亿向量规模)
工程价值(YAML/命令): - 四个 Scaling Plane:Ingestion(Job+CronJob)、VectorStore(StatefulSet+PDB)、Retrieval(HPA)、Generation(HPA) - 向量库选型矩阵:Qdrant/Weaviate/Pinecone/pgvector/Milvus 全面对比 - 向量 DB p99 超过 200ms 时需立即告警(不能靠 prompt engineering 修复) - 优雅降级:向量库不可用时回退到纯 keyword 搜索 - 查询路由微服务:分类查询类型并路由,增加约 5ms 延迟但消除主要失效源 - Matryoshka 表示学习:3072 维截断至 256 维无需重训
可信度: ★★★★☆(DevOps 实战博客,具体 YAML 和 Kubernetes 原语)
后续行动: 建议精读 Kubernetes YAML 配置示例和 HPA/PDB 设置;适合作为 RAG 部署主题页的代码示例来源。
🟡 B3 · On-Premises 企业 RAG 蓝图
链接: https://arxiv.org/abs/2604.01395v1
核心观点: 基于 4+1 视图模型的企业本地 RAG 参考架构,配有可部署参考应用和 CI/CD 管道。
工程价值: - 4+1 视图(逻辑/进程/开发/物理/场景视图) - 参考应用:https://github.com/aiengineeringblueprints/Enterprise_RAG_Blueprint - OpenTelemetry 监控集成(logs/metrics/traces) - Docker Compose 微服务部署 - 访问控制、Guardrails、Query Refinement、Answer Verification 组件 - 增量式采用:基础 RAG → 企业增强层
可信度: ★★★☆☆(学术蓝图,参考应用在早期开发阶段,需行业伙伴验证)
后续行动: 建议审稿,关注参考应用的完整度和 CI/CD 管道可操作性。
🟡 C1 · AI Agent 工程师路线图
链接: https://opencloudai.substack.com/p/ai-agent-engineer-roadmap-how-to
核心观点: 20 步构建生产 AI Agent 的完整蓝图,覆盖从模型选择到部署的全流程。
20 步概览: 模型选择 → Tools → MCP → Memory → Skills → Loops → Routing → Graphs → Parallel Agents → Verification → Checkpoints → Human Approval → Security → Observability → Evals → Cost Control → Deployment
工程价值: - 强调"模型不再是全部产品",AI Agent 工程师角色兴起 - 给出优先顺序建议:先建什么,后加什么 - 涵盖 MCP(Model Context Protocol)、Agent 记忆、多 Agent 协调
可信度: ★★★☆☆(Substack 文章,非同行评审,内容偏概览但有工程框架)
后续行动: 可作为 Agent 系统主题页的目录索引来源;建议配合其他论文深化每个步骤。
🟡 C2 · Agentic AI 推理模型系统设计
链接: https://aiengineeringinsider.substack.com/p/agentic-ai-reasoning-model-system
核心观点: Agentic 推理架构设计,包括快速路径 vs 深思熟虑路径的决策框架,solve_hybrid() 函数的四阶段编排。
关键数据: - 快速路径(单次 LLM 调用)vs 深思熟虑路径(分解+工具+验证):前者产生幻觉,后者正确 - 测试时计算成本权衡:简单提取类任务不应使用推理开销
工程价值: - solve_hybrid() 函数:规划层(Planning)+ 有界 ReAct 循环 - 四阶段深思熟虑路径:分解、规划、工具求解、验证 - Test-time compute 的决策规则(何时需要推理,何时不需要)
可信度: ★★★☆☆(Substack,AI 工程 insider,实用视角但非学术)
后续行动: 建议审稿,关注 solve_hybrid() 的具体代码结构和 ReAct 循环边界设置。
🟠 B4 · AI Model Serving 架构对比
链接: https://www.runpod.io/articles/guides/ai-model-serving-architecture-building-scalable-inference-apis-for-production-applications
核心观点: 2026 年三大开源推理引擎(vLLM/TensorRT-LLM/SGLang)和 NVIDIA Dynamo 编排层的架构对比与选型指南。
关键数据: - vLLM v0.17.1 在 H100 集群 Llama 3.1 8B 上约 12,500 tokens/sec(batch) - TensorRT-LLM v1.2.0:EAGLE-3, N-gram, MTP 投机解码;FP8 + NVFP4 量化;DeepSeek-R1 优化;Multiblock Attention;NVSwitch MultiShot AllReduce 加速 3× - NVIDIA Dynamo + Blackwell:相比 Hopper 提升 30× 吞吐
可信度: ★★★☆☆(RunPod 托管服务博客,benchmark 数字需核实条件)
后续行动: 作为选型参考;benchmark 数字需与其他来源交叉验证。
🟠 A3 · 异构 LLM 推理设计空间
链接: https://arxiv.org/html/2606.29708
核心观点: 异构 PD 推理的设计空间分析,四个轴:accelerator、precision、interconnect、KV residency。
核心洞察: - 精度策略属于运行时角色而非全局设置(低比特格式在不同阶段缓解不同瓶颈) - KV 传输引擎处理字节而非张量语义,跨厂商时表示兼容性是显式边界问题 - KV 交接有生命周期(预约/释放/故障恢复),需要明确所有权
可信度: ★★★★☆(arXiv,工业部署观察 + 源码审查)
后续行动: 建议审稿,关注与 A1/A2 的互补关系(设计空间 vs 具体生产数据)。
保留/丢弃清单
| 条目 | 决定 | 理由 |
|---|---|---|
| A1 MLSys Meta | 保留 | 生产数据(10 亿用户),具体性能数字,完整设计空间方法论 |
| A2 RTP-LLM | 保留 | 阿里巴巴开源,生产验证,量化指标详实,开源代码 |
| A3 异构设计空间 | 保留 | 设计空间框架,与 A1/A2 互补,源码审查依据 |
| A4 Cascade | 保留 | SLO 调度新范式,2.4× 好吞吐提升,生产轨迹验证 |
| A5 OpScale | 保留 | 算子级弹性新范式,36.3% GPU 节省,大规模验证 |
| A6 Red Hat | 保留 | 决策规则、EAGLE-3/EAGLE 3.1 对比、vLLM 集成细节 |
| B1 RAG 2026 | 保留 | 完整架构图、混合搜索数据、Cohere Rerank、RAGAS 指标 |
| B2 K8s RAG | 保留 | YAML 示例、4 Scaling Plane、Vector DB 矩阵、生产失败模式 |
| B3 RAG 蓝图 | 保留(有条件) | 架构框架有价值,参考应用早期阶段需验证 |
| B4 RunPod Serving | 保留(有条件) | 引擎对比有参考价值,benchmark 数字需交叉验证 |
| C1 Agent 路线图 | 保留(有条件) | 框架完整性好,适合作为主题页目录 |
| C2 Agentic 推理 | 保留(有条件) | solve_hybrid() 架构有价值,非学术来源需审稿 |
分类标签建议
#LLM-Inference #Inference-Engine #vLLM #TensorRT-LLM #SGLang #RTP-LLM
#Prefill-Decode-Disaggregation #Speculative-Decoding #EAGLE #Medusa
#KV-Cache #Continuous-Batching #SLO-Scheduling #Cascade #OpScale
#RAG #Hybrid-Search #BM25 #Reranking #GraphRAG #Agentic-RAG
#Kubernetes #HPA #Vector-Database #Qdrant #Pinecone #pgvector
#Enterprise-RAG #RAGAS #LLM-as-Judge
#AI-Agent #MCP #Agent-Memory #Test-Time-Compute
#MoE #Heterogeneous-Inference #Operator-Level-Autoscaling
建议写入路径
| 文件路径 | 内容类型 | 优先级 |
|---|---|---|
/shared/research-kb/inbox/jay/2026-09-03-llm-inference-rag-engineering.md |
本次筛选草稿(主文件) | P0 |
/shared/research-kb/inbox/jay/2026-09-03-llm-inference-engineERING-detailed-A1-A2.md |
A1+A2 精读笔记(建议后续拆分) | P1 |
/shared/research-kb/inbox/jay/2026-09-03-rag-engineering-detailed-B1-B2.md |
B1+B2 精读笔记(建议后续拆分) | P1 |
后续行动建议
精读优先级(Top 3)
- A1(Meta MLSys) → 核实 Table 6 的配置参数表,补充 SLO 约束下最优并行策略量化数据
- A2(RTP-LLM) → 获取 GitHub 仓库,验证开源代码与论文描述的一致性
- A4(Cascade) → Algorithm 1 伪代码转 Markdown 格式,补充与 vLLM 集成细节
审稿需求
- C2(Agentic 推理):Substack 来源,需核实 solve_hybrid() 函数的具体实现细节是否可复现
- B3(RAG 蓝图):参考应用处于早期阶段,需要行业验证结果
主题页更新建议
- 更新 LLM Inference Engine 主题页:补充 RTP-LLM、Cascade、OpScale 三个新系统
- 更新 RAG 主题页:补充 Kubernetes 部署模式(来自 B2)、GraphRAG 准确率数据(来自 B1)
- 新建 AI Agent Engineering 主题页:以 C1 路线图为框架骨架
本次写入文件
实际写入路径:
/shared/research-kb/inbox/jay/2026-09-03-llm-inference-rag-engineering.md
不入库原因说明: - A3、A5、B3、C1、C2、B4 为"保留(有条件)",建议下一轮审稿通过后再写入正式知识库 - 未执行 GitHub 写入操作(符合本次任务约束)