Jay 工程实践筛选 · 2026-07-30
本次主题
LLM 推理引擎工程实践 / RAG 系统生产部署 / Agent 基础设施
检索范围
arXiv (cs.AI, cs.CL, cs.SE, cs.LG) · Papers with Code · inference.net · LeetLLM · PremAI blog · The AI Engineer (Substack) · MLflow blog · Alphacorp blog
✅ 保留条目
1. arXiv:2606.20869 — Engineering RAG Systems for Real-World Applications
类型: 学术论文(arXiv:2506.20869v1, 2026-06更新)
标签: RAG 工程实践 多领域 OCR 生产系统
保留理由: 覆盖 5 个真实领域(市政治理、农业、医疗等),集成多语言 OCR 管道、语义向量检索、in-house 与云端 LLM,附 100 名用户的生产评估研究。包含端到端 pipeline 设计和 evaluation metrics。
工程含量: 高——pipeline 各阶段有明确描述,多模型集成路径,user study 提供 ground truth。
原文链接: https://arxiv.org/html/2606.20869v1
建议: 精读,提取 RAG pipeline 工程决策模式,可纳入主题页。
2. arXiv:2606.01927 — Scaling LLM Inference Beyond Amdahl's Limits (Albireo)
类型: 学术论文 + 系统实现
标签: 推理优化 推理引擎 吞吐量 GPU利用率 生产集成
保留理由: 提出 Albireo 系统,针对 LLM 推理中非可扩展开销(non-scalable overhead)的异步调度优化。生产集成至 MaaS 平台,bentoML 部署。核心数据:Throughput 1.9×, Latency -48%, GPU Utilization +28%, Energy -54%(对比 vLLM)。提供 Databricks 数据集作为 workload,bentoML 作为 serving layer。
工程含量: 极高——有 benchmark 环境说明(具体数据集、bentoML 配置、4 个量化指标),有生产流量对比数据(Figure 12),与 vLLM 的端到端对比数字可信。
原文链接: https://arxiv.org/html/2606.01927
建议: 精读,关注异步调度(Optimistic Asynchronous Scheduling)和 CPU-GPU 同步开销削减的具体机制。
3. arXiv:2605.01280 — Position: LLM Serving Needs Mathematical Optimization(vLLM/SGLang 路由策略分析)
类型: 立场论文(Position Paper)
标签: 推理引擎 调度算法 vLLM SGLang 路由策略
保留理由: 系统梳理 vLLM 和 SGLang 的请求路由(routing)、调度(scheduling)和 KV-cache 驱逐策略,指出 join-shortest-queue / round-robin / LRU 等通用启发式在 LLM 推理场景的结构性低效。引用 DeepSeek V3/R1 生产部署的 EPLB/LPLB 案例。
工程含量: 中——论文定位是 Position,非实现,但引用了真实生产配置(EPLB 已部署),策略分析对工程选型有参考价值。
原文链接: https://arxiv.org/html/2605.01280v1
建议: 审稿,关注 LLM 推理调度与传统分布式系统调度的差异点。
4. arXiv:2602.19594 — ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?
类型: 评测论文
标签: Coding Agent 推理引擎优化 Claude Code vLLM SGLang
保留理由: 研究 Claude Code / Codex CLI / TRAE 等 coding agent 是否能优化真实推理引擎(vLLM/SGLang)中的生产级优化任务。构建 54 个 benchmark 实例(39 来自 vLLM, 15 来自 SGLang),提供 evaluation commands、hard/soft metrics。发现 Claude Code 在 vLLM 优化任务上 True Success Rate 46.2%,TRAE 在 SGLang 上达 86.7%。附 GitHub repo 和数据集链接。
工程含量: 高——直接使用真实推理引擎代码库,有可复现的评测命令,环境为单卡 H100。
原文链接: https://arxiv.org/html/2602.19594v1
建议: 精读,关注 agent 优化代码任务的可复现性和实际工程价值判断。
5. PremAI Blog — vLLM vs SGLang vs LMDeploy: Fastest LLM Inference Engine in 2026?
类型: 工程对比博客
标签: 推理引擎对比 vLLM SGLang LMDeploy H100 benchmark
保留理由: 量化对比三大开源推理引擎(H100, Llama 3.1 8B):Throughput(vLLM ~12,500 tok/s vs SGLang ~16,200 tok/s vs LMDeploy ~16,100 tok/s)、TTFT、并发稳定性、量化支持范围。Feature matrix 覆盖 9 个维度,Decision Framework 给出选型建议。
工程含量: 中——数字来自 benchmarks(引用 LeetLLM),但有明确硬件/模型/scenario 约束,有实际应用场景选型建议。
原文链接: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
建议: 收录,生产选型参考,注意标注数据来源为基准测试而非生产实测。
6. LeetLLM — vLLM vs SGLang vs TensorRT-LLM vs Ollama: Choosing an Inference Engine in 2026
类型: 工程对比博客
标签: 推理引擎对比 TensorRT-LLM Ollama 并发测试 冷启动
保留理由: 补充 TensorRT-LLM 的冷启动代价(compiled path: ~28 min setup),Ollama 的本地开发定位。对比 TTFT p50 / TPOT / throughput at concurrency。有 benchmark checklist(4 metrics: TTFT, TPOT, tok/s at target concurrency, operational cost)和 "unique-prompt vs shared-prefix workload" 分类建议。
工程含量: 中——提供并发测试数据,揭示 TensorRT-LLM 编译开销这一重要工程陷阱。
原文链接: https://leetllm.com/blog/llm-inference-engine-comparison-2026
建议: 收录,与 PremAI 条目互补,合并为推理引擎选型知识节点。
7. The AI Engineer (Substack) — The AI Agents Stack: LLM to Production (2026 Edition)
类型: Substack 行业分析
作者: The AI Engineer (theaiengineer.substack.com)
标签: Agent架构 MCP Guardrails FastAPI 生产部署
保留理由: 2026 Agent 基础设施栈的分层梳理(Layer 1 模型到 Layer 5 部署),指出关键工程趋势:Agent guardrails 已从 LLM guardrails 独立出来成为专项(授权工具调用、rate limit、执行验证),FastAPI 仍是主流部署方式(LangGraph Cloud/Bedrock Agents 未成主流),MCP 服务器连接编辑/终端/文件系统模式已成事实标准。提供 Cursor 的多模型路由架构案例。
工程含量: 中——内容偏总结但有具体系统案例(Cursor 架构),Guardrails 专项化判断有工程洞察价值。
原文链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
建议: 精读,提取 2026 Agent 基础设施栈共识,可更新 Agent Engineering 主题页。
8. MLflow Blog — Setting Up LLM Observability Pipelines in 2026
类型: 官方博客 + 代码示例
标签: LLMOps 可观测性 tracing Langfuse RAG evaluation
保留理由: MLflow 官方给出 2026 LLM 可观测性 pipeline 架构:span model for RAG (retrieval → generation)、cost/latency attribution per step、Langfuse 集成、RAGAS 自动 metric 计算、dashboard 展示 latency/cost/quality 趋势。
工程含量: 中——有 pipeline 架构图和具体集成路径(MLflow + Langfuse + RAGAS),可作为 LLMOps 主题页工程参考。
原文链接: https://mlflow.org/articles/setting-up-llm-observability-pipelines-in-2026
建议: 收录,适合作为 LLMOps / 可观测性主题的工程示例。
❌ 丢弃条目(附理由)
| 条目 | 丢弃理由 |
|---|---|
| VoltAgent/awesome-ai-agent-papers | 仅为论文列表,无原创工程分析;arXiv 自己可以查阅 |
| Sebastian Raschka "LLM Research Papers 2026 (Jan-May)" | 论文摘要汇总,非原始研究;可作为导航但不宜入库 |
| NirantK "AI Agents 2026 Path" (Substack) | 教程/学习路径类内容,非工程实践;无具体环境/命令/性能数据 |
| Alphacorp "RAG Frameworks 2026" | 框架对比缺乏新意,LlamaIndex vs LangChain 的结论业界已知 |
| Maxim AI / Braintrust RAG 评测工具对比 | 工具厂商博客,内容偏产品功能介绍,工程洞察有限 |
| metafiedlab "Production RAG Pipeline 2026" | 市场数据拼凑("$3.33B market")大于技术贡献;含 RAG evaluation 重要性呼吁但无实现细节 |
| LinkedIn "LLM Agent Challenges in Production" | 社交媒体碎片观点,无系统性工程分析 |
| Reddit r/AI_Agents paper list post | 社区导航帖,非原创内容 |
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-07-30-engineering-llm-inference-rag-production.md
🏷️ 分类标签
LLM-Inference RAG Agent-Engineering vLLM SGLang MLOps Production-Engineering Evaluation
📋 后续行动
- 精读: 条目 2 (Albireo, 推理优化具体机制) + 条目 4 (ISO-Bench, coding agent 优化推理引擎)
- 审稿: 条目 3 (LLM Serving 数学优化 Position Paper)
- 主题页更新: LLM Inference 主题页(合并条目 5+6),Agent Engineering 主题页(合并条目 7)
- 去重检查:
/shared/research-kb/inbox/下已有2026-07-文件需核对避免重复