Jay 工程筛选笔记 · 2026-08-20 晚间

筛选主题

当日工程实践文章二次筛选 · 聚焦真实环境、命令、错误、性能数据、可复现步骤


🔴 高价值条目(保留)

1. vLLM vs SGLang vs TGI vs llama.cpp 推理引擎横向对比

  • 来源: DeployBase (deploybase.ai)
  • 原文: https://deploybase.ai/articles/best-llm-inference-engine
  • 时间: 2026-02-23
  • 核心数据(Llama 70B / A100 80GB): | 引擎 | 吞吐量 | TTFT | 备注 | |------|--------|------|------| | vLLM | 3,500 tokens/sec | 150–200ms | PagedAttention,连续批处理 | | SGLang | 2,800 tokens/sec | ~同vLLM | RadixAttention + 前缀缓存优 | | TGI | 2,500 tokens/sec | 150–200ms | 分布式开箱即用 | | llama.cpp(CPU) | 20 tokens/sec | — | 边缘/本地场景 |
  • 工程要点:
  • vLLM 的 PagedAttention 将 KV 缓存视为 OS 页表,消除内存碎片,传统方案 60-80% 显存浪费
  • SGLang 对"重复前缀"场景(agent 多次查同一大文档)有显著优势,支持任意容器化推理引擎混部
  • TGI 无需 GPU 优化知识,适合快速上线团队
  • TensorRT-LLM 达到 H100 上 10,000+ tokens/sec(FP8),但需要 checkpoint 转换 + engine 编译周期
  • 保留理由: 真实 Benchmark 数据,各引擎适用场景明确,有部署 trade-off 分析,适合作为选型决策参考
  • 标签: #推理引擎 #vLLM #SGLang #TensorRT-LLM #Benchmark
  • 建议: 可写入推理工程 benchmark 主题页

2. vLLM vs TensorRT-LLM 生产 Benchmark 详解(Lyceum)

  • 来源: Lyceum Technology Magazine
  • 原文: https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark
  • 时间: 2026-06-11(2026-08-03 更新)
  • 核心数据:
  • Stripe 案例:50M 日均 API 调用从 HuggingFace Transformers 迁移 vLLM,推理成本降低 73%,GPU 集群缩减至 1/3
  • vLLM PagedAttention 实测:相同硬件 batch 能力从 2-5 请求提升至 10-50 请求
  • TensorRT-LLM H100 FP8:TTFT ~100ms,输出 >10,000 tokens/sec
  • 工程要点:
  • TensorRT-LLM 需要 checkpoint 转换、engine 编译、多层配置(tensorrt_backend + Triton),适合有专职 ML infra 团队
  • vLLM 纯 Python,部署周期短,支持 OpenAI-compatible API,生产迭代快
  • SGLang 在"共享长文档 + 结构化 JSON 输出"场景值得关注
  • 保留理由: 有具体成本数字、具体客户案例、明确的适用条件,非泛泛之谈
  • 标签: #vLLM #TensorRT-LLM #生产Benchmark #成本优化 #Stripe案例
  • 建议: 与上一条合并作为"推理引擎选型 2026Q3"主题页核心参考

3. MCP 2026-07-28 规范:面向企业 AI 的无状态协议升级

  • 来源: Cloudflare Blog + Model Context Protocol 官方博客
  • 原文: https://blog.cloudflare.com/mcp-v2 / https://blog.modelcontextprotocol.io/posts/2026-07-28
  • 时间: 2026-07-28
  • 核心变化:
  • 无状态核心:移除传输层会话管理,MCP 成为标准 HTTP 工作负载,可跑在普通负载均衡基础设施上
  • Cloudflare Workers 原生支持:从第一天起,开发者可直接在 Workers 里运行 MCP Server,无需有状态基础设施
  • GET 请求支持:部分资源读取改用 GET,提升 CDN 缓存命中率
  • Google Cloudflare Agents SDKMicrosoft FoundryNetlify 均已 day-zero 兼容新规范
  • 工程要点:
  • 之前 MCP 需要 session 管理,每个 connected tenant 需处理 OAuth token TTL、refresh rotation、指数退避;新规范大幅简化
  • 新的 Mcp-Method / Mcp-Name Header 模式替代旧 JSON-RPC transport
  • 企业级 MCP Server 建设范式转变:不再需要状态后端,可用普通 HTTP 基础设施扩展
  • 可信度判断: 官方规范发布,Cloudflare + Google + Microsoft 联合背书,可信度极高
  • 保留理由: 企业 Agent 基础设施建设的里程碑节点,对工具调用架构有直接影响,需要跟进
  • 标签: #MCP #Agent基础设施 #无状态协议 #Cloudflare #企业AI
  • 建议: 精读规范原文,补充 MCP Server 建设实践笔记

4. RAG 静默失败模式与评价工具链(2026)

  • 来源: Medium (pramodchandrayan) + FutureAGI Substack + QASkills.sh RAGAS 指南
  • 原文:
  • https://medium.com/predict/your-rag-system-is-lying-to-you
  • https://futureagi.substack.com/p/top-5-tools-to-evaluate-rag-performance
  • https://qaskills.sh/blog/ragas-rag-evaluation-metrics-complete-guide
  • 核心洞察:
  • 静默失败是 RAG 最贵失败模式:系统日志正常、chunk 返回、LLM 正常响应,但答案引用于错误文档。2026 年数据显示 73% RAG 失败在检索阶段而非生成阶段
  • RAGAS 评分体系(faithfulness, answer relevance, context precision)已有明确阈值参考:
    • Faithfulness 0.9–1.0: Excellent;0.75–0.9: Acceptable;<0.5: Hallucinatory
  • FutureAGI 是唯一将"部署前测试"和"生产监控"用同一套 eval 配置打通的全生命周期平台;DeepEval 专注 CI 集成;Phoenix 专注可视化调试
  • 评价成本需注意:LLM-as-judge 每条需多次 LLM 调用,规模上来 cost 不容忽视
  • 保留理由: 提供了 RAG 真实失败统计 + 可操作评价指标体系,是生产 RAG 建设必读
  • 标签: #RAG #评价体系 #RAGAS #静默失败 #可观测性
  • 建议: 写入 RAG 工程实践主题页,精读 RAGAS 原文

5. AI Agent 技术栈 2026 版(Eval Gap 分析)

  • 来源: The AI Engineer Substack (theaiengineer.substack.com)
  • 原文: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 时间: 2026-03-11
  • 核心洞察:
  • Eval Gap:LangChain 调查显示 89% 的生产 Agent 团队有可观测性建设,但仅 52% 有正式评价体系,差距 37 个百分点——"能看到日志但不知道效果是否正常"
  • 三层评价架构收敛:PR 级快速检查(工具调用正确性)→ 夜间回归套件(LLM judge)→ 生产持续监控(性能漂移告警)
  • 新型 Benchmark 涌现:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
  • Agent Guardrails 独立成 discipline:不再是输入输出过滤,而是工具调用授权、速率限制、动作验证
  • 保留理由: 首次给出量化 eval gap,视角务实,对生产 Agent 工程有直接指导价值
  • 标签: #Agent工程 #评价体系 #EvalGap #可观测性 #三层架构
  • 建议: 适合与 RAG 评价工具链笔记合并为"LLM 系统质量保障"综合主题

6. ArXiv: LLM Serving 需要数学优化而非启发式(2026)

  • 来源: arXiv 2605.01280
  • 原文: https://arxiv.org/html/2605.01280v1
  • 核心论点:
  • vLLM、SGLang 等主流推理系统的算法核心仍是经典分布式计算的通用策略:JSQ 路由、FIFO 调度、LRU KV 缓存驱逐
  • LLM 推理有独特结构(prefill/decode 分离、KV 缓存模式、可推测解码),通用策略无法充分利用这些结构
  • 形式化方法可提供最坏情况鲁棒性、容量规划fundamental limits 等通用启发式无法提供的理论保证
  • 可信度判断: ArXiv 学术论文,有形式化论证,需要进一步核验实验数据
  • 保留理由: 对推理系统优化方向有学术前瞻价值,可作为技术决策论证参考
  • 标签: #LLM推理理论 #形式化优化 #ArXiv
  • 建议: 审稿级别阅读,关注是否有真实系统实验数据支撑

7. GPU MLOps OOM 场景详解 + Flyte 代码示例

  • 来源: Union.ai 博客
  • 原文: https://www.union.ai/blog-post/gpus-in-mlops-optimization-pitfalls-and-management
  • 核心内容:
  • OOM 场景分析:User A (9GB) + User B (5GB) 并行执行 → 14GB > 12GB → OOM;顺序执行则无问题
  • Flyte 代码示例(GPU 资源声明): python from flytekit import task, workflow from flytekit.types.file import FlyteFile @task( requests=Resources(cpu="2", mem="500Mi", gpu="1"), limits=Resources(cpu="2", mem="500Mi", gpu="1") ) def gpu_powered_task(input_data: FlyteFile) -> str: pass
  • 提出了 GPU 共享调度的多种方案(时间片、空间片、优先级权重)
  • 保留理由: 有具体 OOM 数值场景和可运行代码,适合作为 GPU 调度排障参考
  • 标签: #MLOps #GPU调度 #OOM #Flyte #生产实践
  • 建议: 写入 MLOps 基础设施主题页

🟡 中等价值条目(参考,降级处理)

8. Agent 框架 2026 全景图(Langfuse)

  • 来源: Langfuse Blog
  • 原文: https://langfuse.com/blog/2025-03-19-ai-agent-comparison
  • 评估: 框架横向对比覆盖全面(LangGraph, OpenAI Agent SDK, Claude Agent SDK, Google ADK, Pydantic AI, CrewAI 等),但属于框架选型参考,非具体工程数据,暂降级处理
  • 标签: #Agent框架 #选型参考

9. MLOps 生产基础设施讨论(Reddit r/mlops)

  • 来源: Reddit
  • 亮点: MLOps Community 作者提到 machinelearningatscale.substack.com 关注真实架构选择和 scaling 瓶颈;Argo CD + Kubernetes 部署模式;Flyte/Prefect 替代 Airflow 趋势
  • 评估: 社区讨论线索,非结构化工程数据,降级为背景参考
  • 标签: #MLOps社区 #架构选型

10. DeepLearning.AI vLLM 免费课程

  • 来源: Red Hat Developer
  • 原文: https://developers.redhat.com/blog/2026/06/03/learn-optimize-deploy-and-benchmark-llms-vllm-new-free-course
  • 评估: Andrew Ng 出品,涵盖 LLM Compressor 量化、GuideLLM benchmark、KV cache sizing,动手向;但主要适合入门,系统性工程价值有限
  • 标签: #vLLM教程 #入门

🟢 本次丢弃条目(说明原因)

条目 丢弃原因
AI Engineer 2026 路线图(多个 Substack) 路线图性质,无具体工程数据,重复度高
1000+ Job Description 分析(alexeyondata) 市场/职业分析,非工程实践,参考价值有限
Prompt Engineering 最佳实践(DevOpsNess/Reintech) 通用最佳实践,缺具体 Benchmark 或命令
QuantumRed/Medable Agent 案例(ZenML) 垂直行业案例,缺通用工程价值
Qwen3-235B / GLM 5.2 部署指南(Yotta Labs) 产品发布类,有具体命令但偏厂商内容

📋 汇总与后续行动

本次高价值条目清单

  1. ✅ vLLM/SGLang/TGI 横向 Benchmark — 真实性能数据
  2. ✅ vLLM vs TensorRT-LLM 生产对比 — Stripe 成本案例
  3. ✅ MCP 2026-07-28 无状态规范 — 企业 Agent 基础设施里程碑
  4. ✅ RAG 静默失败 + 评价工具链 — 73% 失败在检索端
  5. ✅ AI Agent Stack 2026 Eval Gap — 37pt gap 量化
  6. ✅ ArXiv LLM Serving 形式化优化论文
  7. ✅ GPU MLOps OOM + Flyte 示例

建议写入路径

  • 主草稿:/shared/research-kb/inbox/jay/2026-08-20T1950-jay-inference-engineering-rag-eval-mcp-stack-aug20.md ✅(本文)
  • 参考 RAG 主题页更新:/shared/research-kb/review/ 下待合并(由同步任务处理)
  • MCP 规范值得精读,补充 MCP Server 建设实践笔记

精读/审稿优先级

优先级 条目
精读 vLLM vs TensorRT-LLM Benchmark 全文;MCP 2026-07-28 规范原文
审稿 ArXiv LLM Serving 形式化优化论文(有无真实系统实验数据)
略读 RAGAS 完整评分说明;Agent Framework 对比原文

Jay · 2026-08-20 19:50 · 第三次筛选