Jay 工程筛选笔记 · 2026-08-20 晚间
筛选主题
当日工程实践文章二次筛选 · 聚焦真实环境、命令、错误、性能数据、可复现步骤
🔴 高价值条目(保留)
1. vLLM vs SGLang vs TGI vs llama.cpp 推理引擎横向对比
- 来源: DeployBase (deploybase.ai)
- 原文:
https://deploybase.ai/articles/best-llm-inference-engine - 时间: 2026-02-23
- 核心数据(Llama 70B / A100 80GB): | 引擎 | 吞吐量 | TTFT | 备注 | |------|--------|------|------| | vLLM | 3,500 tokens/sec | 150–200ms | PagedAttention,连续批处理 | | SGLang | 2,800 tokens/sec | ~同vLLM | RadixAttention + 前缀缓存优 | | TGI | 2,500 tokens/sec | 150–200ms | 分布式开箱即用 | | llama.cpp(CPU) | 20 tokens/sec | — | 边缘/本地场景 |
- 工程要点:
- vLLM 的 PagedAttention 将 KV 缓存视为 OS 页表,消除内存碎片,传统方案 60-80% 显存浪费
- SGLang 对"重复前缀"场景(agent 多次查同一大文档)有显著优势,支持任意容器化推理引擎混部
- TGI 无需 GPU 优化知识,适合快速上线团队
- TensorRT-LLM 达到 H100 上 10,000+ tokens/sec(FP8),但需要 checkpoint 转换 + engine 编译周期
- 保留理由: 真实 Benchmark 数据,各引擎适用场景明确,有部署 trade-off 分析,适合作为选型决策参考
- 标签:
#推理引擎#vLLM#SGLang#TensorRT-LLM#Benchmark - 建议: 可写入推理工程 benchmark 主题页
2. vLLM vs TensorRT-LLM 生产 Benchmark 详解(Lyceum)
- 来源: Lyceum Technology Magazine
- 原文:
https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark - 时间: 2026-06-11(2026-08-03 更新)
- 核心数据:
- Stripe 案例:50M 日均 API 调用从 HuggingFace Transformers 迁移 vLLM,推理成本降低 73%,GPU 集群缩减至 1/3
- vLLM PagedAttention 实测:相同硬件 batch 能力从 2-5 请求提升至 10-50 请求
- TensorRT-LLM H100 FP8:TTFT ~100ms,输出 >10,000 tokens/sec
- 工程要点:
- TensorRT-LLM 需要 checkpoint 转换、engine 编译、多层配置(tensorrt_backend + Triton),适合有专职 ML infra 团队
- vLLM 纯 Python,部署周期短,支持 OpenAI-compatible API,生产迭代快
- SGLang 在"共享长文档 + 结构化 JSON 输出"场景值得关注
- 保留理由: 有具体成本数字、具体客户案例、明确的适用条件,非泛泛之谈
- 标签:
#vLLM#TensorRT-LLM#生产Benchmark#成本优化#Stripe案例 - 建议: 与上一条合并作为"推理引擎选型 2026Q3"主题页核心参考
3. MCP 2026-07-28 规范:面向企业 AI 的无状态协议升级
- 来源: Cloudflare Blog + Model Context Protocol 官方博客
- 原文:
https://blog.cloudflare.com/mcp-v2/https://blog.modelcontextprotocol.io/posts/2026-07-28 - 时间: 2026-07-28
- 核心变化:
- 无状态核心:移除传输层会话管理,MCP 成为标准 HTTP 工作负载,可跑在普通负载均衡基础设施上
- Cloudflare Workers 原生支持:从第一天起,开发者可直接在 Workers 里运行 MCP Server,无需有状态基础设施
- GET 请求支持:部分资源读取改用 GET,提升 CDN 缓存命中率
- Google Cloudflare Agents SDK 和 Microsoft Foundry、Netlify 均已 day-zero 兼容新规范
- 工程要点:
- 之前 MCP 需要 session 管理,每个 connected tenant 需处理 OAuth token TTL、refresh rotation、指数退避;新规范大幅简化
- 新的
Mcp-Method/Mcp-NameHeader 模式替代旧 JSON-RPC transport - 企业级 MCP Server 建设范式转变:不再需要状态后端,可用普通 HTTP 基础设施扩展
- 可信度判断: 官方规范发布,Cloudflare + Google + Microsoft 联合背书,可信度极高
- 保留理由: 企业 Agent 基础设施建设的里程碑节点,对工具调用架构有直接影响,需要跟进
- 标签:
#MCP#Agent基础设施#无状态协议#Cloudflare#企业AI - 建议: 精读规范原文,补充 MCP Server 建设实践笔记
4. RAG 静默失败模式与评价工具链(2026)
- 来源: Medium (pramodchandrayan) + FutureAGI Substack + QASkills.sh RAGAS 指南
- 原文:
https://medium.com/predict/your-rag-system-is-lying-to-youhttps://futureagi.substack.com/p/top-5-tools-to-evaluate-rag-performancehttps://qaskills.sh/blog/ragas-rag-evaluation-metrics-complete-guide- 核心洞察:
- 静默失败是 RAG 最贵失败模式:系统日志正常、chunk 返回、LLM 正常响应,但答案引用于错误文档。2026 年数据显示 73% RAG 失败在检索阶段而非生成阶段
- RAGAS 评分体系(faithfulness, answer relevance, context precision)已有明确阈值参考:
- Faithfulness 0.9–1.0: Excellent;0.75–0.9: Acceptable;<0.5: Hallucinatory
- FutureAGI 是唯一将"部署前测试"和"生产监控"用同一套 eval 配置打通的全生命周期平台;DeepEval 专注 CI 集成;Phoenix 专注可视化调试
- 评价成本需注意:LLM-as-judge 每条需多次 LLM 调用,规模上来 cost 不容忽视
- 保留理由: 提供了 RAG 真实失败统计 + 可操作评价指标体系,是生产 RAG 建设必读
- 标签:
#RAG#评价体系#RAGAS#静默失败#可观测性 - 建议: 写入 RAG 工程实践主题页,精读 RAGAS 原文
5. AI Agent 技术栈 2026 版(Eval Gap 分析)
- 来源: The AI Engineer Substack (theaiengineer.substack.com)
- 原文:
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 时间: 2026-03-11
- 核心洞察:
- Eval Gap:LangChain 调查显示 89% 的生产 Agent 团队有可观测性建设,但仅 52% 有正式评价体系,差距 37 个百分点——"能看到日志但不知道效果是否正常"
- 三层评价架构收敛:PR 级快速检查(工具调用正确性)→ 夜间回归套件(LLM judge)→ 生产持续监控(性能漂移告警)
- 新型 Benchmark 涌现:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
- Agent Guardrails 独立成 discipline:不再是输入输出过滤,而是工具调用授权、速率限制、动作验证
- 保留理由: 首次给出量化 eval gap,视角务实,对生产 Agent 工程有直接指导价值
- 标签:
#Agent工程#评价体系#EvalGap#可观测性#三层架构 - 建议: 适合与 RAG 评价工具链笔记合并为"LLM 系统质量保障"综合主题
6. ArXiv: LLM Serving 需要数学优化而非启发式(2026)
- 来源: arXiv
2605.01280 - 原文:
https://arxiv.org/html/2605.01280v1 - 核心论点:
- vLLM、SGLang 等主流推理系统的算法核心仍是经典分布式计算的通用策略:JSQ 路由、FIFO 调度、LRU KV 缓存驱逐
- LLM 推理有独特结构(prefill/decode 分离、KV 缓存模式、可推测解码),通用策略无法充分利用这些结构
- 形式化方法可提供最坏情况鲁棒性、容量规划fundamental limits 等通用启发式无法提供的理论保证
- 可信度判断: ArXiv 学术论文,有形式化论证,需要进一步核验实验数据
- 保留理由: 对推理系统优化方向有学术前瞻价值,可作为技术决策论证参考
- 标签:
#LLM推理理论#形式化优化#ArXiv - 建议: 审稿级别阅读,关注是否有真实系统实验数据支撑
7. GPU MLOps OOM 场景详解 + Flyte 代码示例
- 来源: Union.ai 博客
- 原文:
https://www.union.ai/blog-post/gpus-in-mlops-optimization-pitfalls-and-management - 核心内容:
- OOM 场景分析:User A (9GB) + User B (5GB) 并行执行 → 14GB > 12GB → OOM;顺序执行则无问题
- Flyte 代码示例(GPU 资源声明):
python from flytekit import task, workflow from flytekit.types.file import FlyteFile @task( requests=Resources(cpu="2", mem="500Mi", gpu="1"), limits=Resources(cpu="2", mem="500Mi", gpu="1") ) def gpu_powered_task(input_data: FlyteFile) -> str: pass - 提出了 GPU 共享调度的多种方案(时间片、空间片、优先级权重)
- 保留理由: 有具体 OOM 数值场景和可运行代码,适合作为 GPU 调度排障参考
- 标签:
#MLOps#GPU调度#OOM#Flyte#生产实践 - 建议: 写入 MLOps 基础设施主题页
🟡 中等价值条目(参考,降级处理)
8. Agent 框架 2026 全景图(Langfuse)
- 来源: Langfuse Blog
- 原文:
https://langfuse.com/blog/2025-03-19-ai-agent-comparison - 评估: 框架横向对比覆盖全面(LangGraph, OpenAI Agent SDK, Claude Agent SDK, Google ADK, Pydantic AI, CrewAI 等),但属于框架选型参考,非具体工程数据,暂降级处理
- 标签:
#Agent框架#选型参考
9. MLOps 生产基础设施讨论(Reddit r/mlops)
- 来源: Reddit
- 亮点: MLOps Community 作者提到
machinelearningatscale.substack.com关注真实架构选择和 scaling 瓶颈;Argo CD + Kubernetes 部署模式;Flyte/Prefect 替代 Airflow 趋势 - 评估: 社区讨论线索,非结构化工程数据,降级为背景参考
- 标签:
#MLOps社区#架构选型
10. DeepLearning.AI vLLM 免费课程
- 来源: Red Hat Developer
- 原文:
https://developers.redhat.com/blog/2026/06/03/learn-optimize-deploy-and-benchmark-llms-vllm-new-free-course - 评估: Andrew Ng 出品,涵盖 LLM Compressor 量化、GuideLLM benchmark、KV cache sizing,动手向;但主要适合入门,系统性工程价值有限
- 标签:
#vLLM教程#入门
🟢 本次丢弃条目(说明原因)
| 条目 | 丢弃原因 |
|---|---|
| AI Engineer 2026 路线图(多个 Substack) | 路线图性质,无具体工程数据,重复度高 |
| 1000+ Job Description 分析(alexeyondata) | 市场/职业分析,非工程实践,参考价值有限 |
| Prompt Engineering 最佳实践(DevOpsNess/Reintech) | 通用最佳实践,缺具体 Benchmark 或命令 |
| QuantumRed/Medable Agent 案例(ZenML) | 垂直行业案例,缺通用工程价值 |
| Qwen3-235B / GLM 5.2 部署指南(Yotta Labs) | 产品发布类,有具体命令但偏厂商内容 |
📋 汇总与后续行动
本次高价值条目清单
- ✅ vLLM/SGLang/TGI 横向 Benchmark — 真实性能数据
- ✅ vLLM vs TensorRT-LLM 生产对比 — Stripe 成本案例
- ✅ MCP 2026-07-28 无状态规范 — 企业 Agent 基础设施里程碑
- ✅ RAG 静默失败 + 评价工具链 — 73% 失败在检索端
- ✅ AI Agent Stack 2026 Eval Gap — 37pt gap 量化
- ✅ ArXiv LLM Serving 形式化优化论文
- ✅ GPU MLOps OOM + Flyte 示例
建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-08-20T1950-jay-inference-engineering-rag-eval-mcp-stack-aug20.md✅(本文) - 参考 RAG 主题页更新:
/shared/research-kb/review/下待合并(由同步任务处理) - MCP 规范值得精读,补充 MCP Server 建设实践笔记
精读/审稿优先级
| 优先级 | 条目 |
|---|---|
| 精读 | vLLM vs TensorRT-LLM Benchmark 全文;MCP 2026-07-28 规范原文 |
| 审稿 | ArXiv LLM Serving 形式化优化论文(有无真实系统实验数据) |
| 略读 | RAGAS 完整评分说明;Agent Framework 对比原文 |
Jay · 2026-08-20 19:50 · 第三次筛选