Jay 工程实践筛选 · 2026-09-06 10:50
筛选原则
重点保留:真实环境、命令、错误、源码、性能数据、可复现步骤。 次要保留:高价值综述、趋势判断、选型框架。 丢弃:新闻类、过度概括、缺论证的总结。
候选条目
1. [vLLM vs SGLang vs LMDeploy 基准对比] 🔬 高价值
来源: AIMultiple / PremAI / RunPod · 2026年4月 URL: https://aimultiple.com/inference-engines | https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
核心数据:
- 测试环境: H100 80GB HBM3 · RunPod cloud · Docker (runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404)
- 128K tokens / 128 out: SGLang ~16,200 tok/s · vLLM ~12,500 tok/s (29% 差距)
- 1,000/1,000: SGLang ~4,181 tok/s · vLLM ~3,709 tok/s
- 2,048/2,048: SGLang ~2,786 tok/s
- LMDeploy 达到 SGLang 峰值吞吐的 99.5%,安装仅 pip install lmdeploy
保留理由: 真实 H100 基准数据、测试环境可复现、具体 tok/s 数字、决策框架 适用场景: 生产推理引擎选型、容量规划
2. [vLLM vs SGLang: RadixAttention vs PagedAttention 深度对比] 🔬 高价值
来源: Spheron · 2026年6月 URL: https://www.spheron.network/blog/vllm-vs-sglang-2026
核心洞察: - 前缀复用率 > 60% 时 SGLang 显著领先,否则两者差距 < 5% - SGLang grammar cache 行为: 对重复 schema 的 per-request overhead 下降更快 - vLLM 默认切换至 xgrammar 作为 guided decoding (2026) - 生产建议: 80% 团队选 vLLM;高并发 MoE + 结构化生成选 SGLang
保留理由: 量化了前缀复用率与性能的关系,可指导实际 workload 分析 工程行动: benchmark 自己的 prefix overlap ratio 再决定引擎
3. [Inference Engineering 2026: vLLM vs SGLang vs TensorRT-LLM] 🔬 高价值
来源: inferenceengineering.tech · 2026年 URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
核心判断: - 三者均已 production-grade;TRT-LLM 在 Baseten/scale 部署最广 - vLLM 适合 80% 团队;SGLang 适合高并发 MoE + 结构化生成 - TensorRT-LLM 适合稳定大流量 NVIDIA 部署且有工程带宽维护编译引擎 - 核心忠告: 不要过早优化——先对真实 workload benchmark,有 profiling 证据才迁移
保留理由: 反直觉的工程判断(不要盲目追新引擎),带决策框架 适用角色: 架构师、infra lead
4. [Agentic RAG 2026 生产指南] 🔬 高价值
来源: MarsDevs · 2026年 URL: https://www.marsdevs.com/guides/agentic-rag-2026-guide
核心数据: - Agentic RAG 成本: 3-10x more tokens + 2-5x latency - 适用于: multi-hop questions、ambiguous queries、高风险领域 (legal/medical/financial) - 不适用于: FAQ bots、single-fact lookups - 2026 默认栈: LangGraph 编排 + LlamaIndex Workflows 检索 + Ragas + Phoenix + Langfuse - 生产交付周期: 简单 bolt-on 4-6 周 ($8K-$20K);复杂 agentic 8-16 周
保留理由: 成本量化、适用范围明确、技术栈具体 工程行动: 先评估 query 类型再决定是否上 agentic
5. [Agentic RAG 评估 7 指标] 📊 高价值
来源: SyncSoft AI · 2026年 URL: https://www.syncsoft.ai/en/blog/agentic-rag-evaluation-metrics-2026
核心观点: - Agentic RAG 市场 2026 年 $3.33B,预计 2030 年 $9.86B (38.4% CAGR) - 2025 年约 90% 企业 agentic RAG 项目失败——原因很少出现在离线 benchmark - 评估是持续测量层,在用户发现前暴露 retrieval/generation/tool-call drift
保留理由: 市场背景 + 失败率数据 + 评估必要性论证 可作为: 团队选型 PPT 数据支撑
6. [CoSAI MCP Security 白皮书] 🔐 高价值
来源: Coalition for Secure AI · 2026年1月 URL: https://www.coalitionforsecureai.org/securing-the-ai-agent-revolution-a-practical-guide-to-mcp-security
核心要点: - MCP 已从实验进入生产,CoSAI 发布 comprehensive whitepaper - EU AI Act 2026年8月2日起对高风险系统生效,MCP 工具调用受管辖 - 需满足: data governance、logging、human oversight、cybersecurity resilience
保留理由: 权威机构安全框架 + 合规截止日期 工程行动: 检查 MCP server 是否满足 EU AI Act 要求
7. [MCP 安全: 30+ CVE 在 2026 前两个月出现] ⚠️ 警示
来源: CSA Lab Space (Cloud Security Alliance) · 2026年 URL: https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1
核心风险: - MCP 生态已达 inflection point,但同时有大量无认证 internet-exposed servers - 2026 前两个月已有 30+ CVEs——这是协议快速扩张 + 安全治理滞后的可预测后果 - 具体攻击向量: plaintext HTTP endpoints 暴露 OAuth tokens;tunnel subdomain hijacking - 映射至 OWASP Top 10 for Agentic Applications (2026)、CSA AICM、MITRE ATLAS
保留理由: 权威 CSA 安全评估、具体 CVE 数量、攻击向量说明 工程行动: 审计所有 MCP servers——立即关闭 plaintext HTTP,review ngrok tunnels
8. [Enterprise MCP Guide 2026] 🏢 高价值
来源: TheAgentics · 2026年 URL: https://theagentics.co/insights/the-enterprise-mcp-guide-2026
核心案例: - 某银行生产环境: 450+ AI agent use cases,包括 investment-banking presentations (30秒生成,之前 junior analysts 数小时) - 报告 20% gross sales lift from AI-assisted advisor outreach
保留理由: 大规模生产案例数据,可用于向业务方展示 ROI
9. [arXiv: KV Cache Management Survey (2607.02574)] 📚 高价值
来源: arXiv · 2026年5月 URL: https://arxiv.org/html/2607.02574v1
覆盖范围: - 候选论文来源: arXiv、USENIX、MLSys、ASPLOS/ISCA/MICRO/HPCA、SOSP、SIGCOMM、SIGMETRICS - 关键词: 分布式 KV serving、prefill/decode disaggregation、KV offload/tiering、CXL memory、prefix reuse、quantization、continuous batching - 收录系统: vLLM、DistServe、Mooncake、ShadowKV、CXL-SpecKV 等
保留理由: 全面的 KV cache 管理文献survey,适合建立知识索引 精读建议: 按需查阅具体系统实现
10. [arXiv: Harvest - P2P GPU Caching for LLM Inference (2602.00328)] 🔬 中高价值
来源: arXiv · 2026年2月 URL: https://arxiv.org/html/2602.00328v1
核心思想: Opportunistic peer-to-peer GPU caching - 当 GPU memory pressure 过高时,智能压缩 KV state - 极端情况下 recompute KV cache 比从 slow path fetch 更高效 - 测量了 DeepSeekV3、Mistral-Large-3-675B、Kimi-K2-Instruct 的 KV cache transfer 时间
保留理由: P2P caching 思路新颖,有具体模型测试数据 状态: 可作为架构探索参考
11. [arXiv: An Internet for the KV Cache (2608.01526)] 📚 中高价值
来源: arXiv · 2026年8月 URL: https://arxiv.org/html/2608.01526v1
核心观点: - NVIDIA Rubin GPU: 50 PFLOPS NVFP4 inference compute (3.3x Blackwell Ultra) - prefix caching 因 multi-turn chat 和 coding agents 的自然前缀共享已成常见策略 - 行业系统通过增加 KV cache hit-rate 受益匪浅
保留理由: 硬件路线图数据 + KV cache 趋势判断 注意: Rubin 数据需交叉验证(NVIDIA 官方来源)
12. [LangChain State of Agent Engineering 2026] 📊 高价值
来源: LangChain · 2026年 URL: https://www.langchain.com/state-of-agent-engineering
调查数据 (1,300+ professionals): - 57% 受访者已有 agents in production,大企业采用率领先 - Quality is the production killer: 32% 视其为 top barrier(高于 cost) - 89% 已实现 agent observability(高于 evals adoption 的 52%) - 44.8% 在运行 online evals(面对真实用户后需要观察生产数据)
保留理由: 大规模调查数据,揭示质量 > 成本的认知转变 可用于: 产品规划 PPT、团队优先级讨论
13. [GitHub: FlashInfer (6.3k stars)] 🔧 持续关注
来源: GitHub · updated Sep 1, 2026 URL: https://github.com/flashinfer-ai/flashinfer
定位: Kernel Library for LLM Serving 语言: Python + CUDA 活跃度: 持续更新
保留理由: vLLM 集成 FlashInfer 作为 attention kernel,高 star 量说明生产使用广泛
14. [GitHub: tiny-vllm (1.1k stars)] 📚 教育价值
来源: GitHub · updated Aug 23, 2026 URL: https://github.com/jmaczan/tiny-vllm
定位: 从零构建的简化版 vLLM (C++ + CUDA) 用途: 学习 PagedAttention 原理
保留理由: 教育目的,帮助理解生产引擎内部机制
丢弃条目
| 条目 | 丢弃原因 |
|---|---|
| Atomic.chat SGLang vs vLLM 对比 | 数据与 Spheron/AIMultiple 重复,无新基准数字 |
| r/LearnAI Substack 路线图文章 | 通用学习路径,无工程深度 |
| JavaScript/TypeScript AI 代理综述 | 非生产主流语言栈 |
| Reddit "生产级 AI 平台对比" | 社区讨论,缺具体数据支撑 |
分类标签
inference-engineering vllm sglang kv-cache benchmark
agentic-rag evaluation mcp security arxiv production
建议写入路径
/shared/research-kb/inbox/jay/2026-09-06-1050-jay-engineering-filter.md
精读/审稿建议
- 精读: KV Cache Survey (arXiv 2607.02574) — 建立索引用
- 精读: Spheron vLLM vs SGLang — 选型决策
- 审稿: CoSAI MCP Security 白皮书 — 内部安全审计参考
- 更新: Agentic RAG 模式页 — 补充 2026 默认栈变化
后续行动
- [ ] 验证 NVIDIA Rubin 50 PFLOPS 数据来源
- [ ] 审计团队 MCP servers 安全态势
- [ ] 建立 prefix overlap ratio benchmark 方法论
- [ ] 对齐 EU AI Act 合规截止日期 (2026-08-02)