Jay 工程实践筛选 · 2026-09-06 10:50

筛选原则

重点保留:真实环境、命令、错误、源码、性能数据、可复现步骤。 次要保留:高价值综述、趋势判断、选型框架。 丢弃:新闻类、过度概括、缺论证的总结。


候选条目

1. [vLLM vs SGLang vs LMDeploy 基准对比] 🔬 高价值

来源: AIMultiple / PremAI / RunPod · 2026年4月 URL: https://aimultiple.com/inference-engines | https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026

核心数据: - 测试环境: H100 80GB HBM3 · RunPod cloud · Docker (runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404) - 128K tokens / 128 out: SGLang ~16,200 tok/s · vLLM ~12,500 tok/s (29% 差距) - 1,000/1,000: SGLang ~4,181 tok/s · vLLM ~3,709 tok/s - 2,048/2,048: SGLang ~2,786 tok/s - LMDeploy 达到 SGLang 峰值吞吐的 99.5%,安装仅 pip install lmdeploy

保留理由: 真实 H100 基准数据、测试环境可复现、具体 tok/s 数字、决策框架 适用场景: 生产推理引擎选型、容量规划


2. [vLLM vs SGLang: RadixAttention vs PagedAttention 深度对比] 🔬 高价值

来源: Spheron · 2026年6月 URL: https://www.spheron.network/blog/vllm-vs-sglang-2026

核心洞察: - 前缀复用率 > 60% 时 SGLang 显著领先,否则两者差距 < 5% - SGLang grammar cache 行为: 对重复 schema 的 per-request overhead 下降更快 - vLLM 默认切换至 xgrammar 作为 guided decoding (2026) - 生产建议: 80% 团队选 vLLM;高并发 MoE + 结构化生成选 SGLang

保留理由: 量化了前缀复用率与性能的关系,可指导实际 workload 分析 工程行动: benchmark 自己的 prefix overlap ratio 再决定引擎


3. [Inference Engineering 2026: vLLM vs SGLang vs TensorRT-LLM] 🔬 高价值

来源: inferenceengineering.tech · 2026年 URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm

核心判断: - 三者均已 production-grade;TRT-LLM 在 Baseten/scale 部署最广 - vLLM 适合 80% 团队;SGLang 适合高并发 MoE + 结构化生成 - TensorRT-LLM 适合稳定大流量 NVIDIA 部署且有工程带宽维护编译引擎 - 核心忠告: 不要过早优化——先对真实 workload benchmark,有 profiling 证据才迁移

保留理由: 反直觉的工程判断(不要盲目追新引擎),带决策框架 适用角色: 架构师、infra lead


4. [Agentic RAG 2026 生产指南] 🔬 高价值

来源: MarsDevs · 2026年 URL: https://www.marsdevs.com/guides/agentic-rag-2026-guide

核心数据: - Agentic RAG 成本: 3-10x more tokens + 2-5x latency - 适用于: multi-hop questions、ambiguous queries、高风险领域 (legal/medical/financial) - 不适用于: FAQ bots、single-fact lookups - 2026 默认栈: LangGraph 编排 + LlamaIndex Workflows 检索 + Ragas + Phoenix + Langfuse - 生产交付周期: 简单 bolt-on 4-6 周 ($8K-$20K);复杂 agentic 8-16 周

保留理由: 成本量化、适用范围明确、技术栈具体 工程行动: 先评估 query 类型再决定是否上 agentic


5. [Agentic RAG 评估 7 指标] 📊 高价值

来源: SyncSoft AI · 2026年 URL: https://www.syncsoft.ai/en/blog/agentic-rag-evaluation-metrics-2026

核心观点: - Agentic RAG 市场 2026 年 $3.33B,预计 2030 年 $9.86B (38.4% CAGR) - 2025 年约 90% 企业 agentic RAG 项目失败——原因很少出现在离线 benchmark - 评估是持续测量层,在用户发现前暴露 retrieval/generation/tool-call drift

保留理由: 市场背景 + 失败率数据 + 评估必要性论证 可作为: 团队选型 PPT 数据支撑


6. [CoSAI MCP Security 白皮书] 🔐 高价值

来源: Coalition for Secure AI · 2026年1月 URL: https://www.coalitionforsecureai.org/securing-the-ai-agent-revolution-a-practical-guide-to-mcp-security

核心要点: - MCP 已从实验进入生产,CoSAI 发布 comprehensive whitepaper - EU AI Act 2026年8月2日起对高风险系统生效,MCP 工具调用受管辖 - 需满足: data governance、logging、human oversight、cybersecurity resilience

保留理由: 权威机构安全框架 + 合规截止日期 工程行动: 检查 MCP server 是否满足 EU AI Act 要求


7. [MCP 安全: 30+ CVE 在 2026 前两个月出现] ⚠️ 警示

来源: CSA Lab Space (Cloud Security Alliance) · 2026年 URL: https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1

核心风险: - MCP 生态已达 inflection point,但同时有大量无认证 internet-exposed servers - 2026 前两个月已有 30+ CVEs——这是协议快速扩张 + 安全治理滞后的可预测后果 - 具体攻击向量: plaintext HTTP endpoints 暴露 OAuth tokens;tunnel subdomain hijacking - 映射至 OWASP Top 10 for Agentic Applications (2026)、CSA AICM、MITRE ATLAS

保留理由: 权威 CSA 安全评估、具体 CVE 数量、攻击向量说明 工程行动: 审计所有 MCP servers——立即关闭 plaintext HTTP,review ngrok tunnels


8. [Enterprise MCP Guide 2026] 🏢 高价值

来源: TheAgentics · 2026年 URL: https://theagentics.co/insights/the-enterprise-mcp-guide-2026

核心案例: - 某银行生产环境: 450+ AI agent use cases,包括 investment-banking presentations (30秒生成,之前 junior analysts 数小时) - 报告 20% gross sales lift from AI-assisted advisor outreach

保留理由: 大规模生产案例数据,可用于向业务方展示 ROI


9. [arXiv: KV Cache Management Survey (2607.02574)] 📚 高价值

来源: arXiv · 2026年5月 URL: https://arxiv.org/html/2607.02574v1

覆盖范围: - 候选论文来源: arXiv、USENIX、MLSys、ASPLOS/ISCA/MICRO/HPCA、SOSP、SIGCOMM、SIGMETRICS - 关键词: 分布式 KV serving、prefill/decode disaggregation、KV offload/tiering、CXL memory、prefix reuse、quantization、continuous batching - 收录系统: vLLM、DistServe、Mooncake、ShadowKV、CXL-SpecKV 等

保留理由: 全面的 KV cache 管理文献survey,适合建立知识索引 精读建议: 按需查阅具体系统实现


10. [arXiv: Harvest - P2P GPU Caching for LLM Inference (2602.00328)] 🔬 中高价值

来源: arXiv · 2026年2月 URL: https://arxiv.org/html/2602.00328v1

核心思想: Opportunistic peer-to-peer GPU caching - 当 GPU memory pressure 过高时,智能压缩 KV state - 极端情况下 recompute KV cache 比从 slow path fetch 更高效 - 测量了 DeepSeekV3、Mistral-Large-3-675B、Kimi-K2-Instruct 的 KV cache transfer 时间

保留理由: P2P caching 思路新颖,有具体模型测试数据 状态: 可作为架构探索参考


11. [arXiv: An Internet for the KV Cache (2608.01526)] 📚 中高价值

来源: arXiv · 2026年8月 URL: https://arxiv.org/html/2608.01526v1

核心观点: - NVIDIA Rubin GPU: 50 PFLOPS NVFP4 inference compute (3.3x Blackwell Ultra) - prefix caching 因 multi-turn chat 和 coding agents 的自然前缀共享已成常见策略 - 行业系统通过增加 KV cache hit-rate 受益匪浅

保留理由: 硬件路线图数据 + KV cache 趋势判断 注意: Rubin 数据需交叉验证(NVIDIA 官方来源)


12. [LangChain State of Agent Engineering 2026] 📊 高价值

来源: LangChain · 2026年 URL: https://www.langchain.com/state-of-agent-engineering

调查数据 (1,300+ professionals): - 57% 受访者已有 agents in production,大企业采用率领先 - Quality is the production killer: 32% 视其为 top barrier(高于 cost) - 89% 已实现 agent observability(高于 evals adoption 的 52%) - 44.8% 在运行 online evals(面对真实用户后需要观察生产数据)

保留理由: 大规模调查数据,揭示质量 > 成本的认知转变 可用于: 产品规划 PPT、团队优先级讨论


13. [GitHub: FlashInfer (6.3k stars)] 🔧 持续关注

来源: GitHub · updated Sep 1, 2026 URL: https://github.com/flashinfer-ai/flashinfer

定位: Kernel Library for LLM Serving 语言: Python + CUDA 活跃度: 持续更新

保留理由: vLLM 集成 FlashInfer 作为 attention kernel,高 star 量说明生产使用广泛


14. [GitHub: tiny-vllm (1.1k stars)] 📚 教育价值

来源: GitHub · updated Aug 23, 2026 URL: https://github.com/jmaczan/tiny-vllm

定位: 从零构建的简化版 vLLM (C++ + CUDA) 用途: 学习 PagedAttention 原理

保留理由: 教育目的,帮助理解生产引擎内部机制


丢弃条目

条目 丢弃原因
Atomic.chat SGLang vs vLLM 对比 数据与 Spheron/AIMultiple 重复,无新基准数字
r/LearnAI Substack 路线图文章 通用学习路径,无工程深度
JavaScript/TypeScript AI 代理综述 非生产主流语言栈
Reddit "生产级 AI 平台对比" 社区讨论,缺具体数据支撑

分类标签

inference-engineering vllm sglang kv-cache benchmark agentic-rag evaluation mcp security arxiv production


建议写入路径

/shared/research-kb/inbox/jay/2026-09-06-1050-jay-engineering-filter.md

精读/审稿建议

  1. 精读: KV Cache Survey (arXiv 2607.02574) — 建立索引用
  2. 精读: Spheron vLLM vs SGLang — 选型决策
  3. 审稿: CoSAI MCP Security 白皮书 — 内部安全审计参考
  4. 更新: Agentic RAG 模式页 — 补充 2026 默认栈变化

后续行动

  • [ ] 验证 NVIDIA Rubin 50 PFLOPS 数据来源
  • [ ] 审计团队 MCP servers 安全态势
  • [ ] 建立 prefix overlap ratio benchmark 方法论
  • [ ] 对齐 EU AI Act 合规截止日期 (2026-08-02)