Jay 工程实践筛选 · 2026-09-16 第2次

任务概述

  • 筛选周期:每天 3 次(08:00 / 14:00 / 20:00 SGT)
  • 本次执行:2026-09-16 14:50 SGT
  • 检索范围:Substack 工程专栏 · GitHub issues/discussions · arXiv · vLLM/SGLang 官方博客
  • 筛选标准:真实环境、命令、错误日志、源码分析、性能数据、可复现步骤

🔍 本次检索主题

检索词 来源 命中
LLM engineering RAG production 2026 site:substack.com Tavily 10
AI agent architecture MLOps engineering 2026 site:substack.com Tavily 10
vLLM SGLang inference engine production 2026 site:github.com Tavily 8
RAG evaluation benchmark production 2026 arxiv Tavily 8
MCP model context protocol implementation engineering 2026 Tavily 8
multimodal LLM systems performance benchmark 2026 Tavily 8

✅ 高价值条目(保留)


1. SGLang · 2026 路线图(GitHub Issue #12780)

来源SGLang Development Roadmap (2026 Q1)

保留理由(工程价值): - 明确列出 2026 Q1 四大重点:功能可靠性(P/D disaggregation 全特性兼容)、易用性(k8s/OME 一键部署)、内核优化(GB300/GB200/MI350)、RL 训练推理对齐 - RL 框架集成具体到 slime, verl, GRPO 等框架名称,有源码对接价值 - SGLang Gateway 作为 DP scheduler 用于 RL rollout 的架构设计有参考意义 - Omni 模型支持、NVFP8 原生训练支持路线清晰

关键工程数据

GB300/B300 内核优化 → 2026 Q1
MI350/MI355 支持   → 2026 Q1
VLM RL with FSDP   → 进行中

可信度:⭐⭐⭐⭐ 高(GitHub 官方 issue,Issue #12780,hnyls2002 维护者发布) 后续行动:对照 SGLang 博客(2026-07 支持 GLM-5.2 NVFP4 达成 500 TPS)验证路线图落地情况


2. vLLM Router · 2026 路线图(GitHub Issue #244)

来源vLLM Router 2026 Roadmap

保留理由(工程价值): - 提出 CPU 侧推理 fast path 问题:GPU 变快后,tokenization/JSON 编解码/CPU 侧处理成为新瓶颈,这是 2026 年大模型推理部署的核心痛点 - 解决方案:Rust tokenizer + L0 exact-match 缓存 + L1 prefix-aware 缓存 + gRPC tokens-in/tokens-out - KV-aware exact routing 列为 P0 旗舰特性,预计 2026 年交付

关键性能指标参考

当前瓶颈:Python/GIL + 序列化开销
目标:Tokenization 缓存命中率提升
gRPC 路径:tokens-in/tokens-out(绕过 JSON overhead)

可信度:⭐⭐⭐⭐ 高(vLLM 官方仓库 router 项目,路标透明) 后续行动:关注 vLLM Router 首次集成 benchmark 结果


3. RAGPerf · 端到端 RAG Benchmark(arXiv:2603.10765v1)

来源RAGPerf: An End-to-End Benchmarking Framework for Retrieval-Augmented Generation

保留理由(工程价值): - 完整测试环境规格,可直接复现: Hardware: 2× AMD EPYC 9334 (32-core), 1.4TB DDR5, 2× NVIDIA H100 NVL (94GB) OS: Ubuntu 22.04, Linux 5.15.0, PyTorch 2.8.0+cu128 Storage: Samsung 990 Pro SSD × 2TB - 标准 benchmark workload:Wikipedia 6.41M docs (19.3GB)、Arxiv PDF 30K、GitHub Code 11M、People's Speech 音频 0.3M - 测试多种 RAG 配置(embedding 模型 size、检索逻辑、向量数据库) - 论文级别引用,有可追溯的学术来源

可信度:⭐⭐⭐⭐⭐ 极高(arXiv 学术论文,完整复现规格) 后续行动:建议收录为 RAG 系统评估参考标准;对照 DomainRAG、CRUD-RAG 做横向比较


4. GaRAGe · 带 Ground Truth 标注的 RAG Benchmark(arXiv:2506.07671, ACL 2025 Findings)

来源GaRAGe: A Benchmark with Grounding Annotations for RAG Evaluation

保留理由(工程价值): - ACL 2025 Findings 级别,经过同行评审 - 聚焦 grounding annotation(接地标注),解决 RAG 评估中"模型是否真正依据检索内容回答"的问题 - 提供了标准评估框架,可用于判断 RAG pipeline 中 retrieval 和 generation 的忠实度

可信度:⭐⭐⭐⭐⭐(ACL peer-reviewed) 后续行动:与 RAGPerf 合并归档;关注其对 RAG 幻觉率衡量的方法论


5. SGLang + vLLM 实测对比(L20 GPU, Qwen3-8B/32B AWQ)

来源GitHub Discussion #17221

保留理由(工程价值): - 真实硬件实测数据: Qwen3-8B AWQ on L20: vLLM vs SGLang 对比 Qwen3-32B AWQ on L20: TTFT ~6s(vLLM),不适合 L20 跑 32B - 关键工程结论:L20 不适合 32B 模型推理,8B 可行;32B 需要更大显存规格 - 作者公开承认测试方法存在不足(Feb 26 承认未在 L20 上发布 32B 结果),工程诚信度高

可信度:⭐⭐⭐ 中(社区实测,有具体型号和错误数据,但非受控实验) 后续行动:可作为 GPU 选型参考;建议对照 SGLang 官方 25x 性能提升博客验证规模部署数据


6. RBG · Kubernetes LLM 推理编排(GitHub, v0.7.0, 2026-06-11)

来源RoleBasedGroup/rbg

保留理由(工程价值): - v0.7.0 (2026-06-11) 稳定版,含完整 YAML 示例: pd-disagg-standalone.yaml → 单卡 standalone P/D 分离 pd-disagg-leader-worker.yaml → 多卡 TP for decode role agg-standalone.yaml → 单卡聚合推理 - 集成 Mooncake(高性能分布式 KV cache 存储)用于 P/D disaggregation - 支持 rbg-planner:ARIMA 负载预测 + TTFT/ITL SLA 目标驱动自动扩缩容 - 支持 SGLang + vLLM 统一 Prometheus metrics

可信度:⭐⭐⭐⭐ 高(GitHub 活跃项目,2026-06-11 更新,发布说明详细) 后续行动:生产 K8s 部署场景建议深入评估;关联 SGLang PD-disagg 路线图


7. SGLang 官方博客 · 2026 工程里程碑

来源SGLang GitHub README News

保留理由(工程价值): | 日期 | 里程碑 | 工程意义 | |------|--------|----------| | 2026-02 | SGLang on GB300 NVL72: 25x 推理性能 | 超大规模集群推理验证 | | 2026-04 | DeepSeek-V4 Day 0 支持 + RL 验证 | 推理引擎→训练框架闭环 | | 2026-06 | DFlash + Spec V2(下一代投机解码) | 延迟降低关键技术 | | 2026-07 | Kimi K3 day-0 支持 | 国内头部模型快速跟进 | | 2026-07 | GLM-5.2 NVFP4 达 500 TPS | 量化精度+推理速度权衡典范 |

可信度:⭐⭐⭐⭐ 高(官方 README,关联 LMSYS 非营利组织) 后续行动:建议建立"推理引擎选型"主题页;500 TPS 数据可作为 GLM-5.2 生产部署参考基线


8. MCP 2026 生态数据(InfoQ + Synvestable + Boldare)

来源: - InfoQ MCP 专题 - Synvestable MCP 企业部署指南 - Boldare MCP 公司排名

保留理由(工程价值): - 规模数据:2026-04 月 SDK 下载量 1.1 亿次(16 个月达成,vs React 3 年);活跃 MCP 服务器 10,000+;Gartner 预测 2026 年底 75% API gateway 厂商支持 MCP - 企业案例: - Block:MCP + Goose agent → token 减少 98.7%(量化价值) - Raiffeisen Bank:风控 AI → 提升 40% - 2026-07-28 规范:MCP 转向无状态架构,解决会话管理扩展性问题;Google Cloud、Netlify、Runlayer 等跟进 - 已知风险:RCE 设计弱点被披露(Boldare 文中有说明);Perplexity CTO 因 context window 开销转向自研

可信度:⭐⭐⭐⭐ 高(跨多个来源交叉验证,有具体百分比数字) 后续行动:建议收录 MCP 企业落地评估框架;关注 RCE 风险缓解方案


9. AI Agents Stack 2026(theaiengineer.substack.com)

来源The AI Agents Stack (2026 Edition)

保留理由(工程价值): - 37 分评估差距洞察:89% 团队建了可观测性,但仅 52% 建了 formal evaluation → "能看到日志但不知道效果是否真的好" - MCP 标准化对 tools 层的改变(整个 tools 层因 MCP 被重塑) - 推理模型(reasoning models)如何改变 agent 自主性边界

丢弃理由(本次筛选): - 缺乏具体部署命令或代码 - 偏架构框架,缺少可复现步骤

综合判断:⭐⭐⭐ 有洞察力,但工程细节不足;建议作为行业趋势参考而非实操指南


10. Production RAG Frameworks 2026(karbouch.substack.com)

来源Production RAG Frameworks Compared: The 2026 Landscape

保留理由(工程价值): - 四层分类框架(2026 RAG 落地必读): Layer 1: Memory / knowledge-graph engines (Cognee, LightRAG, GraphRAG, Graphiti) Layer 2: RAG libraries / frameworks (LlamaIndex, Haystack, R2R, RAGFlow, PageIndex) Layer 3: Chat interfaces with RAG (OpenWebUI, LibreChat, AnythingLLM, Onyx, Verba) Layer 4: LLM application platforms (Dify, Flowise) - Dify: 134K+ GitHub stars,250+ LLM 支持,完整 LLMOps

丢弃理由: - 无具体性能数据或命令 - 分类框架有价值但无工程可操作性

综合判断:⭐⭐⭐ 可作为 RAG 平台选型框架;建议配合具体平台 benchmark 数据使用


❌ 丢弃条目

条目 丢弃理由
"How I'd Learn AI Engineering in 2026" (louisbouchard) Roadmap 类内容,无工程细节,无实测数据
"All you need to know about RAG (in 2026)" (aishwaryasrinivasan) 策略描述偏多,无真实命令或代码;BM25+Rerank 方案可从其他来源获得更详细版本
"Context Engineering as Recommendation Problem" (recsys.substack Vol.157) 学术论文摘要集锦,缺乏工程实操;建议直接查原始论文
"The Ultimate From Zero to Pro AI Engineer Roadmap for 2026" (javarevisited) 付费订阅墙 + roadmap 内容,无具体环境配置
"Building a simple RAG pipeline in 2026" (dataheimer) 过于入门级;Python+Ollama 本地 demo,缺少生产级错误处理和性能考量
"Welcome to the AI Systems Engineer Journey" (theneuralmaze) 高质量概念介绍(chassis 框架有洞见),但缺乏可复现步骤;适合作为概念验证参考而非工程实践指南
IBM/Databricks/AWS MLOps 博客文章 通用概念普及,无 2026 年新内容;Google MLOps 文档标注最后更新 2024-08
Wikipedia AI/MLOps 条目 基础概念,无工程价值

📊 分类标签汇总

#LLM-Inference-Engine      #SGLang #vLLM #Router #RBG
#RAG-Evaluation            #RAGPerf #GaRAGe #Benchmark
#Agent-Architecture        #AI-Agents-Stack #MCP
#MLOps                     #Kubernetes #Mooncake #SLA-autoscaling
#Benchmark                 #Multimodal #Kimi-K3 #GLM-5.2
#Enterprise-MCP            #MCP-Security #Token-Reduction

💡 建议写入路径

优先级 主题 建议路径
P0 SGLang 2026 工程里程碑 /shared/research-kb/inbox/jay/2026-09-16-sglang-2026-roadmap.md
P0 RAGPerf benchmark 完整规格 /shared/research-kb/inbox/jay/2026-09-16-ragperf-benchmark.md
P1 vLLM Router 2026 路线图 /shared/research-kb/inbox/jay/2026-09-16-vllm-router-2026-roadmap.md
P1 RBG Kubernetes LLM 推理编排 /shared/research-kb/inbox/jay/2026-09-16-rbg-kubernetes-llm.md
P1 MCP 2026 生态数据与企业落地 /shared/research-kb/inbox/jay/2026-09-16-mcp-enterprise-2026.md
P2 AI Agents Stack 2026 评估洞察 /shared/research-kb/inbox/jay/2026-09-16-ai-agents-stack-2026.md
P2 Production RAG Frameworks 四层分类 /shared/research-kb/inbox/jay/2026-09-16-rag-frameworks-2026.md

🎯 本次执行摘要

指标 数值
检索命中总量 ~52 条
进入二次评审 19 条
高价值保留 10 条
丢弃 9 条
新增 arXiv 论文 2 篇(RAGPerf, GaRAGe)
新增 GitHub 官方内容 4 项
新增 Substack 工程洞察 4 项
新增 MCP 生态数据 1 项(跨 3 来源)

📋 后续行动建议

  1. 立即行动:将 SGLang 2026 里程碑、RAGPerf、vLLM Router 路线图三条写入正式草稿
  2. 精读建议:RAGPerf 的完整测试床规格(EPYC 9334 + H100 NVL)可作为知识库 RAG 评估标准参考页
  3. 审稿:MCP 企业落地数据(Block 98.7% token 减少)建议由知识库编辑核实原始来源
  4. 主题页更新: - [ ] 新增「LLM 推理引擎选型 2026」主题页(纳入 SGLang/vLLM/RBG) - [ ] 更新「RAG 系统评估」主题页(纳入 RAGPerf/GaRAGe 双基准)

Jay · 工程筛选草稿 · 2026-09-16 · 第2次执行