Jay 工程实践筛选 · 2026-09-16 第2次
任务概述
- 筛选周期:每天 3 次(08:00 / 14:00 / 20:00 SGT)
- 本次执行:2026-09-16 14:50 SGT
- 检索范围:Substack 工程专栏 · GitHub issues/discussions · arXiv · vLLM/SGLang 官方博客
- 筛选标准:真实环境、命令、错误日志、源码分析、性能数据、可复现步骤
🔍 本次检索主题
| 检索词 | 来源 | 命中 |
|---|---|---|
LLM engineering RAG production 2026 site:substack.com |
Tavily | 10 |
AI agent architecture MLOps engineering 2026 site:substack.com |
Tavily | 10 |
vLLM SGLang inference engine production 2026 site:github.com |
Tavily | 8 |
RAG evaluation benchmark production 2026 arxiv |
Tavily | 8 |
MCP model context protocol implementation engineering 2026 |
Tavily | 8 |
multimodal LLM systems performance benchmark 2026 |
Tavily | 8 |
✅ 高价值条目(保留)
1. SGLang · 2026 路线图(GitHub Issue #12780)
来源:SGLang Development Roadmap (2026 Q1)
保留理由(工程价值):
- 明确列出 2026 Q1 四大重点:功能可靠性(P/D disaggregation 全特性兼容)、易用性(k8s/OME 一键部署)、内核优化(GB300/GB200/MI350)、RL 训练推理对齐
- RL 框架集成具体到 slime, verl, GRPO 等框架名称,有源码对接价值
- SGLang Gateway 作为 DP scheduler 用于 RL rollout 的架构设计有参考意义
- Omni 模型支持、NVFP8 原生训练支持路线清晰
关键工程数据:
GB300/B300 内核优化 → 2026 Q1
MI350/MI355 支持 → 2026 Q1
VLM RL with FSDP → 进行中
可信度:⭐⭐⭐⭐ 高(GitHub 官方 issue,Issue #12780,hnyls2002 维护者发布) 后续行动:对照 SGLang 博客(2026-07 支持 GLM-5.2 NVFP4 达成 500 TPS)验证路线图落地情况
2. vLLM Router · 2026 路线图(GitHub Issue #244)
保留理由(工程价值): - 提出 CPU 侧推理 fast path 问题:GPU 变快后,tokenization/JSON 编解码/CPU 侧处理成为新瓶颈,这是 2026 年大模型推理部署的核心痛点 - 解决方案:Rust tokenizer + L0 exact-match 缓存 + L1 prefix-aware 缓存 + gRPC tokens-in/tokens-out - KV-aware exact routing 列为 P0 旗舰特性,预计 2026 年交付
关键性能指标参考:
当前瓶颈:Python/GIL + 序列化开销
目标:Tokenization 缓存命中率提升
gRPC 路径:tokens-in/tokens-out(绕过 JSON overhead)
可信度:⭐⭐⭐⭐ 高(vLLM 官方仓库 router 项目,路标透明) 后续行动:关注 vLLM Router 首次集成 benchmark 结果
3. RAGPerf · 端到端 RAG Benchmark(arXiv:2603.10765v1)
来源:RAGPerf: An End-to-End Benchmarking Framework for Retrieval-Augmented Generation
保留理由(工程价值):
- 完整测试环境规格,可直接复现:
Hardware: 2× AMD EPYC 9334 (32-core), 1.4TB DDR5, 2× NVIDIA H100 NVL (94GB)
OS: Ubuntu 22.04, Linux 5.15.0, PyTorch 2.8.0+cu128
Storage: Samsung 990 Pro SSD × 2TB
- 标准 benchmark workload:Wikipedia 6.41M docs (19.3GB)、Arxiv PDF 30K、GitHub Code 11M、People's Speech 音频 0.3M
- 测试多种 RAG 配置(embedding 模型 size、检索逻辑、向量数据库)
- 论文级别引用,有可追溯的学术来源
可信度:⭐⭐⭐⭐⭐ 极高(arXiv 学术论文,完整复现规格) 后续行动:建议收录为 RAG 系统评估参考标准;对照 DomainRAG、CRUD-RAG 做横向比较
4. GaRAGe · 带 Ground Truth 标注的 RAG Benchmark(arXiv:2506.07671, ACL 2025 Findings)
来源:GaRAGe: A Benchmark with Grounding Annotations for RAG Evaluation
保留理由(工程价值): - ACL 2025 Findings 级别,经过同行评审 - 聚焦 grounding annotation(接地标注),解决 RAG 评估中"模型是否真正依据检索内容回答"的问题 - 提供了标准评估框架,可用于判断 RAG pipeline 中 retrieval 和 generation 的忠实度
可信度:⭐⭐⭐⭐⭐(ACL peer-reviewed) 后续行动:与 RAGPerf 合并归档;关注其对 RAG 幻觉率衡量的方法论
5. SGLang + vLLM 实测对比(L20 GPU, Qwen3-8B/32B AWQ)
保留理由(工程价值):
- 真实硬件实测数据:
Qwen3-8B AWQ on L20: vLLM vs SGLang 对比
Qwen3-32B AWQ on L20: TTFT ~6s(vLLM),不适合 L20 跑 32B
- 关键工程结论:L20 不适合 32B 模型推理,8B 可行;32B 需要更大显存规格
- 作者公开承认测试方法存在不足(Feb 26 承认未在 L20 上发布 32B 结果),工程诚信度高
可信度:⭐⭐⭐ 中(社区实测,有具体型号和错误数据,但非受控实验) 后续行动:可作为 GPU 选型参考;建议对照 SGLang 官方 25x 性能提升博客验证规模部署数据
6. RBG · Kubernetes LLM 推理编排(GitHub, v0.7.0, 2026-06-11)
保留理由(工程价值):
- v0.7.0 (2026-06-11) 稳定版,含完整 YAML 示例:
pd-disagg-standalone.yaml → 单卡 standalone P/D 分离
pd-disagg-leader-worker.yaml → 多卡 TP for decode role
agg-standalone.yaml → 单卡聚合推理
- 集成 Mooncake(高性能分布式 KV cache 存储)用于 P/D disaggregation
- 支持 rbg-planner:ARIMA 负载预测 + TTFT/ITL SLA 目标驱动自动扩缩容
- 支持 SGLang + vLLM 统一 Prometheus metrics
可信度:⭐⭐⭐⭐ 高(GitHub 活跃项目,2026-06-11 更新,发布说明详细) 后续行动:生产 K8s 部署场景建议深入评估;关联 SGLang PD-disagg 路线图
7. SGLang 官方博客 · 2026 工程里程碑
保留理由(工程价值): | 日期 | 里程碑 | 工程意义 | |------|--------|----------| | 2026-02 | SGLang on GB300 NVL72: 25x 推理性能 | 超大规模集群推理验证 | | 2026-04 | DeepSeek-V4 Day 0 支持 + RL 验证 | 推理引擎→训练框架闭环 | | 2026-06 | DFlash + Spec V2(下一代投机解码) | 延迟降低关键技术 | | 2026-07 | Kimi K3 day-0 支持 | 国内头部模型快速跟进 | | 2026-07 | GLM-5.2 NVFP4 达 500 TPS | 量化精度+推理速度权衡典范 |
可信度:⭐⭐⭐⭐ 高(官方 README,关联 LMSYS 非营利组织) 后续行动:建议建立"推理引擎选型"主题页;500 TPS 数据可作为 GLM-5.2 生产部署参考基线
8. MCP 2026 生态数据(InfoQ + Synvestable + Boldare)
来源: - InfoQ MCP 专题 - Synvestable MCP 企业部署指南 - Boldare MCP 公司排名
保留理由(工程价值): - 规模数据:2026-04 月 SDK 下载量 1.1 亿次(16 个月达成,vs React 3 年);活跃 MCP 服务器 10,000+;Gartner 预测 2026 年底 75% API gateway 厂商支持 MCP - 企业案例: - Block:MCP + Goose agent → token 减少 98.7%(量化价值) - Raiffeisen Bank:风控 AI → 提升 40% - 2026-07-28 规范:MCP 转向无状态架构,解决会话管理扩展性问题;Google Cloud、Netlify、Runlayer 等跟进 - 已知风险:RCE 设计弱点被披露(Boldare 文中有说明);Perplexity CTO 因 context window 开销转向自研
可信度:⭐⭐⭐⭐ 高(跨多个来源交叉验证,有具体百分比数字) 后续行动:建议收录 MCP 企业落地评估框架;关注 RCE 风险缓解方案
9. AI Agents Stack 2026(theaiengineer.substack.com)
来源:The AI Agents Stack (2026 Edition)
保留理由(工程价值): - 37 分评估差距洞察:89% 团队建了可观测性,但仅 52% 建了 formal evaluation → "能看到日志但不知道效果是否真的好" - MCP 标准化对 tools 层的改变(整个 tools 层因 MCP 被重塑) - 推理模型(reasoning models)如何改变 agent 自主性边界
丢弃理由(本次筛选): - 缺乏具体部署命令或代码 - 偏架构框架,缺少可复现步骤
综合判断:⭐⭐⭐ 有洞察力,但工程细节不足;建议作为行业趋势参考而非实操指南
10. Production RAG Frameworks 2026(karbouch.substack.com)
来源:Production RAG Frameworks Compared: The 2026 Landscape
保留理由(工程价值):
- 四层分类框架(2026 RAG 落地必读):
Layer 1: Memory / knowledge-graph engines
(Cognee, LightRAG, GraphRAG, Graphiti)
Layer 2: RAG libraries / frameworks
(LlamaIndex, Haystack, R2R, RAGFlow, PageIndex)
Layer 3: Chat interfaces with RAG
(OpenWebUI, LibreChat, AnythingLLM, Onyx, Verba)
Layer 4: LLM application platforms
(Dify, Flowise)
- Dify: 134K+ GitHub stars,250+ LLM 支持,完整 LLMOps
丢弃理由: - 无具体性能数据或命令 - 分类框架有价值但无工程可操作性
综合判断:⭐⭐⭐ 可作为 RAG 平台选型框架;建议配合具体平台 benchmark 数据使用
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| "How I'd Learn AI Engineering in 2026" (louisbouchard) | Roadmap 类内容,无工程细节,无实测数据 |
| "All you need to know about RAG (in 2026)" (aishwaryasrinivasan) | 策略描述偏多,无真实命令或代码;BM25+Rerank 方案可从其他来源获得更详细版本 |
| "Context Engineering as Recommendation Problem" (recsys.substack Vol.157) | 学术论文摘要集锦,缺乏工程实操;建议直接查原始论文 |
| "The Ultimate From Zero to Pro AI Engineer Roadmap for 2026" (javarevisited) | 付费订阅墙 + roadmap 内容,无具体环境配置 |
| "Building a simple RAG pipeline in 2026" (dataheimer) | 过于入门级;Python+Ollama 本地 demo,缺少生产级错误处理和性能考量 |
| "Welcome to the AI Systems Engineer Journey" (theneuralmaze) | 高质量概念介绍(chassis 框架有洞见),但缺乏可复现步骤;适合作为概念验证参考而非工程实践指南 |
| IBM/Databricks/AWS MLOps 博客文章 | 通用概念普及,无 2026 年新内容;Google MLOps 文档标注最后更新 2024-08 |
| Wikipedia AI/MLOps 条目 | 基础概念,无工程价值 |
📊 分类标签汇总
#LLM-Inference-Engine #SGLang #vLLM #Router #RBG
#RAG-Evaluation #RAGPerf #GaRAGe #Benchmark
#Agent-Architecture #AI-Agents-Stack #MCP
#MLOps #Kubernetes #Mooncake #SLA-autoscaling
#Benchmark #Multimodal #Kimi-K3 #GLM-5.2
#Enterprise-MCP #MCP-Security #Token-Reduction
💡 建议写入路径
| 优先级 | 主题 | 建议路径 |
|---|---|---|
| P0 | SGLang 2026 工程里程碑 | /shared/research-kb/inbox/jay/2026-09-16-sglang-2026-roadmap.md |
| P0 | RAGPerf benchmark 完整规格 | /shared/research-kb/inbox/jay/2026-09-16-ragperf-benchmark.md |
| P1 | vLLM Router 2026 路线图 | /shared/research-kb/inbox/jay/2026-09-16-vllm-router-2026-roadmap.md |
| P1 | RBG Kubernetes LLM 推理编排 | /shared/research-kb/inbox/jay/2026-09-16-rbg-kubernetes-llm.md |
| P1 | MCP 2026 生态数据与企业落地 | /shared/research-kb/inbox/jay/2026-09-16-mcp-enterprise-2026.md |
| P2 | AI Agents Stack 2026 评估洞察 | /shared/research-kb/inbox/jay/2026-09-16-ai-agents-stack-2026.md |
| P2 | Production RAG Frameworks 四层分类 | /shared/research-kb/inbox/jay/2026-09-16-rag-frameworks-2026.md |
🎯 本次执行摘要
| 指标 | 数值 |
|---|---|
| 检索命中总量 | ~52 条 |
| 进入二次评审 | 19 条 |
| 高价值保留 | 10 条 |
| 丢弃 | 9 条 |
| 新增 arXiv 论文 | 2 篇(RAGPerf, GaRAGe) |
| 新增 GitHub 官方内容 | 4 项 |
| 新增 Substack 工程洞察 | 4 项 |
| 新增 MCP 生态数据 | 1 项(跨 3 来源) |
📋 后续行动建议
- 立即行动:将 SGLang 2026 里程碑、RAGPerf、vLLM Router 路线图三条写入正式草稿
- 精读建议:RAGPerf 的完整测试床规格(EPYC 9334 + H100 NVL)可作为知识库 RAG 评估标准参考页
- 审稿:MCP 企业落地数据(Block 98.7% token 减少)建议由知识库编辑核实原始来源
- 主题页更新: - [ ] 新增「LLM 推理引擎选型 2026」主题页(纳入 SGLang/vLLM/RBG) - [ ] 更新「RAG 系统评估」主题页(纳入 RAGPerf/GaRAGe 双基准)
Jay · 工程筛选草稿 · 2026-09-16 · 第2次执行