AI 工程二次筛选简报 · 2026-10-02 晚场
执行时间: 2026-10-02 19:50 CST 实例: Jay 本次主题: 工程筛选(晚场)· MoE 推理工程 · CUDA Kernel 自动优化 · 推理引擎实测数据
一、检索覆盖
| 搜索方向 | 范围 | 候选数 | 有效候选 |
|---|---|---|---|
| LLM 推理引擎对比 | vLLM/SGLang/TensorRT-LLM/生产 | 8 | 4 |
| Agentic RAG 生产工程 | 架构/模式/框架 | 8 | 2 |
| MLOps/LLMOps | 工具链/平台/技能树 | 8 | 2 |
| GitHub Trending AI | 2026 年 repos 列表 | 8 | 2 |
| arXiv LLM Serving | 推理/量化/服务系统 | 8 | 3 |
| CUDA Kernel 优化 | GPU 编程/LLM 工程 | 8 | 3 |
| Substack AI 工程 | newsletter/深度文章 | 8 | 1 |
| arXiv MoE Serving | 专家并行/推理加速 | 6 | 3 |
已排除内容: - 所有列表类汇总("Top 30 GitHub repos"、"AI 工程技能树"等无差异条目) - roadmap/学习路径类无差异化内容 - YouTube 视频(非文字可引用内容) - 订阅门槛阻挡的 Substack 内容 - 2026-01 的老旧量化综述(arXiv:2508.16712)
二、工程筛选判断
✅ 保留条目
🔷 条目 E1:CascadeEP——MoE Prefill 异步专家调度(arXiv 2026-09)
- 来源: arXiv | arXiv:2609.33252v1
- arXiv: https://arxiv.org/html/2609.33252v1
- 发布时间: 2026年9月(本月)
- 可信度: 高——有真实 Nsight Systems trace 可视化数据
- 工程价值: ⭐⭐⭐⭐⭐
- 核心发现:
- MoE 模型中 attention imbalance 导致 prefill 阶段 GPU 利用率低
- 提出 CascadeEP:异步专家执行,overlap CPU→GPU expert copy 与 GPU compute
- Nsight trace 清晰显示"on-demand loading"有明显 idle gap,"expert prefetching"完全 overlap
- 已在 Qwen-30B-A3B 上验证,适用于 DeepSeek-V4、Kimi K3 等生产 MoE 模型
- 引用 vLLM x AgentX blog (2026-09-08) 作为生产参考
保留理由: 明确解决生产 MoE serving 的核心痛点(expert loading overhead),有 system trace 证据,引用近期 vLLM 官方工程博客,契合 2026 年 MoE 规模化部署大背景。
后续行动: 建议精读原文 trace 图;与 vLLM MoE EP 实现交叉核验;可纳入 llm-servers 分类的 MoE 专项。
🔷 条目 E2:Speculating Experts——MoE 推理专家预取加速(arXiv 2026-03)
- 来源: arXiv | arXiv:2603.19289v1
- arXiv: https://arxiv.org/pdf/2603.19289
- 发布时间: 2026年3月
- 可信度: 高——包含具体 Nsight trace 和 Qwen-30B-A3B benchmark 数据
- 工程价值: ⭐⭐⭐⭐⭐
- 核心发现:
- MoE 推理中 expert loading 是关键瓶颈(CPU-GPU copy 在 critical path)
- 提出专家预取:用模型内部表征预测未来 token 的 expert 选择,提前将 expert 权重从 CPU 加载到 GPU
- 在 Qwen-30B-A3B 上实现 compute-memcpy overlap,消除 idle gap
- 可直接用于现有预训练 MoE 模型,无需微调,集成进开源推理引擎
保留理由: 与 CascadeEP 解决同一类问题但方法不同(prefetch 预测 vs 异步执行),两者可互补;包含具体模型名称和 benchmark 数据;适合与 E1 配对阅读。
后续行动: 建议与 CascadeEP 对比阅读;核查代码是否已合并入 vLLM 或 SGLang 主线。
🔷 条目 E3:CrossPool——Cold MoE 多 LLM Serving(KV-Cache + Weight Disaggregation)
- 来源: arXiv | arXiv:2606.24506v2
- arXiv: https://arxiv.org/html/2606.24506v2
- 发布时间: 2026年6月(v2 修订)
- 可信度: 高——引用 OSDI 2026 (Chimera),有具体系统和 benchmark 描述
- 工程价值: ⭐⭐⭐⭐
- 核心发现:
- 面向 Cold MoE 模型(不保留权重在 GPU)场景
- KV-Cache disaggregation + weight disaggregation 组合调度
- 引用 Chimera (OSDI 2026) 作为 GPU memory ballooning 基线
- 适用场景:多租户 LLM serving,权重频繁冷切换
保留理由: 面向生产多租户场景,与 vLLM/ SGLang 的 weight 管理策略直接相关;OSDI 引用提升可信度。
后续行动: 建议与 Chimera (OSDI 2026) 关联追踪;核验是否有开源实现。
🔷 条目 E4:CUDA-L2——Reinforcement Learning 超越 cuBLAS 矩阵乘法
- 来源: arXiv | 2026-08(与 CUDA-L1 成系列)
- 可信度: 高——RL 方法具体,有 NVIDIA GTC 2026 相关演讲(S81653)
- 工程价值: ⭐⭐⭐⭐
- 核心发现:
- 用强化学习自动搜索 GPU SASS schedule,超越手工优化的 cuBLAS
- CUDA-L1 用 contrastive RL,CUDA-L2 扩展为通用 RL 框架
- 与 KernelBench (Stanford) 一起构成"LLM 能否写 GPU kernel"的系统性评估框架
保留理由: 展示了 RL 在 GPU kernel 优化中的具体进展,与 2026 年 LLM + GPU kernel 自动生成热点直接相关;GTC 2026 背书提升可信度。
后续行动: 关注 CUDA-L2 开源实现;与 Hugging Face kernel 库(2026-02 发布)交叉核验。
🔷 条目 E5:winder.ai 推理引擎实测——Qwen3.8-27B 具体 benchmark 数据
- 来源: winder.ai | https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
- 发布时间: 2026年(具体日期未标注)
- 可信度: 中——来自实际生产部署用户(非厂商),有具体 GPU 配置
- 工程价值: ⭐⭐⭐⭐
- 核心数据:
- Qwen3.8-27B(hybrid linear-attention),50 并发请求:
- SGLang:1,725 tokens/s
- vLLM:1,610 tokens/s(差距 ~7%)
- 8× NVIDIA RTX PRO 6000 Blackwell GPUs(不是 H100)
- SGLang 用社区针对 Blackwell 的非官方 build(vLLM FP8 packed path 有兼容问题)
- GLM-5.3-Flash on SGLang:2 replica × 2 card
保留理由: 稀缺的 Blackwell 架构实测数据(非 H100);SGLang vs vLLM 在 hybrid attention 模型上的具体差距有工程参考价值; Blackwell 平台仍是 2026 年下半年的前沿硬件。
后续行动: 标注这是特定硬件/模型配置,非通用结论;与 inferenceengineering.tech 的 decision framework 互补使用。
🔷 条目 E6:The AI Engineer Substack——Agent Stack 2026(Layered Architecture)
- 来源: Substack | https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 发布时间: 2026年(具体日期待核)
- 可信度: 中高——技术 Newsletter,Layer 1-5 分层架构清晰
- 工程价值: ⭐⭐⭐⭐
- 核心观点:
- Agent guardrails 从 LLM 护栏独立:2024 年护栏=输入/输出过滤;2026 年护栏=工具调用授权+限速+行为验证
- Layer 1 (Models): Cursor 路由 Claude/GPT-4/自研 fine-tuned 模型
- Layer 2 (Protocols & Tools): MCP servers 连接编辑器/终端/文件系统/git
- Layer 3 (Memory): Codebase-aware retrieval with reranking(不读全 repo,只取相关文件)
- Layer 4 (Orchestration): Multi-step 执行状态管理
- Layer 5 (Guardrails): 独立 Agent 护栏层
保留理由: 分层架构清晰;Guardrails 独立化观点有工程区分度;可与今天上午 Jay 产的 CodeAct/MCP 比较笔记形成补充。
后续行动: 与 jacar.es MCP 指南(今日下午条目)对比;关注 MCP Apps (SEP-1865) 与 Agent 护栏层的集成方式。
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| Spheron Blog / Morph / Premai.io 推理引擎对比 | 产品官网营销内容,无实测命令/代码;决策框架与 inferenceengineering.tech 高度重复 |
| Eduinx / Duy Nguyen / FutureAGI Agentic RAG | 模式图+框架罗列,无生产命令/错误处理/可复现步骤 |
| ByteByteGo Top AI GitHub Repos | 通用列表类,无差异化;ollama/vLLM 等已是知识库基础内容 |
| Acceler8 Talent / Eventum AI MLOps 文章 | 招聘/市场内容,无工程深度 |
| Coursera / Prepzee MLOps Roadmap | 学习路径类,非工程实践内容 |
| AI Supremacy (Substack) | 泛 AI 新闻 newsletter,无工程细节 |
| Simon Willison LLM predictions (Substack) | 观点类,无命令/代码/实测数据;订阅门槛 |
| NVIDIA On-Demand GTC S81653 | 视频内容,无法提取文字;标题可见但无实质工程数据 |
| arXiv:2508.16712 量化系统综述 | 2025年8月论文,时间较早;2026年已有 SAW-INT4 等新工作覆盖同类内容 |
三、分类标签汇总
llm-serversMoEvLLMSGLangexpert-parallelismCascadeEPllm-serversMoEprefetchexpert-loadingSpeculating-Expertsllm-serversdisaggregationKV-cacheCrossPoolGPUCUDAkernel-optimizationRLCUDA-L2llm-serversbenchmarkBlackwellQwen3.8-27Bhybrid-attentionagentguardrailsMCPagent-stackThe-AI-Engineer
四、本次写入
写入路径: /shared/research-kb/inbox/jay/2026-10-02-1950-jay-evening-engineering-filter.md
本次无新增精读任务注入(CascadeEP 和 Speculating Experts 可考虑,但由知识库管理员判断优先级后再安排)。
与今日已有内容的关系: - 与 2026-10-02-1735(下午场 MCP + VectorDB + LLMOps)无重复——本批次聚焦 MoE serving 和 CUDA kernel - 与 2026-10-02-jay-csdn-finetuning(下午 CSDN)无重复——CSDN 条目聚焦 fine-tuning,本批次聚焦 inference serving
置信度声明: 本次评估基于摘要和 snippet,所有 arXiv 条目建议以原文 PDF/HTML 为最终依据。