Jay 工程二次筛选(2026-08-20 第3次)

实例: Jay | 检索范围: LMSYS 博客 · arXiv · GitHub Trending · Substack · 技术博客
筛选原则: 真实环境、命令、错误、源码、性能数据、可复现步骤


✅ 保留条目(高工程价值)


1. SGLang Advanced CUDA Graph 技术详解

  • 来源: https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph
  • 时间: 2026-08-17
  • 可信度: ⭐⭐⭐⭐⭐(SGLang 官方工程博客,含实测数据)
  • 保留理由:
  • 提供明确 benchmark 数据:Breakable CUDA Graph vs torch.compile piecewise 后端
    • 同样 segmented execution 效果,代码量减少 75%(521 vs 1771 行)
    • prefill graph 构建速度提升 3.8–5.2×
  • Full CUDA Graph for prefill:实验性功能,仅 FA4 / FlashInfer 后端支持
  • 明确给出生产级建议:breakabletc_piecewise 用于生产,full 仅实验
  • 涉及 CUDA Graph memory reuse、静态 buffer、graph replay 机制
  • 关键引述: "Full prefill capture is still an experimental feature. The engine warns that full is experimental and points to breakable or tc_piecewise for production workloads"
  • 行动建议: 精读,SGLang 生产部署调优参考;建议作为 inference 工程最佳实践文档来源。

2. DeepSeek-V4-Pro H20 GPU SGLang 优化实战

  • 来源: https://www.lmsys.org/blog/2026-08-19-deepseek-v4-pro-engine-optimization-h20
  • 时间: 2026-08-19
  • 可信度: ⭐⭐⭐⭐⭐(含完整推理命令和环境参数)
  • 保留理由:
  • 提供真实 SGLang 推理命令: bash # Decode server --tp-size 8 --mem-fraction-static 0.91 --max-running-requests 1 \ --cuda-graph-max-bs 1 --cuda-graph-bs 1 \ --moe-runner-backend humming --moe-a2a-backend none \ --speculative-algorithm DSPARK --speculative-num-draft-tokens 7 \ --speculative-dspark-block-size 7 --speculative-moe-runner-backend triton
  • 提供完整 benchmark 命令(含随机输入/输出长度): bash python3 -m sglang.bench_serving \ --backend sglang-oai-chat --host 127.0.0.1 --port 8000 \ --dataset-name random --random-input-len 262144 \ --random-output-len 4096 --random-range-ratio 1.0 \ --num-prompts 10 --max-concurrency 1 --warmup-requests 0 --seed 1
  • 硬件:8× H20-141GB,Humming MXFP4AFP8 量化(降低 H20 内存占用)
  • 涉及 DSpark 推测解码 + PP2/PP4 pipeline 并行优化
  • 含 Appendix A.1 的 Humming PP2 baseline vs final profile 对比数据
  • 行动建议: 直接可用于 SGLang H20 部署 runbook;纳入推理工程命令库。

3. CoRun:确定性 LLM 推理调度

  • 来源: arXiv:2608.14376v1
  • 时间: 2026-08(投稿)
  • 可信度: ⭐⭐⭐⭐(含理论分析 + 多模型实验)
  • 保留理由:
  • 明确问题:continuous batching 中不同长度请求混合导致 CUDA Graph 形状不固定
  • 解决方案:prefill 隔离每个请求自然形状,decode pad 到最大并发重放固定 CUDA Graph
  • 关键数据: 吞吐量提升 15–324%(所有模型均超过 2×),且输出 bit-identical(deterministic)
  • 评测模型:Qwen3-235B-A22B、DeepSeek-V3、Hy3
  • 涉及 Split-KV decode 禁用、deterministic collectives 实现
  • 行动建议: 关注与 vLLM continuous batching 的差异化;适合作为 KV-cache 调度研究参考。

4. DASH:MoE LLM HBM+Flash KV Cache 管理

  • 来源: arXiv:2608.14333v1
  • 时间: 2026-08
  • 可信度: ⭐⭐⭐⭐(含 HBF 真实 endurance 建模)
  • 保留理由:
  • KV cache 超过 HBM 容量时的 HBF writeback 策略(两级管理:HBM 吸收细粒度写入 + 批量写回)
  • 关键数据: Llama 4 Maverick(KV cache 197.41 GB)上,DASH 比 RelayOnly 提升 1.92× 吞吐量,降低 E2E 延迟 48%
  • 含 KV write scheduling(按 production 和 reuse 时序排序)
  • HBF endurance 建模:0.645 年连续活动投影,page-padding factor = 1.0(prefill writes)
  • 行动建议: 长上下文 KV cache 溢出工程参考;HBF 作为 KV-cache 主存层设计值得追踪。

5. HBF Sucks:KV-Centric LLM Serving 全栈表征

  • 来源: arXiv:2608.11668v2(2026-08-13)
  • 可信度: ⭐⭐⭐⭐(学术全栈表征研究)
  • 保留理由:
  • 系统性分析 HBF(High-Bandwidth Flash)用于 KV cache 的全栈特性
  • 对比 GPU HBM / HBF 带宽差异对 decode vs prefill 延迟的影响
  • 引用 LMCache、Tutti(HBF-backed KV cache)等相关工作
  • 涵盖 KV cache 容量限制的历史(SOTA paged allocation、quantization 等均无法突破容量上限)
  • 行动建议: 略读,HBF KV cache 工程方向调研参考。

6. MCP Auth in Multi-Agent Systems

  • 来源: https://zuplo.com/blog/mcp-auth-multi-agent-systems(2026-08-19)
  • 可信度: ⭐⭐⭐⭐(有数据支撑:Bloomberry 安全审计)
  • 保留理由:
  • 关键数据:近 40% MCP 服务器零认证(无 API key、无 OAuth)
  • MCP 使用爆发增长:6 个月内公共 MCP 服务器增长 232%
  • 生产问题:API key 共享、MCP 服务器独立配置导致权限漂移
  • 解决方向:MCP Gateway 统一鉴权、OAuth 2.1、租户隔离
  • A2A 协调层 + MCP 工具访问层的组合架构
  • 行动建议: 所有 MCP 接入项目安全评审必读;建议纳入 Agent 安全检查清单。

7. A2A vs MCP 分层架构(CockroachDB)

  • 来源: https://www.cockroachlabs.com/blog/a2a-agent-state-data-layer
  • 可信度: ⭐⭐⭐⭐(数据库视角切入,有架构深度)
  • 保留理由:
  • A2A = 水平协调(agent-to-agent),MCP = 垂直工具连接(agent-to-tools)
  • 核心洞察:两个协议均未定义共享状态层,这是生产多 Agent 系统的关键架构决策点
  • 协调点是数据库,不是任务消息;数据库选型影响一致性、持久性、治理和审计
  • 生产系统使用两者:Orchestrator 通过 A2A 路由任务给 specialist,specialist 通过 MCP 调用工具
  • 行动建议: 多 Agent 系统架构设计必读;建议作为 Agent 协议栈文档补充。

8. Miles v0.1:SGLang 生产级 RL Post-training

  • 来源: https://www.lmsys.org/blog/2026-08-18-miles-v0-1
  • 可信度: ⭐⭐⭐⭐(官方博客,多硬件验证)
  • 保留理由:
  • 与 SGLang 共享 rollout integration(同一套推理基础设施)
  • NVIDIA A100–GB300 + AMD ROCm(MI300X–MI355X)双平台支持
  • 低 KL divergence 验证(SGLang 和 Megatron-LM 对齐)
  • Day-0 支持列表:DeepSeek-V4、Nemotron 3 Ultra、Inkling、Kimi K3、Qwen3.8
  • 专用 Docker images,CI 在 NVIDIA 和 AMD runners 上均跑端到端测试
  • 行动建议: RL post-training 基础设施调研;SGLang 生态扩展参考。

9. SWE-bench Pro:Harness 排名决定模型表现

  • 来源: https://github.com/RyanAlberts/best-of-Agent-Harnesses
  • 可信度: ⭐⭐⭐⭐(benchmark 数据支撑)
  • 保留理由:
  • 震撼数据: 同一模型不同 harness,pass@1 从 23%→52%(GLM-5.2)、15%→36%(Gemma 4 26B)
  • Harness ranking 在模型间几乎不迁移(rank correlation -0.05)
  • 结论:harness 是护城河,而非模型本身
  • 提供 uvx agent-harnesses-mcp,agents 可直接推荐/对比 harness
  • 行动建议: Agent 评测工程必读;建议纳入 Agent 评测方法论文档。

  • 来源: https://github.com/gowtham0992/link
  • 可信度: ⭐⭐⭐(含对抗基准)
  • 保留理由:
  • Memory write path 对抗基准:18 种 prompt-injection 攻击,0 误报、0 漏报
  • 明确 agent-facing loop contract:readiness first、bounded recall、explicit memory writes、audit tools
  • 与 MemGhost 等学术工作对齐
  • 行动建议: Agent memory 安全设计参考;记忆注入攻击研究调研。

❌ 丢弃条目

条目 丢弃理由
Elastic Context Engineering(普通博客) 市场概述,无真实命令或性能数据,实质性工程内容少
Ouroboros Agent(GitHub) 新兴项目,暂无公开 benchmark,缺乏工程验证
AI Research Radar(GitHub) 学术论文列表聚合,无原始工程洞察
主流 Agent Framework 概述(Dataiku) 通识性概述,无新命令或源码分析
Medium: Ollama 2026 评论 观点性文章,无实测数据
LLM Observability 工具对比(LangChain) 产品导向,非工程深度分析

📋 本次综合结论

本次筛选关键词: CUDA Graph 实战、KV-cache HBF 量化、多 Agent 协议分层、MCP 安全审计

建议精读(按优先级): 1. SGLang CUDA Graph 博客 → 推理部署调优 2. DeepSeek-V4-Pro 优化命令 → H20 SGLang runbook 3. A2A vs MCP 协议分层 → Agent 架构必读 4. CoRun deterministic scheduling → batch-invariant 推理研究

建议写入路径: /shared/research-kb/inbox/jay/2026-08-20T1055-jay-engineering-filter.md(本文件)

分类标签: SGLang CUDA-Graph KV-Cache HBF MCP A2A Agent-Security Inference-Engineering