llm-infra · E1 预消化简报(2026-08-31)

实例:spark · llm-infra 主题 E1 日间预消化轮 · cron 3c698927-9044-4540-873b-f961d6380d7d 生成时间:2026-08-31 18:40 CST 窗口期:2026-08-30 18:40 → 2026-08-31 18:40(约 24h) 基线活文档organized/knowledge/llm-infra.md §IX 76 morning(2026-08-31 16:45 · 8 件 NET-new 锚入 + arXiv 228 + URL 290 四集合校验闭合)

基线 E1 报告: - inbox/spark/2026-08-30-llm-infra-e1prep.md(8-30 18:40 · 56 KB · §IX 72 evening 棒位预备 + 7 条主增量) - inbox/spark/2026-08-31-agent-e1prep.md(8-31 13:38 · 39 KB · v70/v71 主轴协调棒预备 · llm-infra 邻接级 0 件主增量) - 8-30 evening → 8-31 morning 期间 jay 8-31 0940 + 8-31 1450 上午/下午简报带来大量 llm-infra 主轴延展内容(UniBoost + KV Cache 综述 + 引擎横评 + v0.28.0 五联 + SGLang SWA + browser-use 等),其中 8 件已在 §IX 76 morning 棒位锚入


状态

  • 增量条数8 条主增量(含 5 条 §IX 76 evening 棒位预备 NET-new 候选 + 2 条 §IX 77 morning 棒位预备 NET-new 候选 + 1 条评测/工程实践补强)
  • 本棒性质"§IX 76 morning 落定 + 8-31 afternoon/evening 工程实践补强型棒" —— 8-30 18:40 → 8-31 18:40 期间 jay 8-31 早场/午场/下午场/傍晚 5 份简报带来大量 llm-infra 工程实践延展内容,其中 8 件已在 §IX 76 morning 棒位锚入;本棒 = §IX 76 evening 棒位预备 + §IX 77 morning 棒位预备的 afternoon 补强层 —— 重点提示今日 jay afternoon/evening 棒位带来的 5 件 evening NET-new 预备 + 3 件 morning NET-new 预备(10 件预备源中 7 件已在 afternoon 简报中明确标识为"建议精读/泛读存档")
  • 涉及 arXiv 号:净增 10 件预备(arXiv:2607.09172 vLLM 配置权衡 + arXiv:2605.29639 RTP-LLM + arXiv:2606.07362 vLLM torch.compile + arXiv:2601.20408 OptiKIT + arXiv:2601.19139 Apple Silicon + arXiv:2605.01280 LLM Serving 数学优化 + 5 件已在 §IX 76 morning 锚入的沿用:arXiv:2606.18431 + arXiv:2603.20397 + arXiv:2510.09665 + arXiv:2506.09713 + 8 件中其他预备)

一、本棒检查过的来源清单(不硬凑字数)

1.1 work-queue.md(2026-08-31 18:00 自动生成)

  • 待建卡 0 · 待更新活文档 0(全部最新)· 选题榜未成视频脚本 1 件 = arXiv:2608.27455(CritICL · 沿用 8-30 llm-infra e1prep §IX 73 evening 棒位预备 · work-queue #3 + rag 主线预约)· 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张
  • 视图干净 · llm-infra 主轴未触发"高价值待深度解读"或"攻略待写"信号(Top 15/共 5 件均为非 llm-infra 主轴)→ 本棒按"§IX 76 evening 棒位预备 + 8-31 afternoon 工程实践补强"原则落笔

1.2 inbox/jay 8-30 evening → 8-31 全棒位(10+ 份简报)

  • 8-30 evening 棒位
  • inbox/jay/2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(8-30 早场 · CSDN 6 条:vLLM v0.20 五层架构 + SGLang 社区贡献指南 + LLaMA-Factory + Ollama 全流程 + vLLM/SGLang 横评选型 + vLLM/SGLang 混合模型 KV Cache 管理 = 已锚入 §IX 72)
  • inbox/jay/2026-08-30T1130-jay-engineering-filter.md(SGLang DFlash 2 + Spec V2 + SGLang v0.6 + vLLM NVFP4 FlashInfer 强制依赖 + 四引擎横评 + Agent 调试平台 + KV Cache 工程化五大家族 + AI Engineer 薪资 + Substack = 已锚入 §IX 72)
  • inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(四引擎横评 + 500+ 全景图 + 10 向量库 + eBPF + KubeCon + AI Agents Stack + ByteByteGo 5 趋势 + Nathan Benaich + ACL 2026 KV Cache = 已锚入 §IX 72)
  • inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md8-30 傍晚关键源 = SitePoint + Kubenatives + DevOpsBeast + Spheron + arXiv:2604.05012 + arXiv:2604.19157 + vLLM.cpp + MLSys 2026 + GitHub llama.cpp #15180 = 9 件 afternoon 棒位 NET-new 预备 · 已锚入 §IX 73 evening)
  • inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md(KubeCon + GKE AI Zones + TPU Subslicing + llm-d/KAI/DRA + TGI 维护模式 + SGLang v1.2.1 + 向量库 2026 + arXiv:2608.01526 + arXiv:2607.17715 + arXiv:2606.21238 + arXiv:2606.02964 + GitHub Trending + Substack Agentic AI 工程洞察 = 已锚入 §IX 72)

  • 8-31 全天棒位(5 份高密度简报)

  • inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md8-31 早场本棒关键源 = PagedAttention CUDA Kernel 底层(m0_69378371)+ MoE 全栈优化(BytePulse)+ SGLang RadixAttention 基数树 + SGLang KVCache 篇 + DeepSeek MoE 同步税 + vLLM vs SGLang vs TensorRT-LLM 2026 选型 + AI Agent 框架 5 模块 + Substack Physics & Engineering of Frontier LLM Inference 10 Part + State of Model Serving Communities Apr 2026 + State of Model Serving Communities Oct 2025 + Architecting LLM Inference Part 6 = 11 件 NET-new 候选预备
  • inbox/jay/2026-08-31T0940-jay-morning-inference-llm-systems.md(vLLM v0.28.0 详报(584 commits / 270 contributors)+ Sliding-window Beats Linear Attention arXiv:2608.28444 + browser-use 111K stars + SGLang 最新 commits PR #34602/37094/37035 + llama.cpp 最新 commits #28033/28017/26500/28011 + HF Qwen3.8-27B 爆发 = 7 件 8-31 morning 主增量 · v0.28.0 + SGLang SWA + Sliding-window 已锚入 §IX 76 morning
  • inbox/jay/2026-08-31T1235-jay-csdn-vllm-torchcompile-ollama-source-highvalue.md(vLLM 源码解析系列(m0_74825634 + weixin_42479327)+ DP=8 + EP=8 混合并行(xzpdxz)+ torch.compile 源码解读 + PyTorch 内核架构 + Ollama+DeepSeek R1 + LangChain+bge-m3+Chroma + LangGraph 1.0 = 7 件 8-31 noon 主增量 · llm-infra 主轴 4 件预备
  • inbox/jay/2026-08-31T1450-jay-afternoon-inference-scheduling-llmops-agentic.md8-31 下午本棒关键源 = UniBoost arXiv:2606.18431 + KV Cache 五大方向综述 arXiv:2603.20397 + 引擎横评 inferenceengineering.tech + AI Agents Stack 2026 + AI Engineer JD 分析 + Agentic RAG 生产失败模式 + arXiv:2605.01280 + arXiv:2504.11320v4 + PremAI + DeployBase + AIMultiple = 6 件 8-31 afternoon 主增量 · 3 件已锚入 §IX 76 morning
  • inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md8-31 傍晚本棒关键源 = DATABASE 3 件 + BACKEND 8 件 + CLOUD-NATIVE 2 件 + CSDN 7 件 + REPRODUCTION 6 件 + Substack 5 件 = 31 件五分类整理 · llm-infra 主轴 14 件预备 · arXiv:2607.09172 vLLM 配置权衡 + arXiv:2605.29639 RTP-LLM + arXiv:2606.07362 vLLM torch.compile + arXiv:2601.20408 OptiKIT + arXiv:2601.19139 Apple Silicon + arXiv:2605.01280 数学优化均首次出现
  • inbox/jay/2026-08-31T1620-jay-csdn-highvalue-inference-rag-deepseek.md(vLLM 战略级部署指南(gitblog_01152)+ 大模型推理框架性能瓶颈分析(u012605037)+ vLLM 生产环境部署血泪史 10 大坑 + vLLM 0.18 超深度系统级架构分析(zhonglinzhang)+ RAG 2026 实战指南 + DeepSeek-V2 架构解读 + SGLang 与 vLLM 多 GPU 协作 + DeepSeek V3 技术报告解读 + K8s AIOps 实战 = 9 件 8-31 下午 CSDN 主增量
  • inbox/jay/2026-08-31-inference-engineering-benchmarks.md8-31 工程实践本棒关键源 = vLLM vs SGLang vs TGI 2026 Benchmark(llm-academy.dev)+ Particula SGLang vs vLLM + AIMultiple vLLM/SGLang/LMDeploy + State of Model Serving Communities Apr 2026 + Senior LLM Inference Engineer Interview + arXiv:2506.09713 推理引擎 Bug + arXiv:2607.09172 vLLM 配置权衡 + arXiv:2601.20408 OptiKIT eBay + arXiv:2510.09665 KV Cache Layer + arXiv:2605.29639 RTP-LLM Alibaba + arXiv:2601.19139 Apple Silicon + arXiv:2606.07362 vLLM torch.compile = 12 件 8-31 工程实践主增量 · 2 件已锚入 §IX 76 morning + 10 件 NET-new 候选预备
  • inbox/jay/2026-08-31-engineering-e1prep.md(jay engineering E1 8-31 morning 棒位 · 6 条高质量条目 · v0.28.0 + Sliding-window + SGLang SWA + Prefix Sliding + MoE 同步税 + Ken Huang 10 Part = 6 件 8-31 morning 主增量 · v0.28.0 + Sliding-window 已锚入 §IX 76 morning · Prefix Sliding 已锚入 §IX 60

1.3 inbox/tom 8-30 evening → 8-31 全棒位(llm-infra 主轴 + 邻接)

  • inbox/tom/2026-08-30-inference-e1prep.md(8-30 06:10 → 22:20 · 16h 窗口 · 6 条主线索 · 已锚入 §IX 72)
  • inbox/tom/2026-08-31-inference-e1prep.md(8-31 morning 棒位 · llm-infra 主轴 + 邻接)
  • inbox/tom/2026-08-31-0900-hf-daily-2026-08-31.md(15 件候选 · llm-infra 主轴 0 件 · multimodal 主轴 = VoiceMem + VGI-Bench + WarpSAC + Agentic Game Dev = llm-infra 邻接级 4 件)
  • inbox/tom/2026-08-31-evaluation-e1prep.md(evaluation 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-08-31-rag-e1prep.md(RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-08-31T0840-agent-rag-longcontext-radar.md(8 件候选 · 4 件与 llm-infra 主轴邻接 = PILOT + CritICL + Luce + Inspect Evals Census)
  • inbox/tom/2026-08-31T1440-agent-rag-longcontext-radar.md(8 件候选 · llm-infra 主轴 0 件主增量)
  • inbox/tom/2026-08-31_agents-lite.md(8 候选 4 高价值 + 1 Substack = stephen noon 棒位数据源同源 · The AI Agents Stack 2026 Substack 已在 v70 主清单锚定

1.4 inbox/flyp 8-30 evening → 8-31 全棒位

  • inbox/flyp/2026-08-30-multimodal-e1prep.md(multimodal 主轴 11 件预备 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-30-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-multimodal-e1prep.md(multimodal 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-0950-VGI-Bench-visual-intelligence-video-generation-critical-read.md(VGI-Bench · multimodal 主轴 · llm-infra 邻接)
  • inbox/flyp/2026-08-31-1550-PAWBench-probabilistically-aligned-world-model-critical-read.md(PAWBench · world model 主轴 · llm-infra 邻接)
  • inbox/flyp/2026-08-31-1000-rss-cameron-wolfe.md(RSS · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-1002-rss-interconnects.md(RSS · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-1003-rss-yt-two-minute-papers.md(RSS · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-1004-rss-yt-ai-explained.md(RSS · llm-infra 邻接级 0 件)

1.5 inbox/stephen 8-30 evening → 8-31 noon 协调棒

  • inbox/stephen/2026-08-30-ai-industry-e1prep.md(ai-industry 主轴 5 件主增量 + 1 件邻接 · 0 件 llm-infra 主轴净增
  • inbox/stephen/2026-08-30-1245-stephen-coordination-check-noon.md(8-30 noon 协调棒 · 簇 8 = 已锚入 §IX 72)
  • inbox/stephen/2026-08-30-2245-stephen-coordination-check-evening.md(8-30 evening 协调棒 · 已锚入 §IX 72)
  • inbox/stephen/2026-08-31-1245-stephen-coordination-check-noon.md(8-31 noon 协调棒 · llm-infra 主轴多实例 5 时间点 = 已锚入 §IX 76 morning)

1.6 inbox/spark 8-30 → 8-31 早盘 RSS

  • inbox/spark/2026-08-30-1000-rss-gradient-flow.md(5 篇 · HBF 沿用 §IX 72 Hot Chips HBF 三源闭合)
  • inbox/spark/2026-08-30-1001-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-30-1003-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-31-1001-rss-gradient-flow.md(5 篇 · llm-infra 主轴 0 件主增量)
  • inbox/spark/2026-08-31-1002-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-31-1004-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)

1.7 paper_cards 库抽查(2026-08-29 → 2026-08-31 三天新卡)

  • 主分类 llm-infra = 3 件
  • paper_card 1117-2608-26070 Prefix Sliding for efficient test-time scaling(2026-08-28 15:00 入库 · 已锚入 §IX 60 立基延展 19 锚点候选)
  • paper_card 1129-2608-27455 CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes(2026-08-29 入库 · 形态 method · S2 被引 1 · 8-30 NET-new 主增量
  • paper_card 1133-2608-19269 What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals(2026-08-29 入库 · 形态 position · 副分类 evaluation · 8-30 NET-new 主增量
  • 主分类 agent = 1 件 = paper_card 1121-2608-26530 PILOT in the Loop(8-28 入库 · 8-30 邻接级补强
  • 主分类 engineering = 1 件 = paper_card 1120-2608-27448 TTPO: Test-Time Policy Optimization(8-31 morning 邻接级补强
  • 8-29 → 8-31 期间 paper_cards 库无新 llm-infra 主分类卡片(与 §IX 76 morning 沿用预备闭合)

1.8 organized/topic_pages/llm-infra.md + organized/knowledge/llm-infra.md

  • topic_pages/llm-infra.md(320 行 · 代表材料时间从 6-17 至今 · 结构 = 代表材料列表 · 主索引)
  • knowledge/llm-infra.md(471 行 · 14 节 = §0 / §1.(1-12) / §2.13 / §3 / §4 / §5 / §6 / §7 / §8 · §IX 76 morning 棒位已锚入全部 24h 内 llm-infra 主轴 · 本棒 = §IX 76 evening 棒位预备 + §IX 77 morning 棒位预备)

二、最重要的 8 条主增量


增量 1【§1.(3) KV Cache 算子层 + §1.(1) 推理引擎 NET-new · 8-31 morning】🟢 PagedAttention CUDA Kernel 底层实现详解(m0_69378371)—— Block Table 映射 + Copy-on-Write + KVCacheLayout 5.15× vs TGI ★★★★

  • 来源inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md §①(⭐⭐⭐ 极高 · 今日 CSDN 检索最高质量)
  • 来源链接https://blog.csdn.net/m0_69378371/article/details/158455491

要点:

核心工程级 PagedAttention 实现解析: - KV Cache 显存浪费根因:传统预分配 → 内部碎片(Hi 占用 5 token,浪费 2043)+ 外部碎片(长序列占住整块无法释放)+ 前缀重复复制 - Block Table 映射:逻辑块(B0~B31)通过页表映射到物理离散块;va_to_pa(virtual_token_idx) 函数级实现 - CUDA Kernel 计算流程compute_qk_scorescompute_attn_scorescompute_output 三步;线程块通过 Block Table 查找物理块指针,逐块计算局部注意力分数,再全局归约 - Copy-on-Write(写时复制):beam search 多分支共享同一物理块,只在写入时触发 CoW,显存降低 55% - KV 缓存内存布局csrc/attention/attention_kernels.cuKVCacheLayout 结构:K: [num_blocks, num_kv_heads, head_size/x, block_size, x]V: [num_blocks, num_kv_heads, head_size, block_size] - 性能数据:显存利用率 ~92%(传统 ~25%);吞吐量 198.3 tokens/s(传统 TGI 38.5 tokens/s);PagedAttention 吞吐量是 TGI 的 5.15×

关键意涵: - §1.(3) KV Cache 算子层 NET-new 预备 · 与沿用 §IX 67 SGLang RadixAttention 基数树 + §IX 73 vLLM.cpp mudler/vllm.cpp + §IX 75 vLLM v0.28.0 分级 KV Offloading module_path + §IX 76 KV Cache 五大方向综述 + §IX 76 UniBoost 调度 = §1.(3) KV Cache 算子层 NET-new 第 14 件候选预备 - PagedAttention CUDA Kernel 5.15× vs TGI 数据点是 §1.(1) 推理引擎横评 NET-new 预备 · 与沿用 inferenceengineering.tech H100 SXM 80GB Llama-3.1 70B TP=4 FP8 TensorRT-LLM ~3,400 / SGLang ~2,900 / vLLM ~2,800 tok/s + Particula DeepSeek V3 SGLang 3.1× faster vs vLLM + CSDN PagedAttention 198.3 vs TGI 38.5 tok/s = 5.15× = "§1.(1) 推理引擎横评"预备 - 与沿用 Digital Applied 五族工程指南 + AussieAI 500+ 推理优化 + arXiv:2603.20397 Dell KV Cache 五大方向综述 + CSDN PagedAttention CUDA Kernel 底层 = §1.(3) KV Cache "综述 + 横评 + 五族工程 + 五代框架 + Kernel 底层" 五维立基础延展预备 - 与 §IX 73 GitHub llama.cpp #15180 benchmark(vLLM vs llama.cpp 16 并发 vLLM 快 25%)+ CSDN PagedAttention vs TGI 5.15× = "§1.(1) 推理引擎跨后端完整基准预备"扩面

与活文档现有脉络的关系: - §1.(3) KV Cache 算子层 + §IX 53-76 morning 沿用 + CSDN PagedAttention CUDA Kernel 底层实现 m0_69378371 = §IX 76 evening 棒位预备的关键 NET-new 主轴候选预备 - §1.(1) 推理引擎 + §IX 66-76 morning 沿用 + CSDN PagedAttention 198.3 vs TGI 38.5 tok/s = 选型决策树工程级补强预备 - 与 §IX 67 §1.(3) ARC arXiv:2606.21238 + AsymCache arXiv:2606.02964 + Lookahead Sparse KV Cache Offload arXiv:2608.08097 + Internet for KV Cache arXiv:2608.01526 + Online KV Cache Compaction arXiv:2608.00902 + Slasher arXiv:2608.26021 + Prefix Sliding arXiv:2608.26070 + CSDN PagedAttention CUDA Kernel 底层 = §1.(3) KV Cache 算子层 14 件预备候选预备

警示: - ⚠️ P1:vLLM 源码版本对应 ~v0.11-v0.12 时期(2025 Q2-Q3),与 §IX 76 v0.28.0(2026-08-26)已相隔多个大版本,部分实现细节可能有变(BlockSpaceManager V1/V2 → V3+ 演进路径需核验) - ⚠️ P1:PagedAttention vs TGI 5.15× 数据点测试硬件 / batch size / 上下文长度需核验(198.3 vs 38.5 tok/s 数据看起来是单 GPU 场景) - ⚠️ P2:Copy-on-Write 显存降低 55% 的 beam search 分支数需核验 - ⚠️ P2:源码路径 csrc/attention/attention_kernels.cu 在 v0.28.0 中是否仍存在(vLLM 团队曾在 v0.20 后进行多次重构)需核验

建议归入节: §1.(3) KV Cache 算子层(NET-new · CSDN m0_69378371 PagedAttention CUDA Kernel 底层 + Block Table 映射 + Copy-on-Write + KVCacheLayout + PagedAttention 198.3 vs TGI 38.5 tok/s = 5.15×)+ §1.(1) 推理引擎(NET-new 预备 · PagedAttention 5.15× 数据点)+ §IX 76 evening 棒位预备


增量 2【§1.(3) KV Cache 算子层 + §1.(1) 推理引擎 NET-new · 8-31 morning】🟢 SGLang RadixAttention 基数树 KV 缓存管理(u011091936)—— 与 vLLM Block Manager 的本质差异 ★★★

  • 来源inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md §③(⭐⭐ 高 · SGLang 后端 RadixTree 数据结构)
  • 来源链接https://blog.csdn.net/u011091936/article/details/150429518 + https://blog.csdn.net/u011576070/article/details/146889758(KVCache 篇姊妹篇)

要点:

SGLang RadixAttention 核心数据结构: - 插入(Insert):新请求的前缀命中 RadixTree 时直接复用子树;未命中时创建新叶节点 - 驱逐(Eviction):LRU 策略驱逐最少使用节点;CoW 机制避免写入冲突 - 查询(Lookup):O(1) 前缀匹配,支持 prompt 缓存命中判断 - 生产配置enable_prefix_caching=True(SGLang 默认开启)

与 vLLM Block Manager 的本质差异: - vLLM:按 block 粒度管理(block_size=16 tokens)→ 物理内存分配视角 - SGLang:按 token 前缀树管理 → 逻辑语义层视角 - SGLang 在多轮对话场景优势显著:RadixTree 天然支持 50 用户同主题对话共享 common prefix

关键意涵: - §1.(3) KV Cache 算子层 NET-new 预备 · 与沿用 §IX 67 §1.(11) R10-R16 SGLang RadixAttention 沿用 + §IX 75 SGLang HiCache for hybrid models by default #27759 + §IX 76 SGLang Unified Radix Cache 重构论(lmsys.org/blog 2026-08-11 Composable TreeComponent FULL/SWA/MAMBA)+ CSDN RadixAttention 基数树 = "RadixAttention + SWA + HiCache + Unified + RadixTree"五栖 Hybrid Model 路径 NET-new 预备 - §1.(1) 推理引擎选型 NET-new 预备 · vLLM Block Manager(block_size=16 tokens)+ SGLang RadixTree(token 前缀树)= "物理层 vs 语义层"双视角 KV Cache 管理预备 - 与沿用 DevOpsBeast "共享前缀 >60% SGLang prefix cache hit rate 比 vLLM 高 2-3×" + Spheron systemd service unit + Particula DeepSeek V3 SGLang 3.1× faster vs vLLM + inferenceengineering.tech RadixAttention 高并发 +10-20% = "SGLang RadixAttention 工程级多源闭合"预备

与活文档现有脉络的关系: - §1.(3) KV Cache 算子层 + §1.(1) 推理引擎选型 + §IX 53-76 morning 沿用 + CSDN RadixAttention 基数树 u011091936 + KVCache 篇 u011576070 = §IX 76 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 67 R10-R16 SGLang RadixAttention 沿用 + §IX 75 SGLang HiCache for hybrid + §IX 76 SGLang Unified Radix Cache 重构论 + CSDN RadixTree 数据结构详解 = "§1.(3) KV Cache 算子层" 五栖预备 - 与 §IX 67 vLLM.cpp mudler/vllm.cpp v0.0.2(KV Cache Layer 实现参照)+ §IX 75 vLLM v0.28.0 分级 KV Offloading module_path + CSDN RadixTree 详细数据结构 = "§1.(1) 推理引擎选型" 工程级补强预备

警示: - ⚠️ P1:SGLang 版本 ~v0.4.3(2025 年中期),与 §IX 76 SGLang v0.5.18/v0.5.8 GB300/v0.6/v1.2.1 已有多个大版本演进,部分 API 可能变化(建议核验 v0.6+ RadixTree 实现) - ⚠️ P2:源码路径 sglang/python/sglang/srt/managers/schedule_policy.py 在 v0.6+ 是否仍存在(可能已重构到新路径)需核验 - ⚠️ P2:"50 用户同主题对话共享 common prefix" 的具体测试条件(硬件 / 模型 / 上下文长度)需核验

建议归入节: §1.(3) KV Cache 算子层(NET-new · CSDN u011091936 SGLang RadixAttention 基数树 KV 缓存管理 + 插入/驱逐/Lookup/CoW 机制 + u011576070 KVCache 篇前后端分离架构)+ §1.(1) 推理引擎(NET-new 预备 · vLLM Block Manager vs SGLang RadixTree 物理层 vs 语义层双视角)+ §IX 76 evening 棒位预备


增量 3【§1.(3) KV Cache 综述 + §1.(1) 推理引擎配置 NET-new · 8-31 evening】🟡 arXiv:2607.09172 vLLM Configuration Trade-offs —— vLLM 0.10.2 × 5 模型族 × 5 数据集 × INT8/FP8 量化工程级横评 ★★★

  • 来源inbox/jay/2026-08-31-inference-engineering-benchmarks.md §七 + inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md 【BACKEND】⑤
  • 来源链接https://arxiv.org/html/2607.09172v2

要点:

核心方法论: - vLLM 0.10.2(2026-04 时期版本) - 5 个模型族 × 5 个数据集 系统性配置交互分析 - 评估维度 = 能源效率 + 性能 + 精度 三角权衡

核心发现: - 推理优化之间存在相互作用,不能孤立评估(关键发现:vLLM 配置项相互依赖) - 配置项对不同任务类型影响差异显著(不同数据集对同一配置的响应差异巨大) - 量化(INT8/FP8)对精度影响因模型和任务而异(不能简单说 INT8 就一定降精度) - 能源消耗与性能并非线性关系(突破传统 perf-per-watt 假设)

关键意涵: - §1.(3) KV Cache 综述 NET-new 预备 · 与沿用 arXiv:2603.20397 Dell 五大方向综述 + arXiv:2607.08057 ACL 2026 Findings 综述 + AussieAI 500+ 推理优化 + arXiv:2607.09172 vLLM 配置权衡 = "§1.(3) KV Cache 综述/横评/五代框架/五族工程/配置权衡"五维立基础延展预备扩面 - §1.(1) 推理引擎配置 NET-new 预备 · 与沿用 OptiKIT arXiv:2601.20408 eBay(沿用本棒 §6 + TGI EOL + TPU Subslicing + vLLM Conf 8-25)+ arXiv:2607.09172 vLLM 配置权衡 = "§1.(1) 推理引擎配置优化"NET-new 预备 - §1.(12) (v) Harness Reliability 邻接级预备 · 配置交互效应属于 Harness Engineering 范畴 · 与沿用 AI Agents Stack 2026 6 层 + Eval as Infrastructure 三层 + CritICL arXiv:2608.27455 + Inspect Evals Census arXiv:2608.19269 + arXiv:2607.09172 配置权衡 = §1.(12) (v) Harness Reliability 评测方法学预备扩面

与活文档现有脉络的关系: - §1.(3) KV Cache 综述 + §1.(1) 推理引擎配置 + §IX 60-76 morning 沿用 + arXiv:2607.09172 vLLM 0.10.2 配置权衡 = §IX 77 morning 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 60 arXiv:2607.08057 ACL 2026 Findings KV Cache Survey + §IX 76 arXiv:2603.20397 Dell KV Cache 五大方向综述 + arXiv:2607.09172 配置权衡 = "§1.(3) KV Cache 综述三联" + 配置优化第 4 件预备 - 与 §IX 73 vLLM.cpp mudler/vllm.cpp v0.0.2 + arXiv:2607.09172 + OptiKIT arXiv:2601.20408 + §IX 72 AussieAI 500+ 推理优化全景图 = "§1.(1) 推理引擎配置优化"四栖预备

警示: - ⚠️ P1:vLLM 0.10.2(2026-04 版本)与 §IX 76 v0.28.0(2026-08-26 版本)已相隔 18 个 minor 版本,部分配置项可能已重命名或移除(建议核验 v0.28.0 对照) - ⚠️ P2:5 模型族 × 5 数据集的具体清单需精读(候选数据集 = GLUE/SuperGLUE/HumanEval/MMLU/?) - ⚠️ P2:"能源消耗与性能并非线性关系"的具体测试条件(GPU 型号 / 量化方案 / batch size)需核验 - ⚠️ P2:S2 被引 / 影响力被引数据点未在 jay 简报中标识(建议核验立标信号)

建议归入节: §1.(3) KV Cache 综述(NET-new · arXiv:2607.09172 vLLM 0.10.2 配置权衡 · 5 模型族 × 5 数据集 × INT8/FP8 量化 × 配置交互效应)+ §1.(1) 推理引擎配置优化(NET-new 预备 · OptiKIT + arXiv:2607.09172 + vLLM.cpp + AussieAI 四栖预备)+ §IX 77 morning 棒位预备


增量 4【§1.(1) 推理引擎 RTP-LLM Alibaba + §1.(3) KV Cache 量化 NET-new · 8-31 evening】🟡 arXiv:2605.29639 RTP-LLM —— Alibaba W4A8KV4 量化 memory footprint 减半 + 多模态支持 ★★★

  • 来源inbox/jay/2026-08-31-inference-engineering-benchmarks.md §十 + inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md 【BACKEND】⑥
  • 来源链接https://arxiv.org/html/2605.29639v1

要点:

核心优化: - 量化方案W4A8KV4(weight INT4 / activation INT8 / KV cache INT8)—— memory footprint 减半 - KV cache 量化:直接缓解 Decode Phase 内存带宽压力 - 并行执行:生产级并行策略 - 多模态支持:扩展至视觉/音频

关键意涵: - §1.(3) KV Cache 量化 NET-new 预备 · 与沿用 arXiv:2603.20397 Dell 五族综述(量化方向)+ arXiv:2607.09172 vLLM 配置权衡(INT8/FP8 量化)+ arXiv:2604.19157 SAW-INT4 Hessian-aware 4-bit(沿用 §IX 74 锚入)+ arXiv:2605.29639 RTP-LLM W4A8KV4 = "§1.(3) KV Cache 量化四联"预备 - §1.(1) 推理引擎 NET-new 预备 · Alibaba 工业级系统论文 · 与沿用 vLLM v0.27.1/v0.28 MRV2(NVFP4 FlashInfer 强制依赖)+ TensorRT-LLM 1.3.0rc + MAX + Aphrodite + LMDeploy + SGLang + RTP-LLM arXiv:2605.29639 = "§1.(1) 推理引擎九足鼎立"预备(vLLM + SGLang + TensorRT-LLM + MAX + LMDeploy + Aphrodite + vLLM.cpp + DeepSeek + RTP-LLM Alibaba) - 与沿用 v0.28.0 Online MXFP4 + batch-invariant NVFP4 MoE via FlashInfer(§IX 75 + §IX 76 morning 锚入)+ RTP-LLM W4A8KV4 = "§1.(1) 推理引擎量化实践"双栖预备

与活文档现有脉络的关系: - §1.(1) 推理引擎 + §1.(3) KV Cache 量化 + §IX 53-76 morning 沿用 + arXiv:2605.29639 RTP-LLM W4A8KV4 = §IX 77 morning 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 73 vLLM.cpp + §IX 74 arXiv:2604.19157 SAW-INT4 + §IX 75 vLLM v0.28.0 Online MXFP4 + §IX 76 arXiv:2603.20397 Dell 五族综述 + arXiv:2605.29639 RTP-LLM W4A8KV4 = "§1.(3) KV Cache 量化五联"预备 - 与 §IX 60 SGLang v0.5.18/v0.5.8 GB300 + TensorRT-LLM 1.3.0rc + MAX 25.2/26.4 + Aphrodite Engine + LMDeploy + vLLM.cpp + DeepSeek-V3/V4 + RTP-LLM Alibaba = "§1.(1) 推理引擎九足鼎立"预备

警示: - ⚠️ P1:RTP-LLM 是否开源(Alibaba 工业级系统论文通常配套开源,需核验 github.com/alibaba/RTP-LLM 等仓库链接) - ⚠️ P2:W4A8KV4 量化方案在主流推理引擎(vLLM/SGLang/TensorRT-LLM)的兼容性需核验 - ⚠️ P2:multi-modal 扩展的具体模型支持范围(视觉/音频/视频)需核验 - ⚠️ P2:S2 被引 / 影响力被引数据点未在 jay 简报中标识(建议核验立标信号)

建议归入节: §1.(1) 推理引擎(NET-new 预备 · RTP-LLM Alibaba W4A8KV4 量化 + 多模态 · 第 9 件候选预备)+ §1.(3) KV Cache 量化(NET-new · W4A8KV4 量化 memory footprint 减半 + Decode Phase 内存带宽压力缓解)+ §IX 77 morning 棒位预备


增量 5【§1.(1) 推理引擎 Apple Silicon + §1.(2) 推理调度 NET-new · 8-31 evening】🟡 arXiv:2601.19139 Native LLM/MLLM Inference on Apple Silicon —— llama.cpp/MPS/vLLM-metal/MLX 四路对比 ★★★

  • 来源inbox/jay/2026-08-31-inference-engineering-benchmarks.md §十一
  • 来源链接https://ar5iv.labs.arxiv.org/html/2601.19139(arXiv 2601.19139 HTML 版)

要点:

Apple Silicon 推理四路方案对比:

方案 优势 劣势
llama.cpp Hand-tuned Metal kernels、GGUF 量化、单流吞吐优秀 无 continuous batching
PyTorch MPS 模型兼容性好 CUDA-centric,性能次优
vLLM-metal vLLM 生态兼容 混合实现,不够成熟
MLX 原生 Metal 支持、量化支持好 框架限制

关键意涵: - §1.(1) 推理引擎 Apple Silicon NET-new 预备 · 与沿用 §IX 67 MAX(Mojo 内核非 CUDA)+ §IX 73 vLLM.cpp mudler/vllm.cpp v0.0.2(8 种 server archives 含 Metal)+ arXiv:2601.19139 Apple Silicon 四路对比 = "§1.(1) 推理引擎 Apple Silicon 三栖预备" - 与 §IX 67 R7 llama.cpp 6 漏洞 + §IX 73 vLLM.cpp 8 种 archives + §IX 76 v0.28.0 苹果 MLX 后端修复 (#37035) + arXiv:2601.19139 = §1.(1) 推理引擎 Apple Silicon 沿用 + 预备闭合 - §1.(12) (v) Harness Reliability 邻接级预备 · Apple Silicon 推理选型决策树属于 Harness Engineering 范畴

与活文档现有脉络的关系: - §1.(1) 推理引擎 + §IX 53-76 morning 沿用 + arXiv:2601.19139 Apple Silicon 四路对比 = §IX 77 morning 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 67 MAX(Mojo 内核)+ §IX 73 vLLM.cpp(8 种 server archives 含 Metal/MLX)+ §IX 76 SGLang Apple Silicon MLX 后端修复 (#37035) + arXiv:2601.19139 四路对比 = "§1.(1) 推理引擎 Apple Silicon 沿用 + 预备" 闭合 - 与 §IX 67 §1.(12) (v) Harness Reliability + §IX 67 R7 llama.cpp 6 漏洞 + arXiv:2601.19139 = "§1.(1) 推理引擎 + §1.(12) Harness" 邻接级预备

警示: - ⚠️ P1:arXiv 2601.19139 是 2026-01 旧论文(已 7 个月前),可能未涵盖 2026 H1 的最新 MLX / vLLM-metal 演进(建议核验 vLLM-metal 在 v0.28.0 中的成熟度) - ⚠️ P2:vLLM-metal "混合实现,不够成熟"的具体表现需核验(vLLM v0.20+ 已开始 Metal 后端工作) - ⚠️ P2:MLX "框架限制"的具体技术约束(如不支持 continuous batching / 不支持某些 attention 模式)需核验 - ⚠️ P2:ar5iv.labs.arxiv.org 是 arXiv 的 HTML 镜像,需核验与 arxiv.org/abs/2601.19139 的一致性

建议归入节: §1.(1) 推理引擎(NET-new 预备 · Apple Silicon 四路对比 llama.cpp/PyTorch MPS/vLLM-metal/MLX · 第 10 件候选预备 · 与 vLLM.cpp + MAX 形成"边缘/本地推理"路径预备)+ §IX 77 morning 棒位预备


增量 6【§1.(12) (v) Harness Reliability + §1.(2) 推理调度 NET-new · 8-31 evening】🟡 State of Model Serving Communities April 2026(InferenceOps Substack)—— KServe v0.17.0 + llm-d + EPP 拆分 ★★★

  • 来源inbox/jay/2026-08-31-inference-engineering-benchmarks.md §四 + inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md §Substack S2 + inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md 【CLOUD-NATIVE】①
  • 来源链接https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93

要点:

vLLM v0.17 → v0.19 演进路线图: - 视觉/音频/ASR/embedding/rerank/tool-use 多模态覆盖扩展 - Speculative decoding 重大更新 - Model Runner V2 - KV/weight offloading - CUDA graphs + high-performance kernels

KServe v0.17.0(生产级新特性): - LLMInferenceService 生产级 autoscaling(WVA/KEDA/HPA) - OpenAI Responses API 支持 - llm-d 依赖升级 - Intel Gaudi 支持(OpenShift AI Serving) - ARM builds for LLMInferenceService controller - ONNX model class 支持 MLServer

重要变更 — EPP 拆分为 llm-d: - 原 Kubernetes inference 代码拆分至 llm-d 仓库 - 降低碎片化,InferencePool API 保留在 k8s org,引擎专业实现移入 llm-d - 与 §IX 73 llm-d v0.5 + KubeCon NA 2026 升级为最高优先 + NVIDIA Grove + Spheron K8s GPU DRA = "llm-d + KServe 协同"路径预备

SIG-kv-disaggregation 更新: - KV 分离协议标准化进展(与 §IX 64 Prefill-Decode 分离沿用件套 + §IX 76 UniBoost + SGLang Unified Radix Cache 重构论形成"Prefill-Decode 分离 + KV 分离"双栖预备)

关键意涵: - §1.(12) (v) Harness Reliability + §1.(2) 推理调度 NET-new 预备 · KServe v0.17.0 + llm-d + EPP 拆分 + vLLM v0.17→v0.19 演进 = §1.(2) 推理调度 K8s 生态"NET-new 第 3 件预备" - 与沿用 §IX 72 KubeCon NA 2026 AI Inference + Agentic Track + KServe v0.17 + llm-d v0.5 + NVIDIA Grove + Spheron K8s GPU DRA + KAI Scheduler + MLflow K8s AI Serving + InferenceOps State of Model Serving Apr 2026 = "K8s 推理生态"完整路径预备 - §1.(3) KV Cache 综述 NET-new 预备 · SIG-kv-disaggregation 协议标准化进展与 §IX 64 Prefill-Decode 分离沿用件套 + §IX 76 UniBoost + SGLang Unified Radix Cache 重构论形成"Prefill-Decode 分离 + KV 分离协议标准化" 双栖预备 - §1.(1) 推理引擎 NET-new 预备 · vLLM v0.17 → v0.19 演进(speculative decoding / Model Runner V2 / KV offloading)与 §IX 73 vLLM v0.28.0 五大主线形成"vLLM 演进时间线 v0.17 → v0.19 → v0.27 → v0.28"预备

与活文档现有脉络的关系: - §1.(12) (v) Harness Reliability + §1.(2) 推理调度 + §1.(1) 推理引擎 + §1.(3) KV Cache 综述 + §IX 53-76 morning 沿用 + InferenceOps State of Model Serving Apr 2026 = §IX 76 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 72 KubeCon NA 2026 + KServe v0.17 + llm-d v0.5 + NVIDIA Grove + Spheron K8s GPU DRA + KAI Scheduler + MLflow K8s AI Serving + InferenceOps Apr 2026 KServe v0.17.0 详报 = "§1.(2) 推理调度 K8s 生态"完整路径预备 - 与 §IX 73 vLLM.cpp + §IX 75 vLLM v0.28.0 + §IX 76 SGLang Unified Radix Cache + InferenceOps vLLM v0.17→v0.19 演进 = "vLLM/SGLang 演进时间线"完整路径预备

警示: - ⚠️ P1:vLLM v0.17 → v0.19 是 2026-H1 时段(与 §IX 76 v0.28.0 已有 9 个 minor 版本差距),InferenceOps Apr 2026 报告可能未涵盖 v0.20+ 演进(建议对照 vLLM GitHub releases 核验) - ⚠️ P2:EPP(Endpoint Picker)拆分至 llm-d 的具体代码 commit 列表需核验(避免与 §IX 73 llm-d v0.5 锚入的"50k tok/s B200 16×16 拓扑"混淆) - ⚠️ P2:SIG-kv-disaggregation 协议的具体提案 ID(K8s SIG / CNCF TAG?)需核验

建议归入节: §1.(12) (v) Harness Reliability + §1.(2) 推理调度(NET-new · InferenceOps State of Model Serving Apr 2026 · KServe v0.17.0 LLMInferenceService autoscaling + llm-d 拆分 + EPP + SIG-kv-disaggregation 进展)+ §1.(1) 推理引擎(vLLM v0.17→v0.19 演进路线图预备)+ §IX 76 evening 棒位预备


增量 7【§1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability NET-new · 8-31 evening】🟢 The Physics & Engineering of Frontier LLM Inference 10-Part Series(Ken Huang Substack)—— Prefill-Decode 分离 + Prefix Caching + KV 量化 + MoE Serving + 结构化输出五维 ★★★

  • 来源inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md §Substack S1 + inbox/jay/2026-08-31-engineering-e1prep.md 条目 6
  • 来源链接https://kenhuangus.substack.com/p/announcing-the-10-part-series-the

要点:

系列结构(10 Part): - Part 1-3:Prefill/Decode 分离(Disaggregation)+ Chunked Prefill 原理 + vLLM/SGLang 实现差异 - Part 4-6:Prefix Caching 深层机制——Global Radix Tree + Hash-based Token Tree + Cross-session System Prompt 共享 - Part 7-8:KV Cache 量化——FP8 (E4M3) + INT4 量化 KV 布局 + 子通道缩放因子 + Triton 去量化 Kernel - Part 9-10:MoE Serving 挑战——DeepSeek-V4(1.6T/2.8T 总参数,49B/104B 激活参数,256 routed experts + 1 shared expert) + 大规模 Expert Parallelism 分布式系统难题 - 结构化输出SGLang XGrammar vs Outlines——FSM、Pushdown Automata、正则编译、Token Bitmask 预计算

关键结论: - 2026 年推理引擎竞争焦点从"模型质量"转向"生产级效率" - MoE + 结构化输出是下一个主战场

关键意涵: - §1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability NET-new 预备 · 10-Part 系列系统覆盖 Prefill-Decode 分离 + Prefix Caching + KV 量化 + MoE Serving + 结构化输出五维 · 与沿用 arXiv:2603.20397 Dell 综述 + arXiv:2607.08057 ACL 2026 Findings + AussieAI 500+ + AussieAI 700+ + Ken Huang 10-Part = "§1.(3) KV Cache + §1.(12) Harness Reliability 综述五联"预备 - §1.(1) 推理引擎 NET-new 预备 · DeepSeek-V4 详细参数(1.6T/2.8T 总参数 · 49B/104B 激活参数 · 256 routed experts + 1 shared expert)与沿用 §IX 75 vLLM v0.28.0 DeepSeek-V4 端到端支持 + §IX 76 SGLang Unified Radix Cache 重构论 = "DeepSeek-V4 完整路径预备" - §1.(12) (v) Harness Reliability NET-new 预备 · SGLang XGrammar vs Outlines 结构化输出对比与 §IX 73 LangGraph Pregel/BSP + §IX 76 AI Agents Stack 2026 = "结构化输出"预备 - §1.(2) 推理调度 NET-new 预备 · Prefill-Decode 分离(Disaggregation)+ Chunked Prefill 原理 + vLLM/SGLang 实现差异与沿用 §IX 64 Prefill-Decode 分离沿用件套 + §IX 76 UniBoost + SGLang Unified Radix Cache = "Prefill-Decode 分离 + KV 分离"双栖预备

与活文档现有脉络的关系: - §1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability + §1.(1) 推理引擎 + §1.(2) 推理调度 + §IX 53-76 morning 沿用 + Ken Huang 10-Part 系列 = §IX 76 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 60 §1.(3) KV Cache 综述/横评/五代框架 + §IX 73 AussieAI 500+ 推理优化全景图 + §IX 76 arXiv:2603.20397 Dell 综述 + Ken Huang 10-Part = "§1.(3) KV Cache + §1.(12) Harness" 综述五联预备 - 与 §IX 75 vLLM v0.28.0 DeepSeek-V4 + §IX 76 SGLang Unified Radix Cache 重构论 + Ken Huang DeepSeek-V4 详细参数(1.6T/2.8T 总参数 · 49B/104B 激活参数 · 256 routed experts + 1 shared expert) = "DeepSeek-V4 完整路径"预备

警示: - ⚠️ P1:Substack 系列为付费内容,部分 Part 细节可能需付费解锁(建议核验免费 Preview 范围) - ⚠️ P2:DeepSeek-V4 参数(1.6T/2.8T 总参数 · 49B/104B 激活参数 · 256 routed experts + 1 shared expert)需与 DeepSeek 官方技术报告核验(可能存在数字误差) - ⚠️ P2:SGLang XGrammar vs Outlines 对比的具体测试场景(FSM / Pushdown Automata / 正则编译 / Token Bitmask)需核验 - ⚠️ P2:作者 Ken Huang 是独立研究者(非 vLLM/SGLang 官方团队),结论需对照官方文档核验

建议归入节: §1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability(NET-new 预备 · Ken Huang 10-Part 系列 · Prefill-Decode + Prefix Caching + KV 量化 + MoE Serving + 结构化输出五维)+ §1.(1) 推理引擎(DeepSeek-V4 详细参数预备)+ §IX 76 evening 棒位预备


增量 8【§1.(3) KV Cache + §1.(2) 推理调度 + §1.(12) (v) Harness Reliability NET-new · 8-31 evening】🟡 AI Agents Stack 2026 Edition 6 层栈 + OWASP MCP Top 10 + 评估基础设施三层收敛 + 1000+ AI Engineer JD 分析 ★★★

  • 来源inbox/jay/2026-08-31T1450-jay-afternoon-inference-scheduling-llmops-agentic.md §一④ + §一⑤ + inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md 【CLOUD-NATIVE】② + inbox/spark/2026-08-31-agent-e1prep.md v70 主清单锚定
  • 来源链接https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition + https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal

要点:

AI Agents Stack 2026 Edition 6 大趋势: 1. Agent Guardrails ≠ LLM Guardrails: 2024 年 Guardrails = 输入/输出过滤器;2026 年 = 工具调用授权 + 费率限制 + 行为验证"Guardrails before action" 模式成为行业共识 2. OWASP MCP Top 10(beta)发布: 首个工具连接型 Agent 安全检查清单(2026 年重要基础设施) 3. 评估基础设施三层收敛: ① PR 级快速检查(工具调用正确性);② 夜间回归套件(LLM judge 评估质量);③ 生产持续监控(漂移告警) 4. Context Engineering 替代 Prompt Engineering: 架构化信息供给;Memory Blocks(命名结构化字段)成为状态管理标准 5. 新 Benchmark: Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent) 6. 部署现状: FastAPI + 自建 infra 仍是主流;LangGraph Cloud / Bedrock Agents 存在但未主导

AI Engineer 1000+ JD 关键数据: - 三种角色类型: AI-first ~70%(直接做 LLM/GenAI 系统)/ AI-support ~28.5%(基础设施/平台)/ AI-adjacent 少量 - 生产经验要求:95.6%(而非模型研究) - 主导语言:Python 98%+ - 评估工具栈:Ragas + Phoenix + Langfuse(2026 标准组合) - 核心能力: RAG 系统设计、Agent 工作流、API 部署、监控、护栏、评估(LLM-as-Judge)

关键意涵: - §1.(12) (v) Harness Reliability NET-new 预备 · 与沿用 §IX 73 AI Agents Stack 2026 Edition 6 层 + 3 类新 benchmark + Eval as Infrastructure 三层 + §IX 76 morning 沿用 + 8-31 afternoon/evening 三源补充 = "§1.(12) (v) Harness Reliability AI Agents Stack 2026"预备 - §1.(3) KV Cache + §1.(2) 推理调度 NET-new 邻接级预备 · Context Engineering + Memory Blocks + 评估基础设施三层收敛与沿用 §IX 76 KV Cache 五大方向综述(Context-Bench)+ UniBoost 调度 = "§1.(12) (v) + §1.(3) KV Cache + §1.(2) 调度"三栖预备 - 与沿用 §IX 73 vLLM.cpp + §IX 74 SGLang + §IX 75 vLLM v0.28.0 + §IX 76 AI Agents Stack 2026 + OWASP MCP Top 10 + 1000+ AI Engineer JD 分析 = "§1.(12) (v) + §1.(12) (vi) Agent Security"双栖预备

与活文档现有脉络的关系: - §1.(12) (v) Harness Reliability + §IX 73-76 morning 沿用 + AI Agents Stack 2026 Edition 6 层 + OWASP MCP Top 10 + 评估基础设施三层收敛 + 1000+ AI Engineer JD 分析 = §IX 76 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 66 §1.(11) §1.(12) (v) Harness Reliability 沿用件套 + §IX 73 AI Agents Stack 2026 Edition 6 层 + §IX 76 AI Agents Stack 2026 + §IX 76 evening 8-31 afternoon/evening 三源补充 = "§1.(12) (v) Harness Reliability AI Agents Stack 2026"预备闭合 - 与 §IX 66 MCP 生产缺口 + §IX 73 AI Agents Stack 2026 + §IX 76 morning AI Agents Stack 2026 + OWASP MCP Top 10 + 评估基础设施三层收敛 = "MCP 标准化"预备

警示: - ⚠️ P1:The AI Engineer 与 §IX 73 AI Agents Stack 2026 Edition 是否同一作者(Paolo Perrone 可能是 The AI Engineer 主编)需核验 - ⚠️ P2:"Guardrails before action" 模式是否对应特定行业标准(如 NIST AI RMF / OWASP Agentic AI Top 10)需核验 - ⚠️ P2:AI-first ~70% / AI-support ~28.5% 数据点来自 1000+ JD 样本的统计方法论需核验 - ⚠️ P2:Ragas + Phoenix + Langfuse 评估工具栈在 §IX 66 §1.(12) (v) Harness Reliability 沿用件套 + §IX 73 Langfuse/LlamaIndex 中是否已沿用预备闭合需核验

建议归入节: §1.(12) (v) Harness Reliability + §1.(12) (vi) Agent Security(NET-new 预备 · AI Agents Stack 2026 Edition 6 层 + OWASP MCP Top 10 + 评估基础设施三层收敛 + 1000+ AI Engineer JD 分析)+ §IX 76 evening 棒位预备


三、值得警惕的矛盾或待核实说法

  1. CSDN PagedAttention 198.3 vs TGI 38.5 tok/s(5.15×)inferenceengineering.tech H100 SXM 80GB Llama-3.1 70B TP=4 FP8 = TensorRT-LLM 3,400 / SGLang 2,900 / vLLM 2,800 tok/s 表面矛盾:

    • CSDN 数据 = 单 GPU + PagedAttention vs TGI = 早期对照
    • inferenceengineering.tech 数据 = H100 SXM 80GB + TP=4 + FP8 + 三引擎对照 = 当前生产对照
    • 解释:两者测试条件完全不同(硬件 / 模型规模 / 并行策略 / 精度),不可直接比较;CSDN 数据点是 PagedAttention 优势的历史数据点,应作为"§1.(1) 推理引擎横评预备"沿用件套补充
    • 建议归入:§1.(1) 推理引擎横评预备 · 明确"早期单 GPU 对照 vs 当前 H100 TP=4 对照"区分
  2. vLLM 0.10.2 配置权衡 arXiv:2607.09172(2026-04)vLLM v0.28.0 GA(2026-08-26) 时间间隔 4 个月:

    • v0.10.2 与 v0.28.0 间隔 18 个 minor 版本
    • 解释:arXiv:2607.09172 的配置交互效应结论可能在 v0.28.0 中已部分变化(v0.28.0 五大主线 + Model Runner V2 + 分级 KV Offloading 等)
    • 建议归入:§1.(3) KV Cache 综述预备 · 建议核验 v0.28.0 对照数据点
  3. RTP-LLM arXiv:2605.29639 W4A8KV4 memory footprint 减半vLLM v0.28.0 Online MXFP4 + batch-invariant NVFP4 MoE via FlashInfer(§IX 75 + §IX 76 morning 锚入) 不同量化方案:

    • RTP-LLM = W4A8KV4(weight INT4 / activation INT8 / KV cache INT8)
    • vLLM v0.28.0 = Online MXFP4 + batch-invariant NVFP4 MoE
    • 解释:两者量化路径不同(RTP-LLM = INT 量化 / vLLM v0.28.0 = MXFP4 + NVFP4);属于工业界并行方案
    • 建议归入:§1.(1) 推理引擎量化预备 · 建议明确"INT 量化 vs MXFP4 量化"双路径
  4. InferenceOps State of Model Serving Apr 2026(vLLM v0.17 → v0.19)§IX 76 vLLM v0.28.0(2026-08-26) 时间间隔 4 个月:

    • v0.17 → v0.19 是 2026-H1 时段,v0.28.0 是 2026-08
    • 解释:InferenceOps 报告可能未涵盖 v0.20+ 演进(speculative decoding / Model Runner V2 / KV offloading 等在 v0.20+ 才有重大更新)
    • 建议归入:§1.(1) 推理引擎演进时间线预备 · 建议补充 vLLM v0.20 → v0.28 演进数据点
  5. CSDN SGLang RadixAttention 基数树(u011091936,~v0.4.3 2025 年中期)§IX 76 SGLang v0.5.18/v0.5.8 GB300/v0.6/v1.2.1(2026 H1) 时间间隔 12 个月:

    • RadixTree 数据结构可能在 v0.6+ 已重构
    • 解释:建议核验 v0.6+ RadixTree 实现细节是否仍与 u011091936 描述一致
    • 建议归入:§1.(3) KV Cache 算子层预备 · 建议核验 v0.6+ 对照
  6. Ken Huang 10-Part Substack 系列 是付费内容,部分 Part 细节可能需付费解锁:

    • Substack = kenhuangus.substack.com · 可能采用 freemium 模式
    • 解释:建议先核对免费 Preview 范围,再决定是否付费解锁关键 Part(Part 4-6 Prefix Caching + Part 9-10 MoE Serving)
    • 建议归入:§1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability 预备 · 警示付费边界
  7. AI Engineer 1000+ JD 数据点§IX 73 AI Agents Stack 2026 Edition 6 层 是同源预备(来自 Alexey Grigorev / Valeriia Kuka)or 不同预备需核验:

    • 两者均来自 Substack 平台
    • 解释:建议核验 Alexey On Data 与 The AI Engineer 是否同源(如 Alexey Grigorev 同时是 The AI Engineer 撰稿人)
    • 建议归入:§1.(12) (v) Harness Reliability 预备 · 核验同源信号
  8. arXiv:2601.19139 Apple Silicon 四路对比(2026-01)§IX 76 SGLang Apple Silicon MLX 后端修复 (#37035, 2026-08-31) 时间间隔 7 个月:

    • 2026-01 的"MLX 框架限制"评估可能已过时(MLX 在 2026 H1 持续演进)
    • 解释:建议核验 MLX 在 2026 H2 的新进展
    • 建议归入:§1.(1) 推理引擎 Apple Silicon 预备 · 核验 2026 H2 MLX 对照
  9. State of Model Serving Communities Oct 2025(S3 · jay 8-31 morning)April 2026(S2) 间隔 6 个月:

    • 两份 InferenceOps 报告是同一作者的不同时间点快照
    • 解释:建议作为"模型服务社区 2025 H2 → 2026 H1 演进时间线"预备合并锚入
    • 建议归入:§1.(2) 推理调度 K8s 生态预备 · 时间线合并
  10. arXiv:2605.01280 "LLM Serving Needs Mathematical Optimization, Not Heuristics"(jay 8-31 1450 提到) 立标信号弱:

    • 位置论文 · 指出 vLLM/SGLang 核心算法(JSQ/FIFO/LRU)仍是通用策略
    • 警示:建议核验 S2 被引 / 影响力被引数据点(如立标信号弱,建议作为预备候选状态)
    • 建议归入:§1.(2) 推理调度预备 · arXiv:2605.01280 维持候选预备状态
  11. Senior LLM Inference Engineer Interview(aiengineeringinsider.substack.com) 是面试知识体系整理(jay 8-31 inference-engineering-benchmarks §五):

    • 来源是 Substack 平台 · 可能是付费或半付费内容
    • 解释:建议核验该 Substack 的内容深度与付费边界
    • 建议归入:§1.(12) (v) Harness Reliability 预备 · 警示付费边界
  12. CSDN DP=8 + EP=8 混合并行原理(xzpdxz) 立标信号未明:

    • "CSDN 唯一深度解析 EP + DP 混合并行的文章"论断需核验(可能存在更早的 EP 深度解析文章)
    • 解释:建议核验其他 EP 深度解析 CSDN 文章(如 m0_74825634 系列是否已覆盖)
    • 建议归入:§1.(1) 推理引擎 MoE 预备 · 警示"唯一"论断

四、可引用的 arXiv 号列表(10 件 · §IX 76 evening 棒位预备 + §IX 77 morning 棒位预备)

主轴 NET-new 候选预备(5 件 · §IX 76 evening 棒位预备)

  1. arXiv:2607.09172 — Attention to Detail: vLLM Configuration Trade-offs(vLLM 0.10.2 · 5 模型族 × 5 数据集 · INT8/FP8 量化 · 配置交互效应)· §1.(3) KV Cache 综述 + §1.(1) 推理引擎配置优化
  2. arXiv:2605.29639 — RTP-LLM: Alibaba High-Performance LLM Inference Engine(W4A8KV4 量化 memory footprint 减半 + 多模态支持)· §1.(1) 推理引擎 + §1.(3) KV Cache 量化
  3. arXiv:2606.07362 — vLLM Internal Principles: torch.compile + 4-Step Startup Flow(v0.7.0+ 里程碑 · Dynamo Bytecode Transformation + Loading/Storing Compiled Graphs)· §1.(1) 推理引擎 · ⚠️ §IX 76 evening 棒位预备是否纳入需精读核验
  4. arXiv:2601.20408 — OptiKIT: eBay Enterprise LLM Auto-Optimization(H100 · 3 种 workload 配置 · TPE 优化 30 trials · 联合调优 max_num_seqs / max_num_batched_tokens / tensor_parallel_size)· §1.(1) 推理引擎配置优化 + §1.(12) (v) Harness Reliability
  5. arXiv:2601.19139 — Native LLM/MLLM Inference on Apple Silicon(llama.cpp / PyTorch MPS / vLLM-metal / MLX 四路对比 · Metal kernels + GGUF 量化 + continuous batching 缺位)· §1.(1) 推理引擎 Apple Silicon

邻接级补强(5 件 · §IX 77 morning 棒位预备)

  1. arXiv:2605.01280 — LLM Serving Needs Mathematical Optimization, Not Heuristics(位置论文 · 指出 vLLM/SGLang 核心算法仍是通用策略 · 沿用 jay 8-31 1450 §三 归档线索)· §1.(2) 推理调度
  2. arXiv:2606.18431 — UniBoost: Tail-Latency-Aware Scheduling for LLM Serving(沿用 §IX 76 morning 锚入 · 软连续优先级塑形 + KV-Cost 感知抢占式驱逐联合设计)· §1.(2) 推理调度
  3. arXiv:2603.20397 — KV Cache Optimization Strategies Dell Technologies 工业综述(沿用 §IX 76 morning 锚入 · 五大方向 + Llama-2-7B FP16 ≈ 0.5 MiB/token)· §1.(3) KV Cache 综述
  4. arXiv:2510.09665 — Efficient KV Cache Layer for Enterprise LLM Inference(沿用 §IX 76 morning 锚入 · vLLM page size 16 tokens/layer + 2026 开源分布式推理栈对比)· §1.(3) KV Cache 综述
  5. arXiv:2506.09713 — A First Look at Bugs in LLM Inference Engines(沿用 §IX 76 morning 锚入 · vLLM/DeepSpeed/TRT-LLM 首个系统性 bug 分类)· §1.(1) 推理引擎排障 + §1.(3) KV Cache 综述

工程级补强(非 arXiv,但 URL 集合预备扩增)

  • https://blog.csdn.net/m0_69378371/article/details/158455491(PagedAttention CUDA Kernel 底层实现)
  • https://blog.csdn.net/u011091936/article/details/150429518(SGLang RadixAttention 基数树)
  • https://blog.csdn.net/u011576070/article/details/146889758(SGLang KVCache 篇姊妹篇)
  • https://blog.csdn.net/BytePulse/article/details/161257042(MoE 推理加速全栈优化)
  • https://blog.csdn.net/weixin_30467861/article/details/162184820(DeepSeek MoE 同步税)
  • https://blog.csdn.net/smallym1/article/details/163407419(vLLM vs SGLang vs TensorRT-LLM 2026 选型)
  • https://kenhuangus.substack.com/p/announcing-the-10-part-series-the(Physics & Engineering of Frontier LLM Inference 10-Part 系列)
  • https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93(State of Model Serving Apr 2026)
  • https://inferenceops.substack.com/p/state-of-the-model-serving-communities-269(State of Model Serving Oct 2025)
  • https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition(AI Agents Stack 2026 Edition)
  • https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal(AI Engineer 1000+ JD 分析)
  • https://llm-academy.dev/inference/vllm-vs-sglang(vLLM vs SGLang vs TGI 2026 Benchmark)
  • https://github.com/sgl-project/sglang/pull/34602(SGLang dense KV views for MHA/SWA)
  • https://github.com/sgl-project/sglang/pull/37094(SGLang 共享 streaming session slot)
  • https://github.com/sgl-project/sglang/pull/37035(SGLang MLX 后端修复)
  • https://arxiv.org/html/2607.09172v2(vLLM 配置权衡 v2)
  • https://arxiv.org/html/2605.29639v1(RTP-LLM v1)
  • https://arxiv.org/html/2606.07362v1(vLLM Internal Principles v1)
  • https://arxiv.org/html/2601.20408v2(OptiKIT eBay v2)
  • https://ar5iv.labs.arxiv.org/html/2601.19139(Apple Silicon Inference HTML 版)
  • https://arxiv.org/abs/2605.01280(LLM Serving Needs Mathematical Optimization)

五、本棒"§IX 76 evening 棒位预备 + §IX 77 morning 棒位预备"建议清单

5.1 §IX 76 evening 棒位 NET-new 候选预备(5 件主轴)

  1. CSDN PagedAttention CUDA Kernel 底层实现(m0_69378371) → §1.(3) KV Cache 算子层(Block Table + Copy-on-Write + KVCacheLayout + PagedAttention 198.3 vs TGI 38.5 tok/s = 5.15×)
  2. CSDN SGLang RadixAttention 基数树(u011091936 + u011576070) → §1.(3) KV Cache 算子层(vLLM Block Manager vs SGLang RadixTree 物理层 vs 语义层)
  3. State of Model Serving Communities Apr 2026(InferenceOps) → §1.(12) (v) Harness Reliability + §1.(2) 推理调度(KServe v0.17.0 + llm-d + EPP 拆分 + SIG-kv-disaggregation 进展)
  4. The Physics & Engineering of Frontier LLM Inference 10-Part Series(Ken Huang) → §1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability(Prefill-Decode + Prefix Caching + KV 量化 + MoE Serving + 结构化输出五维)
  5. AI Agents Stack 2026 Edition + OWASP MCP Top 10 + 1000+ AI Engineer JD 分析 → §1.(12) (v) Harness Reliability + §1.(12) (vi) Agent Security(6 层 + 评估基础设施三层 + Ragas+Phoenix+Langfuse 评估工具栈)

5.2 §IX 77 morning 棒位 NET-new 候选预备(3 件主轴)

  1. arXiv:2607.09172 vLLM Configuration Trade-offs → §1.(3) KV Cache 综述 + §1.(1) 推理引擎配置优化(v0.10.2 × 5 模型族 × 5 数据集 × INT8/FP8 量化 × 配置交互效应)
  2. arXiv:2605.29639 RTP-LLM Alibaba → §1.(1) 推理引擎 + §1.(3) KV Cache 量化(W4A8KV4 量化 memory footprint 减半 + Decode Phase 内存带宽压力缓解)
  3. arXiv:2601.19139 Native LLM/MLLM Inference on Apple Silicon → §1.(1) 推理引擎 Apple Silicon(llama.cpp / PyTorch MPS / vLLM-metal / MLX 四路对比)

5.3 邻接级补强候选预备(2 件)

  1. arXiv:2606.07362 vLLM Internal Principles torch.compile + 4-Step Startup Flow → §1.(1) 推理引擎(vLLM 内部原理学术解释)
  2. arXiv:2601.20408 OptiKIT eBay Enterprise LLM Auto-Optimization → §1.(1) 推理引擎配置优化 + §1.(12) (v) Harness Reliability(H100 + 3 种 workload + TPE 优化 + 联合调优 max_num_seqs / max_num_batched_tokens / tensor_parallel_size)

5.4 工程实践补强候选预备(4 件)

  • MoE 同步税 30%/15% 数据点(CSDN weixin_30467861 · 8-GPU 30% / 单 GPU 15%)→ §1.(1) 推理引擎 MoE · 与 §IX 75 v0.28.0 DeepSeek-V4 sparse MLA + sequence parallelism (#46789) + ~2× kernel + 3.4% E2E TTFT 协同预备
  • CSDN DP=8 + EP=8 混合并行原理(xzpdxz) → §1.(1) 推理引擎 MoE · 与 §IX 76 SGLang Unified Radix Cache 重构论 + v0.28.0 DeepSeek-V4 sparse MLA 协同预备
  • vLLM v0.18 超深度系统级架构分析(zhonglinzhang) → §1.(1) 推理引擎 · 与 §IX 76 v0.28.0 五大主线(v0.18 → v0.27.1 → v0.28 演进时间线)预备
  • vLLM 生产环境部署血泪史 10 大坑(2401_84494441) → §1.(12) (iv) Service Concurrency Safety · 与 §IX 73 arXiv:2506.09713 Bugs in LLM Inference Engines 协同预备

5.5 警示消化预备(12 件矛盾 + 待核实说法,详见 §三)


六、检查过的来源清单(汇总)

已检查 / 已纳入

  • organized/knowledge/llm-infra.md §IX 76 morning(2026-08-31 16:45 morning · 8 件 NET-new 锚入 + arXiv 228 + URL 290 四集合校验闭合)
  • organized/topic_pages/llm-infra.md(主索引 · 320 行)
  • work-queue.md(2026-08-31 18:00 自动生成 · 视图干净)
  • inbox/spark/2026-08-30-llm-infra-e1prep.md(8-30 18:40 · 56 KB · §IX 72 evening 棒位预备 + 7 条主增量)
  • inbox/spark/2026-08-31-agent-e1prep.md(8-31 13:38 · 39 KB · v70/v71 主轴协调棒预备 · llm-infra 邻接级 0 件主增量)

inbox/jay(11 份): - ✅ inbox/jay/2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(8-30 早场 · 已锚入 §IX 72) - ✅ inbox/jay/2026-08-30T1130-jay-engineering-filter.md(DFlash 2 + SGLang v0.6 + NVFP4 · 已锚入 §IX 72) - ✅ inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(四引擎横评 + 500+ 全景图 + 10 向量库 · 已锚入 §IX 72) - ✅ inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md8-30 傍晚关键源 · 9 件 afternoon NET-new 预备 · 已锚入 §IX 73 evening) - ✅ inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md(KubeCon + GKE AI Zones + TPU Subslicing · 已锚入 §IX 72) - ✅ inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md8-31 早场本棒关键源 · PagedAttention CUDA Kernel + SGLang RadixAttention + DeepSeek MoE 同步税 + Ken Huang 10-Part + State of Model Serving Apr 2026 = 11 件 NET-new 候选预备) - ✅ inbox/jay/2026-08-31T0940-jay-morning-inference-llm-systems.md(vLLM v0.28.0 详报 + Sliding-window + SGLang SWA + browser-use + SGLang PR #34602/37094/37035 + llama.cpp = 7 件 8-31 morning 主增量 · 3 件已锚入 §IX 76 morning) - ✅ inbox/jay/2026-08-31T1235-jay-csdn-vllm-torchcompile-ollama-source-highvalue.md(vLLM 源码解析系列 + DP=8 + EP=8 + torch.compile + Ollama + LangChain + LangGraph 1.0 = 7 件 8-31 noon 主增量) - ✅ inbox/jay/2026-08-31T1450-jay-afternoon-inference-scheduling-llmops-agentic.md8-31 下午本棒关键源 · UniBoost + KV Cache 综述 + 引擎横评 + AI Agents Stack 2026 + AI Engineer JD 分析 = 6 件 8-31 afternoon 主增量 · 3 件已锚入 §IX 76 morning) - ✅ inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md8-31 傍晚本棒关键源 · DATABASE 3 + BACKEND 8 + CLOUD-NATIVE 2 + CSDN 7 + REPRODUCTION 6 + Substack 5 = 31 件五分类整理 · llm-infra 主轴 14 件预备 · arXiv:2607.09172 + arXiv:2605.29639 + arXiv:2606.07362 + arXiv:2601.20408 + arXiv:2601.19139 + arXiv:2605.01280 均首次出现) - ✅ inbox/jay/2026-08-31T1620-jay-csdn-highvalue-inference-rag-deepseek.md(vLLM 战略级部署 + 性能瓶颈分析 + 部署血泪史 + v0.18 超深度架构 + RAG 2026 + DeepSeek-V2/V3 + K8s AIOps = 9 件 8-31 下午 CSDN 主增量) - ✅ inbox/jay/2026-08-31-inference-engineering-benchmarks.md8-31 工程实践本棒关键源 · vLLM vs SGLang vs TGI + Particula + AIMultiple + State of Model Serving Apr 2026 + Senior LLM Inference Interview + arXiv:2506.09713 + arXiv:2607.09172 + arXiv:2601.20408 + arXiv:2510.09665 + arXiv:2605.29639 + arXiv:2601.19139 + arXiv:2606.07362 = 12 件 8-31 工程实践主增量 · 2 件已锚入 §IX 76 morning + 10 件 NET-new 候选预备) - ✅ inbox/jay/2026-08-31-engineering-e1prep.md(jay engineering E1 8-31 morning 棒位 · 6 条高质量条目 · v0.28.0 + Sliding-window + SGLang SWA + Prefix Sliding + MoE 同步税 + Ken Huang 10 Part = 6 件 8-31 morning 主增量 · 3 件已锚入 §IX 76 morning)

inbox/tom(8 份): - ✅ inbox/tom/2026-08-30-inference-e1prep.md(8-30 06:10 → 22:20 · 16h 窗口 · 6 条主线索 · 已锚入 §IX 72) - ✅ inbox/tom/2026-08-31-inference-e1prep.md(8-31 morning 棒位 · llm-infra 主轴 + 邻接) - ✅ inbox/tom/2026-08-31-0900-hf-daily-2026-08-31.md(15 件候选 · multimodal 主轴 4 件 · llm-infra 邻接级 4 件) - ✅ inbox/tom/2026-08-31-evaluation-e1prep.md(evaluation 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/tom/2026-08-31-rag-e1prep.md(RAG 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/tom/2026-08-31T0840-agent-rag-longcontext-radar.md(8 件候选 · 4 件与 llm-infra 主轴邻接 = PILOT + CritICL + Luce + Inspect Evals Census) - ✅ inbox/tom/2026-08-31T1440-agent-rag-longcontext-radar.md(8 件候选 · llm-infra 主轴 0 件主增量) - ✅ inbox/tom/2026-08-31_agents-lite.md(8 候选 4 高价值 + 1 Substack = stephen noon 棒位数据源同源)

inbox/flyp(10 份): - ✅ inbox/flyp/2026-08-30-multimodal-e1prep.md(multimodal 主轴 11 件预备 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-30-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-multimodal-e1prep.md(multimodal 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-0950-VGI-Bench-visual-intelligence-video-generation-critical-read.md(VGI-Bench · multimodal 主轴 · llm-infra 邻接) - ✅ inbox/flyp/2026-08-31-1550-PAWBench-probabilistically-aligned-world-model-critical-read.md(PAWBench · world model 主轴 · llm-infra 邻接) - ✅ inbox/flyp/2026-08-31-1000-rss-cameron-wolfe.md(RSS · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-1002-rss-interconnects.md(RSS · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-1003-rss-yt-two-minute-papers.md(RSS · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-1004-rss-yt-ai-explained.md(RSS · llm-infra 邻接级 0 件)

inbox/stephen(4 份): - ✅ inbox/stephen/2026-08-30-ai-industry-e1prep.md(ai-industry 主轴 · 0 件 llm-infra 主轴净增) - ✅ inbox/stephen/2026-08-30-1245-stephen-coordination-check-noon.md(8-30 noon 协调棒 · 簇 8 = 已锚入 §IX 72) - ✅ inbox/stephen/2026-08-30-2245-stephen-coordination-check-evening.md(8-30 evening 协调棒 · 已锚入 §IX 72) - ✅ inbox/stephen/2026-08-31-1245-stephen-coordination-check-noon.md(8-31 noon 协调棒 · llm-infra 主轴多实例 5 时间点 = 已锚入 §IX 76 morning)

inbox/spark(6 份): - ✅ inbox/spark/2026-08-30-1000-rss-gradient-flow.md(5 篇 · HBF 沿用 §IX 72 Hot Chips HBF 三源闭合) - ✅ inbox/spark/2026-08-30-1001-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴) - ✅ inbox/spark/2026-08-30-1003-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴) - ✅ inbox/spark/2026-08-31-1001-rss-gradient-flow.md(5 篇 · llm-infra 主轴 0 件主增量) - ✅ inbox/spark/2026-08-31-1002-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴) - ✅ inbox/spark/2026-08-31-1004-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)

paper_cards(3 件 llm-infra 主分类 + 1 件 agent + 1 件 engineering 邻接级): - ✅ paper_cards/1117-2608-26070.md Prefix Sliding(8-28 入库 · 已锚入 §IX 60) - ✅ paper_cards/1129-2608-27455.md CritICL(8-29 入库 · 8-30 NET-new 主增量) - ✅ paper_cards/1133-2608-19269.md Inspect Evals Census(8-29 入库 · 8-30 NET-new 主增量) - ✅ paper_cards/1121-2608-26530.md PILOT in the Loop(8-28 入库 · 8-30 邻接级补强 · agent 主分类) - ✅ paper_cards/1120-2608-27448.md TTPO(8-31 morning 邻接级补强 · engineering 主分类

organized(2 件): - ✅ organized/topic_pages/llm-infra.md(主索引 · 320 行) - ✅ organized/knowledge/llm-infra.md(活文档 · 471 行 · §IX 76 morning 已锚入全部 24h 内 llm-infra 主轴)

已检查 / 未纳入(不重复)

  • inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md §⑦ AI Agent 框架核心模块技术报告(agent 主轴 · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-31T1235-jay-csdn-vllm-torchcompile-ollama-source-highvalue.md LangChain + bge-m3 + Chroma + Gradio 本地 RAG(RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-31T1450-jay-afternoon-inference-scheduling-llmops-agentic.md §一⑥ Agentic RAG 生产失败模式(RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-31T1620-jay-csdn-highvalue-inference-rag-deepseek.md RAG 2026 实战指南(RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-31-inference-engineering-benchmarks.md §五 Senior LLM Inference Engineer Interview(已纳入本棒警示 #11

七、本棒小结

8-30 18:40 → 8-31 18:40 llm-infra 主轴净增量 = 8 条主增量 + 4 件工程实践补强

主轴 NET-new 候选预备(5 件 · §IX 76 evening 棒位预备): 1. CSDN PagedAttention CUDA Kernel 底层实现(m0_69378371) → §1.(3) KV Cache 算子层(Block Table + Copy-on-Write + KVCacheLayout + PagedAttention 198.3 vs TGI 38.5 tok/s = 5.15×) 2. CSDN SGLang RadixAttention 基数树(u011091936 + u011576070) → §1.(3) KV Cache 算子层(vLLM Block Manager vs SGLang RadixTree 物理层 vs 语义层) 3. State of Model Serving Communities Apr 2026(InferenceOps) → §1.(12) (v) Harness Reliability + §1.(2) 推理调度(KServe v0.17.0 + llm-d + EPP 拆分 + SIG-kv-disaggregation 进展) 4. The Physics & Engineering of Frontier LLM Inference 10-Part Series(Ken Huang) → §1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability(Prefill-Decode + Prefix Caching + KV 量化 + MoE Serving + 结构化输出五维) 5. AI Agents Stack 2026 Edition + OWASP MCP Top 10 + 1000+ AI Engineer JD 分析 → §1.(12) (v) Harness Reliability + §1.(12) (vi) Agent Security(6 层 + 评估基础设施三层 + Ragas+Phoenix+Langfuse 评估工具栈)

主轴 NET-new 候选预备(3 件 · §IX 77 morning 棒位预备): 6. arXiv:2607.09172 vLLM Configuration Trade-offs → §1.(3) KV Cache 综述 + §1.(1) 推理引擎配置优化 7. arXiv:2605.29639 RTP-LLM Alibaba → §1.(1) 推理引擎 + §1.(3) KV Cache 量化 8. arXiv:2601.19139 Native LLM/MLLM Inference on Apple Silicon → §1.(1) 推理引擎 Apple Silicon

邻接级补强候选预备(2 件 · §IX 77 morning 棒位预备): 9. arXiv:2606.07362 vLLM Internal Principles torch.compile + 4-Step Startup Flow → §1.(1) 推理引擎 10. arXiv:2601.20408 OptiKIT eBay Enterprise LLM Auto-Optimization → §1.(1) 推理引擎配置优化 + §1.(12) (v) Harness Reliability

工程实践补强候选预备(4 件): - MoE 同步税 30%/15% 数据点(CSDN weixin_30467861) - CSDN DP=8 + EP=8 混合并行原理(xzpdxz) - vLLM v0.18 超深度系统级架构分析(zhonglinzhang) - vLLM 生产环境部署血泪史 10 大坑(2401_84494441)

§IX 76 evening 棒位预备建议:本棒 8 条主增量 + 4 件工程实践补强 = §IX 76 evening 棒位(2026-08-31 evening cron · 8-31 evening 落定)预备锚入候选 5 件 + §IX 77 morning 棒位(2026-09-01 morning)预备锚入候选 3 件 + §IX 77 morning 棒位预备锚入候选 2 件 = §IX 76 evening + §IX 77 morning 棒位预备净增 10 件候选预备

与 §IX 76 morning 棒位对照: - §IX 76 morning = 8-31 morning 棒位(2026-08-31 16:45 已立基础延展 + 8 件 NET-new 锚入:vLLM v0.28.0 五联 + SGLang Unified Radix Cache 重构论 + 性能数字 + 引擎横评精读 + KV Cache 五大方向综述 + UniBoost 调度 + arXiv:2510.09665 + arXiv:2506.09713 + Particula + arXiv 225 → 228 + URL 282 → 290 件四集合校验闭合) - §IX 76 evening 棒位预备 = 本棒 5 条 evening NET-new 候选预备 + §IX 77 morning 棒位预备 = 3 件 morning NET-new + 2 件邻接级 = §IX 76 evening + §IX 77 morning 棒位预备净增 10 件候选预备

立标等级分布: - ⭐⭐⭐⭐ = 1 件(CSDN PagedAttention CUDA Kernel 底层实现 · PagedAttention 198.3 vs TGI 38.5 tok/s = 5.15× 数据点) - ⭐⭐⭐ = 7 件(CSDN SGLang RadixAttention 基数树 + arXiv:2607.09172 + arXiv:2605.29639 RTP-LLM + arXiv:2601.19139 Apple Silicon + State of Model Serving Apr 2026 + Ken Huang 10-Part 系列 + AI Agents Stack 2026 + 1000+ AI Engineer JD 分析)

涉及 arXiv 号净增 5 件主轴预备 + 2 件邻接级预备(10 件预备): - 主轴预备 5 件 = arXiv:2607.09172 + arXiv:2605.29639 + arXiv:2601.19139 + arXiv:2606.07362 + arXiv:2601.20408 - 邻接级 2 件 = arXiv:2605.01280 + 5 件已在 §IX 76 morning 锚入的沿用(arXiv:2606.18431 + arXiv:2603.20397 + arXiv:2510.09665 + arXiv:2506.09713 + 8 件中其他预备)

警示消化预备(12 件矛盾 + 待核实说法):详见 §三


spark · 2026-08-31 18:40 · 本棒检查 50+ 来源(inbox jay 12 件 + tom 8 件 + flyp 10 件 + stephen 4 件 + spark 6 件 + paper_cards 5 件 + organized 2 件 + work-queue 1 件) · 主轴 NET-new 5 件 evening 预备 + 主轴 NET-new 3 件 morning 预备 + 邻接级 2 件 + 工程实践补强 4 件 + 警示消化 12 件 = 26 件预备总览 · §IX 76 evening 棒位预备净增 5 件候选预备 + §IX 77 morning 棒位预备净增 5 件候选预备