inference · E1 预消化简报(2026-08-20)

执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-19 22:20 → 2026-08-20 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(2026-08-20 版 · vLLM 0.27+DFlash+MRV2/SGLang v0.6/ThoughtBeamSearch/LazyAttn/Maglev/FreeToken/OpScale/vToken/Albireo/SGLang vs vLLM +29%/Qwen3.8 27B/ICML26 22.3%/AI Agents Stack2026六层+MCP stateless+Dynamo/The Silent Hyperparameter/AIConfigurator/Inference Engineering Benchmarks) 本棒性质: inference 主题 E1 日间预消化轮(24h 窗口);承接 8-19 E1 棒(5条+4邻接)之后,专注 8-19→8-20 新增;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考


状态

  • 增量条数: 7 条主线(含 3 条首度锚入;邻接 4 条)
  • 显著新增: 有——CoRun 确定性推理调度首度锚入 + DASH/HBF Sucks KV Cache 新层首度锚入 + SGLang CUDA Graph 生产建议新增;整体密度中等偏高
  • 本棒说明: Aug 19→20 窗口 inference 核心增量来自 jay 全天主力棒(engineering-e1prep/engineering-filter/csdn-inference-oom-benchmark-commands/inference-vecdb-harness-substack);spark llm-infra-e1prep 主轴 7 件贡献了 CoRun/DASH/HBF Sucks 三件核心 inference 件;paper_cards 近 3 天新卡中 inference 相关度最高的是 1029-2608-13558(Engineering Trace)、102-2608-14929(LM Lineage Verification,engineering)和 2608-14376 批次(已在 jay/spark 材料中锚定)。本棒聚焦 inference 专属新发现。
  • 涉及 arXiv 号: 3 件净增(2608.14376 CoRun/2608.14333 DASH/2608.11668 HBF Sucks);沿用 15+ 件(2605.19537 The Silent Hyperparameter/2601.06288 AIConfigurator/2607.08028 Harness Engineering/2603.09619 Context Engineering/2606.01927 Albireo/2608.08020 ThoughtBeamSearch/2608.13499 OpScale/2608.13263 vToken/2608.02870 Maglev/2608.16157 FreeToken/2608.14465 YOPO/2608.09867 StealingRT 等)

一、最重要的 7 条增量


增量 1【推理调度 · §1.3】🔴 CoRun(arXiv:2608.14376):Continuous Batching 形状固定·确定性推理调度——15-324% 吞吐 + bit-identical 输出 ★★★

来源: inbox/jay/2026-08-20-engineering-e1prep.md(增量2) + inbox/jay/2026-08-20T1055-jay-engineering-filter.md(条目3) + inbox/spark/2026-08-20-llm-infra-e1prep.md(增量2) URL: https://arxiv.org/abs/2608.14376 arXiv: 2608.14376(cs.LG · 2026-08 · Continuous Batching 确定性调度)

要点: - 核心问题: Continuous batching → 不同长度请求混合 → CUDA Graph 形状不固定(vLLM 和 SGLang 共同技术债) → 无法有效利用 graph replay 加速 - CoRun 解法: ① Prefill 隔离每个请求自然形状;② Decode pad 到最大并发,生成固定形状 CUDA Graph;③ 固定形状 graph 可 replay,保持高吞吐 - 关键数据: 吞吐量提升 15–324%(所有模型均超过 2×),输出 bit-identical(确定性) - 评测模型: Qwen3-235B-A22B、DeepSeek-V3、Hy3 - 涉及技术: Split-KV decode 禁用、deterministic collectives 实现 - 工程意义: 这是对 vLLM 和 SGLang 共同技术债的学术解法,若被采纳整合,生产级 continuous batching 效率可进一步提升;bit-identical 输出直接解决 engine-level 可复现性问题

警示: - 15–324% 吞吐量数字来自论文自身评测,评测环境(硬件/模型/batch size)细节需 PDF 核验 - GitHub 是否已开源(截至 2026-08-20)状态需确认;若未开源,工程价值打折扣 - 具体场景下哪种模型提升幅度最大需 PDF 核验

与活文档现有脉络的关系: - inference.md 8-20 版 §1.3 KV Cache 管理暂无 CoRun 方向;本棒 = 推理调度层首度锚入(continuous batching 形状固定 → 确定性推理 → bit-identical 输出) - 与 8-19 版 The Silent Hyperparameter(2605.19537,后端级可复现性)形成纵向深化:两者都是可复现性问题,CoRun 是 batching 层面的工程解法(The Silent Hyperparameter 是量化问题,CoRun 是解决方案) - 与 8-19 版 SGLang Advanced CUDA Graph(LMSYS Blog)形成横向互补:两者都针对 CUDA Graph 形状问题,CUDA Graph 指南是"如何配置",CoRun 是"如何从调度层面根本解决"

建议归入节: §1.3 KV Cache 管理新增 CoRun 子节(continuous batching 形状固定 → 15-324% 吞吐 + bit-identical + Qwen3-235B-A22B/DeepSeek-V3/Hy3 评测);§1.3 与 The Silent Hyperparameter 形成"问题→量化→解法"三层结构标注


增量 2【KV Cache 新层 · §1.3】🔴 DASH(arXiv:2608.14333):HBM+Flash KV Cache 两级管理 for MoE——Llama 4 Maverick 1.92× 吞吐 + 48% 延迟降低 ★★★

来源: inbox/jay/2026-08-20-engineering-e1prep.md(增量3) + inbox/jay/2026-08-20T1055-jay-engineering-filter.md(条目4) + inbox/spark/2026-08-20-llm-infra-e1prep.md(增量3) URL: https://arxiv.org/abs/2608.14333 arXiv: 2608.14333(cs.LG · 2026-08 · KV Cache 两级管理)

要点: - 核心问题: MoE LLM KV cache 容量超 HBM(Llama 4 Maverick KV cache 197.41 GB,超过单卡 HBM)→ 部署瓶颈 - DASH 解法: HBM+Flash 两级管理 - HBM:吸收细粒度写入(production 时序排序) - Flash:批量写回(HBF writeback 策略,page-padding factor=1.0 for prefill writes) - KV write scheduling:按 production 和 reuse 时序排序 - 关键数据: Llama 4 Maverick(KV cache 197.41 GB)上,DASH 比 RelayOnly 提升 1.92× 吞吐量,降低 E2E 延迟 48% - HBF endurance 建模: 0.645 年连续活动投影,page-padding factor=1.0 - 工程意义: HBF 作为 KV-cache 分层缓冲层而非替代层;与 vToken/Maglev/FreeToken(GPU 侧优化)互补,扩展到 GPU+HBM+Flash 三级

警示: - HBF endurance 0.645 年是连续满载写入极端情况,实际生产 endurance 需结合具体使用模式估算 - 197.41 GB KV cache 数字来自 Llama 4 Maverick;其他 MoE 模型 KV cache 容量需分别测算 - 1.92× / 48% 数字来自论文自身评测,需 PDF 核验评测条件

与活文档现有脉络的关系: - inference.md 8-20 版 §1.3 KV Cache 管理已有 vToken/Maglev/FreeToken/KV Cache Transform Coding/Nexus/ICMSP/NIXL 等路线;本棒 = KV Cache 第 19 条路线候选(HBF 两级管理) - 与 8-19 版 DFlash(生产局限:高并发时慢于基线)形成对比:DFlash 解决 prefill 加速,DASH 解决 KV cache 溢出问题——两者解决不同瓶颈 - 与 inference.md §1.3 的 ICMSP/NIXL(跨节点 KV 传输)形成纵向:ICMSP/NIXL 解决 GPU↔GPU 跨节点,DASH 解决 GPU↔Flash 单节点溢出

建议归入节: §1.3 KV Cache 管理新增 DASH 子节(HBM+Flash 两级 KV cache + Llama 4 Maverick 1.92× 吞吐 + 48% 延迟降低 + 197.41 GB KV 容量警示);与 vToken/Maglev/FreeToken 标注为"GPU 侧优化路线",DASH 标注为"GPU+HBM+Flash 三级路线"


增量 3【KV Cache 新层 · §1.3】🔴 HBF Sucks(arXiv:2608.11668v2):HBF 全栈表征 for KV-Centric LLM Serving——GPU HBM/HBF 带宽差异对 decode vs prefill 延迟影响 ★★★

来源: inbox/jay/2026-08-20T1055-jay-engineering-filter.md(条目5) + inbox/spark/2026-08-20-llm-infra-e1prep.md(增量4) URL: https://arxiv.org/abs/2608.11668 arXiv: 2608.11668v2(cs.LG · 2026-08 · HBF 全栈表征)

要点: - 核心内容: 系统性分析 HBF(High-Bandwidth Flash)用于 KV cache 的全栈特性;对比 GPU HBM / HBF 带宽差异对 decode vs prefill 延迟的影响 - 覆盖内容: decode vs prefill 延迟分离建模、KV cache 容量限制历史综述(SOTA paged allocation、quantization 均无法突破容量上限) - 相关工作: LMCache、Tutti(HBF-backed KV cache) - 工程意义: 与 DASH(增量2)互补——DASH 是 HBF 写入侧策略,HBF Sucks 是 HBF 通用全栈特性研究;两者共同构成"HBF KV cache 路线"的双锚点

警示: - HBF Sucks 与 DASH 是否同一作者团队/是否互为引文需 PDF 核验,避免重复归入 - 具体带宽数字和延迟建模参数需 PDF 核验

与活文档现有脉络的关系: - 与增量 2 DASH 互为表里:DASH = HBF 写入侧,HBF Sucks = HBF 读取/全栈侧 - inference.md 8-20 版 §1.3 已有 KV Cache Transform Coding(ICLR 2026)、Queueing-Theoretic Framework(ICML 2026)等;本棒 = HBF 路线第 2 个锚点(与 DASH 并列,均为 HBF KV cache 方向) - 与 §1.3 的 Memory-Centric CXL+PIM 路线形成介质级对照:两者都关注 GPU 内存之外的存储介质,但介质不同(Flash vs CXL/PIM)

建议归入节: §1.3 KV Cache 管理 HBF 路线双锚点(DASH + HBF Sucks 并列);标注 DASH=写入侧策略,HBF Sucks=全栈特性研究;避免重复归入,建议以 DASH 为主要锚点,HBF Sucks 为补强引用


增量 4【推理引擎生产调优 · §1.1】🟠 SGLang Advanced CUDA Graph(LMSYS Blog 2026-08-17):breakable/tc_piecewise vs full 生产建议——prefill graph 构建 3.8-5.2× 加速 ★★

来源: inbox/jay/2026-08-20T1055-jay-engineering-filter.md(条目1) + inbox/jay/2026-08-20-engineering-e1prep.md(增量1) + inbox/spark/2026-08-20-llm-infra-e1prep.md(增量1) URL: https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph arXiv: 无(LMSYS/SGLang 官方工程博客)

要点: - 三种 CUDA Graph 后端对比: - full:捕获整个 prefill 为单个 CUDA Graph,实验性,仅 FA4/FlashInfer 后端支持 - breakable:分段捕获,可动态处理变长序列,生产推荐 - tc_piecewise(torch.compile):最小代码量(177 行 vs 521 行),生产推荐 - 关键性能数据: - prefill graph 构建速度:breakable / tc_piecewisefull3.8–5.2× - 代码量减少 75%:full 521 行 → breakable/tc_piecewise 177 行 - memory reuse:CUDA Graph 静态 buffer 机制与 GPU 内存复用关系 - 生产建议: breakabletc_piecewise 用于生产,full 仅实验性 - 关键引述: "Full prefill capture is still an experimental feature. The engine warns that full is experimental and points to breakable or tc_piecewise for production workloads"

警示: - 官方未给出在哪些具体 workload 下 full 仍优于 breakable/tc_piecewise 的边界条件 - 与 vLLM V1 引擎架构 + DSpark 推测解码(block size=7)的协同性需综合判定

与活文档现有脉络的关系: - inference.md 8-20 版 §1.1 已有 SGLang v0.6 + DFlash + Spec V2 + DSpark;本棒 = SGLang 生产调优新增(CUDA Graph 配置选择是 v0.6 生产部署的关键细节) - 与 8-19 版 CoRun(本棒增量1)形成纵向:CoRun 解决 batching 层形状问题,SGLang CUDA Graph 解决 graph 配置层问题——两者技术层次不同但目标互补 - 与 8-19 版 DFlash 生产局限(高并发时慢于基线)形成对比:DFlash 是投机解码层,CUDA Graph 是编译优化层——两者是 vLLM/SGLang 的不同优化维度

建议归入节: §1.1 推理引擎新增 SGLang CUDA Graph 生产调优子节(breakable/tc_piecewise vs full 生产建议 + prefill graph 构建 3.8-5.2× 加速 + 代码量 -75%);与 CoRun 形成"调度层+graph配置层"双层优化对照


邻接 A【推理引擎生产基准 · §1.1】🟠 DeployBase + Lyceum 推理引擎实测基准——A100 3,500/2,800/2,500 tok/s + Stripe 73% 成本降低 ★★

来源: inbox/jay/2026-08-20T1425-jay-csdn-inference-oom-benchmark-commands-highvalue.md(条目1+2) + inbox/jay/2026-08-20T1335-jay-inference-vecdb-harness-substack-aug20.md(§推理引擎) URLs: - https://deploybase.ai/articles/best-llm-inference-engine - https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark

要点(整合 DeployBase + Lyceum):

A100 80GB Llama 70B 实测(DeployBase):

引擎 吞吐量 TTFT
vLLM 3,500 tok/s 150-200ms
SGLang 2,800 tok/s ~同vLLM
TGI 2,500 tok/s 150-200ms
llama.cpp(CPU) 20 tok/s

Stripe 案例(Lyceum): 50M 日均 API 调用从 HuggingFace Transformers 迁移 vLLM,推理成本降低 73%,GPU 集群缩减至 1/3

Lyceum 补充数据: - TensorRT-LLM H100 FP8:TTFT ~100ms,输出 >10,000 tok/s - vLLM PagedAttention:相同硬件 batch 能力从 2-5 请求→10-50 请求 - TensorRT-LLM 需要 checkpoint 转换+engine 编译+多层配置,适合专职 ML infra 团队;vLLM 纯 Python,部署周期短

SGLang vs vLLM A10 实测(CSDN):

场景 vLLM SGLang 结论
单轮短文本 280 tok/s,85ms 265 tok/s,92ms vLLM 略优
复杂多步骤(共享前缀) 120 tok/s,350ms 310 tok/s,180ms SGLang 显著优势
结构化输出 JSON 180 tok/s(含后处理) 270 tok/s(原生约束) SGLang 明显优势

警示: - DeployBase 数字来自工程垂直博客,非学术论文;测试条件(batch size/seq_len/temperature)未完整披露 - A100 vs H100 vs A10 硬件代差显著,数字不可跨硬件比较 - Stripe 73% 成本降低来自 Lyceum 引用,原数据来源需核实

与活文档现有脉络的关系: - inference.md 8-20 版 §1.1 已有 H100 基准(SGLang ~16,200/LMDeploy ~16,200/vLLM ~12,500);本棒 = A100 档位实测数据(不同硬件层的独立参考点) - 与 8-19 版 Inference Engineering Benchmarks(Llama-3.1 70B H100 ~2,800-3,400 tok/s)形成硬件分层参考体系:H100/A100/A10 各自有独立参考价值

建议归入节: §1.1 新增推理引擎多硬件档位基准子节(A100:3,500/2,800/2,500 tok/s + H100:~2,800-3,400 tok/s + A10:SGLang 复杂场景显著优于 vLLM);与活文档已有 H100 数字分层标注(不可跨硬件比较)


邻接 B【推理引擎生产命令 · §1.1 + §1.6】🟡 CSDN vLLM/SGLang 实战命令库——OOM 排查 + bench_serving 完整命令 + gpu_memory_utilization 软限制 ★

来源: inbox/jay/2026-08-20T1425-jay-csdn-inference-oom-benchmark-commands-highvalue.md(8 件高价值条目) URLs: 多篇 CSDN 博客(详见来源文件)

要点: - vLLM OOM 数值计算: LLaMA-7B FP16 每 token 约 1.5MB KV;4096 长度序列需约 6GB KV cache - PagedAttention 机制: 每 page=8 tokens KV,非连续分配,页表映射 - gpu_memory_utilization 软限制: 0.7→0.8 反而 OOM(warmup dummy requests 阶段已分配);CUDA graphs 额外 1-3 GiB per GPU - bench_serving 完整命令库: bash # SGLang 后端 python3 -m sglang.bench_serving --backend sglang --dataset-name random --num-prompts 1024 --random-input 1024 --random-output 128 --request-rate 128 --max-concurrency 128 --warmup-requests 16 --base-url http://localhost:30000 # vLLM 后端(含 pd-separated) python3 -m sglang.bench_serving --backend vllm --model Qwen/Qwen3-32B-FP8 --dataset-name random --num-prompts 1024 --random-input 2048 --random-output 512 --max-concurrency 512 --pd-separated --base-url http://localhost:9000 - K8s vLLM OOM 排查命令: kubectl describe pod + journalctl -k + Prometheus 内存告警规则 - 连续批处理实测: 吞吐量提升 5-10×,并发请求数提升 3×

警示: - CSDN 博客数字来自社区实战,非学术论文;部分场景数字可能存在选择性报告 - 命令参数来自汇总,部分参数需对照官方文档核验

与活文档现有脉络的关系: - inference.md 8-20 版 §1.6 推理经济学已有 Spheron vLLM 部署指南 + Jarvis Labs CPU Offloading + GPUYard KV 公式;本棒 = 生产命令库补强(bench_serving 完整命令 + OOM 数值计算) - 与 8-20 版 CoRun(增量1)形成纵向:CoRun 是 batching 算法研究,本棒是生产工程师的实测命令——两者层次互补

建议归入节: §1.6 推理经济学邻接新增 CSDN 实战命令库子节(bench_serving 完整命令 + gpu_memory_utilization 软限制 + OOM 数值计算);标注来源为工程博客,非学术论文


邻接 C【推理可复现性 · §1.13】🟡 ArXiv LLM Serving 形式化优化论文(arXiv:2605.01280)——数学优化而非启发式 ★

来源: inbox/jay/2026-08-20T1950-jay-inference-engineering-rag-eval-mcp-stack-aug20.md(条目6) URL: https://arxiv.org/abs/2605.01280 arXiv: 2605.01280(cs.LG · 形式化优化)

要点: - 核心论点: vLLM、SGLang 等主流推理系统算法核心仍是经典分布式计算通用策略(JSQ 路由/FIFO 调度/LRU KV 缓存驱逐);LLM 推理有独特结构(prefill/decode 分离/KV 缓存模式/可推测解码),通用策略无法充分利用这些结构 - 形式化方法价值: 可提供最坏情况鲁棒性、容量规划 fundamental limits 等通用启发式无法提供的理论保证 - 工程意义: 为推理系统优化提供学术前瞻方向

警示: - arXiv 学术论文,有形式化论证但有无真实系统实验数据支撑需 PDF 核验 - 属于学术前沿方向,工程落地尚远

与活文档现有脉络的关系: - inference.md 8-20 版 §1.13 推理引擎可复现性已有 ICML 2026 22.3% claim-level 可复现失败 + The Silent Hyperparameter(2605.19537);本棒 = 形式化优化方向邻接级(与"可复现性危机"互补——一个关注问题,一个关注解法思路)

建议归入节: §1.13 推理引擎可复现性邻接新增形式化优化方向子节(arXiv:2605.01280:通用策略局限+LLM推理独特结构+形式化方法理论保证);标注为学术前沿,工程落地待验证


二、值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险等级
1 CoRun 15–324% 吞吐量提升可复现性 —— 数字来自论文自身评测,评测环境(硬件/模型/batch size)细节需 PDF 核验 arXiv:2608.14376 🟡 中
2 CoRun GitHub 开源状态 —— 截至 2026-08-20 需确认;若未开源,工程价值打折扣 arXiv:2608.14376 🟡 中
3 DASH HBF endurance 0.645 年建模假设 —— 连续满载写入极端情况;实际生产 endurance 需结合具体使用模式估算 arXiv:2608.14333 🟡 中
4 DASH HBF Sucks 是否同一作者团队/是否互为引文 —— 两者是否独立工作需 PDF 核验,避免重复归入 arXiv:2608.14333 + 2608.11668 🟡 中
5 HBF Sucks 具体带宽数字和延迟建模参数 —— 需 PDF 核验,目前只有"全栈表征"方向性描述 arXiv:2608.11668v2 🟢 低(方向已确认)
6 SGLang CUDA Graph full vs breakable/tc_piecewise 边界条件 —— 官方未给出 full 仍优于 breakable 的具体 workload,需进一步核验 LMSYS Blog 🟡 中
7 DeployBase A100 实测数字跨硬件不可比 —— 测试条件(batch size/seq_len/temperature)未完整披露,Lyceum Stripe 73% 原数据来源需核实 DeployBase + Lyceum 🟡 中
8 ArXiv LLM Serving 形式化优化论文(2605.01280)实验数据 —— 有无真实系统实验数据支撑需 PDF 核验,目前只读到方向性论点 arXiv:2605.01280 🟢 低(方向已确认)
9 SGLang Advanced CUDA Graph 与 vLLM V1 + DSpark 协同性 —— breakable/tc_piecewise 在 DSpark 推测解码(block size=7)场景下是否仍为最优需综合判定 LMSYS Blog + jay/spark 8-20 🟡 中

三、可引用 arXiv 号列表

🆕 本棒净增(3 件):

arXiv 号 论文 主题 状态
2608.14376 CoRun:Deterministic LLM Inference Scheduling continuous batching 形状固定 · 15-324% 吞吐 · bit-identical paper_cards 未建 · 建议本周内建卡(主分类 llm-infra/inference)
2608.14333 DASH:HBM+Flash KV Cache Management for MoE LLM HBM+Flash 两级 KV cache · Llama 4 Maverick 1.92× 吞吐 · 48% 延迟降低 paper_cards 未建 · 建议本周内建卡(主分类 llm-infra)
2608.11668v2 HBF Sucks:KV-Centric LLM Serving 全栈表征 GPU HBM/HBF 带宽差异对 decode vs prefill 延迟影响 paper_cards 未建 · 建议本周内建卡(主分类 llm-infra)

🔄 沿用(15+ 件,8-18/8-19 版已锚入):

arXiv 号 论文 主题 归入活文档节 状态
2605.19537 The Silent Hyperparameter 不同后端生成分布统计显著差异 · engine-level 可复现性危机量化 §1.13 8-19 已锚入
2601.06288 AIConfigurator(NVIDIA 主导) CPU建模30秒跨引擎配置搜索 · Qwen3-32B +40% / DeepSeek-V3 +50% §1.1 8-19 已锚入
2607.08028 Harness Engineering output contract + recovery path + audit trail + 隐私合规 trace §1.13 8-19 已锚入
2603.09619 Context Engineering 4层成熟度金字塔 · MCP+A2A 上下文边界 §1.11 8-19 已锚入
2606.01927 Albireo(vLLM插件,1.7×) CPU调度+采样开销消除 · vLLM 0.11.2 评测 §1.1 8-19 已锚入
2608.08020 Thought-Level Beam Search 测试时计算分配 · 思维级 vs Token 级 §1.11 8-18 已锚入
2608.13499 OpScale(MSRA) 算子级弹性扩缩容 · 成本 -36.3% §1.2 8-17 已锚入
2608.13263 vToken GPU内存 token 级 KV 虚拟化回收 §1.3 8-17 已锚入
2608.02870 Maglev 固定大小滑动循环记忆 §1.3 8-17 已锚入
2608.16157 FreeToken 边缘原生 MoE serving §1.3 8-17 已锚入
2608.14465 YOPO 冻结 LM 单次前向同时回答+弃答 §1.11 8-18 已锚入
2608.09867 Stealing Reasoning Traces 加密 CoT API 架构性安全漏洞 §1.12 8-18 已锚入
2604.25724 Salesforce Compound AI Compound AI serverless autoscaling §1.2 8-15 已锚入
2511.01815 KV Cache Transform Coding(ICLR 2026) KV Cache 有损压缩存储 §1.3 8-15 已锚入
2507.06608 Nexus 单 GPU PD 分离 2.2×/20×/2.5× §1.2 8-15 已锚入

四、检查过的来源清单

  • inbox/jay/2026-08-20-engineering-e1prep.md → ⭐⭐⭐⭐⭐ 核心来源:CoRun(2608.14376)+DASH(2608.14333)+HBF Sucks(2608.11668)+SGLang CUDA Graph+LMSYS Blog+Cross-Model Memory Transfer
  • inbox/jay/2026-08-20T1055-jay-engineering-filter.md → ⭐⭐⭐⭐⭐ 核心来源:SGLang CUDA Graph+DeepSeek-V4-Pro H20+CoRun+DASH+HBF Sucks+MCP Auth+A2A vs MCP+Miles v0.1+SWE-bench Pro
  • inbox/jay/2026-08-20T1335-jay-inference-vecdb-harness-substack-aug20.md → ⭐⭐⭐⭐⭐ 核心来源:vLLM V1/SGLang RadixAttention/NVIDIA Dynamo/PremAI H100横评/LMDeploy TTFT/DeployBase 引擎实测
  • inbox/jay/2026-08-20T1425-jay-csdn-inference-oom-benchmark-commands-highvalue.md → ⭐⭐⭐⭐⭐ 核心来源:vLLM OOM 排查+bench_serving 完整命令+gpu_memory_utilization 软限制+A10 SGLang vs vLLM 实测+Lyceum Stripe 案例
  • inbox/jay/2026-08-20T1950-jay-inference-engineering-rag-eval-mcp-stack-aug20.md → ⭐⭐⭐⭐ 核心来源:ArXiv LLM Serving 形式化优化(2605.01280)+vLLM vs TensorRT-LLM 生产对比
  • inbox/spark/2026-08-20-llm-infra-e1prep.md → ⭐⭐⭐⭐⭐ 核心来源:CoRun+DASH+HBF Sucks+SGLang CUDA Graph+Cross-Model Memory Transfer(2608.17050)+Miles v0.1+CSDN 8 件实战补丁
  • inbox/spark/2026-08-19-llm-infra-e1prep.md → ⭐⭐⭐⭐ 核心来源:Albireo(2606.01927)+AIConfigurator+The Silent Hyperparameter+EuroSys 2026 系统论文;参考,非本棒新增
  • inbox/tom/2026-08-19-inference-e1prep.md → Aug 19 版基线(5条:The Silent Hyperparameter/AIConfigurator/Inference Engineering Benchmarks/EuroSys FlexPipe+TokenFlow/Context+Harness Engineering)
  • inbox/tom/2026-08-20-rag-e1prep.md → RAG 主轴;无 inference 直接新增
  • inbox/tom/2026-08-20-evaluation-e1prep.md → evaluation 主轴;无 inference 直接新增
  • inbox/flyp/2026-08-20-multimodal-e1prep.md → multimodal 主轴;无 inference 直接新增
  • inbox/flyp/2026-08-20-risk-e1prep.md → risk 主轴;无 inference 直接新增
  • inbox/stephen/2026-08-20-ai-industry-e1prep.md → AI industry 主轴;无 inference 直接新增
  • inbox/jay/2026-08-20-ai-engineering.md → vLLM V1/SGLang/NVIDIA Dynamo;已在 8-20 版活文档锚入
  • paper_cards/1020-2608-17393.md → LEGO-RL · agent 主分类 · eval 邻接;inference 无直接关联
  • paper_cards/1021-2608-17379.md → PTXBench · evaluation 主分类 · GPU kernel 优化评测;inference 邻接级
  • paper_cards/1027-2608-16590.md → Zetta ζ · evaluation 主分类 · embodied harness;inference 邻接级
  • paper_cards/1028-2608-14929.md → LM Lineage Verification · engineering 主分类 · 模型血统验证;inference 邻接级
  • paper_cards/1029-2608-13558.md → 空文件/缺失
  • paper_cards/1030-2608-13947.md → 空文件/缺失
  • paper_cards/1025-2608-18701.md → SoftVTBench · evaluation 主分类 · 触觉视觉;inference 无关
  • organized/knowledge/inference.md → 2026-08-20 版活文档基线

五、无显著新增量的领域(如实说明)

以下 8-19 版基线已立标方向,本棒检查后确认无新增量,不重复列出:

  • vLLM v0.27 / SGLang v0.6 引擎特性 —— 8-20 版活文档已充分锚入;本棒 SGLang CUDA Graph 是生产调优细节补充,非新引擎特性
  • The Silent Hyperparameter(2605.19537) —— 8-19 版已锚入;本棒 CoRun 是 batching 层面的解法(邻接级深化)
  • AIConfigurator(2601.06288) —— 8-19 版已锚入;本棒无新数据
  • DFlash 生产局限(并发>8 时慢于基线) —— 8-19 版已警示;本棒无新数据
  • Maple-Preview Ternary MoE(5.31GB/20B) —— 8-18 版已锚入;本棒无新端侧量化数据
  • Stealing Reasoning Traces(2608.09867) —— 8-18 版已锚入;本棒无新安全数据
  • YOPO/OpScale/vToken/Maglev/FreeToken —— 8-17/8-18 版已锚入;本棒无新数据
  • Nexus/Not All Prefills/PD Disaggregation —— 8-15/8-16/8-17 版已充分锚入;本棒 CoRun 是 batching 调度层新方向,非新 PD 系统
  • Hugging Face TGI 正式进入维护模式 —— 8-20 版活文档已锚入;本棒无新进展
  • NVIDIA Dynamo / llm-d CNCF Sandbox —— 8-20 版活文档已锚入;本棒无新数据
  • AI Agents Stack 2026 六层架构 —— 8-19 版已锚入;本棒 Context Engineering 4层金字塔已在 8-19 版锚入
  • vLLM vs SGLang JSON 合规率数字(SGLang 96-98.2% vs vLLM 90-94%) —— 8-19 版已标注待核实;本棒无新独立核验数据
  • ICML 2026 22.3% 可复现性危机 —— 8-18 版已锚入;本棒无新大规模审计数据
  • paper_cards 主分类 inference 净增 —— 8-20 批次新卡(1020-1030)主分类均非 inference;CoRun/DASH/HBF Sucks 已在 jay/spark 8-20 材料中锚定,但 paper_card 尚未建立

六、本棒总结

本轮 E1 预消化结论:中等偏高密度新增棒——7 条 net-new(含 3 条首度锚入,4 条邻接),整体密度中等偏高。学术 paper_cards net-new 为 0(主分类 inference),但 llm-infra 主分类中有 CoRun(2608.14376)和 DASH(2608.14333)与 inference 直接相关。本棒最重要发现:CoRun 通过 continuous batching 形状固定实现 bit-identical 确定性推理输出(15-324% 吞吐),DASH/HBF Sucks 开辟了 HBM+Flash KV Cache 两级管理新路线,SGLang CUDA Graph 提供了 breakable/tc_piecewise 的生产级配置建议。

本棒 vs 8-19 结构性差异: - 8-19 = 可复现性危机深化棒(The Silent Hyperparameter + Harness Engineering + Context Engineering 三件套) - 8-20 = 推理调度+KV新层棒(CoRun 确定性 batching + DASH/HBF Sucks 两级 KV Cache + SGLang CUDA Graph 生产调优)

建议今夜活文档接力重点:

  1. §1.3 → 新增 CoRun 子节(continuous batching 形状固定 → 15-324% 吞吐 + bit-identical + 与 The Silent Hyperparameter 形成"问题→量化→解法"三层结构)
  2. §1.3 → 新增 DASH 子节(HBM+Flash 两级 KV cache + Llama 4 Maverick 1.92× 吞吐 + 48% 延迟降低 + 197.41 GB KV 容量警示);标注为 KV Cache 第 19 条路线
  3. §1.3 → HBF Sucks 与 DASH 并列锚入(标注 DASH=写入侧,HBF Sucks=全栈侧;两者避免重复归入)
  4. §1.1 → 新增 SGLang CUDA Graph 生产调优子节(breakable/tc_piecewise vs full 生产建议 + prefill graph 构建 3.8-5.2× 加速 + 代码量 -75%;与 CoRun 形成调度层+graph配置层双层优化对照)
  5. §1.1 → 新增推理引擎多硬件档位基准子节(A100:3,500/2,800/2,500 tok/s + H100:~2,800-3,400 tok/s + A10:SGLang 复杂场景显著优于 vLLM);与活文档已有 H100 数字分层标注
  6. §1.6 → 邻接新增 CSDN 实战命令库子节(bench_serving 完整命令 + gpu_memory_utilization 软限制 + OOM 数值计算)
  7. §1.13 → 邻接新增形式化优化方向子节(arXiv:2605.01280:通用策略局限+LLM推理独特结构+形式化方法理论保证)

边界说明: 本棒仅写入 inbox/tom/2026-08-20-inference-e1prep.md;未读取 knowledge/inference.md 全文(由今夜活文档接力棒负责更新)。


Tom · 2026-08-20 22:20 CST · E1 日间预消化轮 · inference 主题 · 24h 窗口 · 不执行 GitHub 写操作