inference · E1 预消化简报(2026-08-16)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-14 22:20 → 2026-08-16 22:20(约 48h)
基线活文档: organized/knowledge/inference.md(2026-08-15 版 · AWQ INT4 3x并发/Nexus PD多轮失效/Salesforce 3.9x/MCP stateless/NVIDIA Dynamo/H100 Benchmark/KV Cache Transform Coding/Queueing-Theoretic/RMM 9条)
本棒性质: inference 主题 E1 日间预消化轮(48h 窗口);邻接 8-15 E1 棒(9条)之后,专注 8-15→8-16 新增;不重写活文档,只列近 48h 新硬增量供今晚活文档接力决策参考
状态
- 增量条数: 6 条主线(含 0 条首度锚入 inference 主题;邻接 3 条)
- 显著新增: 有(但低于 8-15 的 9 条高密度)——工程文档级增量为主,学术/系统化新量较少
- 本棒说明: Aug 14→15 窗口 inference 核心增量来自 jay 全天主力棒(inference-engineering/csdn-inference/csdn-inference-optimization/afternoon-briefing);spark llm-infra-e1prep 8-16 为 llm-infra 主轴, inference 邻接级;paper_cards 8-15→8-16 净增 0 张主分类 inference;邻接来源(llm-infra/agent/evaluation)贡献 3 条工程补丁;本棒聚焦 inference 专属新发现
- 涉及 arXiv 号: 0 件净增(本棒无新 arXiv 论文);沿用 6 件(2608.13426 RMM / 2604.25724 Salesforce / 2507.06608 Nexus / 2603.13358 Not All Prefills / 2511.01815 KV Cache Transform Coding / 2605.04595 Queueing-Theoretic)
一、最重要的 6 条增量
增量 1【推理引擎工程 · §1.1 + §1.11】vLLM 官方生产质量 CI 流程博客(2026-07-15)——推理引擎自身质量门控 ★★★
来源: inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md(条目1);inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md(Backend ⑤)
URL: https://vllm-project.github.io/blog/keeping-vllm-production-quality/
arXiv: 无(官方博客 · 第一手工程实践)
要点: - vLLM 团队公开介绍其 CI、benchmarking 和 release 流程的工程实践,覆盖生产级 model serving 的质量保障机制 - 与 knowledge/inference.md 中现有 Fable/Atrex-Bench/KernelSight-LM/TELLER/μCUTLASS/TritonForge 等 kernel 层自动化工具形成"推理引擎自身质量门控"新子维度——推理引擎不只被外部测试,自身也在建立内生质量流程 - 与 SGLang 官方博客对比阅读可获得推理引擎质量门控双视角
警示: vLLM 官方博客数据无独立第三方核验;建议与 SGLang 对比以获得更全面的推理引擎质量门控视角
与活文档现有脉络的关系: - inference.md 8-15 版已有 vLLM 0.19 Model Runner V2 / crash rate 三档 / 推测解码实测 - 本棒 = vLLM 自身 CI 质量门控流程首度锚入(无任何 prior vLLM 质量门控制度描述);与 vLLM 原生 transformers 后端(HF Blog 8-14)同属 vLLM 生态位,本棒是"质量流程"维度
建议归入节: §1.1 推理引擎新增 vLLM 自身 CI/质量门控子节;§1.11 推理优化算法邻接(kernel 自动化工具箱的"引擎内生质量"补充)
增量 2【推理优化 · §1.9 + §1.12】Jarvis Labs CPU Offloading 实测数字——memory-bound 优化路径 ★★★
来源: inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md(条目5);inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md(Backend ⑦)
URL: https://jarvislabs.ai/blog/vllm-optimization-techniques
arXiv: 无(技术博客 · 第一手工程实测)
要点: - CPU Offloading 实测数字: - 输出 token 吞吐量: +5.4%(783.09 → 825.77 tok/s) - TTFT: -15.8%(78,994ms → 66,509ms) - TPOT: -4.2%(155.28ms → 148.79ms) - ITL: -7.8%(124.56ms → 114.80ms) - GPU KV Cache 利用率: 98.0% → 99.65% - CPU Offloading 是量化之外的另一条 memory-bound 优化路径——与 inference.md 8-15 版已有 AWQ INT4(量化压缩)形成正交互补
警示(Jay 标注沿用): Jarvis Labs 数据未公开完整硬件配置与测量窗口,需独立核验;引用为"工程实测数据 · 待独立核验"
与活文档现有脉络的关系: - inference.md 8-15 版 §1.9 量化经济学已立 AWQ INT4 3x 并发 / RTX 4090 FP8 最优配置 - 本棒 = CPU Offloading 量化路径互补首度锚入(memory-bound 任务第二条优化路线);与 §1.7 推理经济学(33→34 件套)邻接,+5.4% 吞吐/+99.65% GPU 利用率构成推理经济学新数字
建议归入节: §1.9 量化经济学邻接新增 CPU Offloading 路径(AWQ 是量化压缩,CPU Offloading 是 memory-bound 卸载——两条正交路径);§1.12 E2E Pipeline 邻接(GPU 利用率 99.65%)
增量 3【KV-Cache 工程基础 · §1.3】GPUYard KV Cache 公式——Llama 2 70B 32K = 10.74GB ★★★
来源: inbox/jay/2026-08-16T1105-jay-five-category-briefing.md(Backend ⑥);inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md(Backend ⑧)
URL: https://www.gpuyard.com/tutorials/howto/optimize-kv-cache + https://medium.com/@samanthakoduru96/a-field-guide-to-llm-inference-optimization
arXiv: 无(技术博客 · 工程计算推导)
要点:
- KV Cache 显存公式: Memory = 2 × batch_size × seq_len × num_layers × num_kv_heads × head_dim × precision_bytes
- Llama 2 70B 单序列 32K 上下文 KV Cache = 10.74 GB(80 层 × 8 KV heads × 128 head_dim × FP16)——可作为团队推理内存规划参考数字
- PagedAttention 将内存碎片从 60-80% 降至 <4%,GPU 利用率提升 2-4 倍(GPUYard 2026)
- GQA(Grouped Query Attention)是降低 KV Cache 最重要的架构选择——与 8-15 版已有的 KV Sharing(Gemma 4)/mHC(DeepSeek V4)/Compressed Attention 形成横向验证
工程意义: KV Cache 公式是团队推理内存规划的工程基础数字;GQA 重要性确认了 8-15 版 KV Sharing/mHC 方向的架构合理性
与活文档现有脉络的关系: - inference.md 8-15 版 §1.3 KV-Cache 已有 C2KV KDD 2026(跨请求复用)/KV Cache Transform Coding ICLR 2026/Queueing-Theoretic ICML 2026 - 本棒 = KV Cache 工程数学基础首度锚入(之前无具体公式/具体数字);Llama 2 70B 32K = 10.74GB 是当前活文档最缺失的工程参考数字;PagedAttention 碎片 60-80%→<4% 是对 vLLM PagedAttention 机制的具体量化
建议归入节: §1.3 KV-Cache 新增工程数学基础子节(KV Cache 公式 + Llama 2 70B 32K = 10.74GB + PagedAttention 碎片化量化 + GQA 架构选择重要性)
增量 4【PD Disaggregation 新兴方向 · §1.2 + §1.3】Mix-Quant + KVServe——2026 PD 异构新兴方向 ★★★
来源: inbox/jay/2026-08-16T1105-jay-five-category-briefing.md(Backend ⑧ + ⑨);inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md
arXiv: 无(行业共识 · 技术博客)
要点: - Prefill-Decode 分解已成 2026 生产默认架构——多个实验室生产默认:Prefill(计算密集型)和 Decode(内存密集型)运行在不同机器上,通过 KV Cache 网络传输 - 2026 年新兴方向: - Mix-Quant:Prefill 量化更激进,Decode 更精准——对 PD 分离架构的精细化优化 - KVServe:KV 传输压缩——减少 Prefill→Decode 节点 KV 传输量 - 与现有 KV Cache 优化技术的关系: Mix-Quant/KVServe 与 8-15 版已有 KV Cache Transform Coding ICLR 2026(存储压缩)/C2KV KDD 2026(跨请求复用)共同构成"分层量化+传输压缩+存储压缩"三联优化方向 - Reasoning 模式开启使吞吐量降至 32%,准确率提升 7.5pp——开关代价显著(新增警示)
与活文档现有脉络的关系: - inference.md 8-15 版 §1.2 推理调度已有 Nexus(单 GPU 主动 PD)/Not All Prefills(多轮 Agent 失效)正反案例 - 本棒 = PD 异构新兴方向首度锚入(Mix-Quant + KVServe);与 DCP/Helix/CXL+PIM(正面)/Nexus/Not All Prefills(反面)构成 2026 PD Disaggregation 完整生态;Reasoning 模式开销警示是新的工程约束数字
建议归入节: §1.2 推理调度新增 Mix-Quant/KVServe 新兴方向子节;§1.3 KV-Cache 邻接(分层量化+传输压缩+存储压缩三联);§1.2 新增 Reasoning 模式开销警示(吞吐 -68%,准确率 +7.5pp)
增量 5【推理引擎选型 · §1.1】DeployBase A100 Llama 70B 5 引擎量化对照——A100 vs H100 跨硬件基准 ★★
来源: inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md(条目5);inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md(Backend ⑦)
URL: https://deploybase.ai/articles/best-llm-inference-engine
arXiv: 无(第三方独立测试)
要点: - DeployBase Llama 70B A100 80GB 量化对照(input 512/output 128/batch 1/8/32):
| 引擎 | A100 吞吐 | 备注 |
|---|---|---|
| TensorRT-LLM | 4,500 tok/s | 性能最强但配置最复杂 |
| vLLM | 3,500 tok/s | 吞吐量最高 |
| SGLang | 2,800 tok/s | 延迟优化场景 |
| TGI | 2,500 tok/s | HuggingFace 生态(已进入维护模式) |
| llama.cpp | 20 tok/s | CPU 推理/边缘场景 |
- 与 8-15 版 Spheron H100 Benchmark 对照(TensorRT-LLM 2,100/SGLang 1,920/vLLM 1,850):A100 数值整体高于 H100,注意测试条件差异(input/output/batch 不同,不可直接跨条件比较)
- vLLM vs SGLang A/B 实测 (CSDN 2026-08-16 综合):vLLM 总分微弱领先(+0.9),SGLang 在吞吐量/TTFT/显存效率三项全面领先;vLLM 优势在工程成熟度
警示: DeployBase 数据未公开完整硬件配置与测量窗口,需独立核验;Benchmark 方法论仅部分公开(input 512 tokens/output 128 tokens/batch 1/8/32)
与活文档现有脉络的关系: - inference.md 8-15 版 §1.1 推理引擎已有 Spheron H100 Benchmark 表格(TensorRT-LLM 2,100/SGLang 1,920/vLLM 1,850) - 本棒 = A100 列首度锚入(之前无 A100 引擎横向对照);与 H100 表格形成跨硬件对照,但测试条件不同需谨慎引用
建议归入节: §1.1 推理引擎 Benchmark 表格新增 A100 列(标注测试条件差异);§1.1 选型决策树补丁(vLLM 总分+0.9但 SGLang 三项领先)
增量 6【推理基础设施 · §1.1 + §1.11】WASI-NN:ML 推理接口标准化——Wasm 原生推理生态信号 ★★
来源: inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md(Cloud-Native ⑥ · WASI-NN);inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md
arXiv: 无(CNCF Blog + 技术博客)
要点: - WASI-NN:WASI(WebAssembly System Interface)下的 ML 推理标准化接口,支持 TensorFlow Lite/ONNX/OpenVINO + 硬件加速 - 工程意义: 将 ML 推理抽象为 Wasm 原生接口,实现跨语言/跨硬件的推理服务标准化——是推理引擎编排层(§1.1 Dynamo 1.0)之下的更底层接口标准化 - 与推理引擎生态的关系: OpenVINO 2026.3 GGUF 直接读取 + WASI-NN 共同构成 Intel 硬件生态的"零转换+标准化接口"双轨——OpenVINO 解决模型格式,WASI-NN 解决运行时接口 - NSDI 2026 Wasabi:Hierarchical Wasm + Serverless 融合架构,SpinKube 在 K8s 上运行 Wasm 应用,冷启动微秒级(与 inference 引擎冷启动分钟级形成鲜明对比)
与活文档现有脉络的关系: - inference.md 8-15 版 §1.1 推理引擎已有 NVIDIA Dynamo 1.0 编排层(引擎之上);§1.1 已有 OpenVINO 2026.3 GGUF 直接读取(Intel 硬件路径) - 本棒 = WASI-NN 接口标准化首度锚入(推理引擎生态的更底层接口);与 Dynamo 1.0(编排层)/OpenVINO(引擎层)构成三层架构信号:接口层(WASI-NN)→引擎层(OpenVINO/vLLM)→编排层(Dynamo)
建议归入节: §1.1 推理引擎新增 WASI-NN 接口标准化子节(推理引擎三层架构信号);§1.11 推理优化算法邻接(Wasm 原生推理)
二、邻接增量(补充纳入,不单独列章)
邻接 A【推理引擎 · §1.1邻接】llama.cpp 突破 100k GitHub Stars——本地推理主导地位确认 ★★
来源: inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md(Substack ⑩ · AIxFunda Week 14 2026)
arXiv: 无(Georgi Gerganov GitHub 里程碑)
要点: - llama.cpp 突破 100k GitHub Stars,成为开源社区里程碑 - Georgi Gerganov 创建的本地 LLM 推理引擎在量化生态(CPU/边缘/嵌入式)保持主导地位 - 与 inference.md 8-15 版已有 llama.cpp 相关内容不重复:本棒 = 社区规模里程碑数字
建议归入节: §1.1 推理引擎邻接(llama.cpp 生态规模里程碑)
邻接 B【推理工程 · §1.2邻接】Nano-vLLM 教学框架——四大模块清晰拆解 PagedAttention 原理 ★★
来源: inbox/jay/2026-08-16T1620-jay-csdn-inference-optimization-kvcache-pdsplit.md(条目2)
URL: https://blog.csdn.net/weixin_34416754/article/details/161506703
arXiv: 无(CSDN 教学型源码分析 · 2026-08-08)
要点: - Nano-vLLM 仅约 1.2k 行核心代码,四大模块:LLM Engine(中央调度)/Block Manager(PagedAttention)/Scheduler(双队列)/Model Runner(前向计算) - PagedAttention 将 KV Cache 切分为逻辑块与物理块,通过块表动态管理显存;Block Manager 负责分配与释放,解决显存碎片化 - 教学价值极高,适合作为 inference.md §1.1 PagedAttention 机制的教学补充材料
建议归入节: §1.1 推理引擎邻接(PagedAttention 教学补充,Nano-vLLM 四大模块)
邻接 C【推理工程 · §1.3邻接】Chunked Prefill 时序图——TTFT≈200ms 量级 + 两种 KV 交付模式 ★★
来源: inbox/jay/2026-08-16T1620-jay-csdn-inference-optimization-kvcache-pdsplit.md(条目1)
URL: https://blog.csdn.net/NCU_wander/article/details/161509793
arXiv: 无(CSDN 源码分析 · 2026-06 活跃)
要点: - Chunked Prefill 原理: 超长 Prompt 按 chunk(默认 2k)分批处理,增量构建 KV Cache,TTFT 控制在 ~200ms 量级 - 两种 KV 交付模式: 短 Prompt 一次性全量传输;超长 Prompt 每 chunk 完成后流式传输 - enable-prefix-caching: 请求间共享 KV 前缀(写时复制机制),特殊场景性能提升显著 - 与 8-15 版已有 Nexus/Not All Prefills 互补:本棒是 PD 分离的实现机制层细节
建议归入节: §1.2 推理调度邻接(Chunked Prefill 时序图 + TTFT~200ms + 两种 KV 交付模式)
三、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | Jarvis Labs CPU Offloading +5.4% / -15.8% TTFT 未公开完整硬件配置与测量窗口 | Jarvis Labs blog | 🟡 中 |
| 2 | DeployBase A100 4,500 / 3,500 / 2,800 / 2,500 / 20 tok/s Benchmark 方法论部分公开,测试条件(input 512/output 128)与 Spheron H100(512/256)不同,不可直接跨硬件比较 | DeployBase | 🟡 中 |
| 3 | Reasoning 模式开启使吞吐量降至 32%,准确率提升 7.5pp 来源为 Medium 技术博客,具体模型/硬件配置未披露 | Medium 技术博客 | 🟡 中 |
| 4 | Mix-Quant / KVServe 2026 新兴方向 无独立 arXiv/顶会背书,属于行业共识性方向,需跟踪具体系统论文 | 技术博客/行业共识 | 🟡 中 |
| 5 | PagedAttention 将内存碎片从 60-80% 降至 <4% 具体来源为 GPUYard 博客,数字未经独立核验 | GPUYard | 🟡 中 |
| 6 | Nexus 2.2×/20×/2.5× 数据 沿用 8-15 版警示,需始终标注"单 GPU 内主动 disaggregation" | arXiv:2507.06608 | 🟡 中(长期警示) |
四、可引用 arXiv 号列表
🔄 沿用(8-15 版已锚入,本棒无净增 arXiv 号):
| arXiv 号 | 论文 | 主题 | 归入活文档节 | 状态 |
|---|---|---|---|---|
2608.13426 |
Reduced Matrix Multiplication (RMM) | 输入自适应矩阵乘 | §1.3 或 §1.11 | 8-15 已锚入 |
2604.25724 |
Scalable Inference Architectures for Compound AI Systems (Salesforce) | Compound AI serverless autoscaling | §1.2 | 8-15 已锚入 |
2507.06608 |
Nexus: Active Prefill-Decode Disaggregation on a Single GPU | 单 GPU PD 分离 2.2×/20×/2.5× | §1.2 | 8-15 已锚入 |
2603.13358 |
Not All Prefills Are Equal (PD Disaggregation 多轮 Agent 失效) | PD 多轮场景失效 | §1.2 | 8-15 已锚入 |
2511.01815 |
KV Cache Transform Coding (ICLR 2026) | KV Cache 有损压缩 | §1.3 | 8-15 已锚入 |
2605.04595 |
Queueing-Theoretic Framework for LLM Inference (ICML 2026) | KV Cache 排队论 | §1.3 | 8-15 已锚入 |
本棒 0 件净增 arXiv 号。
五、检查过的来源清单
inbox/jay/2026-08-16T1105-jay-five-category-briefing.md→ ⭐⭐⭐⭐⭐ Backend ⑥ GPUYard KV Cache 公式/Llama 2 70B 32K=10.74GB/Prefill-Decode 默认架构/Mix-Quant/KVServeinbox/jay/2026-08-16T1220-jay-csdn-inference-finetuning-highvalue.md→ ⭐⭐⭐⭐ CSDN 推理框架综合(版本号/DeepSeek开源周/阿里云Benchmark/LangGraph源码)inbox/jay/2026-08-16T1335-jay-github-hf-openvino-llmrouting-stack2026.md→ ⭐⭐⭐⭐ OpenVINO 2026.3 GGUF 直接读取/EAGLE-3 扩展至 VLM/HF State of Open Models Summer 2026inbox/jay/2026-08-16T1620-jay-csdn-inference-optimization-kvcache-pdsplit.md→ ⭐⭐⭐⭐⭐ Chunked Prefill 时序图/Nano-vLLM 四大模块/PD 分离源码/H20 DeepSeek-R1inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md→ ⭐⭐⭐⭐ vLLM CI 质量博客/Jarvis Labs CPU Offloading/DeployBase A100 5 引擎/LushBinary RAG Productioninbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md→ ⭐⭐⭐⭐ Backend 5件(SGLang vs vLLM vs TensorRT-LLM/Jarvis Labs/DeployBase/GPUYard/PD Field Guide/KVServe) + Cloud-Native(WASI-NN/Wasabi NSDI 2026) + Substack(llama.cpp 100k/OpenAI o3-mini) + Reproduction(Awesome-RAG-Reasoning/Awesome-AI-Agent)inbox/jay/2026-08-16T2335-jay-evening-supplement.md→ ⭐⭐⭐ HubSpot 200亿向量 Qdrant/Vector DB 2026 大变局(AI Agent 查询10×/传统向量库基础设施)inbox/spark/2026-08-16-llm-infra-e1prep.md→ llm-infra 主轴;inference 邻接级:无 net-new inference 学术增量,工程细节补丁沿用inbox/tom/2026-08-14-inference-e1prep.md→ Aug 14 版基线(4条:vLLM 0.19/阿里云压测/crash rate/C2KV)inbox/tom/2026-08-15-inference-e1prep.md→ Aug 15 版基线(9条:AWQ/Nexus/Not All Prefills/Salesforce/MCP stateless/NVIDIA Dynamo/H100 Benchmark/KV Cache Transform Coding/Queueing-Theoretic/RMM)inbox/flyp/2026-08-15-multimodal-e1prep.md→ Flyp multimodal 轮;无 inference 直接增量inbox/flyp/2026-08-16-multimodal-e1prep.md→ Flyp multimodal 轮;无 inference 直接增量inbox/stephen/2026-08-15-ai-industry-e1prep.md→ Stephen AI industry 轮;推理引擎邻接有限inbox/stephen/2026-08-16-ai-industry-e1prep.md→ Stephen AI industry 轮;无 inference 直接新增organized/paper_cards/955-964 段 → 新增 5 张:960 Maglev(engineering)无 inference/961 GAN/962 Whisper/963 RibAssist/964 MT;无主分类 inference 新卡
六、无显著新增量的领域(如实说明)
以下 8-15 版基线已立标方向,本棒检查后确认无新增量,不重复列出:
- vLLM 0.19 Model Runner V2 / P-EAGLE / FlexKV / gRPC — 8-15 版已充分锚入;本棒 CI 博客是质量流程补充,非版本更新
- vLLM 原生 transformers 后端(450+ 架构) — 8-14 版已首度锚入;本棒无新数据
- C2KV KDD 2026 / KV Cache Transform Coding ICLR 2026 / Queueing-Theoretic ICML 2026 — 8-15 版已锚入;本棒 GPUYard 公式是工程基础补充,非新路线
- Nexus / Not All Prefills Are Equal — 8-15 版已充分锚入;本棒 Chunked Prefill 是 PD 实现机制层补充,非新系统
- AWQ INT4 3x 并发 / RTX 4090 FP8 最优配置 — 8-15 版已锚入;本棒 CPU Offloading 是正交路径,非 AWQ 更新
- Salesforce Compound AI 8000 企业/1360 亿 Token — 8-15 版已锚入;本棒无新 Compound AI 数据
- MCP 2026-07-28 stateless 架构 — 8-15 版已锚入;本棒无 MCP 新数据
- NVIDIA Dynamo 1.0 / vLLM V1 重构 — 8-15 版已锚入;本棒无新编排层数据
- Spheron H100 Benchmark TensorRT-LLM 2,100 / SGLang 1,920 / vLLM 1,850 — 8-15 版已锚入;本棒 DeployBase A100 是 A100 列新增(不同硬件),非 H100 更新
- RMM arXiv:2608.13426 — 8-15 版已锚入(paper_card 952 已建);本棒无新数据
- GPT-5.6 Sol Ultrafast Cerebras 750 tok/s / KV Sharing / mHC / Compressed Attention — 8-15 版已锚入;本棒无 OpenAI/Cerebras 新数据
- OpenVINO 2026.3 GGUF 直接读取 / EAGLE-3 扩展至 VLM — 8-16 spark llm-infra-e1prep 已锚入;本棒 WASI-NN 是接口层补充,非 OpenVINO 更新
- Hugging Face State of Open Models Summer 2026(数据集 1M 里程碑) — 8-16 spark llm-infra-e1prep 已锚入;本棒无 HF 新数据
- paper_cards 主分类 inference 零新增 — 8-15→8-16 无任何主分类 inference 新卡
七、本棒总结
本轮 E1 预消化结论:中等密度工程补丁棒——6 条 net-new 增量,数量低于 8-15 的 9 条,但均为工程文档级实打实的新增。总体属于"工程基础夯实期":学术/系统化新量(Paper Card)为 0,但工程实践文档(vLLM CI/Jarvis Labs/GPUYard 公式/Mix-Quant+A100+Wasabi)提供了 inference.md 此前缺失的工程细节。
本棒 vs 8-15 结构性差异: - 8-15 = 高密度学术/系统化棒(9 条:含 6 arXiv 新件:RMM/Nexus/Salesforce/KV Transform/Queueing/Theoretic/MCP) - 8-16 = 中等密度工程文档棒(6 条:含 0 arXiv 新件,均为工程实践文档)
建议今夜活文档接力重点:
§1.1→ 新增 vLLM 自身 CI/质量门控子节 + DeployBase A100 Benchmark 列(A100 vs H100 跨硬件表格,注明测试条件差异) + WASI-NN 接口标准化子节(推理引擎三层架构:接口层→引擎层→编排层)§1.9→ 新增 CPU Offloading memory-bound 优化路径(+5.4% 吞吐/-15.8% TTFT/99.65% GPU 利用率)与 AWQ INT4 形成正交双路径§1.3→ 新增 KV Cache 公式工程基础子节(Llama 2 70B 32K=10.74GB + PagedAttention 碎片 60-80%→<4% + GQA 架构重要性)§1.2→ 新增 Mix-Quant/KVServe 2026 新兴方向子节 + Reasoning 模式开销警示(吞吐 -68%/准确率 +7.5pp)§1.2→ 新增 Chunked Prefill 时序图子节(TTFT~200ms/两种 KV 交付模式/写时复制 prefix caching)§1.1→ 邻接新增 Nano-vLLM 教学补充(PagedAttention 四大模块/1.2k 行教学代码)§1.1→ 邻接新增 llama.cpp 100k Stars 生态规模里程碑
边界说明: 本棒仅写入 inbox/tom/2026-08-16-inference-e1prep.md;未读取 knowledge/inference.md 全文(由今夜活文档接力棒负责更新)。
Tom · 2026-08-16 22:20 CST · E1 日间预消化轮 · inference 主题 · 48h 窗口 · 不执行 GitHub 写操作