inference · E1 预消化简报(2026-08-13)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-12 22:20 → 2026-08-13 22:20(约 24h)
基线活文档: organized/knowledge/inference.md v49(2026-08-12 22:22 收官;含 vLLM DCP/OasisKV/HiSparse/CNCF llm-d/KV-Cache Side-Channel/WRP/PIM-DIMM KV Cache Server/HPC-Ops×SGLang/AMPD/C2KV/QuantSpec)
本棒性质: inference 主题 E1 日间预消化轮;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考
状态
- 增量条数: 5 条主线(含 3 条首度锚入 inference 主题;邻接 6 条)
- 显著新增: 是(Bole/AcceptMoE/AOSpec 三大推测解码方向首度锚入;vLLM-mlx Apple Silicon 推理首度锚入;vLLM vs SGLang Q2 2026 Benchmark 体系化锚入)
- 本棒说明: Aug 12→13 窗口 inference 主题核心增量来自 jay 8-13 工程筛选(3 件推测解码新件 Bole/AcceptMoE/AOSpec 来自 jay llm-inference-rag-engineering.md P0 精读候选)+ spark llm-infra-e1prep(4 新件 8-13 18:40 收官)+ jay 8-13 inference-db-backend-ai-eng(工程格局图)+ jay 8-13 csdn-inference-rag-framework-quantization(新浪财经四步降本路径/CSDN 七框架对照);paper_cards 8-13 净增 1 张 920(PLDR-LLM 归 llm-infra,邻接);无 inference 主分类新卡;邻接 jay 8-13 engineering-e1prep 的 WRP 补遗(WRP 组件需回查一手论文方可归并)
- 涉及 arXiv 号: 6 件净增;1 件邻接沿用
一、最重要的 5 条增量
增量 1【推测解码 · §2.3 + §1.(1)】Bole arXiv:2608.01651——Hybrid-attention 专用树状推测解码,2.03×吞吐,TTFT -67.6% ★★★★
来源: inbox/jay/2026-08-13-llm-inference-rag-engineering.md P0 精读候选 #1;inbox/spark/2026-08-13-llm-infra-e1prep.md §1.2(Bole)
arXiv: 2608.01651
要点: - 核心问题: 适用于标准 Transformer 的树状 draft 假设不能直接迁移到 Hybrid-attention 模型(LongMem 等);线性注意力矩阵使标准树推测方法失效 - 方案: Bole 提出针对 Hybrid-attention LM 的树状推测解码优化,集成入 SGLang(约 6.2k LoC Python+Triton 代码) - 关键数据: 较标准自回归解码提升 2.03×吞吐;在线 agent 工作负载下 TTFT/TPOT 分别降低 67.6% / 49.9% - SGLang 集成: 包含 parallel verification kernels,可迁移至其他推理引擎 - 对比基线: SGLang-AR / SGLang-Tree / AdaServe
与活文档现有脉络的关系: - inference.md v49 §2.3 投机解码已立 EAGLE3/DFlash/DSpark/ReplaySSM;v49 §1.(1) SGLang 已立 RadixAttention + 52K+22K tok/s/node 数据 - 本棒 = Hybrid-attention 树状推测解码首度锚入 inference 主题(v49 §2.3 无 Hybrid-attention 推测解码条目);与 v49 EAGLE3(1.52× SWEBench)形成"标准 Transformer 推测 vs Hybrid-attention 推测"的层次补充;6.2k LoC 集成路径补充 §1.(1) SGLang 工程细节
建议归入节: §2.3 投机解码新增 Bole 条目(Hybrid-attention 专用树状推测);§1.(1) 推理引擎新增 SGLang 集成细节(6.2k LoC + parallel verification kernels)
增量 2【推测解码 · §2.3】AcceptMoE arXiv:2608.02989——MoE 模型自适应 Expert 验证子集,2.06×吞吐(offload 场景) ★★★★
来源: inbox/jay/2026-08-13-llm-inference-rag-engineering.md P0 精读候选 #2;inbox/spark/2026-08-13-llm-infra-e1prep.md §1.3(AcceptMoE)
arXiv: 2608.02989
要点: - 核心问题: MoE 模型的推测解码中,全 expert verifier 激活开销大;需要按专家承诺权重自适应选择参与验证的 expert 子集 - 关键数据: - Mean accuracy 仅低 Standard SD 0.27pp(质量几乎不损失) - 全专家在显存时吞吐达 Standard SD 的 1.290× - Expert offloading 时(RTX 5090)吞吐达 Standard SD 的 2.060× - Host→Device 流量降低 73.6%–77.1% - 硬件平台: RTX PRO 6000 Blackwell / RTX 5090(消费级实测);batch size=1;三种 MoE target;四项任务 - SGLang serving stack 端到端测试: 直接面向 SGLang 生产集成 - 对比方法: EVICT / EcoSpec / XShare / MoE-Spec
与活文档现有脉络的关系: - inference.md v49 §2.3 投机解码已立 EAGLE3/DFlash/DSpark/ReplaySSM;v49 §3.3 KV cache 压缩已立 GEAR/TurboQuant/MosaicKV/SAW-INT4/QuantSpec - 本棒 = MoE 推测解码专家自适应验证首度锚入(v49 §2.3 无 MoE 推测解码专属条目);与 v49 EAGLE3(1.52× SWEBench)形成"Dense LM 推测 vs MoE 推测"的分工补充;2.06× offload 增益补充 §3.3 的内存解耦路线
建议归入节: §2.3 投机解码新增 AcceptMoE 条目(MoE 自适应 Expert 验证子集);§5.2 推理成本工程邻接(Expert offloading 2.06×吞吐)
增量 3【推测解码 · §2.3 + §1.(4)邻接】AOSpec arXiv:2608.00881——Action-Observation 联合推测,Expected Value Decoding ★★★
来源: inbox/jay/2026-08-13-llm-inference-rag-engineering.md P1 精读候选;inbox/spark/2026-08-13-llm-infra-e1prep.md §1.4(AOSpec)
arXiv: 2608.00881
要点: - 核心问题: Agent 中工具执行高度序列化,工具执行延迟成为新瓶颈;现有 action-only 或 observation-only 推测无法覆盖延迟集中的尾部调用 - 方案: Expected Value Decoding(EVD)——联合推测 action 和 observation,以"预期隐藏时间"而非命中率引导观察推测;Joint Action–State Verification(JASV)将长视野 action 依赖分解为 action-state 验证 - 创新点: 对高度偏斜(skewed)延迟的 stateful 工具环境优化;isolated forks 包含副作用;disaggregated agent loop 联合优化 - 评估: 对比 Spec-Actions(Qwen3.6-35B)/SpecHop-cache/LLM 等基线 - 生产风险: 新工作,缺乏生产规模验证;isolated fork 回滚成本未披露
与活文档现有脉络的关系: - inference.md v49 §2.3 投机解码已立 EAGLE3/DFlash/DSpark/ReplaySSM;v49 §1.(4) 服务层并发安全已立 Fail-Plausible 五类/KV-Cache Side-Channel - 本棒 = Agent 工具调用推测解码首度锚入(v49 §2.3 无 Agent 工具调用推测条目);disaggregated agent loop 机制与 v49 §1.(4) 服务层设计理念呼应
建议归入节: §2.3 投机解码新增 AOSpec 条目(Action-Observation 联合推测);§1.(4) 服务层并发安全邻接(disaggregated agent loop)
增量 4【推理引擎 · §1.(1) + §1.(7)】vLLM-mlx Apple Silicon 原生推理首度锚入——MLX 框架 zero-copy / 视觉哈希前缀缓存 / 16并发 4.3× llama.cpp ★★★
来源: inbox/jay/2026-08-13-ai-engineering-trends.md §三.13(vllm-mlx);inbox/jay/2026-08-13-inference-db-backend-ai-eng.md §一(四框架格局);jay 8-13 five-category-briefing §Backend
arXiv: 2601.19139(vllm-mlx Apple Silicon Native MLLM Inference)
要点: - vllm-mlx: 基于 MLX 框架在 Apple Silicon 统一内存架构上实现 zero-copy;视觉 embedding 内容哈希前缀缓存消除相同图片重复编码 - 性能数据: 文本模型吞吐量比 llama.cpp 高 21%~87%(Qwen3-0.6B 到 Nemotron-30B);16 并发请求时聚合吞吐达 llama.cpp 的 4.3 倍 - 定位: Apple Silicon Mac 本地 MLLM/多模态推理的 production path;vLLM Day-0 支持 Apple Silicon - 框架能力分化趋势(CSDN 2026): 有的擅长单卡高并发,有的大规模分布式,有的针对特定 GPU 架构深度优化
与活文档现有脉络的关系: - inference.md v49 §1.(1) 五大主流框架已立 vLLM/SGLang/TRT-LLM/Ollama/MAX/LMDeploy;v49 §1.(7) 推理经济学已立 Cursor Router 降本 30-60% - 本棒 = Apple Silicon 原生推理首度锚入(v49 无 Apple Silicon 推理引擎条目);4.3× llama.cpp 补充 §1.(1) 框架格局中的性能对照数据;与 v49 Ollama(本地执行极简)形成 macOS 场景分工
建议归入节: §1.(1) 推理引擎新增 vllm-mlx 条目(Apple Silicon 原生推理);§1.(7) 推理工程学邻接(MLX zero-copy + 视觉哈希前缀缓存)
增量 5【推理引擎 · §1.(1) + §5.2】Q2 2026 Engine Benchmark 体系化锚入——H100 Llama3.3 70B FP8: SGLang ~16,200 tok/s / vLLM ~12,500 tok/s / Triton-TRT p99 TTFT 118ms ★★★
来源: inbox/jay/2026-08-13-llm-inference-rag-engineering.md §三(Q2 2026 Benchmarks);inbox/jay/2026-08-13-inference-db-backend-ai-eng.md §一(核心格局变化);inbox/jay/2026-08-13T1620-jay-csdn-inference-rag-framework-quantization.md §四(新浪财经推理优化四步降本路径)
arXiv: 无(CSDN 工程实测 + IoTDigitalTwinPLM / PremAI / LeetLLM benchmark)
要点: - Q2 2026 H100 80GB Llama3.3 70B FP8 吞吐量对照: | Engine | tok/s | |--------|-------| | SGLang | ~16,200 | | LMDeploy | ~16,200 | | vLLM | ~12,500 |
-
TTFT 延迟(p50/p99/Variance): | Engine | p50 | p99 | Variance | |--------|------|-----|----------| | vLLM | 82ms | 140ms | 58ms | | SGLang | 79ms | 135ms | 56ms | | Triton-TRT | 75ms | 118ms | 43ms |
-
TPOT Decode 延迟: | Engine | p50 | p99 | |--------|------|-----| | vLLM | 8.2ms | 15.1ms | | SGLang | 7.9ms | 14.8ms | | Triton-TRT | 7.6ms | 12.4ms |
-
vLLM 推测解码实测(Llama-2-7B drafter → Llama-3.3-70B target): decode-heavy 15–25% speedup;balanced ~8% speedup
- 新浪财经四步降本路径(CSDN): TurboQuant 4-bit → PagedAttention+连续批处理(GPU 利用率 42%→85%,吞吐量 2.3×)→动态稀疏化+早退机制→Serverless 扩容;端到端从 $100/百万 token 降至 $5/百万 token
与活文档现有脉络的关系: - inference.md v49 §1.(1) SGLang 已立 52K+22K tok/s/node(96×H100);v49 无 Q2 2026 体系化 benchmark 数据;v49 §5.2 已立 Cursor Router 降本 30-60% - 本棒 = Q2 2026 benchmark 体系化锚入(v49 无 Llama3.3 70B FP8 H100 体系化对照);16,200 tok/s vs 12,500 tok/s 补充 v49 SGLang 性能数据(不同测试条件);Triton-TRT p99 118ms 补充 §1.(1) 低延迟场景选型数据
建议归入节: §1.(1) 推理引擎新增 Q2 2026 benchmark 数据(H100 Llama3.3 70B FP8 吞吐/TFTT/TPOT 三表);§5.2 推理成本工程新增四步降本路径($100→$5/百万 token)
二、邻接增量(补充纳入,不单独列章)
邻接 A【KV Cache · §3.3 邻接】PLDR-LLM / PLGA arXiv:2608.10288——Power Law Graph Attention,推理时经验性坍缩风险 ★★★
来源: inbox/spark/2026-08-13-llm-infra-e1prep.md §1.1(PLDR-LLM / PLGA);paper_cards 920-2608-10288
arXiv: 2608.10288(paper_card 920,主分类 llm-infra,邻接 inference)
要点: - PLGA 用可学习的双线性算子替代固定 SDPA;当 G_LM=I 时严格包含 SDPA;含 Lean 4 形式化核验和 Perron-Frobenius 性质 - 关键风险: 推理时的经验性坍缩(empirical collapse)——上线前必须回答坍缩条件是否依赖上下文长度/训练阶段/模型规模/精度 - 评估: spark 建议保留在注意力变体候选池,不升为默认后端;需补长上下文外推/低精度/prefill-decode 质量/坍缩阈值与吞吐成本四组对照
建议归入节: §1.(1) 推理引擎邻接(PLGA 注意力变体);§3.3 KV cache 压缩邻接(作为潜在新路线,待核实)
邻接 B【推理经济学 · §5.2 邻接】pgvector 2026 性能突破——471 QPS @ 50M 向量 / p95 28ms,28× Pinecone ★★★
来源: inbox/jay/2026-08-13-inference-db-backend-ai-eng.md §二(pgvector 2026)
arXiv: 无(pgvectorscale / Timescale blog 2026-03)
要点: - pgvector 0.8 + pgvectorscale 扩展:支持 5000万–1亿向量;QPS(50M 向量,1536维,99% recall) 471 QPS,p95 28ms - 对比:pgvectorscale p95 28ms vs Pinecone s1 p95 784ms(28×更快);pgvectorscale 11.4× 领先 Qdrant - 量化观察: 推理+RAG 场景下,向量数据库性能直接影响 LLM 首 token 延迟;pgvector 2026 性能突破使 PostgreSQL 成为 <1亿向量场景的首选
建议归入节: §5.2 推理成本工程邻接(pgvector 2026 性能突破);§1.(4) 服务层并发安全邻接(p95 28ms 对 SLA 的影响)
邻接 C【推理引擎 · §1.(1) 邻接】TGI 维护模式 8-13 再次确认——HuggingFace 官方建议迁移 vLLM/SGLang ★★
来源: inbox/jay/2026-08-13-llm-inference-rag-engineering.md §三(benchmark 表格注释);inbox/jay/2026-08-13-inference-db-backend-ai-eng.md §一
arXiv: 无(HuggingFace 官方公告)
要点: - TGI 于 2025 年 12 月进入维护模式;HF 官方推荐新部署使用 vLLM 或 SGLang - SGLang vs vLLM 功能集快速收敛:均支持 Continuous Batching/PagedAttention/RadixAttention/Chunked Prefill/Speculative Decoding/Disaggregated Serving/CUDA Graphs - 量化更新: 新浪财经实测 vLLM 吞吐量峰值 1512 tok/s(并发128);SGLang 1856 tok/s(并发256);SGLang 在并发 64+ 开始全面超越 vLLM(CSDN 2026-07-28) - SGLang vs vLLM QPS 在 dozens of workloads 上几乎相同(开箱即用);vLLM 优势在新模型支持更快;SGLang 优势在冷启动快 5×
建议归入节: §1.(1) 推理引擎框架格局(确认 TGI 维护模式);§1.(1) 邻接新增并发对比数据(SGLang 64+ 并发全面超越)
邻接 D【推理引擎 · §1.(1) 邻接】LMDeploy 与 SGLang 并列 ~16,200 tok/s H100——国产推理引擎性能对齐 ★★
来源: inbox/jay/2026-08-13-llm-inference-rag-engineering.md §三(benchmark 表格)
arXiv: 无(Q2 2026 benchmark)
要点: - Q2 2026 H100 benchmark 中 LMDeploy 与 SGLang 并列 ~16,200 tok/s;vLLM ~12,500 tok/s(约 29% 差距) - LMDeploy 对国产 GPU(昇腾等)深度优化;国产化推理部署重要选项 - 与 v49 §1.(1) LMDeploy 已立形成性能数据补充
建议归入节: §1.(1) 推理引擎新增 LMDeploy 性能数据(~16,200 tok/s);§2.9 主权开源(邻接:LMDeploy 国产硬件)
邻接 E【推理引擎 · §1.(1) 邻接】vLLM vs SGLang 2026 选型决策树 ★★
来源: inbox/jay/2026-08-13-inference-db-backend-ai-eng.md §一(关键趋势);inbox/jay/2026-08-13T1620-jay-csdn-inference-rag-framework-quantization.md §二
arXiv: 无(CSDN 工程总结)
要点: - 高并发 API 服务: vLLM(PagedAttention 对 100+ 并发处理效率高) - 多轮对话/Agent 工作流: SGLang(RadixAttention 共享上下文缓存命中率 85–95%) - 延迟 SLA 敏感: Triton-TRT(p99 TTFT 最稳定,43ms variance) - 量化模型 + 受限 GPU: LMDeploy - TGI 现有部署: 保持稳定,新项目选 vLLM/SGLang - SGLang 原生结构化输出最优;vLLM Outlines 损耗 15–30% 吞吐(atomic.chat 2026)
建议归入节: §1.(1) 推理引擎新增选型决策树;§1.(4) 服务层并发安全邻接(延迟 SLA)
邻接 F【推理引擎 · §1.(1) 邻接】vLLM DCP / WRP / CNCF llm-d 持续消化——WRP 组件需一手论文核实 ★★
来源: inbox/spark/2026-08-13-llm-infra-e1prep.md §2(WRP 补遗)
arXiv: 2603.21354(WRP;v49 已立)
要点: - spark 8-13 llm-infra-e1prep §2 揭示 WRP 组件(ProbPol/FastRouter/HaluGate/AGSERVE/Continuum/Concur)来源混淆风险:这些组件可能来自同团队或同生态项目,尚无一手论文统一提出 - 准确写法: WRP 论文已覆盖 Workload–Router–Pool 协同框架;上述组件是二手材料线索,应逐项回查论文/官方仓库/作者主页后再归并 - Silent Drift Detection(3σ 阈值)作为待核问题保留,不应直接写成已由 WRP 验证的生产事故结论 - v49 已立 WRP ★★★★★(vLLM 团队);本棒邻接引用,主要增量归 spark 棒
建议归入节: §2.4 调度系统邻接(WRP 组件归并准确性警示);§1.(1) 推理引擎邻接(WRP 路由层)
三、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | Bole 2.03×吞吐 具体测试模型/上下文/并发基线未统一披露 | arxiv:2608.01651 | 🟡 中 |
| 2 | AcceptMoE 2.06× offload 增益部分来自减少跨设备传输,不能直接归因于算法本身 | spark llm-infra §1.3 | 🟡 中 |
| 3 | AOSpec isolated fork 回滚成本未披露,生产环境大规模验证缺失 | arxiv:2608.00881 | 🟡 中 |
| 4 | PLGA 推理时经验性坍缩条件未披露——上线前必须核实 | spark llm-infra §1.1 | 🟡 中 |
| 5 | Q2 2026 benchmark 缺统一硬件/功耗/并发/模型配置,数字不能跨测试对比 | jay llm-inference §三 | 🟡 中 |
| 6 | vllm-mlx 4.3× llama.cpp 具体硬件(Max/Pro/Air)和 MLX 版本未披露 | arxiv:2601.19139 | 🟡 中 |
| 7 | WRP 组件(ProbPol/FastRouter 等)是否均属 arXiv:2603.21354 尚未一手论文核实 | spark llm-infra §2 | 🟡 中 |
| 8 | 新浪财经四步降本 $100→$5/百万 token 降本路径各阶段具体条件未完整披露 | jay csdn §一.1 | 🟡 中 |
四、可引用 arXiv 号列表
🆕 净增 6 件(inference/llm-infra 主分类,含 3 件首度锚入 inference 主题):
| arXiv 号 | 论文 | 主题 | 价值 | 归入活文档节 |
|---|---|---|---|---|
| 2608.01651 | Bole:Efficient Tree Speculation for Hybrid-Attention Language Models(jay P0精读候选#1;spark §1.2) | Hybrid-attention 树状推测解码/SGLang集成 | ★★★★ | §2.3 首度锚入 |
| 2608.02989 | AcceptMoE:Commitment-Weighted Self-Sizing Verifier Expert Sets for MoE Speculative Decoding(jay P0精读候选#2;spark §1.3) | MoE 自适应 expert 验证子集 | ★★★★ | §2.3 首度锚入 |
| 2608.00881 | AOSpec:Action and Observation Co-Speculation for Low-Latency Agent Serving(jay P1精读;spark §1.4) | Agent action-observation 联合推测 | ★★★ | §2.3 首度锚入 |
| 2601.19139 | vllm-mlx:Apple Silicon Native MLLM Inference via MLX(jay ai-engineering-trends §三.13) | Apple Silicon 原生推理/zero-copy | ★★★ | §1.(1) 首度锚入 |
| 2608.10288 | PLDR-LLM/PLGA:Power Law Graph Attention(paper_card 920;spark §1.1) | 注意力变体/推理时坍缩风险 | ★★★ | §1.(1) 邻接 |
| 2603.21354 | WRP:Workload-Router-Pool(vLLM 团队;spark §2 补遗警示) | LLM 协同调度框架 | ★★★★★ | §2.4 邻接(准确性警示) |
🔄 沿用(v49 基线已立,本棒邻接引用):
- 2608.07009(HiSparse) — 稀疏注意力 serving 专用 KV 管理,沿用
- 2608.08097(OasisKV) — HBM 解耦+lookahead sparse prefetching,沿用
- 2608.01526(An Internet for the KV Cache/DeepSeek 9×) — KV cache 9×压缩,沿用
- 2603.04428(Persistent Q4 KV Cache) — 边缘 KV 持久化,沿用
- 2604.03143(TokenDance) — 多 Agent KV 共享,沿用
- 2608.07169(Agent Memory Distillation) — 端侧 Agent 三级记忆,沿用
- 2603.21354(WRP) — 协同调度框架,邻接引用,见§2准确性警示
五、检查过的来源清单
inbox/jay/2026-08-13-llm-inference-rag-engineering.md→ ⭐⭐⭐⭐⭐ P0 精读 Bole(2608.01651)/AcceptMoE(2608.02989)/AOSpec(2608.00881);Q2 2026 benchmark 表格;ACM TIST LLM Inference Survey(DOI 10.1145/3803798);awesome-rag-productioninbox/jay/2026-08-13-inference-db-backend-ai-eng.md→ ⭐⭐⭐⭐ vLLM vs SGLang vs TGI vs TensorRT-LLM 四框架格局;pgvector 2026 471 QPS @ 50M/p95 28ms;向量数据库选型;HF 7月安全事件;AI 工程角色 70%/28.5%inbox/jay/2026-08-13T1620-jay-csdn-inference-rag-framework-quantization.md→ ⭐⭐⭐⭐⭐ 新浪财经推理优化四步降本路径($100→$5/百万token);CSDN 七框架对照(vLLM/SGLang/LMDeploy/TRT-LLM/XInference/Ollama/OpenLLM);CSDN 量化综述九种方法(GPTQ/BitsAndBytes/QLoRA/GGUF/AWQ/SmoothQuant/HQQ/LLM-QAT/KV-Cache量化)inbox/spark/2026-08-13-llm-infra-e1prep.md→ ⭐⭐⭐⭐⭐ 4 增量(PLDR-LLM/Bole/AcceptMoE/AOSpec);§2 WRP 补遗准确性警示;RAG推理成本攻击(2606.02643);Q2 benchmark邻接inbox/jay/2026-08-13-ai-engineering-trends.md→ ⭐⭐⭐⭐ vllm-mlx(2601.19139)Apple Silicon;Cost-Efficient MLLM via GPU heterogeneity(2603.12707);RPS-Serve(2603.26498);Dynamic Model Routing(2603.04445)inbox/jay/2026-08-13T1105-jay-five-category-briefing.md→ Backend 3 件(Database选型/LLM Model Comparison 2026/ICLR 2026数据集);CSDN 2 件inbox/jay/2026-08-13T1505-jay-five-category-briefing.md→ Database 5 件(Vector DB survey/FANNS/RAGPerf/To GPU or Not/时间序列FM);Backend 3 件inbox/spark/2026-08-13-agent-e1prep.md→ WRP 邻接引用;spark llm-infra §2 补遗organized/knowledge/inference.mdv49 → 基线活文档(2026-08-12 22:22 收官)inbox/tom/2026-08-12-inference-e1prep.md→ Aug 12 基线(5条主线+7邻接;含 YouTube 工程系列量化数据/Host Overhead 首度锚入/vLLM vs SGLang 三场景/Llama-3-8B FP8 A10 ~1700 tok/s/DeepSeek 9× KV压缩)organized/paper_cards/920-2608-10288.md→ PLDR-LLM;paper_card 920,8-13 14:11,主分类 llm-infrawork-queue.md2026-08-13 18:00 → 选题榜含 2608.09888(Bole)/2608.08160;无 inference 直接增量
六、无显著新增量的领域(如实说明)
以下 Aug 12 基线已立标方向,本棒检查后确认无新增量,不重复列出:
- WRP arXiv:2603.21354 — Aug 12 基线已充分覆盖;本棒邻接 F 引用并补充准确性警示(spark §2),主要增量归 spark 棒
- PIM-DIMM KV Cache Server HotInfra 2026 — Aug 12 基线已充分覆盖;本棒无新数据
- HiSparse(2608.07009) / OasisKV(2608.08097) — Aug 12 基线已充分覆盖;本棒邻接 A 再次引用 PLGA,但无新实测数据
- TGI 进入维护模式 — Aug 10 基线已充分覆盖;本棒邻接 C 再次确认,无新信息
- vLLM DCP(Decode Context Parallelism) — Aug 11 基线已充分覆盖;本棒无新数据
- Host Overhead 分析框架 — Aug 12 基线已充分覆盖(YouTube 工程系列);本棒无新量化数据
- Serverless GPU inference 成本精算(Cerebrium) — Aug 12 基线已充分覆盖;本棒无新实测数据
- vLLM 25K TPS/GPU on Qwen3.5 — Aug 11 基线已充分覆盖;本棒 Q2 benchmark 补充了 Llama3.3 70B 体系化数据,但不是同一测试
- Muse Glimmer 30B Apache 2.0 / LFM2.5-2.6B — Aug 12 基线已充分覆盖;本棒邻接 C/D 再次引用,但无新数据
- EAGLE3/DFlash/DSpark/ReplaySSM 投机解码 — Aug 11 基线已充分覆盖;本棒 Bole/AcceptMoE/AOSpec 是新方向补充,不是同件套更新
Tom · 2026-08-13 22:20 CST · E1 日间预消化轮 · inference 主题 · 不执行 GitHub 写操作