inference · E1 预消化简报(2026-08-09)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-08 10:20 → 2026-08-09 14:20(约 28h)
基线活文档: organized/knowledge/inference.md v47(2026-08-08 更新;含 AgenticCoding+TokenOps综述+LLMServing实证+ACRL+GEAR AMD+QuarkEagle3+SpecBox+RETAIN+ARCHead+ALiBi+AMPD+RestoreKV+GoodServe)
本棒性质: inference 主题 E1 日间预消化轮;不重写活文档,只列近 28h 新硬增量供今晚活文档接力决策参考
状态
- 增量条数: 6 条主线(邻接 4 条)
- 显著新增: 是(vLLM Conference 2026-08-25 路线图首确认;C2KV KDD 2026 KV cache 跨请求复用新机制;vLLM Semantic Router v0.3 有状态路由;AMPD ICML 2026 多轮自适应 PD 路由)
- 连续缺位: Tom inference-e1prep 连续第 2 天缺位后本棒补位
- 涉及 arXiv 号: 6 件净增
一、最重要的 6 条增量
增量 1【推理工程学 · §1.(1) + §1.(7)】vLLM Conference 2026-08-25~26 路线图首确认 — Flat Model + Model Runner V2 + 多级 KV Offloading + 1000+ TPS 推测解码 ★★★★
来源: inbox/jay/2026-08-09T1505-jay-engineering-filter.md 条目 2;inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 摘要)
arXiv: 无(官方会议公告)
要点: - vLLM Conference @ Ray Summit(2026-08-25~26)议程确认(State of vLLM 2026): - Flat Model + Model Runner V2 迁移 — vLLM 内部模型运行器进一步重构,继 inference.md v47 已记录 MRV2 成为 dense 模型默认之后,Flat Model 是下一阶段架构方向 - 多级 KV Offloading(disaggregated serving) — 继 inference.md §3.4/3.5 已立 LMCache/Mooncake/TTKV/ICMSP 等 KV offloading 路线,本确认 vLLM 官方 upstream 多级卸载路径 - 向 1000+ TPS 推测解码 — inference.md v47 已记录"NVIDIA Blackwell 突破 1000 TPS/User";本确认 vLLM upstream 路线图层面的 1000+ TPS 目标 - 生产级量化 KV cache 压缩 — 与 GEAR arXiv:2403.05527 + TurboQuant ICLR 2026 + Quark Eagle3 TurboQuant 4-bit 沿用,确认 vLLM 官方将 KV cache 量化压缩纳入 upstream 路线图 - Agentic Production Workloads 专题(Yifan Qiao + Zijing Liu · Inferact) — inference.md §6.1 已立 AI 编码 Agent 工作负载(MCP 2.0/Harness/LiveMem等);本确认 vLLM 社区将该方向列为 2026 Q3-Q4 重点 talk
与活文档现有脉络的关系: - 活文档 §1.(1) 推理引擎 6 寡头+2+1 格局已立;Flat Model/MRV2/KV Offloading/1000+ TPS = vLLM 2026-2027 路线图核心三轴,与 v47 已记录的 DFlash/DFlash+FlashInfer/SpecDec 三合一/EAGLE3/Quark Eagle3 共同构成推理工程学第 9 维"推测解码 + KV offloading + 量化压缩"三维坐标 - Agentic Production Workloads talk = 继 Agentic Coding in the Wild arXiv:2608.00101(§6.1 已立)之后,第 1 件 vLLM 社区官方生产经验系统性 talk
建议归入节: §1.(1) vLLM 路线图;§2.7 Token-Operations 四层架构;§6.1 Agentic 推理三层架构收敛;O249 试金石
增量 2【KV Cache · §3.3 + §3.5】C2KV — KDD 2026 压缩可组合 KV Cache 跨请求复用 ★★★★
来源: inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md 保留条目 3
arXiv: 2607.17715(KDD 2026,2026-08 已会议进行中)
要点:
- 核心问题: KV cache 跨请求复用受限于请求间 token 序列差异;现有方法要么只能同 prompt 复用(system prompt 完全相同),要么需要复杂的状态迁移机制
- 方案: C2KV = Composable KV Cache with C2Token 机制;每个 block 对应一个 C2Token,block 内 token 可见性由因果注意力隐式强制,无需修改模型
- 跨请求复用: C2KV cache 可跨请求直接复用(system prompt / KV / Document 分层组织)
- GitHub 公开: https://github.com/s7a9/C2KV
- 关键数据: 具体吞吐/延迟收益待核实;核心创新在机制设计——跨请求可组合的 KV block 组织方式
- 定位: 与 inference.md §3.3 Cache Compression(PagedAttention/GEAR/TurboQuant/MosaicKV/SAW-INT4)和 §3.5 PD Disaggregation(Mooncake/SwiftCache/KVServe)均邻接,是 KV cache 复用机制层面的新路线
与活文档现有脉络的关系: - 活文档 §3.3 KV cache 压缩 6 件套(GEAR/TurboQuant/MosaicKV/SAW-INT4等)+ §3.5 PD disaggregation(Mooncake/LMCache等)已立;C2KV = KV cache 跨请求复用第 1 件学术锚,填补"可组合跨请求 KV cache"系统性学术工作空白 - 与 LMCache(跨引擎跨请求共享)和 RestoreKV(恢复式 KV 压缩)形成 KV cache 复用三路线:跨引擎共享 / 恢复式压缩 / 可组合跨请求复用
建议归入节: §3.3 KV cache 压缩;§3.5 PD Disaggregation 与分布式 KV;O250 试金石
增量 3【推理引擎 · §1.(1) + §1.(7)】vLLM Semantic Router v0.3 Themis 有状态生产级语义路由 + Fusion in 路由 2026-06-12 ★★★
来源: inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-06-12)
arXiv: 无(vLLM Blog 官方)
要点: - 核心特性: vLLM Semantic Router v0.3 Themis = 有状态生产级语义路由 + Fusion in 路由;从无状态语义路由升级为有状态,支持 session 级别路由决策 - Fusion in 路由: 在路由层而非应用层做语义聚类/融合,减少对下游推理引擎的重复请求 - 定位: 与 inference.md §4.3 SAGA(Program-Level Scheduling) + §4.2 Regime-Aware Routing + LAAR(长上下文路由)均邻接,但这些是请求级/调度器级别路由;Semantic Router v0.3 是引擎入口层的语义路由 - 邻接关系: 与 llm-d(§5.1 CNCF Sandbox)MaxScorePicker + LAAR Envoy EPP filter 共同构成多层次路由体系
与活文档现有脉络的关系: - 活文档 §1.(1) 推理引擎新增 vLLM Semantic Router v0.3 Themis = 有状态生产级语义路由第 1 件;与 ByteByteGo(§6.1 ByteByteGo OpenAI Agent Loop"Cache-aware routing")和 LAAR(§4.2 Regime-Aware Routing)形成三层路由:入口语义路由 / 调度器路由 / 引擎内路由
建议归入节: §1.(1) vLLM Semantic Router v0.3;§4.2 Regime-Aware Routing;§6.1 Agentic 推理三层架构收敛;O251 试金石
增量 4【推理调度 · §4.2】AMPD — ICML 2026 自适应 Multi-round Prefill/Decode 路由 ★★★
来源: inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 6;inbox/spark/2026-08-09-llm-infra-e1prep.md 增量 5
arXiv: 2602.14516(ICML 2026)
要点: - 核心问题: Multi-round LLM 工作流(ReAct Agent 工具调用、迭代 RAG)产生交错的 prefill-decode 负载;传统 PD co-location(vLLM)和 PD disaggregation(Dynamo)各有瓶颈——co-location 在 multi-round 场景导致 prefill/decode 互相干扰;disaggregation 在单轮场景固定拆分开销不划算 - 方案: AMPD = Adaptive Multi-round Prefill/Decode,自适应决定每个请求阶段是 co-locate 还是 disaggregate;自适应路由机制 + Prefill 重新排序策略 - 基线对比: AMPD vs vLLM(PD co-lo) vs vLLM-Continuum(multi-round 专用) vs Dynamo(PD disaggregation) - 代表场景: Agent(ReAct) 和迭代 RAG 是 multi-round 两大代表 - 关键引语(推断): 多轮推理中 PD 分离策略不能一刀切,需动态适配
与活文档现有脉络的关系: - 活文档 §4.2 Regime-Aware Routing(arXiv:2607.09248)已立"O(1)-competitive 非先知调度算法";AMPD = Multi-round 场景下自适应 PD 路由第 1 件 ICML 2026 学术锚,填补"多轮 Agent/RAG 工作负载的动态 PD 分离"系统性研究空白 - 与 Dynamo(固定 PD 分离)和 vLLM-Continuum(专用 multi-round)形成 PD 分离三路线:固定分离 / 专用 multi-round / 自适应分离
建议归入节: §4.2 Regime-Aware Routing;§6.1 Agentic 推理(ReAct/迭代 RAG);O252 试金石
增量 5【推理调度 · §4.1 + §4.2】LLM Serving 数学优化 Position Paper + Training-Free Self-Scheduling — ICLR 2026 双证 ★★★
来源: inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 8-9;inbox/spark/2026-08-09-llm-infra-e1prep.md 增量 5
arXiv: 2605.01280v1(Position Paper ICLR 2026);hZmG4z68Je(OpenReview ICLR 2026)
要点:
(a) LLM Serving 需要数学优化,而不是启发式(arXiv:2605.01280v1 · ICLR 2026): - 核心论断: 当前 LLM serving 的请求路由和负载均衡主要依赖 heuristics,缺乏 worst-case 理论保证 - 理论结果: 即使在对抗性请求序列下,优化方法可达到 Ω(√(B log G)) 的 imbalance 改善因子(与基线比);B = per-worker batch size,G = worker 数量;收益随集群规模和 batch 容量增加而增加 - 意义: 桥接 OR(Operations Research)优化社区和 LLM serving 社区;这是inference.md §4.1理论困境的学术锚升级(inference.md v47 已引 Position Paper 思想,本棒补充具体 arXiv 号) - 状态: ICLR 2026 Under Review
(b) Training-Free Self-Scheduling(OpenReview hZmG4z68Je · ICLR 2026): - 核心方法: 自调度方法避免 head-of-line blocking,实现高吞吐、低延迟;无需训练,在线调度 - 与 vLLM continuous batching 关系: "免训练 vs 训练"对比;两者均可避免 head-of-line blocking,但机制不同
与活文档现有脉络的关系: - 活文档 §4.1 理论困境已引 Position Paper 思想;arXiv:2605.01280v1 = 推理调度"数学优化"学派第 1 件正式学术锚,Ω(√(B log G)) 改善因子有具体理论支撑 - Training-Free Self-Scheduling = 推理调度"免训练自调度"学派第 1 件;与 Flow-Controlled Scheduling(§4.5)邻接但机制不同
建议归入节: §4.1 理论困境与 Position Paper;§4.2 Regime-Aware Routing;O253 试金石
增量 6【推理引擎 · §1.(1) + §1.(7)】vLLM 2026-07 Blog 路线图净新增 — DiffusionGemma + Micro-Agent + Tencent Hunyuan MoE Backend + TileRT + vLLM Day-0 更多模型 ★★★
来源: inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-07);inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md 保留条目 1
arXiv: 无(官方博客)
要点:
(a) DiffusionGemma — 首个 Diffusion dLLM 原生支持(2026-06-09): - 意义: vLLM 成为首个支持扩散语言模型(dLLM) serving 的框架;传统 dLLM 受限于迭代去噪推理,服务化难度大 - 定位: 继 inference.md v47 已记录的多模态(vLLM-Omni)之后,Diffusion 语言模型 + vLLM serving 融合第 1 件
(b) Micro-Agent — 协作式超越 Frontier 模型(2026-06-23): - 意义: 多 Agent 协作推理框架,目标超越 Frontier 模型(OpenAI / Anthropic) - 邻接: 与 Policy-Driven Runtime(§2.5 推理工程学第 9 维)邻接
(c) Tencent Hunyuan MoE Backend(2026-07-01): - 意义: vLLM × HPC-Ops:腾讯 Hunyuan MoE 高性能 attention + backend;第二个区域定制 backend(第一个是 vLLM Korea MI300X) - 关键: 与 vLLM Korea MI300X 形成"区域 HPC-Ops × vLLM"双栖战略,印证 vLLM 生态多地域扩展
(d) TileRT Specialized Decode — 低延迟推理专用 Decode(2026-07-14): - 意义: TRT × vLLM:TileRT 在 vLLM 内实现低延迟推理专用 Decode 方案;继 DFlash 之后 NVIDIA 与 vLLM 第二个深度协同(DFlash 是 block diffusion,TileRT 是 tile-level 编译优化)
(e) vLLM Day-0 支持 NVIDIA Nemotron 3 Ultra(2026-06-03): - 继 inference.md v47 已记录 Nemotron 3 Super 之后,Nemotron 3 Ultra Day-0 追加;vLLM Day-0 支持进入"Nemotron 全系列覆盖"阶段
(f) vLLM on DGX Spark(2026-05-28): - NVIDIA DGX Spark 个人开发栈部署指南;从企业级 K8s 部署扩展到个人开发者环境
与活文档现有脉络的关系: - 活文档 §1.(1) 推理引擎 vLLM 分支已覆盖 vLLM v0.26-0.27/SpecDec/Model Runner V2/TGI EOL/Quark Eagle3/llm-d Dynamo;本增量 = vLLM 2026-06~07 Blog 路线图净新增 6 件:DiffusionGemma + Micro-Agent + Tencent Hunyuan MoE + TileRT + Nemotron 3 Ultra Day-0 + DGX Spark - 使 vLLM 分支从"v0.26→0.27→0.28"版本演进拓展为"模型支持+硬件协同+路由+推理模式+部署环境"多维度全面覆盖
建议归入节: §1.(1) vLLM Blog 2026-07 路线图净新增;§2.7 Token-Operations 四层架构;O254 试金石
二、邻接增量(补充纳入,不单独列章)
邻接 A【推理引擎 · §1.(1)】HPC-Ops × SGLang — Tencent Hunyuan + SGLang Team 2026-08-07 生产级 benchmark ★★★
来源: inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md 保留条目 1;inbox/spark/2026-08-09-llm-infra-e1prep.md 增量 6
arXiv: 无(LMSYS Blog 官方 2026-08-07)
要点: - 来源: Tencent Hunyuan AI Infra + SGLang Team 联合发布(LMSYS Blog 2026-08-07) - 关键数据(混合 batch = 1×128K + 31×4K): SGLang 动态调度比 FlashInfer 快 2.95×;SGLang 比 vLLM Triton CUTLASS 最高快 3.13× - Benchmark(latency µs, batch 1024): HPC-Ops 281.4 / SGLang 300.5 / vLLM Triton 438.3;SGLang 动态调度优势在中等 batch(64-256)最显著 - 内核: Dynamic Attention + Fused MoE + Router GEMM,已合入 SGLang main branch - 工程价值: 混合 prefix 场景(agentic 工作流典型特征)加速效果最显著,直接对位 inference.md §6.1 Agentic 推理
建议归入节: §1.(1) SGLang;§6.1 Agentic 推理三层架构收敛
邻接 B【推理引擎 · §1.(1)】Photon 2.0 — Physical AI 专用推理引擎,Megakernel 编译 ★★
来源: inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md 保留条目 2
arXiv: 无(Moondream Blog 官方)
要点: - 差异化定位: 专为 Physical AI 场景设计(区别于通用 chat 引擎);冷启动优势明显 - Megakernel 编译: 整图编译为单 GPU kernel,消除 operator 间同步开销,编译器可见性跨 operator 边界 - Benchmark(ChartQA): Photon 2.0 在所有 batch size(1/2/4/8)均优于 vLLM 和 SGLang - 限制: 目前仅支持 H100;与 vLLM/SGLang 非竞争而是补充
建议归入节: §1.(1) 推理引擎选型图谱 新兴引擎
邻接 C【推理工程学 · §4.2 + §6.1】LAAR 长上下文路由 + llm-d Envoy EPP filter 二次确认 ★★
来源: inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 7;inference.md v47 已立 LAAR(arXiv:2604.15732v1)
要点: - LAAR(Long-context-Aware Adaptive Routing): 长上下文(>100K token)场景下,prefill 计算成为成本主体,内存带宽成为瓶颈;LLM-d MaxScorePicker + Envoy EPP filter 实现;路由策略:load-aware + session-affinity + cache-affinity - 二次确认: 本棒 jay 17:35 run 二次确认 LAAR 与 llm-d 的具体集成实现路径
建议归入节: §4.2 Regime-Aware Routing;§5.1 llm-d CNCF Sandbox
邻接 D【推理工程学 · §3.3】Colibri 纯 C 零依赖推理引擎 14.7K★ ★★
来源: inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 5;inference.md v47 已立 Colibri
要点:
- 纯 C 实现,零外部依赖,支持 744B MoE 模型推理;对标 llama.cpp / ollama 的轻量级方案
- GitHub URL 待核实: jay 标注"推断 github.com/toblerity/colibri 可能不准确"
- Stars 14.7K 增长快,社区关注度高但项目成熟度待核
建议归入节: §1.(1) 推理引擎 6 寡头+2+1 新兴引擎
三、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | vLLM Conference "1000+ TPS 推测解码"是目标还是已有数据: 路线图层面的愿景还是已有实测达到的数字;具体哪个硬件配置(H100/B200/B300) | jay 8-9 1505 engineering-filter | 🟡 中 |
| 2 | C2KV "跨请求直接复用"具体收益: 对照基线是 no-cache 还是现有 prefix caching;具体吞吐/延迟收益待核 | jay 8-9 1950 engineering-filter arXiv:2607.17715 | 🟡 中 |
| 3 | AMPD "自适应决定 co-locate/disaggregate" vs vLLM-Continuum 具体分工: 两者都是 multi-round 专用,AMPD 相对 vLLM-Continuum 的具体优势场景 | jay 8-9 1735 arXiv:2602.14516 | 🟡 中 |
| 4 | Photon 2.0 "所有 batch size 均优于 vLLM/SGLang"具体测试条件: ChartQA 数据集/模型版本/H100 配置;Megakernel 在长序列或非 Physical AI 场景是否仍有优势 | jay 8-9 1950 engineering-filter | 🟡 中 |
| 5 | Colibri GitHub URL 可信度: jay 标注"推断 URL 可能不准确";Stars 增长快但项目活跃度待核,需核实真实仓库 | jay 8-9 1735 | 🟡 中 |
| 6 | DiffusionGemma "首个 Diffusion dLLM 原生支持"边界: vLLM upstream 适配成熟度;与传统 AR 语言模型生产性能对比;具体哪个 diffusion 方法(Diffusion LM/SDPA/其他) | jay 8-9 1735 vLLM Blog 2026-06-09 | 🟢 低 |
四、可引用 arXiv 号列表
🆕 净增 6 件:
| arXiv 号 | 论文 | 主题 | 价值 |
|---|---|---|---|
| 2607.17715 | C2KV:Composable KV Cache(KDD 2026,C2Token 机制,跨请求复用,GitHub:s7a9/C2KV) | KV cache 跨请求复用新机制 | ★★★★ |
| 2602.14516 | AMPD:Adaptive Multi-round Prefill/Decode(ICML 2026,multi-round 自适应 PD 路由) | 多轮推理自适应 PD 分离 | ★★★ |
| 2605.01280v1 | LLM Serving 需要数学优化 Position Paper(ICLR 2026,Ω(√(B log G))改善因子) | 推理调度数学优化理论锚点 | ★★★ |
| hZmG4z68Je | Training-Free Self-Scheduling for Efficient LLM Inference(OpenReview ICLR 2026) | 免训练自调度 | ★★ |
| 2604.15732v1 | LAAR:Long-context-Aware Adaptive Routing(Envoy EPP filter + llm-d MaxScorePicker) | 长上下文路由(二次确认) | ★★ |
| 2608.03036 | LLM Serving in the Wild(vLLM/SGLang 使用模式实证,TGI 维护确认) | 推理引擎实证研究(二次确认) | ★★ |
🔄 沿用(活文档 Aug 8 基线已立,本棒交叉印证):
- 2608.00101(Agentic Coding in the Wild) — 与 vLLM Conference Agentic Production Workloads talk 邻接
- 2606.20295v2(Token-Operations Survey) — 与 vLLM Blog 路线图多级 KV Offloading 邻接
- 2607.24062(ACRL) — 与 Native RL APIs in vLLM 上游解决方案邻接(已在 spark 棒覆盖)
- 2607.23933(SpecBox) — 与 SLINFER HPCA 2026 Serverless LLM 邻接
- 2403.05527(GEAR) — 与 vLLM Conference 路线图生产级量化 KV cache 压缩邻接
- 2608.00742(Multi-tenant K8s for AI) — 与 Tencent Hunyuan MoE Backend 邻接
- 2605.27744v2(Policy-Driven Runtime) — 与 AMPD 多轮自适应路由邻接
- 2604.00499(Uncertainty-Aware) — 与 AMPD/LAAR 同属推理调度 9 学派
五、检查过的来源清单
inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md→ vLLM Blog 2026-07 路线图 9 件 + AMPD + LAAR + 数学优化 Position Paper + Training-Free Self-Scheduling + Colibri + vLLM v1 Engine + 4 引擎横评inbox/jay/2026-08-09T1950-jay-engineering-filter-inference-agent-protocols.md→ HPC-Ops × SGLang + Photon 2.0 + C2KV + gpuinsights + DeepInfra + atomic.chat + A2A 协议工程inbox/jay/2026-08-09T1620-jay-csdn-inference-rag-engineering-highvalue.md→ CSDN vLLM/SGLang 性能横评 + LMDeploy 选型 + 工程 benchmark 数据表inbox/jay/2026-08-09-research-digest.md→ Token-Native Storage(2608.02376) + Lotus(2607.26227) + Filtered Vector Search(2608.05441)等 7 件(数据库为主,部分邻接)inbox/spark/2026-08-09-llm-infra-e1prep.md→ 增量 5(AMPD + LAAR + 数学优化 + Training-Free Self-Scheduling)全部邻接 inference 主题;vLLM Conference 议程邻接inbox/tom/2026-08-09-0900-hf-daily-2026-08-09.md→ HF Daily 15 篇,无 inference 专项新卡inbox/tom/2026-08-08-inference-e1prep.md→ Aug 8 基线(6 条主线+5 条邻接,Agentic Coding in the Wild/Token-Operations Survey/LLM Serving in the Wild/ACRL/GEAR/Multi-tenant K8s)inbox/tom/2026-08-07-inference-e1prep.md→ Aug 7 基线(4 条主线+3 条邻接,Festina/Policy-Driven Runtime/Uncertainty-Aware/Pythia等)paper_cards/近 3 天(766-823 共 58 张) → inference 主分类 0 张;主分类 agent×16/multimodal×14/evaluation×8/engineering×7/rag×6/其他×7;新卡中与 inference 最接近的是 765-RestoreKV(§3.8 RestoreKV 已立) + 807-Continual Learning in Transition(工程泛化邻接)organized/knowledge/inference.mdv47 → 基线活文档(2026-08-08 更新)work-queue.md2026-08-09 22:00 → 选题榜无 inference 新增
六、无显著新增量的领域(如实说明)
以下 Aug 8 基线已立标方向,本棒检查后确认无新增量,不重复列出:
- vLLM 0.27 SpecDec 三合一(DFlash+Mixed KV+Thinking budget) — 已在 inference.md §2.3/§2.4 充分覆盖;本棒 HPC-Ops × SGLang 数据属于 SGLang 侧印证,非新增路线
- Quark Eagle3 on AMD MI355X — spark 8-9 棒已覆盖 vLLM 0.18 upstream 二次确认;本棒无新数据
- GEAR 4-bit KV cache + AMD Quark Team 生产落地 — 已在 inference.md §3.3 充分覆盖
- ACRL 训练-推理精度不一致 — spark 8-9 棒已覆盖与 vLLM Native RL APIs 关联;本棒无新 arXiv 号
- Token-Operations Survey 全栈综述 — 已在 inference.md §2.7 充分覆盖;本棒 vLLM Conference 路线图与 Token-Operations Survey 多级 KV Offloading 方向一致但无新量化数据
- Agentic Coding in the Wild 生产规模实证 — 已在 inference.md §6.1 充分覆盖;本棒无新实测数据
Tom · 2026-08-09 22:20 CST · E1 日间预消化轮 · inference 主题 · 不执行 GitHub 写操作