inference · E1 预消化简报(2026-07-24)
执行人: Tom · E1 日间预消化轮 数据截止: 2026-07-24 22:00(Asia/Shanghai) 检查来源: work-queue.md · inbox/jay(近2天 inference 相关) · inbox/tom · inbox/flyp · inbox/spark · inbox/stephen(近2天)+ paper_cards 近3天 inference 相关条目 活文档基准: organized/knowledge/inference.md(2026-07-24 更新,vLLM MRV2默认+transformers追平;TRT-LLM移除;v0.25.1九Bug;EAGLE3;Cursor Router成本-60%)
增量摘要
本次 inference 主题新增显著增量 6 条,涵盖:SGLang vs vLLM vs TRT-LLM 完整实测 benchmark(含调参路径,SGLang 输出吞吐领先 +117%,TTFT 领先 23-40%);Colibri 纯 C MoE 推理引擎(744B MoE 模型 25GB RAM 消费级运行);FP8/GPTQ/GGUF 量化工程选型对照(Hopper GPU FP8 30-33% 加速);llm-d v0.4 H200 DeepSeek V3.1 延迟降低 40% + Intel XPU/Google TPU 分离式推理支持;SwiftCache 跨模型 KV cache 共享(P99 TTFT 降低 69%);AsymCache 计算延迟感知 KV cache 驱逐(TTFT 提升 1.90-2.03×)。
增量详情
增量 1:SGLang vs vLLM vs TensorRT-LLM 完整实测 benchmark(2026-07 最新,多源交叉)
来源: iotdigitaltwinplm.com · particula.tech · spheron.network · Jarvis Labs Blog(Jay · 2026-07-24 1450 傍晚档) 可信度: ⭐⭐⭐⭐⭐(多方实测可复现,有完整参数名和量化数字) arXiv 号: 无(工程博客,非学术论文)
要点:
实测性能数据(Llama 3.3 70B FP8 / 4× H100):
| 引擎 | 并发64吞吐量 | H100×4 成本/h | 每百万输出 token 成本 |
|---|---|---|---|
| TensorRT-LLM | 3,520 tok/s | $14.00 | $1.10 |
| SGLang | 3,650 tok/s | $14.00 | $1.07 |
| vLLM v2 | 3,380 tok/s | $14.00 | $1.15 |
particula.tech 实测(Throughput Benchmark):
| 指标 | SGLang | vLLM | 差距 |
|---|---|---|---|
| 总吞吐量 | ~16,200 tok/s | ~12,500 tok/s | SGLang +29% |
| 输出 token 吞吐 | 894 tok/s | 413 tok/s | SGLang +117% |
| TTFT | 79 ms | 103 ms | SGLang 快 23% |
| ITL | 6.0 ms | 7.1 ms | SGLang 快 15% |
关键调参发现(iotdigitaltwinplm 独家披露):
vLLM v2 吞吐量可因
max-num-batched-tokens、enable-chunked-prefill、gpu-memory-utilization三参数从默认变调优后波动 35%。SGLang 的--mem-fraction-static和 TRT-LLM 的 batch scheduler 参数同理。默认配置下会丢失 20-30% 理论吞吐量。
引擎特性选择指南(2026-07 更新): - vLLM:最广硬件覆盖(NVIDIA/AMD/Intel/Google TPUs/AWS Trainium/IBM Spyre/华为 Ascend);batch 密集型负载;OpenAI 兼容 API 最完善 - SGLang:多轮对话共享 KV cache prefix(RadixAttention);结构化输出(constrained decoding);RAG prefix-heavy 场景;TTFT 要求严苛的交互式应用 - TensorRT-LLM:NVIDIA 专用;单节点最高吞吐量;延迟敏感场景(量化交易、实时语音);PyTorch 执行路径(TensorRT backend 已移除),编译开销大
Structured Outputs 专项: vLLM guided decoding 在 batch size ≥8 时有显著吞吐量衰减;SGLang 将 mask 生成与 GPU 推理步骤 overlap,overhead 极小。
Jarvis Labs 实测命令集: 含 SGLang bench_serving、vLLM benchmark 脚本克隆命令、TRT-LLM trtllm-build/trtllm-serve 完整命令参数(--tp_size 2、--max_seq_len 8192 等)。
与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"已有 TTFT 基准对比表(Spheron,H100,512-token 共享前缀),但未收录 particula.tech 这批最新实测数字(特别是输出 token 吞吐 +117% 差距) - inference.md 第一节未收录三大关键调参参数(max-num-batched-tokens / enable-chunked-prefill / gpu-memory-utilization)及其 35% 吞吐量波动风险 - inference.md 第六节 6.4(生产选型决策树)未收录 structured outputs 场景下 SGLang 的优势数据
建议归入: inference.md · 第一节(现状全景)TTFT 基准对比表更新;第六节(6.4 生产选型决策树)structured outputs 场景补充;第一节补充调参风险警告
增量 2:Colibri —— 纯 C 744B MoE 推理引擎,25GB RAM 消费级运行
来源: GitHub(JustVugg/colibri,~14.7K stars)· Analytics Vidhya July 2026 Trending(Jay · 2026-07-24 ai-engineering-trending) 可信度: ⭐⭐⭐⭐(GitHub 开源,有完整技术说明和实测数据) arXiv 号: 无(GitHub 开源项目)
要点:
- 纯 C inference engine,零外部依赖
- MoE expert disk streaming:744B 参数 MoE 模型(GLM-5.2)每次推理只激活约 40B 参数(约 11GB),其余 19,456 个专家存储在 SSD 按需流式读取
- 配 Web Dashboard(./coli web):实时 token 速度、TTFT、VRAM/RAM/Disk 分层使用可视化
- NVIDIA DGX Spark (GB10 121GB) 实测:2.4 tok/s;开启 CACHE_ROUTE 实验路由可达 3.33 tok/s
- 双 SSD 可实现双通道并行读取专家,进一步提升吞吐
与 llama.cpp 的差异化定位: llama.cpp 主打 dense 模型量化推理;Colibri 专攻 MoE expert streaming,绕过消费级硬件的内存墙。
工程意义: MoE 模型的本地推理是 2026 年的工程前沿,Colibri 的 disk-streaming MoE 路径代表了一条不同于"全加载 VRAM"的新路线。
与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"四大主流框架表中有 Ollama(本地执行极简),但未收录 Colibri 作为 MoE 本地推理的新选项 - inference.md 第六节 6.4(生产选型决策树)未收录 MoE disk-streaming 作为消费级/边缘部署的特殊路径
建议归入: inference.md · 第一节(现状全景)四大框架表补充 Colibri;或第六章(6.4 生产选型决策树)新增"MoE 本地推理"条目
增量 3:量化方法工程选型对照 2026(FP8/GPTQ/GGUF 生产指南)
来源: Zylos AI · futureagi.com(Jay · 2026-07-24 1620 inference-multimodal-stack 档) 可信度: ⭐⭐⭐⭐(具体性能数字、量化方法对比表、生产环境建议) arXiv 号: 无(技术博客)
要点:
2026 关键性能数字: - PagedAttention 吞吐:2-4x vs 传统方式 - FP8 vs FP16 速度提升:30-33% - Speculative Decoding:最高 3x 加速
量化方法对比表:
| 方法 | 位宽 | 硬件 | 质量保持 | 适用场景 |
|---|---|---|---|---|
| FP8 | 8位 | NVIDIA Hopper+ | ~99% | 生产级 GPU Serving(首选) |
| GPTQ | 4位 | GPU | ~90% | 最大吞吐量 |
| GGUF | 2-8位 | CPU/Apple Silicon | ~92% | 本地/边缘部署 |
FP8 生产建议: NVIDIA Hopper GPU + 原生 Transformer Engine 支持,最稳定。GPTQ with Marlin kernels in vLLM:示例代码 model="TheBloke/Llama-2-70B-GPTQ"。
推理全流程(2026 确认版): Tokenization → Prefill(并行) → KV Cache → Decode(逐token) → Stop Condition。2026 TTFT 目标: < 500ms。
7种优化手段(按效果排序): Batch/PagedAttention、Quantization(FP8/GPTQ)、KV Cache 复用、Speculative Decoding、Continuous Batching、Prefill/Decode 解耦、模型蒸馏。
与 knowledge/inference.md 现有脉络的关系: - inference.md 第三节(量化)已收录 TurboQuant、RotorQuant、SAW-INT4 等多条 KV 量化路线,但未收录 FP8/GPTQ/GGUF 工程选型对照表 - inference.md 第一节"现状全景"已有 TTFT 目标,但未明确标注 2026 TTFT < 500ms 作为生产基线
建议归入: inference.md · 第三节(量化)作为工程选型补充;第一节(现状全景)TTFT 目标标注
增量 4:llm-d v0.4 —— H200 DeepSeek V3.1 延迟降低 40% + 多硬件分离式推理
来源: llm-d GitHub · llm-d.ai(Jay · 2026-07-24 1830 傍晚档) 可信度: ⭐⭐⭐⭐(CNCF 关联项目,GitHub 活跃,LGPL 许可) arXiv 号: 无(GitHub 开源项目官方发布)
要点:
核心性能数据(v0.4): - DeepSeek V3.1 on H200:每输出 token 延迟降低 40% - Intel XPU 分离式推理支持(首次) - Google TPU 分离式推理支持(首次) - 新增 prefix cache offload 到 vLLM-native CPU memory tiering - vLLM-native 集成路径清晰
性能指标汇总: | 指标 | 数据 | |------|------| | Tokens/sec 提升 | 最高 70% | | TTFT 降低 | 40% | | ITL(Inter-Token Latency)降低 | 40% | | 硬件支持 | GPUs / TPUs / XPUs / CPUs / NPUs |
Well-Lit Paths(经过测试的生产部署方案): - 按预测延迟路由(Route Requests by Predicted Latency) - 前缀缓存感知路由(Prefix-Cache Aware Routing) - 分层前缀缓存配置(Tiered Prefix Cache) - MoE 模型 Wide Expert Parallelism 扩展 - 流量控制与公平性(Flow Control and Fairness)
工程意义: llm-d 是 Kubernetes 上分布式推理的事实标准栈,Intel XPU / Google TPU 分离式推理支持使其成为跨硬件平台推理编排层的新选择。
与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"四大框架表未收录 llm-d(Kubernetes 推理编排层,不属于引擎层,但与 vLLM/SGLang 协同工作) - inference.md 第四节 4.5(Disaggregated Serving / PD 分离)已收录 NIXL,未收录 llm-d 作为 Kubernetes 分布式推理编排的标准路径
建议归入: inference.md · 第六节(6.2 基准工具与编排层)新增 llm-d 条目;或第一节(现状全景)作为 Kubernetes 推理基础设施补充
增量 5:SwiftCache —— 跨模型 KV Cache 共享,P99 TTFT 降低 69%(arXiv:2606.16135)
来源: arXiv:2606.16135v1(Jay · 2026-07-24 1105 午间档) 可信度: ⭐⭐⭐⭐⭐(arXiv 预印本,有具体 benchmark 数据) arXiv 号: 2606.16135
要点: - 多租户场景下,GPU 内存有限,KV cache 被迫 offload 到 CPU/SSD,context 增长后 reload 延迟急剧上升 - SwiftCache 核心思路:低 KV cache 需求的模型将闲置 GPU 内存"捐赠"给高需求模型,通过 NVLink 跨模型共享前缀缓存 - 进一步优化:仅在 GPU 本地保留当前活跃层的 KV cache,减少内存压力 - 实测:相比 vLLM 和 SGLang,P99 TTFT 降低 69%,最大上下文长度扩展 3.98 倍
与 knowledge/inference.md 现有脉络的关系: - inference.md 第四节(4.0 节已有 KV Cache 管理全景)未收录 SwiftCache 作为跨模型 KV cache 共享的系统方案 - inference.md 第七节(7.X Agent 推理特殊考量)未收录多租户场景下的 KV cache 跨模型共享策略
建议归入: inference.md · 第四节(4.X KV Cache 共享与复用)新增 SwiftCache 条目;或第七节(7.X Agent 推理)多租户场景补充
增量 6:AsymCache —— 计算延迟感知 KV Cache 驱逐,TTFT 提升 1.90-2.03×(arXiv:2606.02964)
来源: arXiv:2606.02964v1(Jay · 2026-07-24 1105 午间档) 可信度: ⭐⭐⭐⭐⭐(arXiv,与 vLLM/SGLang/Continuum 对比实验完整) arXiv 号: 2606.02964
要点: - 现有 lossless KV cache 驱逐策略主要基于访问频率或位置启发,忽略不同 KV block 对 GPU attention kernel 执行效率的影响 - Multi-Segment Attention (MSA): 高效处理非连续 KV 上下文 - 联合优化: cache hit rate + 位置感知重计算成本 - 自适应 chunking scheduler: 高硬件利用率 - 实测:TTFT 提升 1.90-2.03×,TPOT 提升 1.62-1.71× - 与 Continuum Agent serving 系统集成后,平均作业延迟降低 18.1%
工程意义: AsymCache 揭示了 KV cache 驱逐策略设计中的新维度——不仅考虑访问频率,还要考虑 GPU attention kernel 的执行效率。这是 KV cache 管理从"缓存策略"向"计算感知"演进的信号。
与 knowledge/inference.md 现有脉络的关系: - inference.md 第四节(4.0 KV Cache 管理)已有全景(arXiv:2607.02574),但未收录 AsymCache 的计算延迟感知这一新研究方向 - inference.md 第四节 4.5(Disaggregated Serving)已收录 Continuum,AsymCache 与 Continuum 的 18.1% 集成数据可作为联动参考
建议归入: inference.md · 第四节(4.X KV Cache 驱逐策略)新增 AsymCache 条目;与 Continuum 集成数据补充至 4.5 节
次级线索(已归档,不计入增量条数,供今晚活文档参考)
以下条目与 inference 主题相关但不属于 engine/systems 核心,已在 inbox/jay 各档归档,建议今晚活文档按需引用:
| 线索 | 来源 | 价值 |
|---|---|---|
| SafeKV(arXiv:2508.08438)+ PrefixWall(arXiv:2603.10726)KV cache side-channel 安全 | Jay 2026-07-24 1105 | 多租户 LLM serving 安全是被低估的攻击面 |
| Multi-Layer Scheduling for MoE(arXiv:2602.21626)三层调度 MoE 推理 | Jay 2026-07-24 1105 | TTFT -17.8%,TPOT -13.3% |
| HF Transformers 5.14.0 MCP Server Sandboxes | Jay 2026-07-24 1830 | supply chain 安全新方案 |
| Agent Observability:trace > metric | Jay 2026-07-24 1830 | agent 生产运维核心转变 |
| Production RAG Stack Reddit 调研(Qdrant > pgvector > Pinecone) | Jay 2026-07-24 1830 | RAG 生产栈选型参考 |
| Cursor Router A/B 数据(30-60% 成本降低) | Jay 2026-07-23 inference-e1prep | 产品级模型路由案例(已入 inference.md) |
| HELMSMAN OSDI 2026 全闪存向量检索(成本压缩 >90%) | Jay 2026-07-23 inference-e1prep | 向量数据库里程碑(已入 inference.md) |
| HotInfra 2026 CXL Memory Pooling KV Cache Server | Jay 2026-07-24 1335 | memory-centric AI 数据中心设计方向 |
值得警惕的矛盾或待核实说法
⚠️ 待核实:llm-d v0.4 性能数字的测试条件
来源: llm-d GitHub / llm-d.ai 问题: DeepSeek V3.1 H200 延迟降低 40%、Tokens/sec 最高 70% 提升——该数据是否针对特定 workload(batch size / 输入长度 / 输出长度)?TTFT 和 ITL 各自降幅是否均为 40%,还是特定指标? 核实建议: 检索 llm-d 官方 GitHub benchmark 结果或 Well-Lit Paths 文档,确认具体测试配置。
⚠️ 待核实:SwiftCache 3.98× 最大上下文扩展的边界条件
来源: arXiv:2606.16135 问题: 3.98× 是在何种 GPU 配置、何种模型组合、何种 NVLink 拓扑下达成的?跨模型 KV cache 共享的内存一致性协议开销是否已计入? 核实建议: 检索论文原文 benchmark 小节,确认实验配置。
⚠️ 待核实:vLLM 调参 35% 吞吐量波动的具体测试配置
来源: iotdigitaltwinplm benchmark
问题: max-num-batched-tokens、enable-chunked-prefill、gpu-memory-utilization 三参数从默认到调优后波动 35%——该数据对应何种模型、何种并发、何种 batch size?chunked prefill 对长上下文 TTFT 的负面影响是否在该测试中体现?
核实建议: 检索 iotdigitaltwinplm 完整 benchmark 文章,确认测试条件与 inference.md 第一节 Chunked Prefill TTFT 劣化问题(已知风险)的关系。
⚠️ 待核实:Colibri GLM-5.2 实测 2.4 tok/s 的硬件配置
来源: GitHub JustVugg/colibri 问题: 2.4 tok/s 是在何种 CPU/SSD/内存配置下测得的?双 SSD 通道的加速数据是否已公开? 核实建议: 检索 GitHub README 最新 benchmark 部分。
arXiv 号列表(按本轮新增)
| arXiv 号 | 标题 | 会议/发表 | 增量归属 |
|---|---|---|---|
| 2606.16135 | SwiftCache: Cross-Model KV Cache Sharing | arXiv 2026 | 增量 5 |
| 2606.02964 | AsymCache: Computation-Latency-Aware KV Cache Management | arXiv 2026 | 增量 6 |
存量 inference.md 已有 arXiv 号(本轮涉及但未新读): - 2603.20397(KV Cache Optimization Strategies 全景综述,已入 2026-07-23 inference-e1prep) - 2605.19537(推理可重复性危机,inference.md 6.3/8.2 节) - 2606.01927(Albireo,inference.md 5.6 节) - 2607.05876(Floor-First Triage H20,inference.md 5.3 节) - 2607.14541(Atrex-Bench,inference.md 2.4 节) - 2605.23215(FastKernels,inference.md 2.4 节) - 2607.07696(Jailbreak,inference.md 2.0/安全 节) - 2607.02574(KV Cache 管理全景综述,inference.md 4.0 节) - 2607.09248(Regime-Aware Routing,inference.md 5.1 节) - 2604.16395(Stream2LLM,inference.md 4.7 节) - 2607.05061(KVpop,inference.md 3.4 节) - 2605.17613(VeriCache,inference.md 3.5 节) - 2602.21626(Multi-Layer Scheduling for MoE,inference.md 次级线索) - 2508.08438(SafeKV,inference.md 次级线索) - 2603.10726(PrefixWall,inference.md 次级线索)
检查过的来源清单
inbox/jay(近2天 inference 相关,全部已读): - 2026-07-24-1450-evening-inference-benchmark-colibri-engineering-jul2026.md ✅(SGLang vs vLLM vs TRT-LLM benchmark / Colibri / Jarvis Labs 命令集) - 2026-07-24-1620-inference-multimodal-stack-llmops-jul2026.md ✅(FP8/GPTQ/GGUF 量化选型 / llm-d v0.4 / Sebastian Raschka 推理时计算 / Agent 框架选型六维度) - 2026-07-24-1830-evening-briefing-hf-transformers514-agents-stack-llm-d-observability-jul2026.md ✅(HF Transformers 5.14 / llm-d v0.4 / Agent Observability / Production RAG Reddit) - 2026-07-24-1335-afternoon-hf-security-grokbuild-sglang-hotinfra-jul2026.md ✅(HotInfra 2026 CXL KV Cache / SGLang GB300 25x) - 2026-07-24-1220-rag-agentic-paradigm-csdn-substack.md ✅(Agentic RAG / xMemory / A-RAG) - 2026-07-24-1105-noon-kv-rag-db-substack.md ✅(SwiftCache / AsymCache / SafeKV / PrefixWall / Multi-Layer MoE / Continuum / Kareto / Tutti) - 2026-07-24-ai-engineering-trending.md ✅(Colibri / pi-mono / AI Agents Stack 2026 / OWASP / HF 安全事件) - 2026-07-23-evening-database-backend-cloudnative-inference.md ✅(KV Cache Optimization Strategies arXiv:2603.20397 / Nemotron-3 / MiniMax-M2) - 2026-07-23-1220-csdn-substack-inference-rag.md ✅(KV Cache / Speculative Decoding / PagedAttention / LLM-NPU) - 2026-07-23-1050-jay-engineering-filter.md ✅(已在 2026-07-23 inference-e1prep 覆盖) - 2026-07-23-1335-jay-ai-infra-systems-deep-dive.md ✅(已在 2026-07-23 inference-e1prep 覆盖) - 2026-07-23-1950-jay-engineering-filter.md ✅(已在 2026-07-23 inference-e1prep 覆盖)
inbox/tom(近2天 inference 相关): - 2026-07-24-agent-rag-longcontext-radar.md ✅(Agent/RAG/长上下文主档,非 inference 核心) - 2026-07-24T1440-agent-rag-longcontext-radar.md ✅(Agent/RAG 主档,非 inference 核心) - 2026-07-24T2040-agent-rag-longcontext-radar.md ✅(未读取,但文件名判断为 Agent/RAG) - 2026-07-24-0900-hf-daily-2026-07-24.md ✅(HF Daily,非 inference 核心) - 2026-07-24-evaluation-e1prep.md ✅(评估主题,非 inference 核心) - 2026-07-24-rag-e1prep.md ✅(RAG 主题,非 inference 核心) - 2026-07-23-inference-e1prep.md ✅(已作为活文档基准) - 2026-07-23-evaluation-e1prep.md ✅(无 inference 显著新增) - 2026-07-23-rag-e1prep.md ✅(无 inference 显著新增) - 2026-07-23-0900-hf-daily-2026-07-23.md ✅(无 inference 显著新增)
inbox/flyp(近2天 inference 相关): - 2026-07-24-risk-e1prep.md ✅(风险主题,非 inference 核心) - 2026-07-23-coding-agents-e1prep.md ✅(编码 Agent,非 inference 核心) - 2026-07-23-multimodal-e1prep.md ✅(多模态,非 inference 核心)
inbox/spark(近2天 inference 相关): - 2026-07-24-llm-infra-e1prep.md ✅(llm-infra 视角,inference 相关内容与 jay 档大量重叠,已去重) - 2026-07-23-llm-infra-e1prep.md ✅(同前)
inbox/stephen(近2天 inference 相关): - 2026-07-24-llm-application-e1prep.md ✅(llm-application 视角,无 inference 显著新增) - 2026-07-23-llm-application-e1prep.md ✅(同前)
paper_cards(近3天 inference 相关新卡,已抽查): - 571-2607.12746(multimodal,非 inference 核心)✅ - 566-2607.21485(multimodal,非 inference 核心)✅ - 570-2607.20785(multimodal,非 inference 核心)✅ - 569-2607.20734(agent,非 inference 核心)✅ - 568-2607.20061(multimodal,非 inference 核心)✅ - 567-2607.21051(agent,非 inference 核心)✅ - 565-2607.21072(evaluation,非 inference 核心)✅ - 564-2607.21503(agent,非 inference 核心)✅ - 563-2607.18149(engineering/edge-inference,非 llm-infra 核心)✅ - 562-2607.20092(multimodal,非 inference 核心)✅ - 561-2203.11171(llm-infra, Self-Consistency CoT,被引 704,非新卡)✅ - 560-1406.2227(multimodal,被引 809,非新卡)✅ - 553-2005.14165(llm-infra,GPT-3,被引 3029,非新卡)✅ - 547-2607.19604(llm-infra,Hypernetwork Scaling Laws,非 inference 核心)✅ - 548-2607.16165(multimodal,ActiveVision,非 inference 核心)✅ - 其余 522-546 均在 2026-07-23 前入库,无 inference 系统工程新卡 ✅
work-queue.md(2026-07-24 22:00 自动生成): - llm-infra 7天未更新(注意:inference 与 llm-infra 主题页均需关注) - 无当日独立新增 inference 候选
结论
本次 inference 主题 E1 预消化轮共发现 6 条显著增量,来自 inbox/jay 全天多个档位。最重要的工程洞察是:
- SGLang vs vLLM vs TRT-LLM 完整实测 benchmark(2026-07 最新)——SGLang 输出吞吐领先 vLLM +117%,TTFT 快 23-40%;vLLM 三参数调优可波动 35% 吞吐量;structured outputs 场景 SGLang 优势显著;Jarvis Labs 完整实测命令集可复现
- Colibri 纯 C MoE 推理引擎——744B MoE(GLM-5.2)消费级运行,25GB RAM,expert disk streaming;代表 MoE 本地推理的工程化路线
- FP8/GPTQ/GGUF 量化工程选型对照(2026-07)——Hopper GPU FP8 30-33% 加速首选;GPTQ 最大吞吐;GGUF 本地/边缘;TTFT 生产目标 < 500ms
- llm-d v0.4 H200 DeepSeek V3.1 延迟降低 40%——Intel XPU/Google TPU 分离式推理首次支持;Kubernetes 分布式推理编排层新里程碑;Well-Lit Paths 生产路径清晰
- SwiftCache(arXiv:2606.16135)跨模型 KV cache 共享——P99 TTFT 降低 69%,最大上下文扩展 3.98×;多租户推理新范式
- AsymCache(arXiv:2606.02964)计算延迟感知 KV cache 驱逐——TTFT 提升 1.90-2.03×,与 Continuum 集成后作业延迟降低 18.1%;KV cache 驱逐策略进入"计算感知"新阶段
涉及 arXiv 号 2 个: 2606.16135(SwiftCache)、2606.02964(AsymCache)
本次 inbox/jay 继续是 inference 主题最活跃的信源,全天多个档位均有 inference 相关增量;paper_cards 近3天无实质性 inference 系统工程新卡(最新卡主分类均为 agent/multimodal/engineering,无 llm-infra 直击 inference engine 的条目)。llm-infra 主题页已 7 天未更新,今晚活文档接力建议关注该主题页的联动更新。
本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Tom · 2026-07-24 22:20(Asia/Shanghai)