inference · E1 预消化简报(2026-07-24)

执行人: Tom · E1 日间预消化轮 数据截止: 2026-07-24 22:00(Asia/Shanghai) 检查来源: work-queue.md · inbox/jay(近2天 inference 相关) · inbox/tom · inbox/flyp · inbox/spark · inbox/stephen(近2天)+ paper_cards 近3天 inference 相关条目 活文档基准: organized/knowledge/inference.md(2026-07-24 更新,vLLM MRV2默认+transformers追平;TRT-LLM移除;v0.25.1九Bug;EAGLE3;Cursor Router成本-60%)


增量摘要

本次 inference 主题新增显著增量 6 条,涵盖:SGLang vs vLLM vs TRT-LLM 完整实测 benchmark(含调参路径,SGLang 输出吞吐领先 +117%,TTFT 领先 23-40%);Colibri 纯 C MoE 推理引擎(744B MoE 模型 25GB RAM 消费级运行);FP8/GPTQ/GGUF 量化工程选型对照(Hopper GPU FP8 30-33% 加速);llm-d v0.4 H200 DeepSeek V3.1 延迟降低 40% + Intel XPU/Google TPU 分离式推理支持;SwiftCache 跨模型 KV cache 共享(P99 TTFT 降低 69%);AsymCache 计算延迟感知 KV cache 驱逐(TTFT 提升 1.90-2.03×)。


增量详情

增量 1:SGLang vs vLLM vs TensorRT-LLM 完整实测 benchmark(2026-07 最新,多源交叉)

来源: iotdigitaltwinplm.com · particula.tech · spheron.network · Jarvis Labs Blog(Jay · 2026-07-24 1450 傍晚档) 可信度: ⭐⭐⭐⭐⭐(多方实测可复现,有完整参数名和量化数字) arXiv 号: 无(工程博客,非学术论文)

要点:

实测性能数据(Llama 3.3 70B FP8 / 4× H100):

引擎 并发64吞吐量 H100×4 成本/h 每百万输出 token 成本
TensorRT-LLM 3,520 tok/s $14.00 $1.10
SGLang 3,650 tok/s $14.00 $1.07
vLLM v2 3,380 tok/s $14.00 $1.15

particula.tech 实测(Throughput Benchmark):

指标 SGLang vLLM 差距
总吞吐量 ~16,200 tok/s ~12,500 tok/s SGLang +29%
输出 token 吞吐 894 tok/s 413 tok/s SGLang +117%
TTFT 79 ms 103 ms SGLang 快 23%
ITL 6.0 ms 7.1 ms SGLang 快 15%

关键调参发现(iotdigitaltwinplm 独家披露):

vLLM v2 吞吐量可因 max-num-batched-tokensenable-chunked-prefillgpu-memory-utilization 三参数从默认变调优后波动 35%。SGLang 的 --mem-fraction-static 和 TRT-LLM 的 batch scheduler 参数同理。默认配置下会丢失 20-30% 理论吞吐量。

引擎特性选择指南(2026-07 更新): - vLLM:最广硬件覆盖(NVIDIA/AMD/Intel/Google TPUs/AWS Trainium/IBM Spyre/华为 Ascend);batch 密集型负载;OpenAI 兼容 API 最完善 - SGLang:多轮对话共享 KV cache prefix(RadixAttention);结构化输出(constrained decoding);RAG prefix-heavy 场景;TTFT 要求严苛的交互式应用 - TensorRT-LLM:NVIDIA 专用;单节点最高吞吐量;延迟敏感场景(量化交易、实时语音);PyTorch 执行路径(TensorRT backend 已移除),编译开销大

Structured Outputs 专项: vLLM guided decoding 在 batch size ≥8 时有显著吞吐量衰减;SGLang 将 mask 生成与 GPU 推理步骤 overlap,overhead 极小。

Jarvis Labs 实测命令集: 含 SGLang bench_serving、vLLM benchmark 脚本克隆命令、TRT-LLM trtllm-build/trtllm-serve 完整命令参数(--tp_size 2、--max_seq_len 8192 等)。

与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"已有 TTFT 基准对比表(Spheron,H100,512-token 共享前缀),但未收录 particula.tech 这批最新实测数字(特别是输出 token 吞吐 +117% 差距) - inference.md 第一节未收录三大关键调参参数(max-num-batched-tokens / enable-chunked-prefill / gpu-memory-utilization)及其 35% 吞吐量波动风险 - inference.md 第六节 6.4(生产选型决策树)未收录 structured outputs 场景下 SGLang 的优势数据

建议归入: inference.md · 第一节(现状全景)TTFT 基准对比表更新;第六节(6.4 生产选型决策树)structured outputs 场景补充;第一节补充调参风险警告


增量 2:Colibri —— 纯 C 744B MoE 推理引擎,25GB RAM 消费级运行

来源: GitHub(JustVugg/colibri,~14.7K stars)· Analytics Vidhya July 2026 Trending(Jay · 2026-07-24 ai-engineering-trending) 可信度: ⭐⭐⭐⭐(GitHub 开源,有完整技术说明和实测数据) arXiv 号: 无(GitHub 开源项目)

要点: - 纯 C inference engine,零外部依赖 - MoE expert disk streaming:744B 参数 MoE 模型(GLM-5.2)每次推理只激活约 40B 参数(约 11GB),其余 19,456 个专家存储在 SSD 按需流式读取 - 配 Web Dashboard(./coli web):实时 token 速度、TTFT、VRAM/RAM/Disk 分层使用可视化 - NVIDIA DGX Spark (GB10 121GB) 实测:2.4 tok/s;开启 CACHE_ROUTE 实验路由可达 3.33 tok/s - 双 SSD 可实现双通道并行读取专家,进一步提升吞吐

与 llama.cpp 的差异化定位: llama.cpp 主打 dense 模型量化推理;Colibri 专攻 MoE expert streaming,绕过消费级硬件的内存墙。

工程意义: MoE 模型的本地推理是 2026 年的工程前沿,Colibri 的 disk-streaming MoE 路径代表了一条不同于"全加载 VRAM"的新路线。

与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"四大主流框架表中有 Ollama(本地执行极简),但未收录 Colibri 作为 MoE 本地推理的新选项 - inference.md 第六节 6.4(生产选型决策树)未收录 MoE disk-streaming 作为消费级/边缘部署的特殊路径

建议归入: inference.md · 第一节(现状全景)四大框架表补充 Colibri;或第六章(6.4 生产选型决策树)新增"MoE 本地推理"条目


增量 3:量化方法工程选型对照 2026(FP8/GPTQ/GGUF 生产指南)

来源: Zylos AI · futureagi.com(Jay · 2026-07-24 1620 inference-multimodal-stack 档) 可信度: ⭐⭐⭐⭐(具体性能数字、量化方法对比表、生产环境建议) arXiv 号: 无(技术博客)

要点:

2026 关键性能数字: - PagedAttention 吞吐:2-4x vs 传统方式 - FP8 vs FP16 速度提升:30-33% - Speculative Decoding:最高 3x 加速

量化方法对比表:

方法 位宽 硬件 质量保持 适用场景
FP8 8位 NVIDIA Hopper+ ~99% 生产级 GPU Serving(首选)
GPTQ 4位 GPU ~90% 最大吞吐量
GGUF 2-8位 CPU/Apple Silicon ~92% 本地/边缘部署

FP8 生产建议: NVIDIA Hopper GPU + 原生 Transformer Engine 支持,最稳定。GPTQ with Marlin kernels in vLLM:示例代码 model="TheBloke/Llama-2-70B-GPTQ"

推理全流程(2026 确认版): Tokenization → Prefill(并行) → KV Cache → Decode(逐token) → Stop Condition。2026 TTFT 目标: < 500ms。

7种优化手段(按效果排序): Batch/PagedAttention、Quantization(FP8/GPTQ)、KV Cache 复用、Speculative Decoding、Continuous Batching、Prefill/Decode 解耦、模型蒸馏。

与 knowledge/inference.md 现有脉络的关系: - inference.md 第三节(量化)已收录 TurboQuant、RotorQuant、SAW-INT4 等多条 KV 量化路线,但未收录 FP8/GPTQ/GGUF 工程选型对照表 - inference.md 第一节"现状全景"已有 TTFT 目标,但未明确标注 2026 TTFT < 500ms 作为生产基线

建议归入: inference.md · 第三节(量化)作为工程选型补充;第一节(现状全景)TTFT 目标标注


增量 4:llm-d v0.4 —— H200 DeepSeek V3.1 延迟降低 40% + 多硬件分离式推理

来源: llm-d GitHub · llm-d.ai(Jay · 2026-07-24 1830 傍晚档) 可信度: ⭐⭐⭐⭐(CNCF 关联项目,GitHub 活跃,LGPL 许可) arXiv 号: 无(GitHub 开源项目官方发布)

要点:

核心性能数据(v0.4): - DeepSeek V3.1 on H200:每输出 token 延迟降低 40% - Intel XPU 分离式推理支持(首次) - Google TPU 分离式推理支持(首次) - 新增 prefix cache offload 到 vLLM-native CPU memory tiering - vLLM-native 集成路径清晰

性能指标汇总: | 指标 | 数据 | |------|------| | Tokens/sec 提升 | 最高 70% | | TTFT 降低 | 40% | | ITL(Inter-Token Latency)降低 | 40% | | 硬件支持 | GPUs / TPUs / XPUs / CPUs / NPUs |

Well-Lit Paths(经过测试的生产部署方案): - 按预测延迟路由(Route Requests by Predicted Latency) - 前缀缓存感知路由(Prefix-Cache Aware Routing) - 分层前缀缓存配置(Tiered Prefix Cache) - MoE 模型 Wide Expert Parallelism 扩展 - 流量控制与公平性(Flow Control and Fairness)

工程意义: llm-d 是 Kubernetes 上分布式推理的事实标准栈,Intel XPU / Google TPU 分离式推理支持使其成为跨硬件平台推理编排层的新选择。

与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"四大框架表未收录 llm-d(Kubernetes 推理编排层,不属于引擎层,但与 vLLM/SGLang 协同工作) - inference.md 第四节 4.5(Disaggregated Serving / PD 分离)已收录 NIXL,未收录 llm-d 作为 Kubernetes 分布式推理编排的标准路径

建议归入: inference.md · 第六节(6.2 基准工具与编排层)新增 llm-d 条目;或第一节(现状全景)作为 Kubernetes 推理基础设施补充


增量 5:SwiftCache —— 跨模型 KV Cache 共享,P99 TTFT 降低 69%(arXiv:2606.16135)

来源: arXiv:2606.16135v1(Jay · 2026-07-24 1105 午间档) 可信度: ⭐⭐⭐⭐⭐(arXiv 预印本,有具体 benchmark 数据) arXiv 号: 2606.16135

要点: - 多租户场景下,GPU 内存有限,KV cache 被迫 offload 到 CPU/SSD,context 增长后 reload 延迟急剧上升 - SwiftCache 核心思路:低 KV cache 需求的模型将闲置 GPU 内存"捐赠"给高需求模型,通过 NVLink 跨模型共享前缀缓存 - 进一步优化:仅在 GPU 本地保留当前活跃层的 KV cache,减少内存压力 - 实测:相比 vLLM 和 SGLang,P99 TTFT 降低 69%,最大上下文长度扩展 3.98 倍

与 knowledge/inference.md 现有脉络的关系: - inference.md 第四节(4.0 节已有 KV Cache 管理全景)未收录 SwiftCache 作为跨模型 KV cache 共享的系统方案 - inference.md 第七节(7.X Agent 推理特殊考量)未收录多租户场景下的 KV cache 跨模型共享策略

建议归入: inference.md · 第四节(4.X KV Cache 共享与复用)新增 SwiftCache 条目;或第七节(7.X Agent 推理)多租户场景补充


增量 6:AsymCache —— 计算延迟感知 KV Cache 驱逐,TTFT 提升 1.90-2.03×(arXiv:2606.02964)

来源: arXiv:2606.02964v1(Jay · 2026-07-24 1105 午间档) 可信度: ⭐⭐⭐⭐⭐(arXiv,与 vLLM/SGLang/Continuum 对比实验完整) arXiv 号: 2606.02964

要点: - 现有 lossless KV cache 驱逐策略主要基于访问频率或位置启发,忽略不同 KV block 对 GPU attention kernel 执行效率的影响 - Multi-Segment Attention (MSA): 高效处理非连续 KV 上下文 - 联合优化: cache hit rate + 位置感知重计算成本 - 自适应 chunking scheduler: 高硬件利用率 - 实测:TTFT 提升 1.90-2.03×,TPOT 提升 1.62-1.71× - 与 Continuum Agent serving 系统集成后,平均作业延迟降低 18.1%

工程意义: AsymCache 揭示了 KV cache 驱逐策略设计中的新维度——不仅考虑访问频率,还要考虑 GPU attention kernel 的执行效率。这是 KV cache 管理从"缓存策略"向"计算感知"演进的信号。

与 knowledge/inference.md 现有脉络的关系: - inference.md 第四节(4.0 KV Cache 管理)已有全景(arXiv:2607.02574),但未收录 AsymCache 的计算延迟感知这一新研究方向 - inference.md 第四节 4.5(Disaggregated Serving)已收录 Continuum,AsymCache 与 Continuum 的 18.1% 集成数据可作为联动参考

建议归入: inference.md · 第四节(4.X KV Cache 驱逐策略)新增 AsymCache 条目;与 Continuum 集成数据补充至 4.5 节


次级线索(已归档,不计入增量条数,供今晚活文档参考)

以下条目与 inference 主题相关但不属于 engine/systems 核心,已在 inbox/jay 各档归档,建议今晚活文档按需引用:

线索 来源 价值
SafeKV(arXiv:2508.08438)+ PrefixWall(arXiv:2603.10726)KV cache side-channel 安全 Jay 2026-07-24 1105 多租户 LLM serving 安全是被低估的攻击面
Multi-Layer Scheduling for MoE(arXiv:2602.21626)三层调度 MoE 推理 Jay 2026-07-24 1105 TTFT -17.8%,TPOT -13.3%
HF Transformers 5.14.0 MCP Server Sandboxes Jay 2026-07-24 1830 supply chain 安全新方案
Agent Observability:trace > metric Jay 2026-07-24 1830 agent 生产运维核心转变
Production RAG Stack Reddit 调研(Qdrant > pgvector > Pinecone) Jay 2026-07-24 1830 RAG 生产栈选型参考
Cursor Router A/B 数据(30-60% 成本降低) Jay 2026-07-23 inference-e1prep 产品级模型路由案例(已入 inference.md)
HELMSMAN OSDI 2026 全闪存向量检索(成本压缩 >90%) Jay 2026-07-23 inference-e1prep 向量数据库里程碑(已入 inference.md)
HotInfra 2026 CXL Memory Pooling KV Cache Server Jay 2026-07-24 1335 memory-centric AI 数据中心设计方向

值得警惕的矛盾或待核实说法

⚠️ 待核实:llm-d v0.4 性能数字的测试条件

来源: llm-d GitHub / llm-d.ai 问题: DeepSeek V3.1 H200 延迟降低 40%、Tokens/sec 最高 70% 提升——该数据是否针对特定 workload(batch size / 输入长度 / 输出长度)?TTFT 和 ITL 各自降幅是否均为 40%,还是特定指标? 核实建议: 检索 llm-d 官方 GitHub benchmark 结果或 Well-Lit Paths 文档,确认具体测试配置。

⚠️ 待核实:SwiftCache 3.98× 最大上下文扩展的边界条件

来源: arXiv:2606.16135 问题: 3.98× 是在何种 GPU 配置、何种模型组合、何种 NVLink 拓扑下达成的?跨模型 KV cache 共享的内存一致性协议开销是否已计入? 核实建议: 检索论文原文 benchmark 小节,确认实验配置。

⚠️ 待核实:vLLM 调参 35% 吞吐量波动的具体测试配置

来源: iotdigitaltwinplm benchmark 问题: max-num-batched-tokensenable-chunked-prefillgpu-memory-utilization 三参数从默认到调优后波动 35%——该数据对应何种模型、何种并发、何种 batch size?chunked prefill 对长上下文 TTFT 的负面影响是否在该测试中体现? 核实建议: 检索 iotdigitaltwinplm 完整 benchmark 文章,确认测试条件与 inference.md 第一节 Chunked Prefill TTFT 劣化问题(已知风险)的关系。

⚠️ 待核实:Colibri GLM-5.2 实测 2.4 tok/s 的硬件配置

来源: GitHub JustVugg/colibri 问题: 2.4 tok/s 是在何种 CPU/SSD/内存配置下测得的?双 SSD 通道的加速数据是否已公开? 核实建议: 检索 GitHub README 最新 benchmark 部分。


arXiv 号列表(按本轮新增)

arXiv 号 标题 会议/发表 增量归属
2606.16135 SwiftCache: Cross-Model KV Cache Sharing arXiv 2026 增量 5
2606.02964 AsymCache: Computation-Latency-Aware KV Cache Management arXiv 2026 增量 6

存量 inference.md 已有 arXiv 号(本轮涉及但未新读): - 2603.20397(KV Cache Optimization Strategies 全景综述,已入 2026-07-23 inference-e1prep) - 2605.19537(推理可重复性危机,inference.md 6.3/8.2 节) - 2606.01927(Albireo,inference.md 5.6 节) - 2607.05876(Floor-First Triage H20,inference.md 5.3 节) - 2607.14541(Atrex-Bench,inference.md 2.4 节) - 2605.23215(FastKernels,inference.md 2.4 节) - 2607.07696(Jailbreak,inference.md 2.0/安全 节) - 2607.02574(KV Cache 管理全景综述,inference.md 4.0 节) - 2607.09248(Regime-Aware Routing,inference.md 5.1 节) - 2604.16395(Stream2LLM,inference.md 4.7 节) - 2607.05061(KVpop,inference.md 3.4 节) - 2605.17613(VeriCache,inference.md 3.5 节) - 2602.21626(Multi-Layer Scheduling for MoE,inference.md 次级线索) - 2508.08438(SafeKV,inference.md 次级线索) - 2603.10726(PrefixWall,inference.md 次级线索)


检查过的来源清单

inbox/jay(近2天 inference 相关,全部已读): - 2026-07-24-1450-evening-inference-benchmark-colibri-engineering-jul2026.md ✅(SGLang vs vLLM vs TRT-LLM benchmark / Colibri / Jarvis Labs 命令集) - 2026-07-24-1620-inference-multimodal-stack-llmops-jul2026.md ✅(FP8/GPTQ/GGUF 量化选型 / llm-d v0.4 / Sebastian Raschka 推理时计算 / Agent 框架选型六维度) - 2026-07-24-1830-evening-briefing-hf-transformers514-agents-stack-llm-d-observability-jul2026.md ✅(HF Transformers 5.14 / llm-d v0.4 / Agent Observability / Production RAG Reddit) - 2026-07-24-1335-afternoon-hf-security-grokbuild-sglang-hotinfra-jul2026.md ✅(HotInfra 2026 CXL KV Cache / SGLang GB300 25x) - 2026-07-24-1220-rag-agentic-paradigm-csdn-substack.md ✅(Agentic RAG / xMemory / A-RAG) - 2026-07-24-1105-noon-kv-rag-db-substack.md ✅(SwiftCache / AsymCache / SafeKV / PrefixWall / Multi-Layer MoE / Continuum / Kareto / Tutti) - 2026-07-24-ai-engineering-trending.md ✅(Colibri / pi-mono / AI Agents Stack 2026 / OWASP / HF 安全事件) - 2026-07-23-evening-database-backend-cloudnative-inference.md ✅(KV Cache Optimization Strategies arXiv:2603.20397 / Nemotron-3 / MiniMax-M2) - 2026-07-23-1220-csdn-substack-inference-rag.md ✅(KV Cache / Speculative Decoding / PagedAttention / LLM-NPU) - 2026-07-23-1050-jay-engineering-filter.md ✅(已在 2026-07-23 inference-e1prep 覆盖) - 2026-07-23-1335-jay-ai-infra-systems-deep-dive.md ✅(已在 2026-07-23 inference-e1prep 覆盖) - 2026-07-23-1950-jay-engineering-filter.md ✅(已在 2026-07-23 inference-e1prep 覆盖)

inbox/tom(近2天 inference 相关): - 2026-07-24-agent-rag-longcontext-radar.md ✅(Agent/RAG/长上下文主档,非 inference 核心) - 2026-07-24T1440-agent-rag-longcontext-radar.md ✅(Agent/RAG 主档,非 inference 核心) - 2026-07-24T2040-agent-rag-longcontext-radar.md ✅(未读取,但文件名判断为 Agent/RAG) - 2026-07-24-0900-hf-daily-2026-07-24.md ✅(HF Daily,非 inference 核心) - 2026-07-24-evaluation-e1prep.md ✅(评估主题,非 inference 核心) - 2026-07-24-rag-e1prep.md ✅(RAG 主题,非 inference 核心) - 2026-07-23-inference-e1prep.md ✅(已作为活文档基准) - 2026-07-23-evaluation-e1prep.md ✅(无 inference 显著新增) - 2026-07-23-rag-e1prep.md ✅(无 inference 显著新增) - 2026-07-23-0900-hf-daily-2026-07-23.md ✅(无 inference 显著新增)

inbox/flyp(近2天 inference 相关): - 2026-07-24-risk-e1prep.md ✅(风险主题,非 inference 核心) - 2026-07-23-coding-agents-e1prep.md ✅(编码 Agent,非 inference 核心) - 2026-07-23-multimodal-e1prep.md ✅(多模态,非 inference 核心)

inbox/spark(近2天 inference 相关): - 2026-07-24-llm-infra-e1prep.md ✅(llm-infra 视角,inference 相关内容与 jay 档大量重叠,已去重) - 2026-07-23-llm-infra-e1prep.md ✅(同前)

inbox/stephen(近2天 inference 相关): - 2026-07-24-llm-application-e1prep.md ✅(llm-application 视角,无 inference 显著新增) - 2026-07-23-llm-application-e1prep.md ✅(同前)

paper_cards(近3天 inference 相关新卡,已抽查): - 571-2607.12746(multimodal,非 inference 核心)✅ - 566-2607.21485(multimodal,非 inference 核心)✅ - 570-2607.20785(multimodal,非 inference 核心)✅ - 569-2607.20734(agent,非 inference 核心)✅ - 568-2607.20061(multimodal,非 inference 核心)✅ - 567-2607.21051(agent,非 inference 核心)✅ - 565-2607.21072(evaluation,非 inference 核心)✅ - 564-2607.21503(agent,非 inference 核心)✅ - 563-2607.18149(engineering/edge-inference,非 llm-infra 核心)✅ - 562-2607.20092(multimodal,非 inference 核心)✅ - 561-2203.11171(llm-infra, Self-Consistency CoT,被引 704,非新卡)✅ - 560-1406.2227(multimodal,被引 809,非新卡)✅ - 553-2005.14165(llm-infra,GPT-3,被引 3029,非新卡)✅ - 547-2607.19604(llm-infra,Hypernetwork Scaling Laws,非 inference 核心)✅ - 548-2607.16165(multimodal,ActiveVision,非 inference 核心)✅ - 其余 522-546 均在 2026-07-23 前入库,无 inference 系统工程新卡 ✅

work-queue.md(2026-07-24 22:00 自动生成): - llm-infra 7天未更新(注意:inference 与 llm-infra 主题页均需关注) - 无当日独立新增 inference 候选


结论

本次 inference 主题 E1 预消化轮共发现 6 条显著增量,来自 inbox/jay 全天多个档位。最重要的工程洞察是:

  1. SGLang vs vLLM vs TRT-LLM 完整实测 benchmark(2026-07 最新)——SGLang 输出吞吐领先 vLLM +117%,TTFT 快 23-40%;vLLM 三参数调优可波动 35% 吞吐量;structured outputs 场景 SGLang 优势显著;Jarvis Labs 完整实测命令集可复现
  2. Colibri 纯 C MoE 推理引擎——744B MoE(GLM-5.2)消费级运行,25GB RAM,expert disk streaming;代表 MoE 本地推理的工程化路线
  3. FP8/GPTQ/GGUF 量化工程选型对照(2026-07)——Hopper GPU FP8 30-33% 加速首选;GPTQ 最大吞吐;GGUF 本地/边缘;TTFT 生产目标 < 500ms
  4. llm-d v0.4 H200 DeepSeek V3.1 延迟降低 40%——Intel XPU/Google TPU 分离式推理首次支持;Kubernetes 分布式推理编排层新里程碑;Well-Lit Paths 生产路径清晰
  5. SwiftCache(arXiv:2606.16135)跨模型 KV cache 共享——P99 TTFT 降低 69%,最大上下文扩展 3.98×;多租户推理新范式
  6. AsymCache(arXiv:2606.02964)计算延迟感知 KV cache 驱逐——TTFT 提升 1.90-2.03×,与 Continuum 集成后作业延迟降低 18.1%;KV cache 驱逐策略进入"计算感知"新阶段

涉及 arXiv 号 2 个: 2606.16135(SwiftCache)、2606.02964(AsymCache)

本次 inbox/jay 继续是 inference 主题最活跃的信源,全天多个档位均有 inference 相关增量;paper_cards 近3天无实质性 inference 系统工程新卡(最新卡主分类均为 agent/multimodal/engineering,无 llm-infra 直击 inference engine 的条目)。llm-infra 主题页已 7 天未更新,今晚活文档接力建议关注该主题页的联动更新。


本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Tom · 2026-07-24 22:20(Asia/Shanghai)