inference · E1 预消化简报(2026-09-13)

状态摘要

  • 增量条数5 条主增量(3-8 目标区间内;性质属 v3.30 升档后 ~42h 净窗口期,今日核心 = ① OmniKVQuant 多模态 KV 异构量化新范式 ② Φ-Bench 首个 LLM 基础设施工程能力 benchmark ③ 推理引擎可复现性(隐性超参数)正式锚入 ④ Akashic MemAttention 生产级 vLLM 扩展 ⑤ KV cache "压缩+纠错"新范式确立)
  • 性质:本棒属 v3.30(2026-09-13 04:00 升档)后 42h 净窗口期,今日核心贡献 = ① arXiv:2609.11582 OmniKVQuant(多模态 Omni-LLM KV cache 异构值几何量化)② arXiv:2609.10226 Φ-Bench(首个 LLM 基础设施工程能力 benchmark,StepFun AI)③ arXiv:2605.19537 推理引擎可复现性(推理后端=隐性超参数)正式锚入 ④ arXiv:2607.05708 Akashic MemAttention(vLLM 0.10.0 扩展型生产级 Agent 记忆基础设施)⑤ arXiv:2609.04263 KV cache 质量恢复(低秩注意力补偿)
  • 涉及 arXiv 号arXiv:2609.11582(OmniKVQuant · KV Cache 量化 · Omni-LLM 多模态)+ arXiv:2609.10226(Φ-Bench · LLM 基础设施工程 benchmark)+ arXiv:2607.05708(Akashic MemAttention · vLLM 0.10.0 扩展 · 长期记忆持久化)+ arXiv:2605.19537(推理引擎可复现性 · 推理后端=隐性超参数)+ arXiv:2609.04263(KV cache 质量恢复 · 低秩注意力补偿)

一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-13 22:00 自动生成)

  • 选题榜未成视频脚本 2 件:2609.11561(Negative Self-Distillation · jay 认领)+ 2608.12564(WMRL World Model RL Research Agents · 444票 立标极显著)
  • 待写攻略 1 件:bishop555/Solana-Drainer-Tool(Tom 认领)
  • 富化缺口 15 张卡缺 TLDR
  • 无 inference 专项主题缺货警告

1.2 inbox/tom 9-13 棒位

  • 2026-09-13T2040-agent-rag-longcontext-radar.md(20:40 CST · 第 3 次 radar · MaP-WAM + Think Before You Link + ActReview + Substack Agent Memory Is Not RAG)
  • 2026-09-13T1440-agent-rag-longcontext-radar.md(14:40 CST · 第 2 次 radar)
  • 2026-09-13T0840-agent-rag-longcontext-radar.md(08:41 CST · 第 1 次 radar · arXiv provider 批量超时,HF Daily 为主)
  • 2026-09-13-0900-hf-daily-2026-09-13.md(09:00 CST · 15 篇 · WMRL 444票 ▲极显著 + NCP-ArchPreview 231▲ + SenseNova-U1.5 183▲ + AgentGrad 92▲ + SpatialBlock 91▲)
  • 2026-09-13-rag-e1prep.md(08:52 CST · RAG 主轴 · 无 inference 主轴净增量)
  • 2026-09-13-evaluation-e1prep.md(15:42 CST · Evaluation 主轴 · 无 inference 主轴净增量)
  • 2026-09-13-1003-rss-yt-yannic-kilcher.md(10:03 CST · Yannic Kilcher · 无 inference 相关)
  • 2026-09-13-1004-rss-yt-lex-fridman.md(10:04 CST · Lex Fridman · 无 inference 相关)

1.3 inbox/jay 9-13 全天 inference 相关工程文件

  • 2026-09-13T1230-jay-csdn-inference-finetuning-highvalue-sep13.md(12:30 CST · 17 条 CSDN 候选,6 条 ⭐⭐⭐⭐ 及以上:vLLM 源码 git commit 9ff7041 ⭐⭐⭐⭐⭐ + vLLM v0.20.0 系统架构 ⭐⭐⭐⭐ + LoRA/QLoRA OOM 排障五步法 ⭐⭐⭐⭐ + 2026 LoRA/QLoRA 完全指南 ⭐⭐⭐⭐ + MCP 2026-07-28 重构 ⭐⭐⭐⭐⭐ + vLLM/SGLang/TRT-LLM 2026 选型指南 ⭐⭐⭐⭐)
  • 2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md(13:35 CST · 6 件核心:Akashic MemAttention ⭐⭐⭐⭐⭐(arXiv:2607.05708)+ 推理引擎可复现性 ⭐⭐⭐⭐⭐(arXiv:2605.19537)+ MCP 生产安全 + AI Agents Stack 2026 + GPU MCP 部署 + Jam with AI LLM Inference 101)
  • 2026-09-13T2109-jay-evening-briefing-kvcache-phi-finetuning-sep13.md(21:09 CST · 晚间核心:OmniKVQuant ⭐⭐⭐⭐⭐(arXiv:2609.11582)+ Φ-Bench ⭐⭐⭐⭐⭐(arXiv:2609.10226)+ KV cache 质量恢复 ⭐⭐⭐⭐(arXiv:2609.04263)+ LiteKV(IEEE INFOCOM 2026)+ KVarN(arXiv:2606.03458)+ ByteByteGo Top AI GitHub Repos + Kaitchup Substack + China GB Standards)
  • 2026-09-13-morning-briefing-multimodal-vecdb-inference.md(11:07 CST · vLLM vs SGLang vs TRT-LLM 2026 选型 + SGLang BCG + ai-dynamo/dynamo K8s recipes + NVIDIA NIM Operator + REVA + Mr.LHDR)
  • 2026-09-13T1735-jay-evening-briefing-sep13-2026.md(17:36 CST · SGLang ~16,200 vs LMDeploy ~16,200 vs vLLM ~12,500 tok/s H100 + p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixArk $400M + Ken Huang KV Cache Frontier Chapter 2 + Agentic RAG 范式转变 + HF WebGPU Kernels 200+)

1.4 inbox/spark 9-13 llm-infra e1prep(2026-09-13 18:40 CST)

  • 本棒 llm-infra 主轴核心 = 7 件 NET-new:Akashic arXiv:2607.05708(⭐⭐⭐⭐⭐)+ 推理引擎可复现性 arXiv:2605.19537(⭐⭐⭐⭐⭐)+ ai-dynamo/dynamo + NVIDIA NIM Operator + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测 + Ken Huang 10 章 KV Cache Frontier + HF WebGPU Kernels 200+
  • 0 件 llm-infra 主分类 NET-new paper_card 入库(1334 张净增确认在 v3.31 cutoff 前已落档)

1.5 inbox/flyp 9-13 multimodal + risk e1prep

  • 2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md(15:50 CST · MaP-WAM paper_card 1322 锚入确认)
  • 2026-09-13-risk-e1prep.md(16:30 CST · Risk 主轴 · 无 inference 主轴净增量)
  • 2026-09-13-1000-rss-cameron-wolfe.md(10:00 CST · 无 inference 主轴)
  • 2026-09-13-1001-rss-interconnects.md(10:01 CST · 无 inference 主轴)

1.6 inbox/stephen 9-13 ai-industry e1prep(2026-09-13 10:23 CST)

  • 无 inference 主轴净增量;Dario Amodei《We Must Pace the Frontier》属行业治理邻接

1.7 paper_cards 近 3 天新卡(Sep 10-13 入库)

编号 arXiv 标题 主分类 与 inference 关系
1328 2609.11085 Beyond Solver Verdicts(Generative Reward Models) llm-infra v3.30 已锚入
1330 2609.10445 Building Multilingual Bridges(L2 Reasoning) llm-infra v3.30 已锚入
1334 2608.15380 Adaptive Bridge(ROS2 DDS) llm-infra v3.30 已锚入
1322 2609.11561 MaP-WAM(Memory-as-Plans) agent 邻接(Agent 记忆规划)
1304 2609.10266 KVShareArena llm-infra 邻接(KV Cache 复用)
1329 2609.10745 Think Before You Link rag 邻接(RAG 检索质量)
1331 2609.10539 IdeaAMBIG evaluation 邻接(实现可行性)
1332 2609.09143 Image Tokenizers as Visual Languages multimodal 邻接(多模态编解码)
1333 2609.09076 ActReview multimodal 邻接(工程)
929 2608.12036 Mechanist agent 邻接(Agent 机制解释)
951 2608.13010 RAGSieve rag 邻接(RAG 安全)

今日无新增主分类 inference 的 paper_card 入库。v3.30 cutoff(2026-09-13 04:00 CST)之前已入库的 inference 主轴卡片已全部锚入完毕。

1.8 inference.md 活文档基线确认(v3.30 · 2026-09-13 04:00 升档)

  • inference.md v3.30 已覆盖:NVIDIA Dynamo 1.0 + SGLang v0.5.19 Beam Search + vLLM v0.20.2 + vLLM V1 五项 + vLLM Speculators v0.3.0 + vLLM RDT + vLLM Router + vLLM K8s 冷启动 8min→1min + vLLM prefix cache 16-token 边界踩坑 + vLLM 0.19.0 + vLLM Blackwell/GB200 26.2k tok/s + SGLang v0.6 + SGLang BCG + SGLang DeepSeek MLA 3.1× + SGLang EAGLE + LMDeploy TurboMind + TensorRT-LLM v1.2.1 + RTP-LLM + MAX + HF WebGPU + Detokenization Leaks(arXiv:2609.06674)+ CoRL Least Privilege(arXiv:2609.07529)+ Φ-Bench(arXiv:2609.10226 沿用 v3.30 预备级)
  • 沿用件套(v3.30 闭合级)= arXiv:2609.03430 + arXiv:2606.19746 + arXiv:2609.01316 + arXiv:2609.01777 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2508.08438 + arXiv:2609.06008 + arXiv:2609.07139 + arXiv:2609.04971 + arXiv:2509.01809 + arXiv:2609.11412 + arXiv:2609.11294

二、增量条目(5 条主增量)


增量 ① OmniKVQuant:多模态 Omni-LLM 的 KV Cache 异构值几何量化(NET-new 事件级 · ⭐⭐⭐⭐⭐)

  • 来源:jay 9-13 21:09 evening-briefing-kvcache-phi-finetuning-sep13.md §一.1(arXiv:2609.11582 · cs.CV · 2026-09-10)
  • 要点OmniKVQuant 是第一个专门针对跨模态 KV 分布差异设计量化的方案。核心挑战:视频/音频/文本混合推理场景中,音频/视频/文本 tokens 各自占据不同值空间——Keys 的局部方差远低于 Gaussian 分布(尤其是 audio/video tokens);Value 分布更复杂,跨模态共享旋转效果不如为每种模态单独选择。解决方案:异构值几何(heterogeneous value geometry)处理——为每种模态单独选择最优量化策略,而非统一共享旋转。引用了 TurboESM(3-bit KV cache 蛋白质语言模型,Hu et al.)和 Octopus(八面体参数化 + 最优平方误差量化,Boss et al.)的工作。
  • 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联——v3.30 已锚入 KIVI(ICML 2024)、KVQuant、RotateKV(arXiv:2501.16383)、KVLinC(arXiv:2510.05373)、KVarN(arXiv:2606.03458)、KVShareArena(arXiv:2609.10266)。OmniKVQuant 代表 2026 年 KV cache 量化的最新演进:从"统一量化"到"异构模态感知量化"。这与 v3.30 已锚入的"vLLM V1 KV-Cache fp8 1.6× H100"等工程化量化形成方法学互补。
  • 建议归入节:§1.(3) KV Cache 子轴(OmniKVQuant 异构值几何量化 · 多模态 Omni-LLM KV cache 新范式)
  • arXiv 号清单arXiv:2609.11582 = 1 件 NET-new inference 主轴
  • 可信度:★★★★★(arXiv 2026-09-10,完整方法 + 分布分析表格,cs.CV)

增量 ② Φ-Bench:首个 LLM 基础设施工程能力 Benchmark(NET-new 事件级 · ⭐⭐⭐⭐⭐)

  • 来源:jay 9-13 21:09 evening-briefing-kvcache-phi-finetuning-sep13.md §一.2(arXiv:2609.10226v1 · StepFun AI 团队 Leilei Ding & Yanyong Zhang 主导 · 2026-09-09)
  • 要点核心问题:LLM 能否工程化和优化自己的基础设施栈? Benchmark 规模:85 个任务,涵盖 9 个 LLM 基础设施领域(内核级/实现级/系统优化级)。三种任务格式:localized kernel-level → long-horizon implementation → end-to-end system optimization。来源:真实代码仓库 + 前沿研究优化问题。评测结果:8 个前沿模型参与,Claude Opus 5 领先(36.53%),但无模型能稳定覆盖所有任务。这是第一个系统评估 LLM 在基础设施工程能力 的 benchmark,与 coding agent 评测(SWE-Bench)形成互补——SWE-Bench 测代码实现,Φ-Bench 测系统优化。
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学直接关联。v3.30 预备级锚入 Φ-Bench(arXiv:2609.10226),本棒正式提升为独立增量条目。Φ-Bench 与 v3.30 已锚入的"LLM 评测规范"邻接——推理引擎可复现性研究(arXiv:2605.19537,增量 ③)共同指向"benchmark 标准化报告推理栈"的工程需求。
  • 建议归入节:§1.(1) 推理引擎方法学(Φ-Bench:首个 LLM 基础设施工程能力 benchmark · Claude Opus 5 领先 36.53% · 无模型覆盖所有任务)+ §1.(4) 量化子轴邻接(benchmark 驱动量化优化方向)
  • arXiv 号清单arXiv:2609.10226 = 1 件 NET-new inference 主轴(v3.30 预备级,本棒正式提升)
  • 可信度:★★★★★(StepFun AI 前沿研究 + 完整 benchmark 架构 + 评测结果,arXiv 2026-09-09)

增量 ③ 推理引擎可复现性:推理后端应被列为 LLM 评估的"隐性超参数"(NET-new 方法学级 · ⭐⭐⭐⭐⭐)

  • 来源:jay 9-13 13:35 afternoon-briefing-mcp-production-inference-stack-sep13.md §5(arXiv:2605.19537 · 2026-01)+ spark 9-13 llm-infra e1prep 增量 ②
  • 要点系统性研究截至 2026-01 完整推理引擎生态。核心发现:不同推理引擎(vLLM / TensorRT-LLM / SGLang / llama.cpp / transformers 等)对同一模型、同一输入产生的输出分布显著不同——这种差异可大到将 top-5 候选 token 整体换血。核心结论:推理后端应被列为 LLM 评估中的"隐性超参数";benchmark 对比必须标准化报告推理栈。jane 9-13 晚间简报进一步给出精细实测数字(9-13 17:36 evening briefing):SGLang ~16,200 vs LMDeploy ~16,200 vs vLLM ~12,500 tok/s on H100,p99 TTFT SGLang 54.2s vs vLLM 58.9s,RadixAttention 6.4× 前缀复用优势,DeepSeek V3 SGLang 3.1× faster。
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学直接关联——v3.30 已锚入 vLLM vs SGLang vs LMDeploy 选型决策树,Φ-Bench(增量 ②)共同指向推理栈标准化需求。本增量为此选型决策提供学理基础:不同引擎即使相同模型相同输入也会产生显著不同的 token 分布,因此 benchmark 对比必须标准化报告推理栈。同时与 v3.30 §4.1 推理经济学邻接——引擎选择直接影响评测结果的可复现性和成本。
  • 建议归入节:§1.(1) 推理引擎方法学(推理引擎可复现性:推理后端=隐性超参数 · benchmark 必须标准化报告推理栈)+ §1.(2) 推理调度子轴(选型数字补充:p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4×)
  • arXiv 号清单arXiv:2605.19537 = 1 件 NET-new inference 主轴
  • 可信度:★★★★★(系统性 arXiv 研究,覆盖完整推理引擎生态,2026-01)

增量 ④ Akashic MemAttention:生产级 vLLM 0.10.0 扩展型长程 Agent 记忆基础设施(NET-new 方法学级 · ⭐⭐⭐⭐⭐)

  • 来源:jay 9-13 13:35 afternoon-briefing-mcp-production-inference-stack-sep13.md §3(arXiv:2607.05708 · 2026)+ spark 9-13 llm-infra e1prep 增量 ①
  • 要点vLLM 0.10.0 控制路径扩展,GPU 执行路径 / 注意力后端 / KV-cache 管理器保持不变。三个接入点:① 记忆检索插入请求准入层;② 记忆回写插入请求完成层;③ 物理布局维护拆分为在线迁移路径 + 后台存储。解决 agentic workflow 中长期记忆(long-term memory)与短期上下文(short-term context)之间的张力——长期记忆需要持久化但又不能无限增长。bounded chunks + cross-chunk inference(受 Claude Code 启发)。与 VikingMem(VLDB 2026,arXiv:2605.29640)互补:VikingMem 是内存页管理 + 状态持久化,Akashic 是 vLLM 层面的注意力级记忆管理。Jay 9-13 14:50 afternoon engineering filter 还给出了 Agent 记忆系统三路对比:vLLM 扩展型(Akashic)vs RAG 引入型(MaP-WAM)vs 微型关联记忆型(δ-mem,4.87M,Poria 团队)。
  • 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴直接关联。v3.30 已锚入 KVShareArena(arXiv:2609.10266,RAG/multi-agent 场景 KV cache 复用失效)和 MaP-WAM(arXiv:2609.11561,Memory-as-Plans)。Akashic 提供生产级 vLLM 主线扩展型实现——前者是离线修补/算法层方案,Akashic 是生产级 vLLM 扩展型基础设施。首次提供"生产级 Agentic Workflow 持久化 KV-cache + 记忆回写"完整工程实现路径,无需 fork vLLM 主线即可实验。
  • 建议归入节:§1.(3) KV Cache 子轴(Akashic MemAttention:vLLM 0.10.0 扩展 · 长期记忆持久化基础设施 · 与 VikingMem 互补)+ §1.(11) Kernel/Harness 子轴(Agent 记忆系统三路对比:Akashic vs MaP-WAM vs δ-mem)
  • arXiv 号清单arXiv:2607.05708 = 1 件 NET-new inference 主轴
  • 可信度:★★★★★(arXiv 论文,基于 vLLM 0.10.0 扩展,Jay 三棒位连续确认,7 月已雷达但 v3.30 未实质锚入,本棒正式首次锚入)

增量 ⑤ KV cache "压缩+纠错"新范式:低秩注意力补偿(NET-new 方法学级 · ⭐⭐⭐⭐)

  • 来源:jay 9-13 21:09 evening-briefing-kvcache-phi-finetuning-sep13.md §一.3(arXiv:2609.04263 · 2026 更新版)+ IEEE INFOCOM 2026 LiteKV + arXiv:2606.03458 KVarN
  • 要点(汇总三条 KV cache 新线索)
  • (a) arXiv:2609.04263 Quality Recovery for Quantized KV Caches via Low-Rank Attention:KV cache 量化后信息损失不可逆,本工作通过低秩注意力补偿(Low-Rank Attention)恢复质量。引用了 GEAR(arXiv:2403.05527)、KVTuner(arXiv:2502.04420)、KIVI(ICML 2024)、RotateKV(arXiv:2501.16383)、KVLinC(arXiv:2510.05373)、KVarN(arXiv:2606.03458,2026)。代表 2026 年 KV cache 量化的新范式:从纯量化压缩转向"量化+纠错联合设计"
  • (b) LiteKV(IEEE INFOCOM 2026):专为边缘 LLM 推理设计的轻量级在线 KV cache 替换算法,内存降低 75%,同时保持与无内存约束基线相当的生成质量和 95% 解码效率。对比基线:PagedAttention(vLLM)、StreamingLLM、H2O 等。边缘部署场景(IoT/移动端),与云端 disaggregated serving 互补。
  • (c) KVarN(arXiv:2606.03458,2026)归一化方差以缓解推理任务中的错误累积——解决 KV cache 量化误差在多步推理中逐步放大的问题。
  • 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联。三条线索共同指向 2026 年 KV cache 量化的三维演进:① 异构模态感知(OmniKVQuant,增量 ①)→ ② 量化+纠错联合设计(Low-Rank Recovery)→ ③ 边缘轻量化(LiteKV)。v3.30 已锚入 KIVI、KVQuant、RotateKV、KVLinC、KVarN,本棒补入 Low-Rank Recovery 范式和 LiteKV 边缘场景,形成完整的 2026 KV cache 量化技术演进图谱。
  • 建议归入节:§1.(3) KV Cache 子轴(Low-Rank KV Cache 质量恢复:量化+纠错联合设计新范式 + LiteKV 边缘推理 + KVarN 方差归一化)
  • arXiv 号清单arXiv:2609.04263 + arXiv:2606.03458 = 2 件 NET-new inference 主轴邻接
  • 可信度:★★★★(完整方法,引用关系丰富,覆盖 2024-2026 主要工作)

三、矛盾/待核实条目

待核实 ① OmniKVQuant 与 TurboESM/Octopus 的方法学差异

  • 问题描述:OmniKVQuant 引用了 TurboESM(3-bit KV cache,Hu et al.)和 Octopus(八面体参数化,Boss et al.)作为方法学基础,但均属蛋白质语言模型或参数化领域。OmniKVQuant 将这些方法迁移到多模态 LLM 的 KV cache 场景,迁移性论证是否充分?
  • 建议动作:精读 arXiv:2609.11582 §3 方法论迁移部分,核实异构值几何 vs 统一旋转的边界条件

待核实 ② Φ-Bench Claude Opus 5 领先 36.53% 的任务分布

  • 问题描述:Φ-Bench 结果显示 Claude Opus 5 领先(36.53%),但无模型能稳定覆盖所有 85 个任务。具体哪些任务类型 Claude Opus 5 强,哪些模型强?85 个任务的领域分布如何?
  • 建议动作:精读 arXiv:2609.10226 Table 2/3,确认 Claude Opus 5 的 task distribution

待核实 ③ Akashic MemAttention 与 VikingMem(VLDB 2026)的边界与互补关系

  • 问题描述:Jay 9-13 晚间简报指出 Akashic(vLLM 0.10.0 控制路径扩展)与 VikingMem(内存页管理 + 状态持久化)互补,但两者在记忆持久化栈中的具体边界尚需核实。Akashic 的 bounded chunks 是否与 VikingMem 的内存页管理有重叠?
  • 建议动作:精读 arXiv:2607.05708 §4 Implementation 与 VikingMem 论文 §3 System Design 对照

待核实 ④ 推理引擎可复现性 arXiv:2605.19537 的 top-5 候选 token "整体换血"量化表述

  • 问题描述:Jay 描述为"top-5 候选 token 整体换血",是原文表述还是二次引述?原文对输出分布差异的量化阈值(KL divergence 或其他指标)是什么?
  • 建议动作:精读 arXiv:2605.19537 §3 Experiments,核实量化差异的具体指标

四、可引用的 arXiv 号列表

arXiv 号 标题 主分类 形态 锚定位置
2609.11582 OmniKVQuant: KV Cache Quantization for Omni-LLMs inference method 本棒增量 ① · §1.(3) KV Cache 子轴 NET-new
2609.10226 Φ-Bench: LLM Infrastructure Engineering Benchmark llm-infra benchmark 本棒增量 ② · §1.(1) 推理引擎方法学 NET-new(v3.30 预备级升格)
2607.05708 Akashic: A Low-Overhead LLM Inference Service with MemAttention inference method 本棒增量 ④ · §1.(3) KV Cache + §1.(11) Kernel/Harness NET-new
2605.19537 推理后端对 LLM 可复现性的影响 inference method 本棒增量 ③ · §1.(1) 推理引擎方法学 NET-new
2609.04263 Quality Recovery for Quantized KV Caches via Low-Rank Attention inference method 本棒增量 ⑤ · §1.(3) KV Cache 子轴 NET-new 邻接
2606.03458 KVarN: Variance-Normalized KV Cache Quantization inference method 本棒增量 ⑤ 邻接 · §1.(3) KV Cache 子轴
2609.06674 Detokenization Leaks(Side-Channel Privacy) security vulnerability v3.30 已锚入 §3.5
2609.07529 CoRL(Least Privilege on Tool Calls) agent method v3.30 已锚入 §3.5
2609.10266 KVShareArena llm-infra benchmark v3.30 已锚入 §1.(3)
2609.11561 MaP-WAM agent method v3.30 已锚入 §1.(11)
2609.11294 Memory Compression for Agents agent method v3.30 邻接锚入
2609.11390 VikingRAG rag method v3.30 邻接锚入
2605.29640 OpenViking / VikingMem(VLDB 2026) database systems v3.30 邻接锚入
2609.11209 REVA(RAG Serving 成本优化,ICDM 2026) rag method 邻接级锚入
2609.11318 Mr.LHDR(Deep Research Agent Benchmark) agent benchmark 邻接级锚入

五、给今晚活文档接力的建议

今晚 inference 活文档(knowledge/inference.md)接力方向建议:

  1. §1.(3) KV Cache 子轴 补入 OmniKVQuant(arXiv:2609.11582):异构值几何量化,多模态 Omni-LLM KV cache 新范式,与 TurboESM/Octopus 方法学关系待核实
  2. §1.(3) KV Cache 子轴 补入"压缩+纠错"新范式:arXiv:2609.04263 低秩注意力质量恢复 + KVarN(arXiv:2606.03458)+ LiteKV(IEEE INFOCOM 2026),形成 2026 KV cache 量化三维演进图谱(异构模态感知 + 量化+纠错联合 + 边缘轻量化)
  3. §1.(1) 推理引擎方法学 补入 Φ-Bench(arXiv:2609.10226):首个 LLM 基础设施工程能力 benchmark,Claude Opus 5 领先 36.53%,v3.30 预备级升格正式锚入
  4. §1.(1) 推理引擎方法学 补入推理引擎可复现性(arXiv:2605.19537):推理后端=隐性超参数,benchmark 必须标准化报告推理栈;补充 p99 TTFT SGLang 54.2s vs vLLM 58.9s 精细数字
  5. §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴 补入 Akashic MemAttention(arXiv:2607.05708):vLLM 0.10.0 扩展型生产级 Agent 记忆基础设施;Agent 记忆系统三路对比:Akashic vs MaP-WAM vs δ-mem
  6. 待核实项目:OmniKVQuant 方法学迁移充分性(P0);Φ-Bench Claude Opus 5 任务分布(P1);Akashic vs VikingMem 边界(P1);推理引擎可复现性 top-5 "整体换血"量化指标(P2)

六、本棒检查过的来源完整清单

work-queue.md(2026-09-13 22:00)
inference.md(v3.30,2026-09-13 04:00 升档)
inbox/tom/2026-09-12-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-11-inference-e1prep.md(9-11 基准)
inbox/tom/2026-09-13T2040-agent-rag-longcontext-radar.md
inbox/tom/2026-09-13T1440-agent-rag-longcontext-radar.md
inbox/tom/2026-09-13T0840-agent-rag-longcontext-radar.md
inbox/tom/2026-09-13-0900-hf-daily-2026-09-13.md
inbox/tom/2026-09-13-rag-e1prep.md
inbox/tom/2026-09-13-evaluation-e1prep.md
inbox/tom/2026-09-13-1003-rss-yt-yannic-kilcher.md
inbox/tom/2026-09-13-1004-rss-yt-lex-fridman.md
inbox/jay/2026-09-13T1230-jay-csdn-inference-finetuning-highvalue-sep13.md
inbox/jay/2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md
inbox/jay/2026-09-13T2109-jay-evening-briefing-kvcache-phi-finetuning-sep13.md
inbox/jay/2026-09-13-morning-briefing-multimodal-vecdb-inference.md
inbox/jay/2026-09-13T1735-jay-evening-briefing-sep13-2026.md
inbox/spark/2026-09-13-llm-infra-e1prep.md(18:40 CST)
inbox/spark/2026-09-12-llm-infra-e1prep.md
inbox/flyp/2026-09-13-risk-e1prep.md
inbox/flyp/2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md
inbox/stephen/2026-09-13-ai-industry-e1prep.md
paper_cards/ Sep 10-13 入库卡:929/951/1322/1328/1329/1330/1331/1332/1333/1334/1304(共 11 张)

Tom · 2026-09-13 22:20 CST · E1 预消化 · inference · 5 条主增量(OmniKVQuant ⭐⭐⭐⭐⭐ + Φ-Bench ⭐⭐⭐⭐⭐ + 推理引擎可复现性 ⭐⭐⭐⭐⭐ + Akashic MemAttention ⭐⭐⭐⭐⭐ + KV cache 压缩+纠错新范式 ⭐⭐⭐⭐)+ 6 件涉及 arXiv 号