inference · E1 预消化简报(2026-09-13)
状态摘要
- 增量条数:5 条主增量(3-8 目标区间内;性质属 v3.30 升档后 ~42h 净窗口期,今日核心 = ① OmniKVQuant 多模态 KV 异构量化新范式 ② Φ-Bench 首个 LLM 基础设施工程能力 benchmark ③ 推理引擎可复现性(隐性超参数)正式锚入 ④ Akashic MemAttention 生产级 vLLM 扩展 ⑤ KV cache "压缩+纠错"新范式确立)
- 性质:本棒属 v3.30(2026-09-13 04:00 升档)后 42h 净窗口期,今日核心贡献 = ① arXiv:2609.11582 OmniKVQuant(多模态 Omni-LLM KV cache 异构值几何量化)② arXiv:2609.10226 Φ-Bench(首个 LLM 基础设施工程能力 benchmark,StepFun AI)③ arXiv:2605.19537 推理引擎可复现性(推理后端=隐性超参数)正式锚入 ④ arXiv:2607.05708 Akashic MemAttention(vLLM 0.10.0 扩展型生产级 Agent 记忆基础设施)⑤ arXiv:2609.04263 KV cache 质量恢复(低秩注意力补偿)
- 涉及 arXiv 号:arXiv:2609.11582(OmniKVQuant · KV Cache 量化 · Omni-LLM 多模态)+ arXiv:2609.10226(Φ-Bench · LLM 基础设施工程 benchmark)+ arXiv:2607.05708(Akashic MemAttention · vLLM 0.10.0 扩展 · 长期记忆持久化)+ arXiv:2605.19537(推理引擎可复现性 · 推理后端=隐性超参数)+ arXiv:2609.04263(KV cache 质量恢复 · 低秩注意力补偿)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-09-13 22:00 自动生成)
- 选题榜未成视频脚本 2 件:2609.11561(Negative Self-Distillation · jay 认领)+ 2608.12564(WMRL World Model RL Research Agents · 444票 立标极显著)
- 待写攻略 1 件:bishop555/Solana-Drainer-Tool(Tom 认领)
- 富化缺口 15 张卡缺 TLDR
- 无 inference 专项主题缺货警告
1.2 inbox/tom 9-13 棒位
2026-09-13T2040-agent-rag-longcontext-radar.md(20:40 CST · 第 3 次 radar · MaP-WAM + Think Before You Link + ActReview + Substack Agent Memory Is Not RAG)2026-09-13T1440-agent-rag-longcontext-radar.md(14:40 CST · 第 2 次 radar)2026-09-13T0840-agent-rag-longcontext-radar.md(08:41 CST · 第 1 次 radar · arXiv provider 批量超时,HF Daily 为主)2026-09-13-0900-hf-daily-2026-09-13.md(09:00 CST · 15 篇 · WMRL 444票 ▲极显著 + NCP-ArchPreview 231▲ + SenseNova-U1.5 183▲ + AgentGrad 92▲ + SpatialBlock 91▲)2026-09-13-rag-e1prep.md(08:52 CST · RAG 主轴 · 无 inference 主轴净增量)2026-09-13-evaluation-e1prep.md(15:42 CST · Evaluation 主轴 · 无 inference 主轴净增量)2026-09-13-1003-rss-yt-yannic-kilcher.md(10:03 CST · Yannic Kilcher · 无 inference 相关)2026-09-13-1004-rss-yt-lex-fridman.md(10:04 CST · Lex Fridman · 无 inference 相关)
1.3 inbox/jay 9-13 全天 inference 相关工程文件
2026-09-13T1230-jay-csdn-inference-finetuning-highvalue-sep13.md(12:30 CST · 17 条 CSDN 候选,6 条 ⭐⭐⭐⭐ 及以上:vLLM 源码 git commit 9ff7041 ⭐⭐⭐⭐⭐ + vLLM v0.20.0 系统架构 ⭐⭐⭐⭐ + LoRA/QLoRA OOM 排障五步法 ⭐⭐⭐⭐ + 2026 LoRA/QLoRA 完全指南 ⭐⭐⭐⭐ + MCP 2026-07-28 重构 ⭐⭐⭐⭐⭐ + vLLM/SGLang/TRT-LLM 2026 选型指南 ⭐⭐⭐⭐)2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md(13:35 CST · 6 件核心:Akashic MemAttention ⭐⭐⭐⭐⭐(arXiv:2607.05708)+ 推理引擎可复现性 ⭐⭐⭐⭐⭐(arXiv:2605.19537)+ MCP 生产安全 + AI Agents Stack 2026 + GPU MCP 部署 + Jam with AI LLM Inference 101)2026-09-13T2109-jay-evening-briefing-kvcache-phi-finetuning-sep13.md(21:09 CST · 晚间核心:OmniKVQuant ⭐⭐⭐⭐⭐(arXiv:2609.11582)+ Φ-Bench ⭐⭐⭐⭐⭐(arXiv:2609.10226)+ KV cache 质量恢复 ⭐⭐⭐⭐(arXiv:2609.04263)+ LiteKV(IEEE INFOCOM 2026)+ KVarN(arXiv:2606.03458)+ ByteByteGo Top AI GitHub Repos + Kaitchup Substack + China GB Standards)2026-09-13-morning-briefing-multimodal-vecdb-inference.md(11:07 CST · vLLM vs SGLang vs TRT-LLM 2026 选型 + SGLang BCG + ai-dynamo/dynamo K8s recipes + NVIDIA NIM Operator + REVA + Mr.LHDR)2026-09-13T1735-jay-evening-briefing-sep13-2026.md(17:36 CST · SGLang ~16,200 vs LMDeploy ~16,200 vs vLLM ~12,500 tok/s H100 + p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixArk $400M + Ken Huang KV Cache Frontier Chapter 2 + Agentic RAG 范式转变 + HF WebGPU Kernels 200+)
1.4 inbox/spark 9-13 llm-infra e1prep(2026-09-13 18:40 CST)
- 本棒 llm-infra 主轴核心 = 7 件 NET-new:Akashic arXiv:2607.05708(⭐⭐⭐⭐⭐)+ 推理引擎可复现性 arXiv:2605.19537(⭐⭐⭐⭐⭐)+ ai-dynamo/dynamo + NVIDIA NIM Operator + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测 + Ken Huang 10 章 KV Cache Frontier + HF WebGPU Kernels 200+
- 0 件 llm-infra 主分类 NET-new paper_card 入库(1334 张净增确认在 v3.31 cutoff 前已落档)
1.5 inbox/flyp 9-13 multimodal + risk e1prep
2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md(15:50 CST · MaP-WAM paper_card 1322 锚入确认)2026-09-13-risk-e1prep.md(16:30 CST · Risk 主轴 · 无 inference 主轴净增量)2026-09-13-1000-rss-cameron-wolfe.md(10:00 CST · 无 inference 主轴)2026-09-13-1001-rss-interconnects.md(10:01 CST · 无 inference 主轴)
1.6 inbox/stephen 9-13 ai-industry e1prep(2026-09-13 10:23 CST)
- 无 inference 主轴净增量;Dario Amodei《We Must Pace the Frontier》属行业治理邻接
1.7 paper_cards 近 3 天新卡(Sep 10-13 入库)
| 编号 | arXiv | 标题 | 主分类 | 与 inference 关系 |
|---|---|---|---|---|
| 1328 | 2609.11085 | Beyond Solver Verdicts(Generative Reward Models) | llm-infra | v3.30 已锚入 |
| 1330 | 2609.10445 | Building Multilingual Bridges(L2 Reasoning) | llm-infra | v3.30 已锚入 |
| 1334 | 2608.15380 | Adaptive Bridge(ROS2 DDS) | llm-infra | v3.30 已锚入 |
| 1322 | 2609.11561 | MaP-WAM(Memory-as-Plans) | agent | 邻接(Agent 记忆规划) |
| 1304 | 2609.10266 | KVShareArena | llm-infra | 邻接(KV Cache 复用) |
| 1329 | 2609.10745 | Think Before You Link | rag | 邻接(RAG 检索质量) |
| 1331 | 2609.10539 | IdeaAMBIG | evaluation | 邻接(实现可行性) |
| 1332 | 2609.09143 | Image Tokenizers as Visual Languages | multimodal | 邻接(多模态编解码) |
| 1333 | 2609.09076 | ActReview | multimodal | 邻接(工程) |
| 929 | 2608.12036 | Mechanist | agent | 邻接(Agent 机制解释) |
| 951 | 2608.13010 | RAGSieve | rag | 邻接(RAG 安全) |
今日无新增主分类 inference 的 paper_card 入库。v3.30 cutoff(2026-09-13 04:00 CST)之前已入库的 inference 主轴卡片已全部锚入完毕。
1.8 inference.md 活文档基线确认(v3.30 · 2026-09-13 04:00 升档)
- inference.md v3.30 已覆盖:NVIDIA Dynamo 1.0 + SGLang v0.5.19 Beam Search + vLLM v0.20.2 + vLLM V1 五项 + vLLM Speculators v0.3.0 + vLLM RDT + vLLM Router + vLLM K8s 冷启动 8min→1min + vLLM prefix cache 16-token 边界踩坑 + vLLM 0.19.0 + vLLM Blackwell/GB200 26.2k tok/s + SGLang v0.6 + SGLang BCG + SGLang DeepSeek MLA 3.1× + SGLang EAGLE + LMDeploy TurboMind + TensorRT-LLM v1.2.1 + RTP-LLM + MAX + HF WebGPU + Detokenization Leaks(arXiv:2609.06674)+ CoRL Least Privilege(arXiv:2609.07529)+ Φ-Bench(arXiv:2609.10226 沿用 v3.30 预备级)
- 沿用件套(v3.30 闭合级)= arXiv:2609.03430 + arXiv:2606.19746 + arXiv:2609.01316 + arXiv:2609.01777 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2508.08438 + arXiv:2609.06008 + arXiv:2609.07139 + arXiv:2609.04971 + arXiv:2509.01809 + arXiv:2609.11412 + arXiv:2609.11294
二、增量条目(5 条主增量)
增量 ① OmniKVQuant:多模态 Omni-LLM 的 KV Cache 异构值几何量化(NET-new 事件级 · ⭐⭐⭐⭐⭐)
- 来源:jay 9-13 21:09 evening-briefing-kvcache-phi-finetuning-sep13.md §一.1(arXiv:2609.11582 · cs.CV · 2026-09-10)
- 要点:OmniKVQuant 是第一个专门针对跨模态 KV 分布差异设计量化的方案。核心挑战:视频/音频/文本混合推理场景中,音频/视频/文本 tokens 各自占据不同值空间——Keys 的局部方差远低于 Gaussian 分布(尤其是 audio/video tokens);Value 分布更复杂,跨模态共享旋转效果不如为每种模态单独选择。解决方案:异构值几何(heterogeneous value geometry)处理——为每种模态单独选择最优量化策略,而非统一共享旋转。引用了 TurboESM(3-bit KV cache 蛋白质语言模型,Hu et al.)和 Octopus(八面体参数化 + 最优平方误差量化,Boss et al.)的工作。
- 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联——v3.30 已锚入 KIVI(ICML 2024)、KVQuant、RotateKV(arXiv:2501.16383)、KVLinC(arXiv:2510.05373)、KVarN(arXiv:2606.03458)、KVShareArena(arXiv:2609.10266)。OmniKVQuant 代表 2026 年 KV cache 量化的最新演进:从"统一量化"到"异构模态感知量化"。这与 v3.30 已锚入的"vLLM V1 KV-Cache fp8 1.6× H100"等工程化量化形成方法学互补。
- 建议归入节:§1.(3) KV Cache 子轴(OmniKVQuant 异构值几何量化 · 多模态 Omni-LLM KV cache 新范式)
- arXiv 号清单:
arXiv:2609.11582= 1 件 NET-new inference 主轴 - 可信度:★★★★★(arXiv 2026-09-10,完整方法 + 分布分析表格,cs.CV)
增量 ② Φ-Bench:首个 LLM 基础设施工程能力 Benchmark(NET-new 事件级 · ⭐⭐⭐⭐⭐)
- 来源:jay 9-13 21:09 evening-briefing-kvcache-phi-finetuning-sep13.md §一.2(arXiv:2609.10226v1 · StepFun AI 团队 Leilei Ding & Yanyong Zhang 主导 · 2026-09-09)
- 要点:核心问题:LLM 能否工程化和优化自己的基础设施栈? Benchmark 规模:85 个任务,涵盖 9 个 LLM 基础设施领域(内核级/实现级/系统优化级)。三种任务格式:localized kernel-level → long-horizon implementation → end-to-end system optimization。来源:真实代码仓库 + 前沿研究优化问题。评测结果:8 个前沿模型参与,Claude Opus 5 领先(36.53%),但无模型能稳定覆盖所有任务。这是第一个系统评估 LLM 在基础设施工程能力 的 benchmark,与 coding agent 评测(SWE-Bench)形成互补——SWE-Bench 测代码实现,Φ-Bench 测系统优化。
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学直接关联。v3.30 预备级锚入 Φ-Bench(arXiv:2609.10226),本棒正式提升为独立增量条目。Φ-Bench 与 v3.30 已锚入的"LLM 评测规范"邻接——推理引擎可复现性研究(arXiv:2605.19537,增量 ③)共同指向"benchmark 标准化报告推理栈"的工程需求。
- 建议归入节:§1.(1) 推理引擎方法学(Φ-Bench:首个 LLM 基础设施工程能力 benchmark · Claude Opus 5 领先 36.53% · 无模型覆盖所有任务)+ §1.(4) 量化子轴邻接(benchmark 驱动量化优化方向)
- arXiv 号清单:
arXiv:2609.10226= 1 件 NET-new inference 主轴(v3.30 预备级,本棒正式提升) - 可信度:★★★★★(StepFun AI 前沿研究 + 完整 benchmark 架构 + 评测结果,arXiv 2026-09-09)
增量 ③ 推理引擎可复现性:推理后端应被列为 LLM 评估的"隐性超参数"(NET-new 方法学级 · ⭐⭐⭐⭐⭐)
- 来源:jay 9-13 13:35 afternoon-briefing-mcp-production-inference-stack-sep13.md §5(arXiv:2605.19537 · 2026-01)+ spark 9-13 llm-infra e1prep 增量 ②
- 要点:系统性研究截至 2026-01 完整推理引擎生态。核心发现:不同推理引擎(vLLM / TensorRT-LLM / SGLang / llama.cpp / transformers 等)对同一模型、同一输入产生的输出分布显著不同——这种差异可大到将 top-5 候选 token 整体换血。核心结论:推理后端应被列为 LLM 评估中的"隐性超参数";benchmark 对比必须标准化报告推理栈。jane 9-13 晚间简报进一步给出精细实测数字(9-13 17:36 evening briefing):SGLang ~16,200 vs LMDeploy ~16,200 vs vLLM ~12,500 tok/s on H100,p99 TTFT SGLang 54.2s vs vLLM 58.9s,RadixAttention 6.4× 前缀复用优势,DeepSeek V3 SGLang 3.1× faster。
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学直接关联——v3.30 已锚入 vLLM vs SGLang vs LMDeploy 选型决策树,Φ-Bench(增量 ②)共同指向推理栈标准化需求。本增量为此选型决策提供学理基础:不同引擎即使相同模型相同输入也会产生显著不同的 token 分布,因此 benchmark 对比必须标准化报告推理栈。同时与 v3.30 §4.1 推理经济学邻接——引擎选择直接影响评测结果的可复现性和成本。
- 建议归入节:§1.(1) 推理引擎方法学(推理引擎可复现性:推理后端=隐性超参数 · benchmark 必须标准化报告推理栈)+ §1.(2) 推理调度子轴(选型数字补充:p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4×)
- arXiv 号清单:
arXiv:2605.19537= 1 件 NET-new inference 主轴 - 可信度:★★★★★(系统性 arXiv 研究,覆盖完整推理引擎生态,2026-01)
增量 ④ Akashic MemAttention:生产级 vLLM 0.10.0 扩展型长程 Agent 记忆基础设施(NET-new 方法学级 · ⭐⭐⭐⭐⭐)
- 来源:jay 9-13 13:35 afternoon-briefing-mcp-production-inference-stack-sep13.md §3(arXiv:2607.05708 · 2026)+ spark 9-13 llm-infra e1prep 增量 ①
- 要点:vLLM 0.10.0 控制路径扩展,GPU 执行路径 / 注意力后端 / KV-cache 管理器保持不变。三个接入点:① 记忆检索插入请求准入层;② 记忆回写插入请求完成层;③ 物理布局维护拆分为在线迁移路径 + 后台存储。解决 agentic workflow 中长期记忆(long-term memory)与短期上下文(short-term context)之间的张力——长期记忆需要持久化但又不能无限增长。bounded chunks + cross-chunk inference(受 Claude Code 启发)。与 VikingMem(VLDB 2026,arXiv:2605.29640)互补:VikingMem 是内存页管理 + 状态持久化,Akashic 是 vLLM 层面的注意力级记忆管理。Jay 9-13 14:50 afternoon engineering filter 还给出了 Agent 记忆系统三路对比:vLLM 扩展型(Akashic)vs RAG 引入型(MaP-WAM)vs 微型关联记忆型(δ-mem,4.87M,Poria 团队)。
- 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴直接关联。v3.30 已锚入 KVShareArena(arXiv:2609.10266,RAG/multi-agent 场景 KV cache 复用失效)和 MaP-WAM(arXiv:2609.11561,Memory-as-Plans)。Akashic 提供生产级 vLLM 主线扩展型实现——前者是离线修补/算法层方案,Akashic 是生产级 vLLM 扩展型基础设施。首次提供"生产级 Agentic Workflow 持久化 KV-cache + 记忆回写"完整工程实现路径,无需 fork vLLM 主线即可实验。
- 建议归入节:§1.(3) KV Cache 子轴(Akashic MemAttention:vLLM 0.10.0 扩展 · 长期记忆持久化基础设施 · 与 VikingMem 互补)+ §1.(11) Kernel/Harness 子轴(Agent 记忆系统三路对比:Akashic vs MaP-WAM vs δ-mem)
- arXiv 号清单:
arXiv:2607.05708= 1 件 NET-new inference 主轴 - 可信度:★★★★★(arXiv 论文,基于 vLLM 0.10.0 扩展,Jay 三棒位连续确认,7 月已雷达但 v3.30 未实质锚入,本棒正式首次锚入)
增量 ⑤ KV cache "压缩+纠错"新范式:低秩注意力补偿(NET-new 方法学级 · ⭐⭐⭐⭐)
- 来源:jay 9-13 21:09 evening-briefing-kvcache-phi-finetuning-sep13.md §一.3(arXiv:2609.04263 · 2026 更新版)+ IEEE INFOCOM 2026 LiteKV + arXiv:2606.03458 KVarN
- 要点(汇总三条 KV cache 新线索):
- (a) arXiv:2609.04263 Quality Recovery for Quantized KV Caches via Low-Rank Attention:KV cache 量化后信息损失不可逆,本工作通过低秩注意力补偿(Low-Rank Attention)恢复质量。引用了 GEAR(arXiv:2403.05527)、KVTuner(arXiv:2502.04420)、KIVI(ICML 2024)、RotateKV(arXiv:2501.16383)、KVLinC(arXiv:2510.05373)、KVarN(arXiv:2606.03458,2026)。代表 2026 年 KV cache 量化的新范式:从纯量化压缩转向"量化+纠错联合设计"。
- (b) LiteKV(IEEE INFOCOM 2026):专为边缘 LLM 推理设计的轻量级在线 KV cache 替换算法,内存降低 75%,同时保持与无内存约束基线相当的生成质量和 95% 解码效率。对比基线:PagedAttention(vLLM)、StreamingLLM、H2O 等。边缘部署场景(IoT/移动端),与云端 disaggregated serving 互补。
- (c) KVarN(arXiv:2606.03458,2026):归一化方差以缓解推理任务中的错误累积——解决 KV cache 量化误差在多步推理中逐步放大的问题。
- 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联。三条线索共同指向 2026 年 KV cache 量化的三维演进:① 异构模态感知(OmniKVQuant,增量 ①)→ ② 量化+纠错联合设计(Low-Rank Recovery)→ ③ 边缘轻量化(LiteKV)。v3.30 已锚入 KIVI、KVQuant、RotateKV、KVLinC、KVarN,本棒补入 Low-Rank Recovery 范式和 LiteKV 边缘场景,形成完整的 2026 KV cache 量化技术演进图谱。
- 建议归入节:§1.(3) KV Cache 子轴(Low-Rank KV Cache 质量恢复:量化+纠错联合设计新范式 + LiteKV 边缘推理 + KVarN 方差归一化)
- arXiv 号清单:
arXiv:2609.04263+arXiv:2606.03458= 2 件 NET-new inference 主轴邻接 - 可信度:★★★★(完整方法,引用关系丰富,覆盖 2024-2026 主要工作)
三、矛盾/待核实条目
待核实 ① OmniKVQuant 与 TurboESM/Octopus 的方法学差异
- 问题描述:OmniKVQuant 引用了 TurboESM(3-bit KV cache,Hu et al.)和 Octopus(八面体参数化,Boss et al.)作为方法学基础,但均属蛋白质语言模型或参数化领域。OmniKVQuant 将这些方法迁移到多模态 LLM 的 KV cache 场景,迁移性论证是否充分?
- 建议动作:精读 arXiv:2609.11582 §3 方法论迁移部分,核实异构值几何 vs 统一旋转的边界条件
待核实 ② Φ-Bench Claude Opus 5 领先 36.53% 的任务分布
- 问题描述:Φ-Bench 结果显示 Claude Opus 5 领先(36.53%),但无模型能稳定覆盖所有 85 个任务。具体哪些任务类型 Claude Opus 5 强,哪些模型强?85 个任务的领域分布如何?
- 建议动作:精读 arXiv:2609.10226 Table 2/3,确认 Claude Opus 5 的 task distribution
待核实 ③ Akashic MemAttention 与 VikingMem(VLDB 2026)的边界与互补关系
- 问题描述:Jay 9-13 晚间简报指出 Akashic(vLLM 0.10.0 控制路径扩展)与 VikingMem(内存页管理 + 状态持久化)互补,但两者在记忆持久化栈中的具体边界尚需核实。Akashic 的 bounded chunks 是否与 VikingMem 的内存页管理有重叠?
- 建议动作:精读 arXiv:2607.05708 §4 Implementation 与 VikingMem 论文 §3 System Design 对照
待核实 ④ 推理引擎可复现性 arXiv:2605.19537 的 top-5 候选 token "整体换血"量化表述
- 问题描述:Jay 描述为"top-5 候选 token 整体换血",是原文表述还是二次引述?原文对输出分布差异的量化阈值(KL divergence 或其他指标)是什么?
- 建议动作:精读 arXiv:2605.19537 §3 Experiments,核实量化差异的具体指标
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主分类 | 形态 | 锚定位置 |
|---|---|---|---|---|
| 2609.11582 | OmniKVQuant: KV Cache Quantization for Omni-LLMs | inference | method | 本棒增量 ① · §1.(3) KV Cache 子轴 NET-new |
| 2609.10226 | Φ-Bench: LLM Infrastructure Engineering Benchmark | llm-infra | benchmark | 本棒增量 ② · §1.(1) 推理引擎方法学 NET-new(v3.30 预备级升格) |
| 2607.05708 | Akashic: A Low-Overhead LLM Inference Service with MemAttention | inference | method | 本棒增量 ④ · §1.(3) KV Cache + §1.(11) Kernel/Harness NET-new |
| 2605.19537 | 推理后端对 LLM 可复现性的影响 | inference | method | 本棒增量 ③ · §1.(1) 推理引擎方法学 NET-new |
| 2609.04263 | Quality Recovery for Quantized KV Caches via Low-Rank Attention | inference | method | 本棒增量 ⑤ · §1.(3) KV Cache 子轴 NET-new 邻接 |
| 2606.03458 | KVarN: Variance-Normalized KV Cache Quantization | inference | method | 本棒增量 ⑤ 邻接 · §1.(3) KV Cache 子轴 |
| 2609.06674 | Detokenization Leaks(Side-Channel Privacy) | security | vulnerability | v3.30 已锚入 §3.5 |
| 2609.07529 | CoRL(Least Privilege on Tool Calls) | agent | method | v3.30 已锚入 §3.5 |
| 2609.10266 | KVShareArena | llm-infra | benchmark | v3.30 已锚入 §1.(3) |
| 2609.11561 | MaP-WAM | agent | method | v3.30 已锚入 §1.(11) |
| 2609.11294 | Memory Compression for Agents | agent | method | v3.30 邻接锚入 |
| 2609.11390 | VikingRAG | rag | method | v3.30 邻接锚入 |
| 2605.29640 | OpenViking / VikingMem(VLDB 2026) | database | systems | v3.30 邻接锚入 |
| 2609.11209 | REVA(RAG Serving 成本优化,ICDM 2026) | rag | method | 邻接级锚入 |
| 2609.11318 | Mr.LHDR(Deep Research Agent Benchmark) | agent | benchmark | 邻接级锚入 |
五、给今晚活文档接力的建议
今晚 inference 活文档(knowledge/inference.md)接力方向建议:
- §1.(3) KV Cache 子轴 补入 OmniKVQuant(arXiv:2609.11582):异构值几何量化,多模态 Omni-LLM KV cache 新范式,与 TurboESM/Octopus 方法学关系待核实
- §1.(3) KV Cache 子轴 补入"压缩+纠错"新范式:arXiv:2609.04263 低秩注意力质量恢复 + KVarN(arXiv:2606.03458)+ LiteKV(IEEE INFOCOM 2026),形成 2026 KV cache 量化三维演进图谱(异构模态感知 + 量化+纠错联合 + 边缘轻量化)
- §1.(1) 推理引擎方法学 补入 Φ-Bench(arXiv:2609.10226):首个 LLM 基础设施工程能力 benchmark,Claude Opus 5 领先 36.53%,v3.30 预备级升格正式锚入
- §1.(1) 推理引擎方法学 补入推理引擎可复现性(arXiv:2605.19537):推理后端=隐性超参数,benchmark 必须标准化报告推理栈;补充 p99 TTFT SGLang 54.2s vs vLLM 58.9s 精细数字
- §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴 补入 Akashic MemAttention(arXiv:2607.05708):vLLM 0.10.0 扩展型生产级 Agent 记忆基础设施;Agent 记忆系统三路对比:Akashic vs MaP-WAM vs δ-mem
- 待核实项目:OmniKVQuant 方法学迁移充分性(P0);Φ-Bench Claude Opus 5 任务分布(P1);Akashic vs VikingMem 边界(P1);推理引擎可复现性 top-5 "整体换血"量化指标(P2)
六、本棒检查过的来源完整清单
work-queue.md(2026-09-13 22:00)
inference.md(v3.30,2026-09-13 04:00 升档)
inbox/tom/2026-09-12-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-11-inference-e1prep.md(9-11 基准)
inbox/tom/2026-09-13T2040-agent-rag-longcontext-radar.md
inbox/tom/2026-09-13T1440-agent-rag-longcontext-radar.md
inbox/tom/2026-09-13T0840-agent-rag-longcontext-radar.md
inbox/tom/2026-09-13-0900-hf-daily-2026-09-13.md
inbox/tom/2026-09-13-rag-e1prep.md
inbox/tom/2026-09-13-evaluation-e1prep.md
inbox/tom/2026-09-13-1003-rss-yt-yannic-kilcher.md
inbox/tom/2026-09-13-1004-rss-yt-lex-fridman.md
inbox/jay/2026-09-13T1230-jay-csdn-inference-finetuning-highvalue-sep13.md
inbox/jay/2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md
inbox/jay/2026-09-13T2109-jay-evening-briefing-kvcache-phi-finetuning-sep13.md
inbox/jay/2026-09-13-morning-briefing-multimodal-vecdb-inference.md
inbox/jay/2026-09-13T1735-jay-evening-briefing-sep13-2026.md
inbox/spark/2026-09-13-llm-infra-e1prep.md(18:40 CST)
inbox/spark/2026-09-12-llm-infra-e1prep.md
inbox/flyp/2026-09-13-risk-e1prep.md
inbox/flyp/2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md
inbox/stephen/2026-09-13-ai-industry-e1prep.md
paper_cards/ Sep 10-13 入库卡:929/951/1322/1328/1329/1330/1331/1332/1333/1334/1304(共 11 张)
Tom · 2026-09-13 22:20 CST · E1 预消化 · inference · 5 条主增量(OmniKVQuant ⭐⭐⭐⭐⭐ + Φ-Bench ⭐⭐⭐⭐⭐ + 推理引擎可复现性 ⭐⭐⭐⭐⭐ + Akashic MemAttention ⭐⭐⭐⭐⭐ + KV cache 压缩+纠错新范式 ⭐⭐⭐⭐)+ 6 件涉及 arXiv 号