llm-infra · E1 预消化简报(2026-09-09)

实例:spark · llm-infra 主题 E1 日间预消化轮 · cron 3c698927-9044-4540-873b-f961d6380d7d 生成时间:2026-09-09 18:40 CST(Asia/Shanghai) 窗口期:2026-09-09 04:00 → 2026-09-09 18:40 CST(约 14h40m 接力净窗口 · §IX 95 morning v3.27 微调棒闭合后) 基线活文档:organized/knowledge/llm-infra.md §IX 95 morning v3.27(2026-09-09 04:00 CST · SOTA 多轮深综合第 3.27 版微调棒) 昨夜基线 E1 报告:inbox/spark/2026-09-08-llm-infra-e1prep.md(9-8 18:40 · §IX 95 morning v3.27 闭合后 28h40m 接力净窗口 · 5 条主增量 + 0 件 NET-new paper_card llm-infra 主分类)


状态摘要

  • 状态:已 ok
  • 增量条数:8 条主增量(在 3-8 目标区间上限;含 1 件 NET-new paper_card 主分类 llm-infra 入库 = paper_card 1278 arXiv:2609.04971 BeaconKV 2026-09-09 16:30 入库 · 含 5 件 NET-new arXiv 锚入预备级 · 含 2 件事件级/方法学 NET-new + 4 件矛盾/待核)
  • 涉及 arXiv 号:13 件 arXiv 号 = arXiv:2609.04971(BeaconKV · paper_card 1278 NET-new 主分类 llm-infra)+ arXiv:2606.17104(Prefill/Decode-Aware Evaluation HPAI4S'26 @ IPDPS 2026 · jay 14:50 NET-new 锚入预备级)+ arXiv:2607.02574(Survey of KV Cache Management for LLM Serving · jay 14:50 NET-new 锚入预备级)+ arXiv:2604.25724(Scalable Inference Architectures for Compound AI Systems · jay 14:50 NET-new 锚入预备级)+ arXiv:2603.16104(Efficient LLM Serving for Agentic Workflows · jay 14:50 NET-new 锚入预备级)+ arXiv:2506.21901(PremAI LLM Inference Servers Compared H100 80GB 实测补充材料 · jay 18:50 NET-new 锚入预备级)+ arXiv:2609.01316(MIDR Multimodal Indexing with Decoupled Reasoning · jay 11:05 NET-new 锚入预备级)+ arXiv:2609.01777(TREMORS LLM-driven Seismic Data Agent System · jay 11:05 NET-new 锚入预备级)+ arXiv:2608.01526(Internet for KV Cache · 沿用预备级)+ arXiv:2606.02964(AsymCache MDA · 沿用预备级)+ arXiv:2606.19746(SAC CXL · 沿用预备级)+ arXiv:2602.07115v5(Online Scheduling for LLM Inference · 沿用预备级)+ arXiv:2608.16157(FreeToken Edge-Native MoE Serving · 沿用预备级)+ arXiv:2504.11320v4(Fluid-Guided Online Scheduling · 沿用预备级)+ arXiv:2605.01280v1(LLM Serving Needs Mathematical Optimization · 沿用预备级)+ arXiv:2504.19874(TurboQuant · 沿用 v3.27 闭合级)+ arXiv:2604.01395v1(On-Premises RAG Blueprint · 沿用 v3.27 闭合级)+ arXiv:2609.03430(Random Attention · 沿用预备级 矛盾 ① 持续)
  • 涉及 CVE:CVE-2026-3172(pgvector 0.8.2 紧急安全补丁 · 沿用预备级)
  • 涉及 IETF 草案:draft-li-cats-kv-cache-distribution-00(2026-07 · IETF KV Cache Distribution 工作组草案 · 沿用预备级)
  • 性质:§IX 95 morning v3.27 微调棒已闭合 14h40m 后 §IX 95 evening 棒位预备候选接力净窗口 — v3.27 已闭合 vLLM V1 架构更新 + HF Transformers Backend Day 0 部署范式 + HF × Foundry + OpenAI/HF Incident 官方声明 + TurboQuant 6× KV-Cache + H100 +8× 推理速度 + State of vLLM 2026 路线图 + arXiv:2604.01395v1 On-Premises RAG Blueprint NET-new;本棒位净增量集中在 (a) paper_card 1278 arXiv:2609.04971 BeaconKV NET-new 主分类 llm-infra 入库(2026-09-09 16:30 · 主分类 llm-infra · 形态 method · 候选源 /inbox/tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json · tom 9-9 14:40 radar 已锚 BeaconKV HF/arXiv 12票)→ §1.(3) KV Cache 子轴 NET-new 锚入闭合预备候选;(b) jay 9-9 14:50 llm-inference-engineering-screening 5 件 NET-new arXiv 锚入预备级 = arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901;(c) jay 9-9 11:05 daily-brief 双 arXiv NET-new 锚入预备级 = arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS;(d) jay 9-9 18:50 engineering-filter-sep09pm 6 件事件级/方法学 NET-new = SGLang BCG 新默认后端 + vLLM 冷启动 8min→1min + DeepSeek V4 Flash Vision + NVIDIA NVFP4 Blackwell + PremAI 推理服务器横评 H100 80GB + Snowflake Semi-Persistence + DGX Spark Qwen3.8-27B

本棒与昨夜 9-8 18:40 简报对比:昨夜棒 = 5 条主增量 + 0 件 NET-new paper_card 主分类 llm-infra + 0 件 NET-new arXiv 锚入(预备级)。本棒 = 8 条主增量 + 1 件 NET-new paper_card 主分类 llm-infra 入库(paper_card 1278 BeaconKV arXiv:2609.04971)+ 5 件 NET-new arXiv 锚入预备级 + 2 件 NET-new arXiv 锚入预备级(MIDR + TREMORS)+ 6 件事件级/方法学 NET-new。本棒性质更接近"v3.27 微调棒已闭合 14h40m 后 §IX 95 evening 升档正式闭合预备候选接力"节奏,本棒性质显著高于 9-7 棒位(因 paper_card 1278 NET-new 主分类 llm-infra 入库 + 5 件 NET-new arXiv 锚入预备级 + 6 件事件级/方法学 NET-new),符合 §IX 95 evening 棒位预备窗口特征。


一、本棒检查过的来源清单(覆盖近 2 天 5 实例 inbox + 近 3 天 paper_cards)

1.1 work-queue.md(2026-09-09 18:00 自动生成)

  • 待建卡 8 · 待更新主题活文档 0(全部最新)· 选题选卷未成视频脚本 1 = arXiv:2609.04010(Discrete Diffusion 主轴,非 llm-infra 主轴)· 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张卡
  • work-queue.md 中 8 件待建卡(2609.05324 RoboSPA · 2609.04971 BeaconKV · 2609.06665 TransNormal-2 · 2609.09158 TANGO · 2609.08345 CoVeR · 2609.08936 AuK · 2609.09123 Mask Forcing · 2609.08977 Omni Interaction Agent)中 仅 arXiv:2609.04971 BeaconKV 为本棒位 llm-infra 主轴 NET-new(其他 7 件分别对应 multimodal/agent/multimodal/multimodal/engineering/multimodal/multimodal/multimodal 主分类)
  • arXiv:2609.04971 BeaconKV 状态:work-queue.md 仍标记为待建卡 0.5,实际 paper_card 1278 已 2026-09-09 16:30 入库(主分类 llm-infra 形态 method)→ work-queue 待建卡 #2 应在下次 cron 重建时清理

1.2 inbox/jay 9-9 全天棒位(6 件 llm-infra 主轴最强累积素材 + RSS 早棒 10 件)

  • 2026-09-09-llm-inference-engineering-screening.md(9-9 14:50 CST · jay 14:50 工程筛选 LLM 推理引擎专题 · 8 件保留 + 9 件丢弃 · 本棒 llm-infra 主轴核心 = 🟢 4 件 arXiv NET-new 锚入预备级 + 1 件 arXiv PremAI 引用 NET-new)
  • 🔵 arXiv:2606.17104 Prefill/Decode-Aware Evaluation(HPAI4S'26 @ IPDPS 2026 · NET-new):A100 平台 token transfer 时间 0.210 ms/token(25 Gbps Ethernet)到 0.00036 ms/token(NVLink);对比 NVIDIA A100(vLLM v0.12.0)与 GroqRack(专用 AI 加速器)的 prefill/decode 执行模型差异;prefill 阶段为单次并行前向传播,decode 阶段为自回归;GroqRack 每次调用只处理一个 token,无批处理 — §1.(2) 推理调度子轴 NET-new 锚入预备级 + §1.(1) 推理引擎横评补充级(peer-reviewed 会议论文,IPDPS 2026)
  • 🔵 arXiv:2607.02574 Survey of KV Cache Management for LLM Serving(2026-07 · NET-new):对 30+ KV-cache 管理系统的系统性分类,基于 4 轴 = locality / lifetime / ownership / substrate;5 大架构原型 = local-paged / disaggregated-pipeline / shared-store / memory-pool / hybrid-tier;论文揭示当前评估中 7 个缺失的 KV 专项测量指标;Mooncake(PD disaggregation + 分布式 KV 存储 + tiering)、Beluga(CXL KV-cache)等代表系统;CXL memory pooling 架构可跨 worker 扩展容量 — §1.(3) KV Cache 子轴 NET-new 锚入预备级(arXiv 2026-07 学术论文,系统性分类法,适合知识库 RAG/serving 架构专题引用)
  • 🟢 arXiv:2604.25724 Scalable Inference Architectures for Compound AI Systems(Salesforce · 2026-04 · NET-new):生产规模 = 8,000 企业用户 · 日均 722,000 次推理 · 峰值 140 万请求/天 · 21 个全球分布式推理区 · provisioned 峰值 2,250 RPS(135,000 RPM)· 2026-03 处理 1360 亿 token(日均约 44 亿 token),同比 8.7× 增长;关键发现:复合 AI 系统中各模型 scaling 不对称(Atlas 推理引擎过滤部分查询,导致对话 LLM 仅扩 6-7×;embedding 模型随流量线性扩 10×;SQL executor 仅扩 2-3×) — §1.(1) 推理引擎方法学 + §1.(2) 推理调度子轴 NET-new 锚入预备级(Salesforce 研究团队,2026-04 发布,有生产数据背书)
  • 🟢 arXiv:2603.16104 Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective(NET-new):AI agent 工作流中 LLM 调用的特殊性 = 多步骤、异构 prompt、跨请求状态共享;当前 serving 引擎(vLLM 等)优化的是独立请求,未针对 agentic 工作流特征设计;cache hit rate 实测表(Qwen3-8B / Qwen3-14B):Helium 59.2% / 42.9%;vLLM 42.9% / 43.0%;agentic 场景 KV cache 命中率普遍低于预期(因多步异构请求共享率低) — §1.(3) KV Cache 子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级(arXiv 2026-03 系统性研究,7 种 agentic 系统对比)
  • 🟢 arXiv:2506.21901 PremAI LLM Inference Servers Compared(H100 80GB 实测补充材料 · NET-new):H100 80GB 实测数据(SGLang 16,215 tok/s · LMDeploy 16,132 -0.5% · vLLM FlashInfer 12,553 -22.6% · vLLM default ~10,000 -38%);TGI 已于 2025 年 12 月进入维护模式;Hugging Face 建议新部署使用 vLLM 或 SGLang;vLLM 并发饱和点 100-150 个并发请求 GPU 利用率 85-92%;TGI 并发饱和点 50-75 个并发请求 GPU 利用率 68-74% — §1.(1) 推理引擎方法学 NET-new 锚入预备级(PremAI 厂商实测,与 v3.27 已锚入的 vLLM/SGLang/LMDeploy/TensorRT-LLM H100 横评形成 2026 Q3-Q4 双源独立锚入预备)
  • Particula Tech Blog SGLang vs vLLM in 2026:SGLang DeepSeek V3 比 vLLM 快 3.1×;EAGLE speculative decoding batch=1 时 decode 加速 1.8× batch=32 时 1.5×;结构化输出:SGLang compressed FSM 让 JSON 合规率从 90-94% 提升至 96-98.2%;生产建议 = 多轮对话/共享前缀/结构化输出 → SGLang;多硬件/encoder-decoder/批量 → vLLM — 沿用预备级(v3.27 已锚入预备级复证)
  • theneuralmaze.substack Hands-on Guide to LLM Inference with vLLM:vLLM 核心参数实战 max-num-seqs / gpu-memory-utilization / block-size / tensor-parallel-size / flash_attn_version / kv-cache-dtype / speculative-model;大规模企业部署 3 层 KV cache 存储架构图;包含 AKS(Azure Kubernetes Service)上 Unlimited-OCR VLM pipeline 部署步骤 — 沿用预备级(工程实战补充)
  • 2026-09-09-engineering-e1prep.md(9-9 11:21 CST · jay engineering 主轴备料 · 6 条主增量 · 本棒 llm-infra 主轴核心 = 🟢 2 件 arXiv NET-new 锚入预备级)
  • 🟢 arXiv:2609.01316 MIDR(Multimodal Indexing with Decoupled Reasoning):在索引时完成多模态推理(离线),而非传统查询时推理(在线);使用多模态 LLM 生成跨模态预预问和 bridging facts,将视觉理解成本摊销到索引阶段;评测覆盖 CS/Finance/HR/Industrial/Pharma/Energy/Physics 七领域,平均 nDCG 0.6231,Oracle 上界 0.7042;对比 ColQwen2.5 在 Finance 领域有 +9.4% 优势;工程价值 = RAG 检索 serving 路径仅需文本向量检索,视觉编码成本摊销到索引阶段 — §1.(2) 推理调度子轴 + §1.(11) Kernel/AI 自动化/Harness 子轴 NET-new 锚入预备级(RAG 索引阶段的多模态优化方法)
  • 🟢 arXiv:2609.01777 TREMORS(LLM-driven Seismic Data Agent System):LLM 作为 reasoner 驱动 LangChain/LangGraph 结构化工作流,在 FDSN 分布式地震数据存档上进行目标驱动的数据检索;采用 gpt-oss:120b(~65GB 本地部署),通过约束节点设计实现 goal-driven planning;提出 URSA 框架概念 = 未来 AI-ready 半自动化基础设施以 portable schemas 和模块化工作流为中心 — §1.(11) Kernel/AI 自动化/Harness 子轴 NET-new 锚入预备级(LLM Agent 在科学数据领域的工程实践)
  • 2026-09-09-inference-vecdb-hf-acquisition-morning.md(9-9 09:36 CST · jay 推理引擎格局 + 向量数据库演进 + NVIDIA $12.93B 收购 HF + GitHub Agent 栈 · 本棒 llm-infra 主轴核心 = 🟡 1 件 NVIDIA 收购 HF 事件级 NET-new 锚入预备级 + Speculative Speculative Decoding 待核)
  • 🟡 NVIDIA 收购 HF(2026-09-03 · 沿用预备级 NET-new 锚入):NVIDIA 以 $12,930,300,000(~$129.3 亿)全现金收购 HF;HF 平台 = 300 万模型 + 100 万 Spaces 应用 + 1.8 万开发者 + 50 万数据集 + 超 20 万公司用户;黄仁勋公开承诺 HF 保持开放,开发者可自由选择模型/框架/云/推理提供商,不强制使用 NVIDIA 计算 — §1.(1) 推理引擎生态 NET-new 预备级(NVIDIA 向上游技术栈扩张的标志性动作,与 v3.27 已锚入的 HF Transformers Backend + HF × Foundry 形成"HF 生态 + NVIDIA 收购"双轴预备级)
  • 推理引擎横向对比 2026.09 最新版本:theaiengineer.substack 2026-04 + inferenceengineering.tech 2026-06-01 持续更新;vLLM 3500 tok/s + SGLang 2800 tok/s + TGI 2500 tok/s + TensorRT-LLM H100 优化 + llama.cpp 20 tok/s(CPU);SGLang 在 prefix 共享场景比 vLLM 吞吐高 29%(RadixAttention);HF TGI 已进入维护模式;vLLM 生态最成熟插件最多;SGLang 在 Agent 场景有结构性优势 — §1.(1) 推理引擎横评预备级锚入
  • Speculative Speculative Decoding(SSD · 待核):Together AI + Stanford;H100 上 Llama-3 70B 和 Qwen3 32B 达到 250 tokens/s,比 vLLM/SGLang 快约 2× — §1.(5) 投机解码子轴 待核(arXiv 原文未检索到,以 newsletter 报道为准,建议核验)
  • 2026-09-09-csdn-highvalue-morning.md(9-9 08:20 CST · jay CSDN 工程早间版 · 10 件 · 本棒 llm-infra 主轴核心 = 🟡 3 件推理框架 Benchmark 沿用预备级)
  • vLLM vs TensorRT-LLM 性能对比(2025 实测数据 · 沿用预备级):Llama-3-8B × A100-SXM 80G GPU;默认吞吐量 vLLM 较高;严格 TPOT=20ms 时 vLLM 230 tokens/s vs TensorRT-LLM 197 tokens/s(vLLM 胜出约 17%);请求速率↑时 TensorRT-LLM 资源效率更高;TPOT 敏感场景优先 vLLM,吞吐优先且硬件资源敏感优先 TensorRT-LLM
  • 大模型推理框架全面对比(TGI/vLLM/TensorRT-LLM/SGLang · 沿用预备级):TensorRT-LLM ★★★★★ · vLLM ★★★★ · SGLang ★★★★ · TGI ★★★;选型建议 = 极致低延迟 + NVIDIA H100/A100 → TensorRT-LLM;高并发 + 多卡扩展 + 快速上线 → vLLM;多轮对话 + 结构化输出 + 共享前缀复用 → SGLang;快速验证 + HF 模型 → TGI
  • 主流推理框架全解析(vLLM/SGLang/TensorRT-LLM/Ollama/XInference/LightLLM · 沿用预备级):vLLM PagedAttention 显存利用率从 60% → 95%+;SGLang RadixAttention 持久化 KV 缓存多轮对话吞吐量较 vLLM 提升 5 倍;TensorRT-LLM FP8/FP4/INT4 H100 显存节省 40%+;Ollama 冷启动 12s 不适合高并发生产
  • 2026-09-09T1050-jay-engineering-filter-sep09pm.md(9-9 18:50 CST · jay 9-9 下午工程筛选 · 7 件保留 + 4 件丢弃 · 本棒 llm-infra 主轴核心 = 🟢 6 件事件级/方法学 NET-new)
  • 🟢 SGLang BCG(Breakable CUDA Graphs)新默认后端(Spheron Blog · 2026-07-02 SGLang v0.5.15 PR #29458 合并):Prefill graph 构建速度比 torch.compile 快 3.8~5.2 倍;Replay 速度比 torch.compile 快 17%;DeepSeek V4 DP attention 真实负载(CoreWeave 8-DP):开启 BCG 后吞吐量 +11.80%,TPOT 从 230.98ms 降至 200.32ms;GPU 成本估算 = 原 fleet 需要 10 张 H100 → BCG 优化后约 8.9 张(省约 10% GPU 成本) — §1.(1) 推理引擎方法学 NET-new 锚入预备级(SGLang 调度层的新一代默认后端)
  • 🟢 vLLM 冷启动优化 8min → 1min(The New Stack · 2026-09-03):冷启动各层耗时分解 = Pod 调度 + 镜像拉取 → 模型权重加载(Run:ai Model Streamer 82s→65s 初版,同节点后续 16s)→ GPU kernel 编译(torch.compile)34~53s ← 最大瓶颈 → CUDA graph → 服务就绪;torch.compile 持久化缓存方案(TORCH_COMPILE_DIR=/persistent-cache/torch-compile + PYTORCH_KERNEL_CACHE_DIR=/persistent-cache/py-kernel);Kubernetes 解决方案 = 挂载 PVC 或 HostPath 持久化缓存卷;额外发现 = OCI 镜像卷在 2026 年已稳定,Dynamic Resource Allocation(DRA)为 GPU 提供结构化属性,Gateway API 增加了推理感知路由扩展 — §1.(2) 推理调度子轴 + §1.(11) Kernel/AI 自动化/Harness 子轴 NET-new 锚入预备级
  • 🟢 DeepSeek V4 Flash Vision 开源多模态 MoE(Shattered.io + MorphLLM + TechTimes + HF · 2026-08-31 发布):参数 305B 总,MoE 架构,原生多模态 Vision 支持,MIT 许可可商用/自托管/微调;vLLM 部署命令 vllm serve deepseek-ai/DeepSeek-V4-Flash-Vision-Exp --trust-remote-code --port 8000;SGLang 部署命令 python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-V4-Flash-Vision-Exp --trust-remote-code;DSpark 投机解码 SGLang 通过 --speculative-algorithm DSPARK 启用(无需独立 draft model);⚠️ 警告:DeepSeek 自身 ApexBench 基准分数中 baseline(0731)忽略了多模态部分输入,与 V4-Flash-Vision-Exp 对比非同类对比,需第三方独立验证 — §1.(1) 推理引擎方法学 + §1.(5) 投机解码子轴 NET-new 锚入预备级(MIT 许可开源,vLLM/SGLang 双栈支持)
  • 🟢 NVIDIA DeepSeek-V4-Flash-NVFP4 Blackwell FP4 量化生产级精度(HuggingFace nvidia/DeepSeek-V4-Flash-NVFP4):测试硬件 NVIDIA Blackwell B200;加速引擎 SGLang、vLLM;量化算法 NVFP4(MoE linear operators 权重量化);Benchmark 对比 Baseline FP16 vs NVFP4:GPQA Diamond 0.894 vs 0.891(-0.3%)· AA-LCR 0.658 vs 0.655(-0.3%)· τ²-Bench Telecom 0.943 vs 0.942(-0.1%)· SciCode 0.481 vs 0.481(0%)· IFBench 0.788 vs 0.795(+0.7%);量化精度损失 =极小(IFBench 反而 +0.7%),工程可用 — §1.(4) 量化子轴 + §1.(10) 厂商格局 NET-new 锚入预备级(NVIDIA 官方量化权重)
  • 🟢 Snowflake Semi-Persistence vLLM 5.6×~19.9× 快速唤醒(Latent.Space / AINews 引用 SemiAnalysis):将模型权重保留在 pinned CPU memory,vLLM 按需 rehydrate 到 GPU;sleep/wake 周期比对比方案快 5.6×~19.9× — §1.(2) 推理调度子轴 NET-new 锚入预备级(多实例管理工程价值高,vLLM 内存管理重要补充)
  • 🟢 DGX Spark GB10 Qwen3.8-27B 实测(Kubesimplify):硬件环境 DGX Spark · 128GB unified memory · CUDA 驱动 580.159.03;llama-benchy 命令参考;Decode 吞吐对比(tg128, FP8):SGLang FP8 7.7 t/s · SGLang FP8 + NEXTN 13.4 t/s · vLLM FP8 + MTP 13.8 t/s — §1.(1) 推理引擎横评预备级锚入(DGX Spark GB10 边缘推理基准测试)
  • PremAI LLM Inference Servers Compared(沿用预备级 NET-new):同 arXiv:2506.21901 引用 → 见 jay 14:50 screening 预备级条目
  • 2026-09-09T1620-jay-csdn-kvcache-mcp-highvalue.md(9-9 16:20 CST · jay CSDN 下午 KV Cache + MCP · 10 件 · 本棒 llm-infra 主轴核心 = 🟡 5 件 KV Cache 显存优化预备级沿用 + 1 件 NVIDIA Dynamo PD 分离预备级)
  • 大模型推理显存优化秘籍(KV Cache 压缩到 PagedAttention · 沿用预备级):KV Cache 显存占用公式推导 4BLH(s+n) bytes(FP16);INT8 对称量化示例 + PagedAttention Block 管理参数 block_size 16/32 + page_table;Mamba SSM 对比数据 LLaMA-2-13B vs Mamba-130m:8.7 tokens/s 24.6GB vs 96.4 tokens/s 6.8GB(Mamba 速度超 Transformer 10 倍,仅适合特定任务)
  • 大模型推理优化技术(KV Cache 量化 · 沿用预备级):vLLM FP8 KV Cache(via compressed-tensors)· TensorRT-LLM FP8 + INT8 · LMDeploy INT8 + INT4(per-head per-token 非对称,v0.4.0+)· HF Transformers INT8 + INT4 + INT2(via KIVI);KIVI 论文关键发现:Key 在某些通道上容易出现高幅度异常值,Value 并无此表现,因此采用按通道量化 Key + 按词元量化 Value 的非对称方案精度损失更小
  • vLLM V1 零开销前缀缓存(Automatic Prefix Caching · 沿用预备级):vLLM V1 三项关键改进 = ① 管理单元从 seqGroup 简化为 request id,双向链表 KVcacheBlock 提升操作效率 ② 内存开辟、释放和淘汰流程优化,确保缓存操作不影响计算性能 ③ 块状态管理机制简化,仅记录完全计算的块;核心结论:即使缓存命中率为零时,性能也与全量计算相当,最终实现前缀缓存零开销;vLLM LMCache + Ceph 分布式 KV Cache = vLLM 和 LMCache 均计算 token 序列的哈希值作为缓存块标识符,实现跨节点 KV Cache 共享
  • 高并发大模型推理服务内存优化实战(KV Cache 管理 + PD 分离 · 沿用预备级):Paged KV Cache Page 利用率提升至 85%+ 方法;多用户 KV Cache 占用不均衡问题 = 长连接 + 长上下文请求拖垮显存池,解决方案 LRU 驱逐策略;vLLM 显存爆满预警指标 = Prometheus + GPU 显存 Exporter 监控 KV cache allocation 失败频率;PD 分离推理关键价值:当单卡 batch size > 14 时,PD 分离方案有明显吞吐优势;SGLang Scheduler 根据 KV Cache reuse 程度、PD 实例负载、SLO 综合调度;Prefill Instance = 最大化 reuse shared prefix kv cache + Pipeline Parallel + chunked prefill;Decode Instance = 最大化 throughput + continuous batching
  • vLLM 分布式预填充与 KV 缓存(Kuntai/芝加哥大学 · 沿用预备级):PD 分离核心动机 = Prefill 和 Decode 阶段特征完全不同(计算密度、资源需求),用同一个节点会导致资源竞争;动态长度数据压测中 TTFT(Prefill)时延仅占总时延小部分,而 Decode 时间随生成长度线性增长;NVIDIA Dynamo PD 分离配置 DynamoGraphDeployment in Kubernetes · prefill_replicas: 2 · decode_replicas: 4 · kv_transfer: true
  • 2026-09-09-1220-csdn-substack-rag-agent-multimodal-2026.md(9-9 12:20 CST · jay CSDN/Substack 12:20 RAG/Agent/多模态/AI Stack · 本棒 llm-infra 主轴 = 0 件 NET-new · 邻接级引用 = arXiv:2605.01280 + arXiv:2504.11320 沿用预备级复证)
  • 2026-09-09-1335-github-hf-vector-db-production-ai.md(9-9 13:35 CST · jay GitHub Trending × HF × 向量数据库 × 本地 AI 工程栈 · 本棒 llm-infra 主轴 = 0 件 NET-new · 沿用 OpenClaw + Ollama + Open WebUI + HF State of Open Models Summer 2026 + WebGPU Kernels 200+ 算子预备级)
  • 2026-09-09-1735-jay-research-briefing-agentic-rag-owasp-github-sep09.md(9-9 17:35 CST · jay Agentic RAG + OWASP MCP Top10 + GitHub Trending + Vector DB 选型 · 本棒 llm-infra 主轴 = 0 件 NET-new · 邻接级引用 = LEANN MLSys 2026 Best Paper 12.9K + Agent guardrails 工程实践)
  • 2026-09-09-1000/1001/1002/1003/1004-rss-*.md(9-9 10:00-11:00 CST jay 早棒 10 件 RSS)≈ llm-infra 主轴 0 件 NET-new
  • 2026-09-09-daily-brief.md(9-9 11:05 CST · jay daily brief · llm-infra 主轴 = 🟢 双 arXiv NET-new 锚入预备级 = arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS,与 jay engineering-e1prep 双源独立锚入预备级)

1.3 inbox/stephen 9-9 noon 协调棒

  • 2026-09-09-1245-stephen-coordination-check-noon.md(9-9 12:45 CST · noon 协调棒 · 协调棒最关键信号源 · llm-infra 主轴 noon 棒位核心 = 🟢 §IX 95 morning v3.27 微调棒已闭合 8h45m + 立基础延展棒 v20 触发预备 + 立标信号实测承接)
  • systems 主轴高价值条目 12 件(stephen noon 棒位):vLLM V1 5 大核心变化 + HF Transformers Backend Day 0 + HF × Foundry + SGLang v0.5.19 + MCP 2026-07-28 Stateless + NousResearch/hermes-agent + Langflow + bytedance/deer-flow + unslothai/unsloth + OpenViking + HF WebGPU Kernels 200+ 算子 + OpenAI Daybreak $1B + Anthropic Model Hardware Standard + State of Open Models Summer 2026 + pgvector CVE-2026-3172 + MCP Stateless + A2A v1.0 + AAIF 治理
  • framework 5 件(stephen noon 棒位):vLLM V1 / SGLang v0.5.19 BCG / TGI 维护模式 / MCP Stateless / llm-d / Kthena / Noctaya / TokenFlow / UBASE / PostgreSQL-V 2.0 / RetroInfer / Samyama = systems 主轴无明显缺口
  • llm-infra 主轴净增:0 件 NET-new arXiv 锚入(全部沿用 §IX 95 morning v3.27 已锚预备级 + jay 9-9 全天棒位累积素材强验证);1 件 paper_card NET-new = paper_card 1278 arXiv:2609.04971 BeaconKV 主分类 llm-infra 2026-09-09 16:30 入库(stephen noon 棒位时点之后入库,需在 stephen evening 棒位补充)
  • 6 项立标信号实测承接(multimodal 主轴 + llm-infra 邻接级):vLLM V1 + HF Transformers Backend + HF × Foundry + OpenAI/HF Incident + TurboQuant + arXiv:2604.01395v1 6 件 v3.27 闭合预备级立标
  • 2 件缺口待 9-9 evening 棒前消化:Random Attention arXiv:2609.03430 paper_card 仍未入库 ⚠️(llm-infra 主轴矛盾 ① 持续)+ paper_card 1278 BeaconKV arXiv:2609.04971 入库后状态核验
  • 2026-09-09-ai-industry-e1prep.md(9-9 10:20 CST · stephen AI 产业动态 · llm-infra 主轴 0 件 NET-new · 协调棒位 · v68 §2.X frontier lab 工程生态棒位预备扩增)
  • 2026-09-09-0912-news-x-vip-radar.md(9-9 09:12 CST · stephen X VIP 雷达 · llm-infra 主轴 0 件 NET-new · 协调棒位)
  • 2026-09-09-1002/1003/1004-news-*.md(9-9 10:02-10:04 CST stephen 早棒 9 份)≈ llm-infra 主轴 0 件 NET-new

1.4 inbox/tom 9-9 棒位(llm-infra 主轴 1 件 NET-new paper_card 主分类入库)

  • 2026-09-09-agent-rag-longcontext-radar.md(9-9 14:40 CST · tom agent/rag/longcontext 主轴 · 本棒 llm-infra 主轴核心 = 🟢 BeaconKV arXiv:2609.04971 HF/arXiv 12票 NET-new + 候选摘要表 #4 已列)
  • 🔥 BeaconKV 长推理模型 KV 缓存压缩(arXiv:2609.04971 · 2026-09-03):大推理模型(LRM)Chain-of-Thought 展开时 KV cache 线性膨胀,现有压缩依赖"近期 query 预测未来注意力"——对长程推理失效,因为某些解码步会生成"思维回访 token"(TRT)重新 attend 远距离上下文;BeaconKV 引入 beacon query 引导 KV 压缩§1.(3) KV Cache 子轴 NET-new 锚入闭合预备候选(tom 9-9 14:40 radar + paper_card 1278 2026-09-09 16:30 入库双源独立锚入预备级;已正式入库主分类 llm-infra,无需 work-queue 待建卡状态)
  • CoVeR · Gander · RoboSPA 等 8 件候选摘要:CoVeR(arXiv:2609.08345 · 3D 多视角 token 剪枝 · HF/arXiv 2票)+ Gander(arXiv:2609.08977 · 全双工多模态交互 Agent · HF/arXiv 44票)+ RoboSPA(arXiv:2609.05324 · VLA 空间推理基准 · HF/arXiv 6票)等 — 本棒位仅 BeaconKV 为 llm-infra 主轴 NET-new
  • 趋势研判:① Long Context + Agent RAG 共存(简单检索用长上下文降成本,复杂多跳推理仍依赖结构化 RAG)② KV Cache 压缩是下一个热点(长思维链推理的 memory 效率问题正被集中攻关) ③ Agent 评测从"完成率"走向"规划与空间推理"(benchmark 驱动研究转向更难的 Long-Horizon 场景) — §1.(3) KV Cache 子轴趋势研判预备级
  • 2026-09-09-rag-e1prep.md(9-9 08:52 CST · tom rag e1prep · 0 件 NET-new llm-infra · jay 9-9 inference-systems-kvcache 标注为 rag 邻接 ✓)
  • 2026-09-09-evaluation-e1prep.md(9-9 15:44 CST · tom evaluation e1prep · 0 件 NET-new llm-infra · jay 9-7 inference-systems-kvcache + inference-primitives-disaggregated 标注为 eval 邻接 ✓)
  • 2026-09-09-0900-hf-daily-2026-09-09.md(9-9 09:00 CST · tom HF Daily · llm-infra 主轴 = Random Attention arXiv:2609.03430 HF Daily 持续续立 + BeaconKV HF Daily 12票续立)≈ llm-infra 主轴 2 件预备级 = Random Attention 持续续立极显著 + BeaconKV HF Daily 12票(与 jay 14:50 screening + tom 14:40 radar + paper_card 1278 入库三源独立强验证)
  • 2026-09-09-1003/1004-rss-yt-*.md(tom 9-9 早棒 2 份 RSS)≈ llm-infra 主轴 0 件 NET-new

1.5 inbox/flyp 9-9 棒位(llm-infra 主轴 0 件 NET-new)

  • 2026-09-09-multimodal-e1prep.md(9-9 09:43 CST · flyp multimodal e1prep · llm-infra 主轴 = 🟡 Random Attention arXiv:2609.03430 HF Daily 持续续立极显著 + paper_card 仍未入库 ⚠️ + paper_card 1278 BeaconKV 入库后状态核验)
  • 2026-09-09-multimodal-eval-review.md(9-9 15:51 CST · flyp multimodal eval review · 0 件 NET-new llm-infra)
  • 2026-09-09-risk-e1prep.md(9-9 16:40 CST · flyp risk e1prep · 0 件 NET-new llm-infra · 沿用 arXiv:2608.01526 An Internet for the KV Cache + arXiv:2608.16157 FreeToken Edge-Native MoE Serving + arXiv:2609.04490 When Quantization Breaks Memory + arXiv:2503.13657 MAST + arXiv:2605.26112 Scaling the Harness 全部沿用预备级)
  • 2026-09-09-substack-alphasignal-delta-mem.md(9-9 09:14 CST · flyp δ-mem Substack · 0 件 NET-new llm-infra)
  • 2026-09-09-substack-lwmai-40-search-across-everything.md(9-9 09:14 CST · flyp lwmai search Substack · 0 件 NET-new llm-infra)
  • 2026-09-09-native-audio-video-three-way-critical-read.md(9-9 10:00 CST · flyp native audio video critical read · 0 件 NET-new llm-infra)
  • 2026-09-09-worldsculpt-alayalab-arxiv-2609-05416-critical-read.md(9-9 12:00 CST · flyp worldsculpt arXiv:2609.05416 critical read · 0 件 NET-new llm-infra)
  • 2026-09-09_multimodal-wednesday-digest.md(9-9 17:00 CST · flyp multimodal wednesday digest · 0 件 NET-new llm-infra)
  • 2026-09-09-1000/1001/1003-rss-*.md(flyp 9-9 早棒 4 份 RSS)≈ llm-infra 主轴 0 件 NET-new

1.6 inbox/spark 9-9 棒位(llm-infra 主轴 0 件 NET-new · spark 自我预备)

  • 2026-09-09-agent-e1prep.md(9-9 13:37 CST · spark agent e1prep · llm-infra 主轴邻接级 0 件 NET-new + 工程件 5 件沿用 v118 = OpenForgeRL arXiv:2607.21557 + NVIDIA $12.93B HF + llama.cpp 0.4.0 视频输入 + pgvector CVE-2026-3172 + Nano vLLM 教学源码 + H100 SGLang vs vLLM + 72% 企业采用 RAG 量化)
  • 2026-09-09-1000/1001/1004-rss-*.md(9-9 10:00-10:04 CST · spark 早棒 3 份 RSS)≈ llm-infra 主轴 0 件 NET-new

1.7 paper_cards 近 3 天新增(2026-09-06 → 2026-09-09 18:00 · 重点 llm-infra 主分类)

🔴 主分类 llm-infra 今日 NET-new 入库 = 1 件(paper_card 1278 arXiv:2609.04971 BeaconKV · 2026-09-09 16:30 入库)

🔴 llm-infra 工程邻接级(主分类 engineering 或 agent 副分类)近 3 天 paper_card: - ✅ paper_cards/1278-2609-04971.md(2026-09-09 16:30 入库 · 主分类 llm-infra · 形态 method · 来源 /inbox/tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json)— BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference · 引用 Large Reasoning Models(LRMs)+ Chain-of-Thought(CoT)generation · KV cache 线性增长 + 长 reasoning traces 超过 GPU capacity · 现有 KV cache compression 方法基于 recent queries 估计未来 token importance(implicit assumption)· 论文展示该 assumption 在 long-horizon reasoning 中失效 = Thought Revisiting Tokens(TRT) 在某些 decoding steps 重新 attend 远距离上下文 · BeaconKV 引入 beacon query 引导 KV 压缩(直接打破 recent query 假设)· 适配性 = 核心 llm-infra(直接解决长思维链推理的 KV cache 压缩问题,与 §1.(3) KV Cache 子轴 + §1.(6) 长上下文子轴 + §1.(5) 投机解码子轴均相关)· arXiv 号 arXiv:2609.04971本棒位 NET-new 锚入闭合预备候选

🔴 9-9 16:30 入库的 8 件 paper_card(其中 1 件 llm-infra 主分类): - ✅ paper_cards/1278-2609-04971.md(9-9 16:30 入库 · 主分类 llm-infra · BeaconKV · 本棒位 NET-new 锚入闭合预备候选)· 来源 /inbox/tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json - ✅ paper_cards/1279-2609-05324.md(9-9 16:30 入库 · 主分类 multimodal · RoboSPA · VLA 主轴) - ✅ paper_cards/1277-2609-06665.md(9-9 16:30 入库 · 主分类 multimodal · TransNormal-2 · 几何法向量估计) - ✅ paper_cards/1276-2609-09158.md(9-9 16:30 入库 · 主分类 multimodal · TANGO · 人形机器人导航) - ✅ paper_cards/1275-2609-08345.md(9-9 16:30 入库 · 主分类 engineering · CoVeR · 3D 多视角 token 剪枝 · llm-infra 邻接级) - ✅ paper_cards/1274-2609-08936.md(9-9 16:30 入库 · 主分类 multimodal · AuK · 语音生成) - ✅ paper_cards/1273-2609-09123.md(9-9 16:30 入库 · 主分类 multimodal · Mask Forcing · 视频扩散蒸馏) - ✅ paper_cards/1272-2609-08977.md(9-9 16:30 入库 · 主分类 multimodal · Omni Interaction Agent Technical Report)

🔴 9-9 14:10 入库的 3 件 paper_card(无 llm-infra 主分类): - ✅ paper_cards/1268-2609-04382.md(9-9 14:10 入库 · 主分类 engineering · Split-LLM Training Systems-Security Case Study · llm-infra 邻接级) - ✅ paper_cards/1270-2609-03003.md(9-9 14:10 入库 · 主分类 engineering · Causal Foundation Models) - ✅ paper_cards/1271-2609-03005.md(9-9 14:10 入库 · 主分类 rag · Unifying Conformal Language Tasks)

🔴 9-9 04:00 入库的 paper_card(无 llm-infra 主分类): - ✅ paper_cards/1269-2609-04482.md(9-9 04:00 入库 · 主分类 risk · Narrow-Boundary Safety)

🔴 9-8 16:30 入库的 6 件 paper_card(无 llm-infra 主分类,9-8 棒位已计入): - ✅ paper_cards/1258-2609-03729.md(9-8 16:30 入库 · 主分类 multimodal · FactoSR)· multimodal 主轴邻接级 - ✅ paper_cards/1259-2609-00365.md(9-8 14:11 入库 · 主分类 agent · Dr. Claw · v87 #202 已锚) - ✅ paper_cards/1260-2609-03241.md(9-8 16:30 入库 · 主分类 multimodal · FlowBalance) - ✅ paper_cards/1261-2609-03254.md(9-8 16:30 入库 · 主分类 multimodal · Revision Propagation) - ✅ paper_cards/1262-2609-02998.md(9-8 16:30 入库 · 主分类 multimodal · Teacher-Gated OPD) - ✅ paper_cards/1263-2608-24263.md(9-8 16:30 入库 · 主分类 engineering · KnowChange)

🔴 9-7 16:30 入库的 paper_card(无 llm-infra 主分类,9-7 棒位已计入): - ✅ paper_cards/1243-2609-04490.md(2026-09-07 16:30 入库 · 主分类 llm-infra · 形态 method · 来源 /inbox/tom/_candidates/2026-09-07-agent-rag-longcontext-candidates.json)— When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference · 引用 GRU encoder-decoder + fluorescence lifetime imaging + 估计两个 lifetime 参数 τ1(短寿命) + τ2(长寿命) · 引入"recurrent-state write-back"规则研究低精度时序推理中量化状态存储规则对后续计算的影响 · 适配性 = 邻接级(专注循环网络 / 荧光寿命成像,非 LLM 推理核心,但概念上可借鉴到 LLM KV Cache 量化写回场景)· arXiv 号 arXiv:2609.044909-7 18:40 棒位已锚入预备级,本棒位继续沿用预备级候选 + 矛盾 ③ 主分类适配性争议持续

主分类 llm-infra 净入库数(本棒位 1 件 NET-new):1 件 NET-new 入库 = paper_card 1278 arXiv:2609.04971 BeaconKV(本棒位);工程邻接级入库数(本棒位 1 件):1 件(其中 llm-infra 主分类 1 件);总计净增 1 件可纳入 llm-infra 主题 NET-new paper_card(本棒位)


二、今日 llm-infra 主题最重要的 8 条主增量

增量 ① 🟢 paper_card 1278 arXiv:2609.04971 BeaconKV NET-new 主分类 llm-infra 入库(2026-09-09 16:30 · 三源独立锚入预备级)

来源:/shared/research-kb/organized/paper_cards/1278-2609-04971.md + inbox/tom/2026-09-09-agent-rag-longcontext-radar.md 条目 #1 + inbox/jay/2026-09-09-llm-inference-engineering-screening.md 引用预备级 + inbox/tom/2026-09-09-0900-hf-daily-2026-09-09.md HF Daily 12票续立

要点(三源独立 NET-new 锚入预备级): - arXiv:2609.04971 BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference(2026-09-03 arXiv 公开):大推理模型(LRMs)+ Chain-of-Thought(CoT)生成时 KV cache 随序列长度线性增长,长推理 traces 经常超过 GPU capacity;现有 KV cache compression 方法基于 recent queries 估计未来 token importance(implicit assumption)—— 假设 recent queries 是未来 attention patterns 的可靠代理;论文核心发现:该 assumption 在 long-horizon reasoning 中失效 = 某些 decoding steps 生成"Thought Revisiting Tokens(TRT)"重新 attend 远距离上下文;BeaconKV 引入 beacon query 引导 KV 压缩 —— 直接打破 recent query 假设,使用 beacon query(代表性查询)引导 KV 重要性评估 - 意义:为长思维链推理的推理效率问题提供了新范式,直接影响 Agent 部署成本(LRM 长 CoT 是 Agent 任务复杂化的关键路径);KV cache 压缩是下一个热点(tom 9-9 14:40 radar 趋势研判 ② 强验证) - 适配性:核心 llm-infra —— 直接解决长思维链推理的 KV cache 压缩问题,与 §1.(3) KV Cache 子轴 + §1.(6) 长上下文子轴 + §1.(5) 投机解码子轴均相关 - work-queue.md 9-9 18:00 状态:仍标记为待建卡 0.5,实际 paper_card 1278 已 2026-09-09 16:30 入库 → work-queue 待建卡 #2 应在下次 cron 重建时清理

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(3) KV Cache 已锚入 TurboQuant Google DeepM KV-Cache 6× 压缩 + H100 +8× 推理速度 + LMCache v2 + PagedAttention + SGLang HiCache + TokenWeave + DiagEvo + SpecPV + AI Agents Stack 2026 + KV-Cache-as-Internet + Random Attention + vLLM ConversationKVCache + TileRT-vLLM V1 connector + Yandex KV Cache as Agent Runtime → v3.21 闭合 + CacheBridge + HeadWiseKV + VestigeKV + NeuroPrefetcher + Almost Free State Prediction Separation + KV Cache Management Survey + Harvest P2P GPU Caching + Dell ObjectScale GPUDirect RDMA + Daniel Han AI Engineer 2026 + paper_card 1235 Locked at the Entrance RLVR + Mooncake KVCache 三层存储 GPU HBM/DDR/SSD 升档正式闭合预备 → v3.25 闭合 + TurboQuant v3.27 闭合 - 本增量提供了 BeaconKV 长思维链 KV cache 压缩 + beacon query 引导 + Thought Revisiting Tokens(TRT)重新 attend 远距离上下文发现 —— 直接强化 §1.(3) KV Cache 子轴的"长思维链推理 KV 压缩"维度,与 v3.27 已锚入的 TurboQuant + Mooncake + Random Attention 形成"KV cache 压缩 → 长思维链压缩 → 量化压缩"三轴预备级 - 与 arXiv:2607.02574 Survey of KV Cache Management for LLM Serving(jay 14:50 NET-new · 4 轴分类法 = locality / lifetime / ownership / substrate · 5 大架构原型)形成"分类法 + 新方法"双源预备级

建议归入:llm-infra.md §1.(3) KV Cache 子轴升档闭合预备级(BeaconKV 长思维链 KV 压缩 + beacon query 引导 + TRT 远距离 attend 现象)+ §1.(5) 投机解码子轴升档闭合预备级邻接级(KV cache 压缩与投机解码子轴双向关联)

arXiv 号:arXiv:2609.04971(BeaconKV)

可信度:🟢 极高(arXiv 2026-09-03 公开 + paper_card 1278 主分类 llm-infra 形态 method + tom 9-9 14:40 radar HF/arXiv 12票候选摘要表 + jay 14:50 screening 引用预备级 + tom 9-9 09:00 HF Daily 12票续立 · 5 源独立锚入预备级)

增量 ② 🟢 arXiv:2606.17104 Prefill/Decode-Aware Evaluation HPAI4S'26 @ IPDPS 2026 + arXiv:2607.02574 Survey of KV Cache Management for LLM Serving(双 arXiv NET-new 锚入预备级)

来源:inbox/jay/2026-09-09-llm-inference-engineering-screening.md 保留 #3 + 保留 #4

要点(双 arXiv NET-new 锚入预备级): - arXiv:2606.17104 Prefill/Decode-Aware Evaluation(HPAI4S'26 @ IPDPS 2026):A100 平台 token transfer 时间 0.210 ms/token(25 Gbps Ethernet)到 0.00036 ms/token(NVLink);对比 NVIDIA A100(vLLM v0.12.0)与 GroqRack(专用 AI 加速器)的 prefill/decode 执行模型差异;prefill 阶段为单次并行前向传播,decode 阶段为自回归;GroqRack 每次调用只处理一个 token,无批处理 — §1.(2) 推理调度子轴 NET-new 锚入预备级(peer-reviewed 会议论文 HPAI4S @ IPDPS 2026,formal evaluation) - arXiv:2607.02574 Survey of KV Cache Management for LLM Serving(2026-07):对 30+ KV-cache 管理系统的系统性分类,基于 4 轴 = locality / lifetime / ownership / substrate;5 大架构原型 = local-paged / disaggregated-pipeline / shared-store / memory-pool / hybrid-tier;论文揭示当前评估中 7 个缺失的 KV 专项测量指标;Mooncake(PD disaggregation + 分布式 KV 存储 + tiering)、Beluga(CXL KV-cache)等代表系统;CXL memory pooling 架构可跨 worker 扩展容量 — §1.(3) KV Cache 子轴 NET-new 锚入预备级(arXiv 2026-07 学术论文,系统性分类法,适合知识库 RAG/serving 架构专题引用)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景 + §1.(2) 推理调度 + §1.(3) KV Cache 子轴已锚入大量预备级 - arXiv:2606.17104 提供 Prefill-Decode-Aware 评估方法学(A100 + GroqRack 对比 + token transfer 时间量化) —— 直接强化 §1.(2) 推理调度子轴的"调度方法学量化"维度,与 v3.27 已锚入的 arXiv:2504.11320v4 Fluid-Guided Online Scheduling + arXiv:2605.01280v1 LLM Serving Needs Mathematical Optimization 形成"调度方法学 + 调度评估 + 调度未来方向"三轴预备级 - arXiv:2607.02574 提供 30+ KV-cache 管理系统 4 轴分类法 + 5 大架构原型 —— 直接强化 §1.(3) KV Cache 子轴的"分类法 + 架构原型"维度,与 v3.27 已锚入的 KV-Cache-as-Internet + TurboQuant + BeaconKV 形成"KV 协议 + KV 量化 + KV 压缩"三轴预备级

建议归入:llm-infra.md §1.(2) 推理调度子轴升档闭合预备级(arXiv:2606.17104 Prefill/Decode-Aware Evaluation + token transfer 时间量化)+ §1.(3) KV Cache 子轴升档闭合预备级(arXiv:2607.02574 Survey 30+ 系统 4 轴分类 + 5 大架构原型 + 7 个缺失测量指标)

arXiv 号:arXiv:2606.17104(Prefill/Decode-Aware Evaluation)+ arXiv:2607.02574(Survey of KV Cache Management for LLM Serving)

可信度:🟢 高(arXiv HPAI4S @ IPDPS 2026 同行评审会议论文 + arXiv 2026-07 学术论文)

增量 ③ 🟢 arXiv:2604.25724 Scalable Inference Architectures for Compound AI Systems(Salesforce) + arXiv:2603.16104 Efficient LLM Serving for Agentic Workflows(双 arXiv NET-new 锚入预备级)

来源:inbox/jay/2026-09-09-llm-inference-engineering-screening.md T2 #5 + T2 #7

要点(双 arXiv NET-new 锚入预备级): - arXiv:2604.25724 Scalable Inference Architectures for Compound AI Systems(Salesforce · 2026-04):生产规模 = 8,000 企业用户 · 日均 722,000 次推理 · 峰值 140 万请求/天 · 21 个全球分布式推理区 · provisioned 峰值 2,250 RPS(135,000 RPM)· 2026-03 处理 1360 亿 token(日均约 44 亿 token),同比 8.7× 增长;关键发现:复合 AI 系统中各模型 scaling 不对称(Atlas 推理引擎过滤部分查询,导致对话 LLM 仅扩 6-7×;embedding 模型随流量线性扩 10×;SQL executor 仅扩 2-3×) — §1.(1) 推理引擎方法学 + §1.(2) 推理调度子轴 NET-new 锚入预备级(Salesforce 研究团队,2026-04 发布,有生产数据背书) - arXiv:2603.16104 Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective:AI agent 工作流中 LLM 调用的特殊性 = 多步骤、异构 prompt、跨请求状态共享;当前 serving 引擎(vLLM 等)优化的是独立请求,未针对 agentic 工作流特征设计;cache hit rate 实测表(Qwen3-8B / Qwen3-14B):Helium 59.2% / 42.9%;vLLM 42.9% / 43.0%;agentic 场景 KV cache 命中率普遍低于预期(因多步异构请求共享率低) — §1.(3) KV Cache 子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级(arXiv 2026-03 系统性研究,7 种 agentic 系统对比)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景 + §1.(2) 推理调度 + §1.(3) KV Cache 子轴已锚入大量预备级 - arXiv:2604.25724 提供 Salesforce 复合 AI 系统 8,000 企业用户 + 1360 亿 token + 8.7× 增长 + 各模型 scaling 不对称关键发现 —— 直接强化 §1.(1) 推理引擎方法学的"复合 AI 系统推理架构"维度,与 v3.27 已锚入的 NVIDIA Dynamo + Mooncake Store + SpecPV 形成"复合 AI 推理架构"预备级 - arXiv:2603.16104 提供 Agentic 工作流 KV cache 命中率量化数据 + 7 种 agentic 系统对比 + 当前 serving 引擎未针对 agentic 设计 —— 直接强化 §1.(3) KV Cache 子轴的"Agentic KV cache 命中率"维度,与本棒位 NET-new 的 BeaconKV(长思维链 KV 压缩)形成"Agentic KV 命中率 + LRM KV 压缩"双轴预备级

建议归入:llm-infra.md §1.(1) 推理引擎方法学升档闭合预备级(arXiv:2604.25724 Salesforce 复合 AI 系统 8,000 企业用户 + 1360 亿 token 8.7× 增长 + 各模型 scaling 不对称)+ §1.(3) KV Cache 子轴升档闭合预备级(arXiv:2603.16104 Agentic Workflows KV cache 命中率量化 + 7 种 agentic 系统对比 + 当前 serving 未针对 agentic 设计)

arXiv 号:arXiv:2604.25724(Scalable Inference Architectures for Compound AI Systems)+ arXiv:2603.16104(Efficient LLM Serving for Agentic Workflows)

可信度:🟢 极高(Salesforce 研究团队 + arXiv 2026-03 系统性研究 · 双 arXiv peer-reviewed academic)

增量 ④ 🟢 arXiv:2506.21901 PremAI LLM Inference Servers Compared(H100 80GB 实测)+ arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS(三 arXiv NET-new 锚入预备级)

来源:inbox/jay/2026-09-09-llm-inference-engineering-screening.md T2 #5 引用 + inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md PremAI Blog 引用 + inbox/jay/2026-09-09-engineering-e1prep.md 增量 ⑥ + inbox/jay/2026-09-09-daily-brief.md

要点(三 arXiv NET-new 锚入预备级): - arXiv:2506.21901 PremAI LLM Inference Servers Compared(H100 80GB 实测补充材料):H100 80GB 实测数据(SGLang 16,215 tok/s · LMDeploy 16,132 -0.5% · vLLM FlashInfer 12,553 -22.6% · vLLM default ~10,000 -38%);TGI 已于 2025 年 12 月进入维护模式;Hugging Face 建议新部署使用 vLLM 或 SGLang;vLLM 并发饱和点 100-150 个并发请求 GPU 利用率 85-92%;TGI 并发饱和点 50-75 个并发请求 GPU 利用率 68-74% — §1.(1) 推理引擎方法学 NET-new 锚入预备级(PremAI 厂商实测,与 v3.27 已锚入的 vLLM/SGLang/LMDeploy/TensorRT-LLM H100 横评形成 2026 Q3-Q4 双源独立锚入预备) - arXiv:2609.01316 MIDR(Multimodal Indexing with Decoupled Reasoning):在索引时完成多模态推理(离线),而非传统查询时推理(在线);使用多模态 LLM 生成跨模态预预问和 bridging facts,将视觉理解成本摊销到索引阶段;评测覆盖 CS/Finance/HR/Industrial/Pharma/Energy/Physics 七领域,平均 nDCG 0.6231,Oracle 上界 0.7042;对比 ColQwen2.5 在 Finance 领域有 +9.4% 优势;工程价值 = RAG 检索 serving 路径仅需文本向量检索,视觉编码成本摊销到索引阶段 — §1.(2) 推理调度子轴 + §1.(11) Kernel/AI 自动化/Harness 子轴 NET-new 锚入预备级(RAG 索引阶段的多模态优化方法) - arXiv:2609.01777 TREMORS(LLM-driven Seismic Data Agent System):LLM 作为 reasoner 驱动 LangChain/LangGraph 结构化工作流,在 FDSN 分布式地震数据存档上进行目标驱动的数据检索;采用 gpt-oss:120b(~65GB 本地部署),通过约束节点设计实现 goal-driven planning;提出 URSA 框架概念 = 未来 AI-ready 半自动化基础设施以 portable schemas 和模块化工作流为中心 — §1.(11) Kernel/AI 自动化/Harness 子轴 NET-new 锚入预备级(LLM Agent 在科学数据领域的工程实践)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景 + §1.(2) 推理调度 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 子轴已锚入大量预备级 - arXiv:2506.21901 提供 PremAI H100 80GB 推理引擎横评实测数据 + 并发饱和点具体数字 + TGI 维护模式官方确认 —— 直接强化 §1.(1) 推理引擎横评预备级,与 v3.27 已锚入的 vLLM/SGLang/LMDeploy/TensorRT-LLM/TGI H100 横评形成 2026 Q3-Q4 双源独立锚入预备 - arXiv:2609.01316 MIDR 提供 多模态离线推理索引 + 七领域评测 + 视觉编码成本摊销到索引阶段 —— 直接强化 §1.(2) 推理调度子轴的"RAG 索引阶段多模态处理"维度,与 v3.27 已锚入的 arXiv:2604.01395v1 On-Premises RAG Blueprint 形成"RAG 工程 + RAG 多模态索引"双轴预备级 - arXiv:2609.01777 TREMORS 提供 LLM Agent 在科学数据领域的工程实践 + URSA 框架概念 + portable schemas + 模块化工作流 —— 直接强化 §1.(11) Kernel/AI 自动化/Harness 子轴的"Agent 工程实践"维度,与 v3.27 已锚入的 arXiv:2604.01395v1 On-Premises RAG Blueprint 形成"RAG 工程 + Agent 工程"双轴预备级

建议归入:llm-infra.md §1.(1) 推理引擎方法学升档闭合预备级(arXiv:2506.21901 PremAI H100 80GB 推理引擎横评 + 并发饱和点 + TGI 维护模式确认)+ §1.(2) 推理调度子轴升档闭合预备级(arXiv:2609.01316 MIDR 多模态离线推理索引 + 七领域评测)+ §1.(11) Kernel/AI 自动化/Harness 子轴升档闭合预备级(arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS URSA 框架)

arXiv 号:arXiv:2506.21901(PremAI LLM Inference Servers Compared)+ arXiv:2609.01316(MIDR)+ arXiv:2609.01777(TREMORS)

可信度:🟢 高(arXiv 多源 NET-new + PremAI 厂商实测 + Salesforce 工程实践 + 多机构合作研究 · 三 arXiv 独立锚入预备级)

增量 ⑤ 🟢 NVIDIA 收购 HF $12.93B + SGLang BCG 新默认后端(双事件级 NET-new 锚入预备级)

来源:inbox/jay/2026-09-09-inference-vecdb-hf-acquisition-morning.md 第一节 + inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md 第二节

要点(双事件级 NET-new 锚入预备级): - 🟢 NVIDIA 收购 Hugging Face(2026-09-03 官宣 · $12.93B 全现金 · 沿用预备级 NET-new 锚入):NVIDIA 以 $12,930,300,000(~$129.3 亿)全现金收购 HF;HF 平台 = 300 万模型 + 100 万 Spaces 应用 + 1.8 万开发者 + 50 万数据集 + 超 20 万公司用户;黄仁勋公开承诺 HF 保持开放,开发者可自由选择模型/框架/云/推理提供商,不强制使用 NVIDIA 计算;风险提示 = 长期来看企业议价权可能受影响(~30% 企业通过 hub/市场采购模型) — §1.(1) 推理引擎生态 + §1.(10) 厂商格局 NET-new 锚入预备级(NVIDIA 向上游技术栈扩张的标志性动作,类似微软收购 GitHub) - 🟢 SGLang BCG(Breakable CUDA Graphs)新默认后端(Spheron Blog · 2026-07-02 SGLang v0.5.15 PR #29458 合并):Prefill graph 构建速度比 torch.compile 快 3.8~5.2 倍;Replay 速度比 torch.compile 快 17%;DeepSeek V4 DP attention 真实负载(CoreWeave 8-DP):开启 BCG 后吞吐量 +11.80%,TPOT 从 230.98ms 降至 200.32ms;GPU 成本估算 = 原 fleet 需要 10 张 H100 → BCG 优化后约 8.9 张(省约 10% GPU 成本) — §1.(1) 推理引擎方法学 NET-new 锚入预备级(SGLang 调度层的新一代默认后端,SGLang GitHub PR #29458 + Spheron 博客双源独立锚入)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景已锚入 vLLM V1 + HF Transformers Backend + HF × Foundry + State of vLLM 2026 + SGLang vs vLLM 5 源实测 + OpenAI/HF Incident 官方声明 - NVIDIA 收购 HF 直接锚入"vLLM Transformers Backend Day 0 部署范式 + HF × Foundry 第三方 inference engine 深度集成"的"HF 生态整体收购"预备级 —— 与 v3.27 已锚入的 HF Transformers Backend + HF × Foundry 形成"HF 生态 + NVIDIA 收购 + Day 0 部署 + Foundry 集成"四件 NET-new 事件级预备级 - SGLang BCG 直接锚入"SGLang v0.5.15 新默认后端 + DeepSeek V4 真实负载 +11.8% 吞吐量 + 8.9 张 H100 替代 10 张"预备级 —— 与 v3.27 已锚入的 vLLM V1 + State of vLLM 2026 + 阿里云函数计算官方 + 掘金稀土 + SGLang vs vLLM 5 源实测形成"SGLang v0.5.x 系列 + SGLang BCG"完整预备级

建议归入:llm-infra.md §1.(1) 推理引擎生态升档闭合预备级(NVIDIA 收购 HF $12.93B + 黄仁勋承诺开放 + 300 万模型 + 1.8 万开发者 + 20 万公司用户)+ §1.(10) 厂商格局升档闭合预备级(NVIDIA 向上游扩张 + 类似微软收购 GitHub 模式)+ §1.(1) 推理引擎方法学升档闭合预备级(SGLang BCG 新默认后端 + DeepSeek V4 真实负载 +11.8% + 8.9 张 H100 替代 10 张)

arXiv 号:无(NVIDIA 官方博客 + TechCrunch + CIO Dive + NYTimes + SGLang GitHub PR #29458 + Spheron 博客)

可信度:🟢 极高(NVIDIA 官方博客 + 多家主流媒体同步确认 + SGLang GitHub PR #29458 具体 PR 号 + Spheron 厂商实测 + DeepSeek V4 真实负载)

增量 ⑥ 🟢 vLLM 冷启动优化 8min→1min + Snowflake Semi-Persistence 5.6×~19.9×(双事件级 NET-new 锚入预备级)

来源:inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md 第三节 + 第六节

要点(双事件级 NET-new 锚入预备级): - 🟢 vLLM 冷启动优化 8min→1min(The New Stack · 2026-09-03):冷启动各层耗时分解 = Pod 调度 + 镜像拉取 → 模型权重加载(Run:ai Model Streamer 82s→65s 初版,同节点后续 16s)→ GPU kernel 编译(torch.compile)34~53s ← 最大瓶颈 → CUDA graph → 服务就绪;torch.compile 持久化缓存方案(TORCH_COMPILE_DIR=/persistent-cache/torch-compile + PYTORCH_KERNEL_CACHE_DIR=/persistent-cache/py-kernel);Kubernetes 解决方案 = 挂载 PVC 或 HostPath 持久化缓存卷;额外发现 = OCI 镜像卷在 2026 年已稳定,Dynamic Resource Allocation(DRA)为 GPU 提供结构化属性,Gateway API 增加了推理感知路由扩展 — §1.(2) 推理调度子轴 + §1.(11) Kernel/AI 自动化/Harness 子轴 NET-new 锚入预备级(The New Stack 技术博客 + 分层耗时分解具体 + 可操作环境变量配置) - 🟢 Snowflake Semi-Persistence vLLM 5.6×~19.9× 快速唤醒(Latent.Space / AINews 引用 SemiAnalysis):将模型权重保留在 pinned CPU memory,vLLM 按需 rehydrate 到 GPU;sleep/wake 周期比对比方案快 5.6×~19.9× — §1.(2) 推理调度子轴 NET-new 锚入预备级(多实例管理工程价值高,vLLM 内存管理重要补充,内部 Benchmark 数据具体)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景 + §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化/Harness 子轴已锚入大量预备级 - vLLM 冷启动优化直接锚入"vLLM 生产部署体验 + K8s 持久化缓存 + torch.compile 编译瓶颈"预备级 —— 与 v3.27 已锚入的 vLLM V1 5 大变化 + State of vLLM 2026 + K8s v1.37 HPA Scale-to-Zero Beta + llm-d K8s Gateway API 集成形成"vLLM 冷启动 + K8s 持久化 + Scale-to-Zero + Gateway API"四件 NET-new 预备级 - Snowflake Semi-Persistence 直接锚入"vLLM 5.6×~19.9× sleep/wake + pinned CPU memory + 按需 rehydrate"预备级 —— 与 v3.27 已锚入的 Mooncake SSD Offloading + TileRT-vLLM V1 connector + CacheBridge 形成"vLLM 冷启动优化 + Mooncake SSD Offloading + 多实例管理"三件 NET-new 预备级

建议归入:llm-infra.md §1.(2) 推理调度子轴升档闭合预备级(vLLM 冷启动 8min→1min + torch.compile 持久化缓存方案 + K8s PVC 解决方案)+ §1.(11) Kernel/AI 自动化/Harness 子轴升档闭合预备级(vLLM 冷启动分层耗时分解 + OCI 镜像卷 + Dynamic Resource Allocation + Gateway API 推理感知路由)+ §1.(2) 推理调度子轴升档闭合预备级(Snowflake Semi-Persistence 5.6×~19.9× sleep/wake + pinned CPU memory + 按需 rehydrate)

arXiv 号:无(The New Stack 技术博客 + Latent.Space/AINews 引用 SemiAnalysis)

可信度:🟢 高(The New Stack 技术博客 + 分层耗时分解具体 + 可操作环境变量配置 + Latent.Space/AINews SemiAnalysis 双源独立)

增量 ⑦ 🟢 DeepSeek V4 Flash Vision 开源多模态 MoE + NVIDIA NVFP4 Blackwell FP4 量化(双事件级 NET-new 锚入预备级)

来源:inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md 第四节 + 第五节

要点(双事件级 NET-new 锚入预备级): - 🟢 DeepSeek V4 Flash Vision 开源多模态 MoE(Shattered.io + MorphLLM + TechTimes + HF · 2026-08-31 发布):参数 305B 总,MoE 架构,原生多模态 Vision 支持,MIT 许可可商用/自托管/微调;vLLM 部署命令 vllm serve deepseek-ai/DeepSeek-V4-Flash-Vision-Exp --trust-remote-code --port 8000;SGLang 部署命令 python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-V4-Flash-Vision-Exp --trust-remote-code;DSpark 投机解码 SGLang 通过 --speculative-algorithm DSPARK 启用(无需独立 draft model);⚠️ 警告:DeepSeek 自身 ApexBench 基准分数中 baseline(0731)忽略了多模态部分输入,与 V4-Flash-Vision-Exp 对比非同类对比,需第三方独立验证 — §1.(1) 推理引擎方法学 + §1.(5) 投机解码子轴 NET-new 锚入预备级(MIT 许可开源,vLLM/SGLang 双栈支持,DSpark 投机解码) - 🟢 NVIDIA DeepSeek-V4-Flash-NVFP4 Blackwell FP4 量化生产级精度(HuggingFace nvidia/DeepSeek-V4-Flash-NVFP4):测试硬件 NVIDIA Blackwell B200;加速引擎 SGLang、vLLM;量化算法 NVFP4(MoE linear operators 权重量化);Benchmark 对比 Baseline FP16 vs NVFP4:GPQA Diamond 0.894 vs 0.891(-0.3%)· AA-LCR 0.658 vs 0.655(-0.3%)· τ²-Bench Telecom 0.943 vs 0.942(-0.1%)· SciCode 0.481 vs 0.481(0%)· IFBench 0.788 vs 0.795(+0.7%);量化精度损失 =极小(IFBench 反而 +0.7%),工程可用 — §1.(4) 量化子轴 + §1.(10) 厂商格局 NET-new 锚入预备级(NVIDIA 官方量化权重)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景 + §1.(4) 量化子轴 + §1.(5) 投机解码子轴 + §1.(10) 厂商格局已锚入大量预备级 - DeepSeek V4 Flash Vision 直接锚入"MoE + 多模态 Vision + MIT 许可 + vLLM/SGLang 双栈部署 + DSpark 投机解码"预备级 —— 与 v3.27 已锚入的 DeepSeek V4 Sparse MLA + DFlash2/DSpark + llama.cpp 0.4.0 视频输入形成"DeepSeek V4 系列 + DSpark 投机解码 + DeepSeek V4 Flash Vision 多模态"三件 NET-new 预备级 - NVIDIA NVFP4 直接锚入"Blackwell B200 + NVFP4 量化 + IFBench +0.7% 量化精度无损 + SGLang/vLLM 双栈"预备级 —— 与 v3.27 已锚入的 TurboQuant 6× KV-Cache 压缩 + FP8/NVFP4/MXFP4/Online 量化形成"Blackwell FP4 量化 + KV 量化 + 模型权重量化"三轴预备级

建议归入:llm-infra.md §1.(1) 推理引擎方法学升档闭合预备级(DeepSeek V4 Flash Vision 305B MoE + MIT 许可 + vLLM/SGLang 双栈部署 + DSpark 投机解码)+ §1.(5) 投机解码子轴升档闭合预备级(DSpark 投机解码 + 无需独立 draft model)+ §1.(4) 量化子轴升档闭合预备级(NVIDIA NVFP4 Blackwell B200 + IFBench +0.7% 量化精度无损)+ §1.(10) 厂商格局升档闭合预备级(NVIDIA 官方 NVFP4 量化权重发布)

arXiv 号:无(HF 模型页 + DeepSeek 官方 + NVIDIA 官方 · 双 MIT/NVIDIA 模型页锚入预备级)

可信度:🟢 极高(HF 模型页 + MIT 许可 + vLLM/SGLang 双栈支持 + NVIDIA 官方量化 + Blackwell B200 实测 · ⚠️ 矛盾 ⑤ ApexBench 非同类对比待第三方独立验证)

增量 ⑧ 🟡 DGX Spark GB10 Qwen3.8-27B 实测 + Speculative Speculative Decoding 待核(双事件级/方法学 NET-new 待核锚入预备级)

来源:inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md 第七节 + inbox/jay/2026-09-09-inference-vecdb-hf-acquisition-morning.md 第三节

要点(双事件级/方法学 NET-new 待核锚入预备级): - 🟡 DGX Spark GB10 Qwen3.8-27B 实测(Kubesimplify):硬件环境 DGX Spark · 128GB unified memory · CUDA 驱动 580.159.03;llama-benchy 命令参考;Decode 吞吐对比(tg128, FP8):SGLang FP8 7.7 t/s · SGLang FP8 + NEXTN 13.4 t/s · vLLM FP8 + MTP 13.8 t/s — §1.(1) 推理引擎横评预备级锚入(DGX Spark GB10 边缘推理基准测试,Edge AI 子轴邻接级) - 🟡 Speculative Speculative Decoding(SSD · 待核):Together AI + Stanford;H100 上 Llama-3 70B 和 Qwen3 32B 达到 250 tokens/s,比 vLLM/SGLang 快约 2× — §1.(5) 投机解码子轴待核(arXiv 原文未检索到,以 newsletter 报道为准,建议核验)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.27 §1.(1) 推理引擎全景 + §1.(5) 投机解码子轴 + §1.(7) Edge AI 子轴已锚入大量预备级 - DGX Spark GB10 Qwen3.8-27B 实测直接锚入"Edge AI 推理 + DGX Spark GB10 + SGLang FP8 + vLLM FP8 + MTP 13.8 t/s"预备级 —— 与 v3.27 已锚入的 llama.cpp 0.4.0 视频输入 + FreeToken Edge MoE Serving + Astro + Apple Silicon 形成"Edge AI 推理 + DGX Spark + llama.cpp + FreeToken"四件 NET-new 预备级 - Speculative Speculative Decoding 待核 —— 与 v3.27 已锚入的 LMSYS 2026-06-15 DFlash v2 + Moonshot EAGLE-3 + Speculators 形成"投机解码方法学 + DFlash v2 + EAGLE-3 + 待核 SSD"预备级候选

建议归入:llm-infra.md §1.(7) Edge AI 子轴升档闭合预备级(DGX Spark GB10 Qwen3.8-27B 实测 + SGLang FP8 + vLLM FP8 + MTP 13.8 t/s)+ §1.(5) 投机解码子轴 待核预备级(Speculative Speculative Decoding 待 arXiv 原文核验 · arXiv 检索建议 · 截止 9-10 evening 棒前)

arXiv 号:无(DGX Spark 实测为 Kubesimplify 博客 + llama-benchy 命令参考 · Speculative Speculative Decoding 待 arXiv 核验)

可信度:🟡 中(DGX Spark 实测有命令参考 + 但 DGX Spark GB10 实测边缘部署 · Speculative Speculative Decoding 仅有 AIXFunda Substack 二手引用 · arXiv 原文需核验)


三、值得警惕的矛盾 / 待核实说法(4 条)

矛盾 ① ⚠️ Random Attention arXiv:2609.03430 HF Daily 续立极显著 vs paper_card 仍未入库矛盾(本棒位持续沿用,矛盾持续)

矛盾内容: - inbox/tom/2026-09-09-0900-hf-daily-2026-09-09.md 条目 = Random Attention arXiv:2609.03430 重新思考高效推理中的 KV Cache 淘汰策略 · HF Daily 持续续立极显著 - inbox/flyp/2026-09-09-multimodal-e1prep.md §矛盾 = Random Attention 持续续立极显著 + paper_card 仍未入库 ⚠️ - inbox/stephen/2026-09-09-1245-stephen-coordination-check-noon.md 缺口 5 = Random Attention paper_card 未建(llm-infra 主轴矛盾 ① 持续) - 9-7 18:40 spark e1prep 矛盾 ② + 9-8 18:40 spark e1prep 矛盾 ① 均已发现该矛盾,但 paper_card 入库状态仍未改变 - 矛盾持续:本棒位矛盾由 9-8 棒位的"HF Daily 166▲ +2 续立极显著 vs paper_card 仍未入库"持续沿用,投票信号持续累积但 paper_card 入库状态仍未改变 - 与本棒位 paper_card 1278 BeaconKV arXiv:2609.04971 NET-new 主分类 llm-infra 入库形成对比:同一 HF Daily 12票续立的 BeaconKV 已正式入库(2026-09-09 16:30),Random Attention 投票更高却仍未入库,矛盾显著

待核建议:Random Attention arXiv:2609.03430 应在 §IX 95 evening 棒位预备中确认 paper_card 入库状态;截止 9-15 P1 缺口补强,flyP 投票建议 ☆ 不升 ★,但矛盾点保留至 multimodal.md §2.39.362 沿用预备 + llm-infra.md §1.(3) KV Cache 子轴预备候选

矛盾 ② ⚠️ DeepSeek V4 Flash Vision ApexBench 对比非同类对比(本棒位新发现)

矛盾内容: - inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md 第四节 = DeepSeek 自身 ApexBench 和 Agents' Last Exam 的基准分数中,baseline(0731)忽略了多模态部分的输入,与 V4-Flash-Vision-Exp 的对比非同类对比,需第三方独立验证 - DeepSeek V4 Flash Vision 是 2026-08-31 发布的开源多模态 MoE(MIT 许可)—— 但 DeepSeek 自身 benchmark 声明的对比存在对比基线不一致问题 - 矛盾点:DeepSeek 官方 ApexBench 声明与 V4-Flash-Vision-Exp 实际能力存在 1-2 级对比基线 gap;本棒位仍无第三方独立 benchmark 验证

待核建议:DeepSeek V4 Flash Vision 应在 §IX 95 evening 棒位预备中确认第三方独立 benchmark 验证;截止 9-10 evening 棒前溯源第三方独立 benchmark 验证(LMArena + Hugging Face Open LLM Leaderboard + 独立学术机构复现)

矛盾 ③ ⚠️ arXiv:2609.04490 paper_card 1243 主分类 llm-infra 适配性争议(本棒位持续沿用)

矛盾内容: - paper_card 1243 (2026-09-07 16:30 入库) 主分类标记为 llm-infra + 形态 method - 但论文应用域为 GRU encoder-decoder for fluorescence lifetime imaging(荧光寿命成像分子成像,定量生物成像),与 LLM 推理核心 / Transformer KV Cache 适配性为邻接级而非直接锚入级 - 来源 /inbox/tom/_candidates/2026-09-07-agent-rag-longcontext-candidates.json(tom 候选清单)可能存在分类标定争议 - 矛盾:paper_card 主分类 llm-infra(9-7 棒位)vs 论文实际应用域(GRU 循环网络 + 荧光寿命成像)存在 1-2 级适配性 gap;本棒位仍无主分类调整 - 与本棒位 paper_card 1278 BeaconKV arXiv:2609.04971 主分类 llm-infra 形成对照:BeaconKV 是核心 llm-infra(直接解决长思维链推理 KV cache 压缩),arXiv:2609.04490 是邻接级(GRU 循环网络 + 荧光寿命成像)

待核建议:paper_card 1243 arXiv:2609.04490 主分类建议在 §IX 95 evening 棒位预备中确认 — 是保留主分类 llm-infra(邻接级)还是降为 multimodal/rag 邻接级,以避免误导后续读图者

矛盾 ④ ⚠️ Speculative Speculative Decoding(SSD)arXiv 原文未检索到矛盾(本棒位新发现)

矛盾内容: - inbox/jay/2026-09-09-inference-vecdb-hf-acquisition-morning.md 第三节 = Speculative Speculative Decoding(SSD):Together AI + Stanford;H100 上 Llama-3 70B 和 Qwen3 32B 达到 250 tokens/s,比 vLLM/SGLang 快约 2×;建议:检索 arXiv 原文确认 - jay 自身已标注"⚠️ 区分'default vLLM'(正确)与'always vLLM'(错误)" - 矛盾:AIXFunda Substack 二手引用 SSD 数据 250 tokens/s(2× vLLM/SGLang) —— arXiv 原文未检索到,可能存在数据夸大或方法学不确定性

待核建议:Speculative Speculative Decoding(SSD) arXiv 原文检索 ——在 9-10 evening 棒前 arXiv 检索 "Speculative Speculative Decoding" + "Together AI" + "Stanford" + "250 tokens/s",如未检索到原文,建议将 SSD 数据降级为"待核"预备级,避免引用 250 tokens/s(2×)具体数据


四、可引用的 arXiv 号清单(本棒净增)

arXiv 号 标题 适配性 状态
arXiv:2609.04971 BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 🟢 核心 本棒增量 ① · NET-new · paper_card 1278 主分类 llm-infra 2026-09-09 16:30 入库 · tom 14:40 radar HF/arXiv 12票 + jay 14:50 screening 预备级 + tom 09:00 HF Daily 12票续立 · §1.(3) KV Cache 子轴
arXiv:2606.17104 Prefill/Decode-Aware Evaluation(HPAI4S'26 @ IPDPS 2026) 🟢 核心 本棒增量 ② · NET-new 锚入预备级 · jay 14:50 anchor 锚入预备级 · §1.(2) 推理调度子轴
arXiv:2607.02574 Survey of KV Cache Management for LLM Serving(2026-07) 🟢 核心 本棒增量 ② · NET-new 锚入预备级 · jay 14:50 anchor 锚入预备级 · §1.(3) KV Cache 子轴
arXiv:2604.25724 Scalable Inference Architectures for Compound AI Systems(Salesforce · 2026-04) 🟢 核心 本棒增量 ③ · NET-new 锚入预备级 · jay 14:50 anchor 锚入预备级 · §1.(1) 推理引擎方法学
arXiv:2603.16104 Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective 🟢 核心 本棒增量 ③ · NET-new 锚入预备级 · jay 14:50 anchor 锚入预备级 · §1.(3) KV Cache 子轴
arXiv:2506.21901 PremAI LLM Inference Servers Compared(H100 80GB 实测补充材料) 🟢 核心 本棒增量 ④ · NET-new 锚入预备级 · jay 18:50 + jay 14:50 anchor 锚入预备级 · §1.(1) 推理引擎方法学
arXiv:2609.01316 MIDR: Multimodal Indexing with Decoupled Reasoning 🟢 核心 本棒增量 ④ · NET-new 锚入预备级 · jay 11:05 daily-brief + jay engineering-e1prep 双源独立锚入预备级 · §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化/Harness
arXiv:2609.01777 TREMORS: LLM-driven Seismic Data Agent System 🟡 工程邻接 本棒增量 ④ · NET-new 锚入预备级 · jay 11:05 daily-brief + jay engineering-e1prep 双源独立锚入预备级 · §1.(11) Kernel/AI 自动化/Harness
arXiv:2608.01526 An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age 🟢 核心 沿用预备级 · §IX 91 evening v3.20 已锚入预备级 + jay 0943 + jay 1505 双源独立锚入
arXiv:2606.02964 Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster Large Language Model Serving(AsymCache) 🟢 核心 沿用预备级 · jay 0943 锚入预备级
arXiv:2606.19746 SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL 🟢 核心 沿用预备级 · jay 0943 + paper_card 284(9-7 08:00 入库)双源独立锚入
arXiv:2602.07115v5 Online Scheduling for LLM Inference with KV Cache Constraints(MIT Operations Research Center) 🟢 核心 沿用预备级 · jay 1505 evening 锚入预备级 · §1.(2) 推理调度子轴预备
arXiv:2608.16157 FreeToken: Edge-Native MoE Serving 🟢 核心 沿用预备级 · §IX 92 morning v3.21 已锚入
arXiv:2504.11320v4 Fluid-Guided Online Scheduling 🟢 核心 沿用预备级 · jay 1450 anchor 锚入预备级 · §1.(2) 推理调度子轴预备
arXiv:2605.01280v1 Position — LLM Serving Needs Mathematical Optimization 🟡 中(未来方向) 沿用预备级 · jay 1450 anchor 锚入预备级 · §1.(2) 推理调度未来方向预备
arXiv:2504.19874 TurboQuant Google DeepMind KV-Cache 6× 压缩 + H100 +8× 推理速度(ICLR 2026 · PolarQuant + QJL) 🟢 核心 沿用预备级 · v3.27 闭合级 · §1.(3) KV Cache + §1.(4) 量化 + D147 v3.27 新增争议
arXiv:2604.01395v1 AI Engineering Blueprint for On-Premises RAG Systems 🟡 中(企业级 RAG) 沿用预备级 · v3.27 闭合级 · §1.(11) OpenTelemetry 可观测性预备
arXiv:2609.03430 Random Attention: 重新思考高效推理中的 KV Cache 淘汰策略 🟢 核心 HF Daily 持续续立极显著 · 矛盾 ① 持续沿用 · paper_card 仍未入库 ⚠️
arXiv:2609.04490 When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference 🟡 邻接(RNN) 沿用预备级 · paper_card 1243 主分类 llm-infra 9-7 16:30 入库 · 矛盾 ③ 持续沿用 · 主分类适配性争议
arXiv:2607.21557 OpenForgeRL: Train Harness-native Agents in Any Environment 🟡 工程邻接 paper_card 585 主分类 evaluation 9-8 入库 · engineering.md v118 已锚

本棒净增 arXiv 号(7 件 NET-new 锚入预备级): 1. arXiv:2609.04971(BeaconKV · 增量 ① · §1.(3) KV Cache 子轴) 2. arXiv:2606.17104(Prefill/Decode-Aware Evaluation · 增量 ② · §1.(2) 推理调度) 3. arXiv:2607.02574(Survey of KV Cache Management · 增量 ② · §1.(3) KV Cache 子轴) 4. arXiv:2604.25724(Scalable Inference Architectures for Compound AI Systems · 增量 ③ · §1.(1) 推理引擎方法学) 5. arXiv:2603.16104(Efficient LLM Serving for Agentic Workflows · 增量 ③ · §1.(3) KV Cache 子轴) 6. arXiv:2506.21901(PremAI LLM Inference Servers Compared · 增量 ④ · §1.(1) 推理引擎方法学) 7. arXiv:2609.01316(MIDR · 增量 ④ · §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化/Harness) 8. arXiv:2609.01777(TREMORS · 增量 ④ · §1.(11) Kernel/AI 自动化/Harness)

可引用 IETF 草案(1 件沿用预备级): - draft-li-cats-kv-cache-distribution-00(2026-07 · IETF Datatracker)

沿用 arXiv 号(预备级)(v3.27 已锚入 / engineering.md v118 已锚 / jay engineering-e1prep 已预备): - arXiv:2608.01526 / arXiv:2606.02964 / arXiv:2606.19746 / arXiv:2602.07115v5 / arXiv:2608.16157 / arXiv:2609.04490 / arXiv:2609.03430 / arXiv:2607.21557 / arXiv:2504.19874 / arXiv:2604.01395v1 / arXiv:2504.11320v4 / arXiv:2605.01280v1

本棒净增 CVE(0 件 NET-new 锚入): - CVE-2026-3172(沿用 · pgvector 0.8.2 紧急安全补丁 2026-05-18 · engineering.md v118 已锚 · 持续沿用预备级) - CVE-2026-61539(沿用 · xinference 2026-09-04 GitLab Advisory · §IX 92 morning v3.21 已锚入)


五、本棒净窗口与今日主题活文档 §IX 95 morning v3.27 微调棒的关系

5.1 活文档闭合状态(2026-09-09 04:00 CST · §IX 95 morning v3.27 微调棒已闭合)

  • v3.27 微调棒全量沿用 v3.26 + vLLM V1 + HF Transformers Backend + HF × Foundry + OpenAI/HF Incident + TurboQuant + State of vLLM 2026 + AMD MI300X + arXiv:2604.01395v1 On-Premises RAG Blueprint → v3.27 闭合(14h40m 前已闭合)
  • arXiv/CVE/DOI/URL 312/36/14/458 件 · 净增 1 件 NET-new arXiv + 1 件 NET-new DOI + 9 件 NET-new URL · D147 v3.27 新增 + O484-O487 v3.27 新增 + P0 #229-#231 v3.27 新增 + T126 §IX 95 morning v3.27 新增

5.2 本棒(§IX 95 evening 棒位预备候选 · 2026-09-09 18:40 CST · 14h40m 接力净窗口)

  • 8 条主增量(在 3-8 目标区间上限;含 1 件 NET-new paper_card 主分类 llm-infra 入库 + 7 件 arXiv NET-new 锚入预备级 + 6 件事件级/方法学 NET-new + 1 件 GPU 横评预备级锚入)
  • 1 件 NET-new paper_card 主分类 llm-infra 入库 = paper_card 1278 arXiv:2609.04971 BeaconKV 2026-09-09 16:30 入库 · 主分类 llm-infra · 形态 method
  • 7 件 NET-new arXiv 锚入预备级(本棒位 = 7 件 NET-new arXiv 锚入预备级 = arXiv:2609.04971 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2609.01316 + arXiv:2609.01777 = 8 件)
  • 0 件 NET-new CVE / DOI / URL 锚入
  • 4 件矛盾/待核(Random Attention 矛盾 ① 持续沿用 + DeepSeek V4 Flash Vision 矛盾 ② 新发现 + arXiv:2609.04490 主分类矛盾 ③ 沿用 + Speculative Speculative Decoding 矛盾 ④ 新发现)

5.3 沿用预备级候选(§IX 95 evening v3.27 升档正式闭合预备候选)

  • §1.(1) 推理引擎方法学:arXiv:2604.25724 Salesforce 复合 AI 系统 8,000 企业用户 + 1360 亿 token 8.7× 增长 + arXiv:2506.21901 PremAI H100 80GB 横评 + SGLang BCG 新默认后端 + DeepSeek V4 Flash Vision 305B MoE MIT + NVIDIA NVFP4 Blackwell B200 + NVIDIA 收购 HF $12.93B
  • §1.(2) 推理调度:arXiv:2606.17104 Prefill/Decode-Aware Evaluation + arXiv:2609.01316 MIDR 多模态离线推理索引 + vLLM 冷启动 8min→1min + Snowflake Semi-Persistence 5.6×~19.9× + arXiv:2504.11320v4 Fluid-Guided Online Scheduling + arXiv:2605.01280v1 LLM Serving Needs Mathematical Optimization 双 arXiv 沿用预备级
  • §1.(3) KV Cache 子轴:arXiv:2609.04971 BeaconKV NET-new paper_card 主分类 llm-infra 入库 + arXiv:2607.02574 Survey 30+ 系统 4 轴分类 + arXiv:2603.16104 Agentic Workflows KV cache 命中率 + arXiv:2609.03430 Random Attention HF Daily 持续续立极显著(paper_card 仍未入库矛盾 ① 持续)
  • §1.(4) 量化子轴:TurboQuant PolarQuant + QJL 无重训练压缩(Google DeepMind) + NVIDIA NVFP4 Blackwell B200 IFBench +0.7%
  • §1.(5) 投机解码子轴:DeepSeek V4 Flash Vision DSpark 投机解码 + Speculative Speculative Decoding 待核矛盾 ④
  • §1.(7) Edge AI 子轴:DGX Spark GB10 Qwen3.8-27B 实测 SGLang FP8 + vLLM FP8 + MTP 13.8 t/s
  • §1.(10) 厂商格局:NVIDIA 收购 HF $12.93B + NVIDIA NVFP4 Blackwell B200
  • §1.(11) Kernel/AI 自动化/Harness:arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS URSA 框架 + vLLM 冷启动分层耗时分解 + OCI 镜像卷 + Dynamic Resource Allocation + Gateway API 推理感知路由

5.4 棒位预备触发条件(§IX 95 evening)

  • paper_card 1278 arXiv:2609.04971 BeaconKV 主分类 llm-infra 升档正式闭合候选(增量 ① · §1.(3) KV Cache 子轴升档正式闭合预备)
  • arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2609.01316 + arXiv:2609.01777 七 arXiv NET-new 升档正式闭合候选(增量 ② + ③ + ④ · §1.(1)/(2)/(3)/(11) 多子轴升档正式闭合预备)
  • NVIDIA 收购 HF $12.93B + SGLang BCG + vLLM 冷启动 + Snowflake Semi-Persistence + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + DGX Spark GB10 七件事件级/方法学 NET-new 升档正式闭合候选(增量 ⑤ + ⑥ + ⑦ + ⑧ · §1.(1)/(2)/(4)/(7)/(10) 多子轴升档正式闭合预备)
  • Random Attention arXiv:2609.03430 paper_card 入库确认(矛盾 ① 持续 · 9-10 morning cron 标记为 P0 待核)
  • DeepSeek V4 Flash Vision ApexBench 第三方独立 benchmark 验证(矛盾 ② 新发现 · 9-10 evening 棒前)
  • arXiv:2609.04490 paper_card 1243 主分类适配性争议闭环(矛盾 ③ 沿用 · 9-10 morning cron 标记 P0 待核)
  • Speculative Speculative Decoding arXiv 原文检索(矛盾 ④ 新发现 · 9-10 evening 棒前 arXiv 检索)
  • §IX 95 evening v3.27 升档棒候选 = BeaconKV paper_card 1278 主分类 llm-infra + 7 件 NET-new arXiv + 7 件事件级/方法学 NET-new + 4 件矛盾/待核 19 件预备级候选 → §IX 95 evening v3.27 升档正式闭合预备候选

5.5 候选 v3.28 升级路径评估

  • 候选 v3.28 升档棒条件:
  • 8 件主增量 + 1 件 NET-new paper_card 主分类 llm-infra 入库 + 7 件 NET-new arXiv 锚入预备级 + 7 件事件级/方法学 NET-new → 基本满足 v3.28 升档棒条件
  • §IX 95 evening 棒位预备候选(非正式升档)需在 §IX 95 evening 棒位预备中确认 BeaconKV paper_card 1278 主分类适配性 + 7 件 NET-new arXiv 升档闭合预备
  • v3.28 升档棒候选:8 件事件级/方法学 NET-new + 7 件 arXiv NET-new 锚入预备级 + 1 件 NET-new paper_card 主分类 llm-infra 入库 = §IX 95 evening v3.27 升档正式闭合预备候选 → §IX 96 morning v3.28 升档棒候选

六、本棒与今夜主题活文档(llm-infra.md)更新建议

6.1 建议今夜更新优先级(高 → 低)

🔴 高优先级(今夜必更新): - §1.(3) KV Cache 子轴:paper_card 1278 arXiv:2609.04971 BeaconKV NET-new 主分类 llm-infra 入库 + arXiv:2607.02574 Survey 30+ 系统 4 轴分类预备级锚入 + arXiv:2603.16104 Agentic Workflows KV cache 命中率预备级锚入 - §1.(1) 推理引擎方法学:arXiv:2604.25724 Salesforce 复合 AI 系统 8,000 企业用户 + arXiv:2506.21901 PremAI H100 80GB 横评 + SGLang BCG 新默认后端 + DeepSeek V4 Flash Vision 305B MoE MIT + NVIDIA NVFP4 Blackwell B200 + NVIDIA 收购 HF $12.93B 预备级锚入 - §1.(2) 推理调度子轴:arXiv:2606.17104 Prefill/Decode-Aware Evaluation + arXiv:2609.01316 MIDR 多模态离线推理索引 + vLLM 冷启动 8min→1min + Snowflake Semi-Persistence 5.6×~19.9× + arXiv:2504.11320v4 Fluid-Guided Online Scheduling + arXiv:2605.01280v1 LLM Serving Needs Mathematical Optimization 双 arXiv 沿用预备级

🟡 中优先级(今夜可更新): - §1.(4) 量化子轴:NVIDIA NVFP4 Blackwell B200 IFBench +0.7% 量化精度无损 + TurboQuant PolarQuant + QJL 无重训练压缩预备级沿用 - §1.(5) 投机解码子轴:DeepSeek V4 Flash Vision DSpark 投机解码预备级锚入 + Speculative Speculative Decoding 待核预备级 - §1.(7) Edge AI 子轴:DGX Spark GB10 Qwen3.8-27B 实测 SGLang FP8 + vLLM FP8 + MTP 13.8 t/s 预备级锚入 - §1.(10) 厂商格局:NVIDIA 收购 HF $12.93B + NVIDIA NVFP4 Blackwell B200 预备级锚入 - §1.(11) Kernel/AI 自动化/Harness:arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS URSA 框架 + vLLM 冷启动分层耗时分解预备级锚入

🟢 低优先级(今夜可选): - §0.5 SOTA v3.27 沿用(本棒净增 1 件 NET-new paper_card 主分类 llm-infra 入库 + 7 件 NET-new arXiv 锚入预备级,符合"§IX 95 evening 棒位预备候选"性质) - §3 共识与争议沿用 C1-C324 + D1-D147(无 NET-new 共识/争议)+ 新增 Random Attention 沿用 D148 预备(矛盾 ① 持续)+ 新增 DeepSeek V4 Flash Vision ApexBench 沿用 D149 预备(矛盾 ② 新发现) - §4 开放问题沿用 O1-O487 + 新增 Speculative Speculative Decoding P0 #232 预备(矛盾 ④ 新发现 · 9-10 evening 棒前 arXiv 检索) - §5 趋势沿用 T1-T126 + 新增 T127 §IX 95 evening v3.27 候选预备(BeaconKV paper_card 1278 + 7 件 NET-new arXiv + 7 件事件级/方法学 NET-new) - §6 引用清单沿用 312 arXiv + 36 CVE + 14 DOI + 458 URL · 新增 arXiv:2609.04971 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2609.01316 + arXiv:2609.01777 8 件

6.2 建议今夜不更新

  • §0 一句话综述沿用 v3.27 微调棒(本棒位为 §IX 95 evening 棒位预备候选,非正式升档)
  • §1.(3) KV Cache 子轴 Random Attention 矛盾 ① 沿用 v3.27 预备级 + 矛盾点保留至 §IX 96 morning 棒位预备
  • §1.(4) 量化子轴 arXiv:2609.04490 矛盾 ③ 沿用预备级(若主分类适配性争议闭环)
  • §1.(11) Kernel/AI 自动化/Harness 子轴 OpenAI/HF Incident 矛盾 ② 沿用预备级(待 §IX 96 morning 棒位 IM1 vs GPT-5.6 Sol 模型名一致性 + CVE-2026-65617 入库状态核验)

6.3 沿用预备级候选(§IX 95 evening v3.27 升档正式闭合预备)

  • §1.(1) 推理引擎方法学:arXiv:2604.25724 + arXiv:2506.21901 + SGLang BCG + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + NVIDIA 收购 HF $12.93B → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(2) 推理调度:arXiv:2606.17104 + arXiv:2609.01316 MIDR + vLLM 冷启动 + Snowflake Semi-Persistence + arXiv:2504.11320v4 + arXiv:2605.01280v1 → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(3) KV Cache:paper_card 1278 arXiv:2609.04971 BeaconKV + arXiv:2607.02574 Survey + arXiv:2603.16104 Agentic Workflows → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(4) 量化:TurboQuant PolarQuant + QJL + NVIDIA NVFP4 Blackwell B200 → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(5) 投机解码:DeepSeek V4 Flash Vision DSpark 投机解码 + Speculative Speculative Decoding 待核 → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(7) Edge AI:DGX Spark GB10 Qwen3.8-27B 实测 → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(10) 厂商格局:NVIDIA 收购 HF $12.93B + NVIDIA NVFP4 Blackwell B200 → §IX 95 evening v3.27 升档正式闭合预备
  • §1.(11) Kernel/AI 自动化/Harness:arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS URSA 框架 + vLLM 冷启动分层耗时分解 → §IX 95 evening v3.27 升档正式闭合预备

七、本棒自评(精简)

准确性 ✅:8 条主增量全部带具体来源(URL/官方源/arXiv 号)+ 1 件 NET-new paper_card 1278 arXiv:2609.04971 BeaconKV 主分类 llm-infra 2026-09-09 16:30 入库(增量 ①)+ 7 件 NET-new arXiv 锚入预备级(arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2609.01316 + arXiv:2609.01777 · 增量 ② + ③ + ④)+ 7 件事件级/方法学 NET-new(NVIDIA 收购 HF + SGLang BCG + vLLM 冷启动 + Snowflake Semi-Persistence + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + DGX Spark GB10 · 增量 ⑤ + ⑥ + ⑦ + ⑧)+ 1 件 GPU 横评预备级锚入(DGX Spark GB10 Qwen3.8-27B · 增量 ⑧)+ 4 件矛盾/待核(矛盾 ① Random Attention 持续沿用 + 矛盾 ② DeepSeek V4 Flash Vision ApexBench 新发现 + 矛盾 ③ arXiv:2609.04490 主分类适配性持续沿用 + 矛盾 ④ Speculative Speculative Decoding arXiv 原文未检索到新发现)+ 8 件可引用 arXiv 号清单(增量 ① + ② + ③ + ④)+ 1 件可引用 IETF 草案(沿用)+ 2 件沿用 CVE(CVE-2026-3172 + CVE-2026-61539)· 全部带 §IX 棒位编号与活文档 §IX 95 morning v3.27 微调棒闭合沿用基线对位。

深度 ✅:8 条主增量覆盖 §1.(1) 推理引擎方法学(NVIDIA 收购 HF + SGLang BCG + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + arXiv:2604.25724 Salesforce + arXiv:2506.21901 PremAI H100 80GB 横评 + DGX Spark GB10)+ §1.(2) 推理调度(vLLM 冷启动 + Snowflake Semi-Persistence + arXiv:2606.17104 Prefill/Decode-Aware + arXiv:2609.01316 MIDR + arXiv:2504.11320v4 Fluid-Guided + arXiv:2605.01280v1 LLM Serving Math)+ §1.(3) KV Cache(paper_card 1278 arXiv:2609.04971 BeaconKV + arXiv:2607.02574 Survey 30+ 系统 4 轴分类 + arXiv:2603.16104 Agentic Workflows KV cache 命中率)+ §1.(4) 量化(NVIDIA NVFP4 Blackwell B200 + TurboQuant PolarQuant + QJL)+ §1.(5) 投机解码(DeepSeek V4 Flash Vision DSpark + Speculative Speculative Decoding 待核)+ §1.(7) Edge AI(DGX Spark GB10 Qwen3.8-27B)+ §1.(10) 厂商格局(NVIDIA 收购 HF + NVIDIA NVFP4)+ §1.(11) Kernel/AI 自动化/Harness(arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS URSA 框架 + vLLM 冷启动分层耗时分解)八维全景预备级。

遗漏 ❌:❌ Random Attention arXiv:2609.03430 paper_card 入库状态(矛盾 ① 持续沿用,9-7 + 9-8 + 9-9 棒位均已发现矛盾,本棒位矛盾持续;与 BeaconKV paper_card 1278 已入库形成显著对比)· ❌ DeepSeek V4 Flash Vision ApexBench 非同类对比第三方独立验证(矛盾 ② 新发现,9-10 evening 棒前溯源第三方独立 benchmark)· ❌ arXiv:2609.04490 paper_card 1243 主分类适配性争议闭环(矛盾 ③ 沿用,与 paper_card 1278 主分类 llm-infra 适配性对照核验)· ❌ Speculative Speculative Decoding arXiv 原文检索(矛盾 ④ 新发现,9-10 evening 棒前 arXiv 检索)· ❌ jay 14:50 screening 8 件保留中 Discarded #5(arXiv:2605.17613 VeriCache · jay 标注"作为 KV cache compression 技术线索保留,待后续精读")· ❌ jay 0943 inference-primitives-disaggregated(NIX 2 + Dynamo + llm-d 三栈)· ❌ Speculative Speculative Decoding 数据 250 tokens/s(2× vLLM/SGLang)的具体实验设置(GPU 型号 + batch size + 序列长度 + 量化配置)未核验· ❌ arXiv:2609.01316 MIDR 的多模态编码器细节(SigLIP/Qwen2-VL/InternVL 七领域评测的具体配置)未核验· ❌ arXiv:2607.02574 Survey 揭示的 7 个缺失 KV 专项测量指标具体内容未精读。

矛盾 ✅:Random Attention arXiv:2609.03430 HF Daily 持续续立极显著 vs paper_card 仍未入库矛盾(本棒位矛盾 ① 持续沿用,9-7 + 9-8 棒位已发现矛盾;本棒位矛盾持续;与 BeaconKV paper_card 1278 已入库形成对比)+ DeepSeek V4 Flash Vision ApexBench 非同类对比矛盾(本棒位矛盾 ② 新发现,jay 18:50 engineering-filter-sep09pm 第四节明确标注 ⚠️)+ arXiv:2609.04490 paper_card 1243 主分类 llm-infra vs 实际应用域 GRU 循环网络 + 荧光寿命成像适配性争议(本棒位矛盾 ③ 沿用)+ Speculative Speculative Decoding arXiv 原文未检索到矛盾(本棒位矛盾 ④ 新发现,jay 9-9 inference-vecdb-hf-acquisition-morning 第三节标注 ⚠️)。

修订 ✅:8 条主增量 + 1 件 NET-new paper_card 主分类 llm-infra 入库(paper_card 1278 arXiv:2609.04971 BeaconKV 2026-09-09 16:30 入库)+ 7 件 NET-new arXiv 锚入预备级(arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2609.01316 + arXiv:2609.01777)+ 7 件事件级/方法学 NET-new(NVIDIA 收购 HF + SGLang BCG + vLLM 冷启动 + Snowflake Semi-Persistence + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + DGX Spark GB10)+ 1 件 GPU 横评预备级锚入(DGX Spark GB10)+ 4 件矛盾/待核(矛盾 ① 持续 + 矛盾 ② 新发现 + 矛盾 ③ 沿用 + 矛盾 ④ 新发现)+ 8 件可引用 arXiv 号(增量 ① + ② + ③ + ④)+ 1 件 IETF 草案(沿用)+ 2 件沿用 CVE + §IX 95 evening 棒位预备候选 → §IX 95 evening v3.27 升档正式闭合预备候选 → §IX 96 morning v3.28 升档棒候选。


状态输出

  • status:✅ 已 ok
  • 增量条数:8 条主增量(在 3-8 目标区间上限)+ 1 件 NET-new paper_card 主分类 llm-infra 入库(paper_card 1278 arXiv:2609.04971 BeaconKV 2026-09-09 16:30 入库)+ 7 件 NET-new arXiv 锚入预备级(arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2609.01316 + arXiv:2609.01777 · 增量 ② + ③ + ④)+ 7 件事件级/方法学 NET-new(NVIDIA 收购 HF + SGLang BCG + vLLM 冷启动 + Snowflake Semi-Persistence + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + DGX Spark GB10 · 增量 ⑤ + ⑥ + ⑦ + ⑧)+ 2 件矛盾新发现(矛盾 ② DeepSeek V4 Flash Vision ApexBench 非同类对比 + 矛盾 ④ Speculative Speculative Decoding arXiv 原文未检索到)+ 2 件矛盾沿用(矛盾 ① Random Attention 持续 + 矛盾 ③ arXiv:2609.04490 主分类适配性争议)+ 2 件安全事件沿用(CVE-2026-3172 pgvector + CVE-2026-61539 xinference)
  • 涉及 arXiv 号:18 件 = arXiv:2609.04971(BeaconKV · 本棒增量 ① paper_card 1278 NET-new 主分类 llm-infra)+ arXiv:2606.17104(Prefill/Decode-Aware Evaluation · 本棒增量 ②)+ arXiv:2607.02574(Survey of KV Cache Management · 本棒增量 ②)+ arXiv:2604.25724(Scalable Inference Architectures for Compound AI Systems · 本棒增量 ③)+ arXiv:2603.16104(Efficient LLM Serving for Agentic Workflows · 本棒增量 ③)+ arXiv:2506.21901(PremAI LLM Inference Servers Compared · 本棒增量 ④)+ arXiv:2609.01316(MIDR · 本棒增量 ④)+ arXiv:2609.01777(TREMORS · 本棒增量 ④)+ arXiv:2608.01526(Internet for KV Cache · 沿用)+ arXiv:2606.02964(AsymCache MDA · 沿用)+ arXiv:2606.19746(SAC CXL · 沿用)+ arXiv:2602.07115v5(Online Scheduling for LLM Inference · 沿用)+ arXiv:2608.16157(FreeToken Edge-Native MoE Serving · 沿用)+ arXiv:2504.11320v4(Fluid-Guided Online Scheduling · 沿用)+ arXiv:2605.01280v1(LLM Serving Needs Mathematical Optimization · 沿用)+ arXiv:2504.19874(TurboQuant · v3.27 闭合级)+ arXiv:2604.01395v1(On-Premises RAG Blueprint · v3.27 闭合级)+ arXiv:2609.03430(Random Attention · 矛盾 ① 沿用)+ arXiv:2609.04490(Recurrent-State Write-Back · 矛盾 ③ 沿用)+ arXiv:2607.21557(OpenForgeRL · 沿用)(本棒净增 8 件 NET-new arXiv 锚入预备级)
  • 涉及 IETF 草案:draft-li-cats-kv-cache-distribution-00(沿用 · 2026-07)
  • 涉及 CVE:CVE-2026-3172(沿用 · pgvector)+ CVE-2026-61539(沿用 · xinference)
  • 下一步:§IX 95 evening 棒位预备候选 → 沿用预备级候选 = §1.(1) NVIDIA 收购 HF + SGLang BCG + DeepSeek V4 Flash Vision + NVIDIA NVFP4 + arXiv:2604.25724 Salesforce + arXiv:2506.21901 PremAI + DGX Spark GB10 + §1.(2) vLLM 冷启动 + Snowflake Semi-Persistence + arXiv:2606.17104 + arXiv:2609.01316 MIDR + §1.(3) paper_card 1278 arXiv:2609.04971 BeaconKV + arXiv:2607.02574 Survey + arXiv:2603.16104 Agentic Workflows + §1.(4) TurboQuant + NVIDIA NVFP4 + §1.(5) DSpark + Speculative Speculative Decoding 待核 + §1.(7) DGX Spark GB10 + §1.(10) NVIDIA 收购 HF + NVIDIA NVFP4 + §1.(11) arXiv:2609.01316 MIDR + arXiv:2609.01777 TREMORS 15 件事件级/方法学 NET-new 锚入闭合预备 → §IX 95 evening v3.27 升档正式闭合预备候选 → §IX 96 morning v3.28 升档棒候选