inference · E1 预消化简报(2026-08-30)
实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683
生成时间:2026-08-30 22:20 CST(Asia/Shanghai)
窗口期:2026-08-28 22:20 → 2026-08-30 22:20(约 48h)
基线活文档:organized/knowledge/inference.md(2026-08-30 更新标注:vLLM Conf2026; SGLang DSpark Bug; Kimi K3 Day0; ACL KV九件; TurboQuant ICLR2026; MAX; MATS 加密推理; 引→约320条 arXiv)
状态
- 增量条数:6 条主增量(NET-new 3 条 + 邻接级补强 3 条)
- 本棒性质:"K8s 工程落地层 + MLSys 2026 系统量化 + 新 paper_card 预备"型棒 —— 今日 jay 四联简报带来大量工程细节,但大部分已锚入 inference.md;本棒聚焦"活文档 §1.(2) K8s 推理调度缺真实 YAML"+"§1.(3) KV Cache 缺 ACL 2026 综述"+"§1.(11) 缺 MLSys 2026 系统量化"三条真实缺口,以及 2 件 paper_card NET-new 预备
- 涉及 arXiv 号:净增 5 件(arXiv:2604.05012 + arXiv:2604.19157 + arXiv:2608.27455 + arXiv:2608.19269 + arXiv:2507.12442)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-08-30 22:00 自动生成)
- 待建卡 0 · 待更新活文档 0(全部最新)· 选题榜 10 件(arXiv:2608.26070 Prefix Sliding 最高优先)
- 视图干净;inference 主轴未触发"高价值待深度解读"信号(Top 15 均为视频脚本候选)
1.2 inbox/jay 今日四联简报(08-30 11:30 / 11:45 / 15:00 / 15:05 / 19:50 / 21:05)
- 11:30:DFlash 2 + Spec V2 + SGLang v0.6 + vLLM NVFP4 FlashInfer 强制依赖 + 四引擎横评(已锚入 inference.md §1.(1))
- 11:45:四路引擎 benchmark + 500+ 推理优化技术全景图 + 10 大向量库 benchmark + ACL 2026 KV Cache 综述(arXiv:2607.08057)+ The AI Agents Stack 2026 Edition(已锚入 inference.md §1.(1)/§1.(3))
- 15:00:SitePoint vLLM K8s 生产部署 + Kubenatives HPA YAML + DevOpsBeast vLLM vs SGLang 横评 + Spheron SGLang systemd + arXiv:2604.05012 + arXiv:2604.19157 + vLLM.cpp + MLSys 2026 + GitHub llama.cpp #15180
- 15:05:KubeCon NA 2026 AI Inference Track + GKE AI Zones + llm-d/KAI/DRA 三件套 + TGI 维护模式 + SGLang v1.2.1 + 向量库 benchmark + arXiv:2608.01526 + C²KV + Adaptive KV Caching + AsymCache(大部分已锚入 inference.md)
- 19:50:二次筛选升级——vLLM NVFP4 FlashInfer 强制依赖(阻断性变更)升级为最高优先;KubeCon NA 2026 AI Inference Track 升级为最高优先;Pydantic v2 兼容排障升级为最高优先
- 21:05:SIGMOD 2026 Filter-Agnostic Vector Search + VLDB 2026 SSD 图索引优化 + Black-Hole Attack 向量库投毒攻击 + CIDR 2026 Decoupled 向量搜索
1.3 inbox/tom 今日 radar(08-30 08:40 / 14:40 / 20:40)
- 08:40:8 件候选,CritICL 8▲ + PILOT in the Loop 27▲ + Inspect Evals Census 2▲ + Agentic Game Dev 134▲(主分类 agent,inference 邻接)
- 14:40:同上午 radar,重叠
- 20:40:同上午 radar,CritICL / PILOT / Inspect Evals Census / Agentic Game Dev 再次确认
1.4 inbox/flyp(08-30 15:50 SSM hybrid long-context critical-read)
- arXiv:2507.12442:SSM-Scope —— Transformer / SSM / Hybrid 长上下文 operator-level profiling;短上下文(<8K)Transformer 快 1.9×;长上下文(~57K)SSM 反超,最高 4× 加速;SSM selective scan kernel 占 >55% 推理延迟;crossover point 在约 57K tokens
1.5 inbox/spark(08-30 18:40 llm-infra e1prep · 本棒最关键交叉源)
- spark llm-infra e1prep 覆盖了今日几乎所有工程条目(vLLM K8s + HPA + DevOpsBeast + Spheron + arXiv:2604.05012/2604.19157 + MLSys 2026 + vLLM.cpp + AI Agents Stack + CritICL + Inspect Evals Census),本棒从中抽取 inference 主题 NET-new 条目
1.6 inbox/stephen(08-30 noon / evening)
- ai-industry 主轴;inference 邻接 0 件
1.7 paper_cards 库近 3 日新卡(2026-08-28 → 2026-08-30)
- llm-infra 主分类:4 件 —— paper_card 1117-2608-26070(Prefix Sliding,8-28)+ 1128-2001-08361(Scaling Laws backfill)+ 1129-2608-27455(CritICL,8-29) + 1133-2608-19269(Inspect Evals Census,8-29)
- inference 主分类:0 件(近 3 日无新增 inference 主分类 paper_card)
- adjacent:paper_card 1121-2608-26530(PILOT in the Loop,8-28,agent 主分类,inference 邻接)
1.8 organized/knowledge/inference.md
- vLLM Conf 2026 / SGLang DSpark Bug / Kimi K3 Day-0 / ACL KV 九件 / TurboQuant ICLR2026 / MAX / MATS / 引→约320条 arXiv
- §1.(2) 推理调度 K8s:仅有"llm-d CNCF Sandbox / KAI Scheduler / DRA driver"框架性描述,缺真实 YAML + HPA 阈值参数
- §1.(3) KV Cache:有 ACL 2026 KV Cache 综述(arXiv:2607.08057)条目,但缺 2026 MLSys 系统论文集群(DriftBench / SuperInfer / Meta PD disaggregation TCO)
- §1.(11) Kernel/AI 自动化/Harness:缺 2026 MLSys 系统量化 + 缺 SSA/TTA/TTI 推理时 scaling 新范式条目
二、最重要的 6 条主增量
增量 1【§1.(2) 推理调度 K8s · NET-new · 2026-08-30】🟢 vLLM K8s 生产部署完整 YAML + HPA 真实参数(SitePoint 2026 + Kubenatives)
- 来源:
inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md§1(SitePoint)+ §2(Kubenatives) - 来源链接:
https://www.sitepoint.com/vllm-production-deployment-guide-2026+https://www.kubenatives.com/p/how-vllm-serves-models-kubernetes - 可信度:高(2026 年更新,含真实 YAML 和运维命令)
要点:
SitePoint vLLM K8s 生产部署指南核心内容:
- 完整 Deployment YAML(含 runtimeClassName: nvidia + NVIDIA RuntimeClass 配置)
- topologySpreadConstraints GPU 打散策略(maxSkew: 1,按 kubernetes.io/hostname 分布)
- NetworkPolicy 限制 vLLM Pod 只能被反向代理访问,禁止其他 workloads 直连
- Secret 管理:kubectl create secret generic hf-secret --from-literal=token=$HF_TOKEN
- Prometheus metrics 端点注解(prometheus.io/scrape: true,port 8000,path /metrics)
- gRPC 部署:pip install vllm[grpc];替换 httpGet 为 Kubernetes 原生 gRPC probes(K8s 1.24+)
- 生产环境 --disable-log-requests(关闭请求 Payload 日志);保留 --log-stats
- VLLM_API_KEY 环境变量 / --api-key 双向认证
Kubenatives HPA 真实 YAML 关键参数:
- HPA 扩容信号 metric:vllm_num_requests_waiting(Waiting 队列长度)
- HPA scaleDown:stabilizationWindowSeconds: 600(10 分钟冷却);每次最多缩容 1 Pod;周期 5 分钟
- HPA scaleUp:每分钟最多加 2 Pod
- 关键阈值:vllm:gpu_cache_usage_perc > 90% 即将触发 preemption;> 95% 需降 max-num-seqs 或加 GPU
- vllm:num_requests_running 持续等于 max-num-seqs → 饱和,需扩容
与活文档现有脉络的关系: - inference.md §1.(2) 推理调度现有 llm-d / KAI Scheduler / DRA 框架性描述,缺真实 YAML 模板 + HPA 参数;本条为 NET-new 补入 - 与 §IX 67 K8s 1.37 GA + §IX 72 KubeCon NA 2026 AI Inference Track 构成"K8s 推理调度"完整工程路径(框架 → 真实 YAML) - 与 spark llm-infra e1prep §1.(2) K8s 生产部署 YAML 模板预备(8-30 18:40)二源闭合
建议归入节:§1.(2) 推理调度(NET-new · vLLM K8s 生产部署 YAML 模板 + HPA 真实参数 · topologySpreadConstraints + NetworkPolicy + gRPC probes + Prometheus metrics + HPA 扩容/缩容阈值)
增量 2【§1.(3) KV Cache 算子层 · NET-new · 2026-08-30】🟢 MLSys 2026 系统论文三联(DriftBench + SuperInfer + Meta PD disaggregation TCO)
- 来源:
inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md§8(Modular Blog)+inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md§二(KubeCon NA 2026 AI Inference Track) - 来源链接:
https://www.modular.com/blog/three-trends-from-mlsys-2026 - 可信度:高(Modular 工程师署名博客,现场报告)
要点:
MLSys 2026 关键系统论文三联:
① DriftBench(Gianluigi Vitale,MLSys 2026):生产 LLM Serving 系统基础设施漂移检测 benchmark。核心问题:生产 LLM Serving 系统在实际负载下会发生基础设施级漂移(GPU 利用率、KV cache 命中率、TTFT/SFT 等指标随时间漂移),现有 benchmark 无法捕获。DriftBench 提供生产级漂移检测方法论。工程价值:SRE 必备工具。
② SuperInfer(Superchips SLO-aware scheduling,MLSys 2026):发现 GH200 上 NVLink-C2C 900 GB/s 带宽实际利用率 <5%,原因是软件栈将其当作 PCIe 使用。这是 2026 年生产部署的关键数据点——NVIDIA GH200 的 NVLink-C2C 互联带宽并未被充分利用,软件层面存在重大优化空间。
③ Meta《Optimizing Deployment Configurations for LLM Inference》:生产部署中 prefill-decode 分离的实际 TCO 数据 = 15-25% 改善。原因:prefill 是 FLOP/s-bound(计算密集),decode 是 HBM bandwidth-bound(带宽密集),两者在不同 accelerator 上分别运行时成本效益最优。
与活文档现有脉络的关系: - inference.md §1.(3) KV Cache 已有 ACL 2026 综述(arXiv:2607.08057)+ 多件 2026 KV Cache 论文(An Internet for the KV Cache / C²KV / ReCache / HiSparse / DASH 等),缺 2026 MLSys 系统论文集群 - SuperInfer GH200 NVLink-C2C <5% 利用率 → 与 §1.(4) 硬件层 NVIDIA GH200/NVLink-C2C 现有条目邻接,可作为该节的量化数据补充 - DriftBench → §1.(12) (iv) Service Concurrency Safety(生产 SLO / 漂移检测) - Meta PD disaggregation TCO 15-25% → §1.(2) PD Disaggregation(现有 §1.2 有量化成本数据,本条 TCO 数据可作为补充)
建议归入节:§1.(3) KV Cache(MLSys 2026 三联 · DriftBench 漂移检测 + SuperInfer NVLink-C2C <5% 利用率 + Meta PD disaggregation TCO 15-25% 改善)+ §1.(4) 硬件层邻接(SuperInfer GH200 量化数据)+ §1.(2) PD Disaggregation 邻接(Meta TCO 数据)
增量 3【§1.(3) KV Cache 算子层 · NET-new · 2026-08-30】🟢 arXiv:2604.05012 + arXiv:2604.19157 KV Cache 实证双件
- 来源:
inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md§5(arXiv:2604.05012)+ §6(arXiv:2604.19157) - 来源链接:
https://arxiv.org/abs/2604.05012+https://arxiv.org/html/2604.19157v1 - 可信度:高(arXiv 实证论文)
要点:
arXiv:2604.05012 — KV Cache 管理策略实证横评(vLLM PagedAttention vs InfiniGen vs H2O): - 对比 vLLM PagedAttention、InfiniGen、H2O 在 latency / throughput / memory / request rates / model sizes 维度的实证表现 - 核心结论:没有单一方案在所有 GPU、context length、batch size 下均优 - 不同 KV cache 策略(paging / offload / eviction / sparse)适用于不同 workload 形态 - 标题:"Comparative Characterization of KV Cache Management Strategies for LLM Inference"
arXiv:2604.19157 — SAW-INT4(Hessian-aware 4-bit KV Cache 量化): - 在线标定(online calibration):服务引擎运行期间收集 query vectors - 每层构建二阶矩矩阵 Mℓ,用作 attention-sensitive 方向的权重 - 每层学习正交旋转矩阵 Rℓ,用于 KV 量化前的预处理 - 对比四种策略:naive INT4 / KMeans (Vector Quantization) / Hessian-aware (Kim et al. 2026) / Hadamard rotation - 结合 PagedAttention 和 fused kernels 做受控 token-wise 对比实验 - 结果:Hessian-aware rotation + INT4 在保持精度的同时显著降低 KV cache 内存
与活文档现有脉络的关系: - inference.md §1.(3) KV Cache 已有 TurboQuant(arXiv:2504.19874,ICLR 2026)+ QAH(arXiv:2608.20953)+ GEAR + HiSparse + DASH + ReCache 等,缺 实证横评(无单一最优方案) 和 Hessian-aware 旋转量化 - arXiv:2604.05012 实证结论(没有银弹)→ 可作为 §1.(3) 开篇结论性条目,统领现有各种 KV Cache 优化方案 - arXiv:2604.19157 SAW-INT4 → 与 TurboQuant(极低比特量化)+ QAH(量化后精度修复)构成 §1.(3) 量化三件套
建议归入节:§1.(3) KV Cache(NET-new · arXiv:2604.05012 实证横评统领 + arXiv:2604.19157 SAW-INT4 Hessian-aware 4-bit 量化)
增量 4【§1.(11) Kernel/AI 自动化/Harness · NET-new · 2026-08-29/30】🟡 SSM Hybrid 长上下文 Benchmark:crossover 在约 57K tokens(arXiv:2507.12442,flyp 精读)
- 来源:
inbox/flyp/2026-08-30-1550-ssm-hybrid-long-context-bench-critical-read.md(flyp 精读)+inbox/spark/2026-08-30-llm-infra-e1prep.md§1.4 - 来源链接:
https://arxiv.org/abs/2507.12442(v4: 2026-03-22) - 可信度:中高(operator-level profiling + 多平台 + 明确 crossover point;缺训练侧讨论和规模外推验证)
- 代码:
https://github.com/sapmitra/ssm-scope(SSM-Scope,open-source)
要点:
- 短上下文(<8K tokens):Transformer 比 SSM 快到 1.9×(KV cache + 成熟 kernel 优势仍在)
- 长上下文(~57K tokens):SSM 反超,最高 4× 加速,内存足迹减小约 64%
- 真实瓶颈:SSM selective scan kernel 因顺序 element-wise 特性,在边缘 GPU 上占 >55% 推理延迟
- crossover point:约 57K tokens(可作为 hybrid 架构 attention/SSM 配比决策起点)
- 与业界趋势吻合:Nemotron-H / Jamba / Hymba / Bamba 等 hybrid 模型定位一致
- 引用注意:需配套引用 "Achilles' Heel of Mamba"(纯 SSM 召回弱)避免"SSM 万能"叙事
与活文档现有脉络的关系: - inference.md §1.(1) 推理引擎现有 MAX(非 NVIDIA 第三引擎)+ llama.cpp(边缘/CPU);SSM hybrid 作为新架构类别,尚未在 inference.md 量化落地 - inference.md §1.(3) KV Cache 现有 Mamba Hybrid Prefix Caching 支持(vLLM 0.28 MRV2 新功能);本条提供 SSM vs Transformer 延迟 crossover 的量化基准 - 与 §1.(11) SSM/Hybrid 架构推理性能邻接;crossover point 可作为 hybrid 部署的决策依据
建议归入节:§1.(3) KV Cache 或 §1.(1) 推理引擎(NET-new · SSM Hybrid vs Transformer 长上下文 crossover 量化 · 57K tokens 反超临界点)+ §1.(11) 邻接
增量 5【§1.(11) Kernel/AI 自动化/Harness · NET-new · 2026-08-29 paper_card 入库】🟡 CritICL(arXiv:2608.27455,paper_card 1129)
- 来源:
paper_cards/1129-2608-27455.md(2026-08-29 入库 · 主分类 llm-infra · 形态 method)+inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md#4(8▲)+inbox/tom/2026-08-30T2040-agent-rag-longcontext-radar.md#1(升级确认) - 来源链接:
https://arxiv.org/abs/2608.27455 - 可信度:高(2026-08-26 paper · 8▲社区票 · 推理时弱到强泛化新范式)
- 立标信号:S2 被引 1 · 影响力被引 0(热度尚未充分建立)
要点:
- 标题:"CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes"
- 核心方法:利用同系列模型中弱模型的失败模式作为引导信号,让强模型在推理时自我改进
- 关键洞察:失败模式在不同规模模型间有结构性规律,可被复用
- 与 test-time scaling 的关系:CritICL 一致优于标准 in-context learning,性能与 test-time scaling 方法相当或更优,同时所需生成次数和 token 成本显著更低
- 意义:推理时 scaling 的第三类方法(与 self-consistency / sampling-based TTS 并列;第一类 = 多次生成采样,第二类 = 验证器引导)
与活文档现有脉络的关系: - inference.md §1.(11) 已有 CritICL 推理时缩放第三类方法学标注(来自 spark 8-29 evening 简报);paper_card 1129 入库后正式确认 - 与 PILOT in the Loop(arXiv:2608.26530)同为推理时自改进方法,但 CritICL 聚焦弱到强泛化,PILOT 聚焦在线执行重定向 - 与 §1.(12) (v) Harness Reliability 邻接——两者均为 Agent 推理时 harness 层面的方法创新
建议归入节:§1.(11) Kernel/AI 自动化/Harness(NET-new · CritICL 推理时弱到强泛化 · paper_card 1129 · 推理时 scaling 第三类方法)
增量 6【§1.(11) + §3 共识与争议 · NET-new · 2026-08-29 paper_card 入库】🟡 Inspect Evals Census(arXiv:2608.19269,paper_card 1133)
- 来源:
paper_cards/1133-2608-19269.md(2026-08-29 入库 · 主分类 llm-infra · 形态 position · 副分类 evaluation)+inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md#3(2▲)+inbox/tom/2026-08-30T2040-agent-rag-longcontext-radar.md#3(升级确认) - 来源链接:
https://arxiv.org/abs/2608.19269 - 可信度:中高(2026-08-24 · 2▲ · 评测诚信 position paper)
- 立标信号:S2 被引 0 · 影响力被引 0(work-queue Top 15 #1 高价值待深度解读候选;热度极弱但方向重要)
要点:
- 标题:"What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals"
- 核心问题:评测 artifact(benchmark)只规定了"任务-评分器-指标"的正向计算,却不必然 license 指标背后的声明(claim)——因为复现所需的历史证据和语义锚定可能是无界的
- 核心发现:对 124 个 Inspect Evals 单元的审查发现——110 个在确定性推理前停止,缺少历史证据或语义锚定
- 核心贡献:将缺失的 claim-replay 层形式化,并在固定 commit 上清点所有 124 个机械合格的 Inspect Evals 单元
与活文档现有脉络的关系: - inference.md §3 共识与争议现有 UPHELD(arXiv:2608.21281v1,多轮对话自动评估可靠性问题);Inspect Evals Census 聚焦评测 artifact 的 claim-replay 层形式化,与 UPHELD 构成评测诚信双视角 - 与 §1.(12) (v) Harness Reliability(评测方法学沿革 22+ 例候选)邻接 - 建议谨慎引入:立标信号极弱(2▲ / S2 0),且 8-29 evening 已有 work-queue Top 15 #1 标注,持续观察立标信号后再决定是否作为主锚点
建议归入节:§3 共识与争议(NET-new · Inspect Evals Census claim-replay 层形式化)+ §1.(11) 邻接(评测诚信双视角:UPHELD 多轮对话 + Inspect Evals Census claim-replay)
三、值得警惕的矛盾或待核实说法
-
SuperInfer "GH200 NVLink-C2C 900 GB/s 利用率 <5%" 与 inference.md §1.(4) NVIDIA GH200 现有条目关系待核实: - 来源:Modular Blog MLSys 2026 recap,工程师署名,但具体论文出处未在 jay 简报中给出 arXiv ID - 建议:核实 Modular Blog 是否提供原始论文 arXiv ID 或 ml-systems-papers repo 链接
-
DevOpsBeast "SGLang 新模型支持滞后 1-4 周" 与 §IX 72 inference.md "SGLang DeepSeek-V4 Day-0 + Kimi K3 Day-0" 矛盾: - DevOpsBeast 论断可能为 2026-04~06 数据;2026-07 后 SGLang 团队已加快 Day-0 支持 - 建议:inference.md §1.(1) SGLang vs vLLM 选型表格中删除或更新该过时论断
-
HPA metric name
vllm_num_requests_waiting(SitePoint raw metric) vsvllm:num_requests_waiting(Prometheus 命名空间格式)表面矛盾: - 两种格式是 raw metric name vs Prometheus 注解格式的差异,实为同一指标 - 建议:inference.md §1.(2) K8s HPA 配置中明确两种格式的对应关系 -
arXiv:2604.05012 + arXiv:2604.19157(2026-04 提交) 在 jay 8-30 15:00 才被发现入库: - 可能是 arXiv 索引延迟或 jay 检索策略调整;非 inference.md 已覆盖的遗漏 - 建议:§1.(3) KV Cache 引入这两篇时注明"2026-04 旧论文重新立标"
-
CritICL(arXiv:2608.27455)S2 被引 1 + 影响力被引 0 立标信号弱: - 8-29 入库,24h 内仅 1 次引用;推理时 scaling 第三类方法学方向重要但热度尚未建立 - 建议:§1.(11) 引入为候选条目,持续观察立标信号
-
Inspect Evals Census(arXiv:2608.19269)S2 被引 0 + 影响力被引 0 立标信号极弱: - work-queue Top 15 #1 标注;评测诚信方向重要但社区热度极低 - 建议:§3 共识与争议引入,但标注"立标信号观察中"
四、可引用的 arXiv 号列表(5 件)
主轴 NET-new(3 件)
- arXiv:2604.05012 — Comparative Characterization of KV Cache Management Strategies for LLM Inference(vLLM PagedAttention / InfiniGen / H2O 实证横评 · 2026-04)→ §1.(3) KV Cache
- arXiv:2604.19157 — SAW-INT4: Hessian-aware 4-bit KV Cache Quantization(2026-04)→ §1.(3) KV Cache 量化
- arXiv:2507.12442 — Characterizing State Space Model and Hybrid Language Model Performance with Long Context(SSM-Scope v4 · 2026-03-22)→ §1.(3) KV Cache / §1.(1) 推理引擎邻接
邻接级补强(2 件)
- arXiv:2608.27455 — CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes(2026-08-26 · paper_card 1129 · 8▲)→ §1.(11) Kernel/AI 自动化/Harness
- arXiv:2608.19269 — What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals(2026-08-24 · paper_card 1133 · 2▲ · 立标信号弱)→ §3 共识与争议 + §1.(11) 邻接
沿用件套(已在 inference.md,非本棒净增)
- arXiv:2608.01526(An Internet for the KV Cache · 已在 §1.(3))
- arXiv:2607.08057(ACL 2026 KV Cache 综述 · 已在 §1.(3))
- arXiv:2607.17715(C²KV · 已在 §1.(3))
- arXiv:2608.26530(PILOT in the Loop · 已在 §1.(11) 邻接)
- arXiv:2606.21238(Adaptive KV Caching · 已在 §1.(3))
- arXiv:2606.02964(AsymCache · 已在 §1.(3))
五、本棒小结
inference 主题 8-28 22:20 → 8-30 22:20 净增量 = 6 条主增量
| # | 条目 | 分类 | 价值 | 建议归入节 |
|---|---|---|---|---|
| 1 | SitePoint + Kubenatives vLLM K8s 真实 YAML + HPA 参数 | NET-new | ⭐⭐⭐⭐⭐ | §1.(2) 推理调度 |
| 2 | MLSys 2026 三联(DriftBench + SuperInfer + Meta PD disagg TCO) | NET-new | ⭐⭐⭐⭐ | §1.(3) + §1.(4) + §1.(2) |
| 3 | arXiv:2604.05012 + arXiv:2604.19157 KV Cache 实证双件 | NET-new | ⭐⭐⭐⭐ | §1.(3) KV Cache |
| 4 | SSM Hybrid 长上下文 Benchmark(crossover ~57K tokens) | NET-new | ⭐⭐⭐ | §1.(3) / §1.(1) |
| 5 | CritICL(arXiv:2608.27455,paper_card 1129) | NET-new | ⭐⭐⭐ | §1.(11) |
| 6 | Inspect Evals Census(arXiv:2608.19269,paper_card 1133) | NET-new | ⭐⭐ | §3 + §1.(11) |
与 8-29 evening Tom inference e1prep(8-29 06:10 → 22:20 · 6 条主增量)对照: - 8-29 增量:MATS Research + MAX + SK Hynix HBF + UPHOLD + ByteByteGo EP223 + KV Cache 五族 - 8-30 增量:K8s YAML + HPA(8-29 无)+ MLSys 2026 三联(新)+ KV Cache 实证双件(新)+ SSM hybrid(邻接级升级)+ CritICL + Inspect Evals Census(paper_card 新入库) - 本棒特征:工程落地层(K8s YAML)+ 系统顶会量化(MLSys 2026)+ 新 paper_card 入库预备(CritICL / Inspect Evals Census)
六、检查过的来源汇总
已检查 / 已纳入本棒
- ✅
organized/knowledge/inference.md(2026-08-30 更新标注 · 320 条 arXiv 基线) - ✅
work-queue.md(2026-08-30 22:00) - ✅
inbox/jay/2026-08-30T1130-jay-engineering-filter.md(DFlash 2 + Spec V2 + vLLM NVFP4 + 四引擎横评) - ✅
inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(四引擎 + 500+ 全景 + ACL 2026 KV Cache) - ✅
inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md(本棒最关键源) - ✅
inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md(KubeCon NA + llm-d/KAI/DRA) - ✅
inbox/jay/2026-08-30T1950-jay-engineering-filter-round3.md(二次筛选升级) - ✅
inbox/jay/2026-08-30T2105-jay-five-category-evening-briefing.md(SIGMOD/VLDB/CIDR 向量搜索) - ✅
inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md - ✅
inbox/tom/2026-08-30T1440-agent-rag-longcontext-radar.md - ✅
inbox/tom/2026-08-30T2040-agent-rag-longcontext-radar.md - ✅
inbox/flyp/2026-08-30-1550-ssm-hybrid-long-context-bench-critical-read.md(本棒关键邻接源) - ✅
inbox/spark/2026-08-30-llm-infra-e1prep.md(本棒最关键交叉源) - ✅
paper_cards/1129-2608-27455.md(CritICL,8-29) - ✅
paper_cards/1133-2608-19269.md(Inspect Evals Census,8-29) - ✅
paper_cards/1121-2608-26530.md(PILOT in the Loop,8-28) - ✅
inbox/spark/2026-08-28-llm-infra-e1prep.md(8-28 evening 延续参照) - ✅
inbox/tom/2026-08-29-inference-e1prep.md(8-29 evening 参照)
已检查 / 未纳入(无 inference 净新增)
inbox/jay/2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(CSDN 推理/LLaMA-Factory · 已在 inference.md)inbox/jay/2026-08-30T1420-jay-csdn-langchain-v1-langgraph-mcp-env-pydantic.md(CSDN MCP · agent 主轴)inbox/tom/2026-08-30-rag-e1prep.md(RAG 主轴 · inference 邻接 0 件)inbox/tom/2026-08-30-evaluation-e1prep.md(evaluation 主轴)inbox/flyp/2026-08-30-multimodal-e1prep.md(multimodal 主轴)inbox/flyp/2026-08-30-risk-e1prep.md(risk 主轴)inbox/stephen/2026-08-30-ai-industry-e1prep.md(ai-industry 主轴)inbox/spark/2026-08-30-agent-e1prep.md(agent 主轴)inbox/spark/2026-08-30-1000-rss-gradient-flow.md(RSS · inference 邻接 0 件)
Tom · 2026-08-30 22:20 CST · 本棒检查 20+ 来源(inbox jay 8 件 + tom 3 件 + flyp 2 件 + spark 2 件 + stephen 1 件 + paper_cards 4 件 + inference.md 1 件 + work-queue 1 件) · inference 主题 NET-new 6 条 · 涉及 arXiv 号 5 件(净增)