研究草稿 · Jay · 2026-10-11 下午(第3次)

本次主题

推理引擎实测数据更新 · KV Cache 调度新论文 · Cloud-OpsBench 云原生运维基准 · SGLang GitHub 生产 Bug 追踪 · Substack 高价值工程洞察

检索范围

  • Tavily 深度搜索(Inference Engine 2026 实测、KV Cache 调度、Cloud-Native Benchmark)
  • SGLang GitHub Issues(2026-10 最新生产 Bug)
  • Substack(AI Agent Stack 2026、OWASP Agents 安全)
  • 参考已入库:Jay 10-11 1450 engineering-filter(Inference 决策树/MCP 故障/可观测性)、10-11 1105(Vector DB/Pgvector)

一、Database 高价值条目

✅ 保留:VLDB 2026 — TDSQL 72.6M QphDS 登顶 TPC-DS

  • 来源: VLDB 2026 Conference Program,vldb.org/2026/program.html
  • 核心数据:
  • 10,000 GB TPC-DS 集群配置:TDSQL 得分 72.6 million QphDS
  • 第二名 1.81× 差距;第三名 3.82× 差距
  • 单位成本优势:比第二名低 79%、比第三名低 37%(per 1000 QphDS)
  • 核心技术:MPP 执行框架 + Forward Node 机制 + 向量化执行引擎 + 运行时 Filter 优化
  • 保留理由: 公开 benchmark 数据,有具体数字,可作为分布式 OLAP 选型参考
  • 可信度: 高(VLDB 官方会议记录)
  • 后续行动: 对标分析可引用;关注国产数据库进展

ℹ️ 参考:arxiv cs.DB 2026-08 新论文(数据库方向)

  • 来源: arxiv.org/list/cs.DB/2026-08
  • 已知的 VLDB 2026 收录范围: SRDS 2026(IEEE Reliable Distributed Systems)数据库相关论文
  • 建议: 批量扫 arxiv cs.DB 月度列表,提取有代码仓/公开数据集的论文归档

二、Backend(Inference Engine)高价值条目

⭐⭐⭐ Inference Engine 2026 实测数据更新(Winder.ai)

来源: winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison(2026)

核心量化结论:

Engine 1 concurrent 10 concurrent 50 concurrent TTFT@50 $/M tokens@50
SGLang 0.5.20 81 tok/s 627 tok/s 1,725 tok/s 1.5s $0.56
vLLM 0.30.0 76 tok/s 589 tok/s 1,610 tok/s 2.1s $0.60
llama.cpp b11179 56 tok/s 138 tok/s 97 tok/s 8.2s $10.03

Qwen3.8-27B(混合线性注意力模型),单卡 H100,2026-09 采集数据

关键工程判断(与上午 1450 条目互补): - SGLang 自限速机制:caps its own concurrency to fit its state cache,仅在日志行提示,不在 API 层暴露 - vLLM 保守启动策略:序列长度超限直接拒绝启动(对比 SGLang 更宽松) - llama.cpp 致命弱点:混合模型场景每次都重新处理完整 prompt,并发超 4 用户后性能断崖

与上午数据对比: 上午 engineering-filter 引用 SGLang 16215 tok/s(LMDeploy 16132、vLLM 12553),本条数据(1725 tok/s @ 50 concurrent)为同一集群相对并发数字,口径一致。

  • 保留理由: 2026-09 最新实测,$0.56/M tokens 是目前最准确的生产成本数字,SGLang 自限速提醒是重要工程陷阱
  • 可信度: 高(Winder.ai 商业平台,实测可复现)
  • 后续行动: 生产成本估算工具可引用 $0.56/H100 数字;补充 Blackwell 支持差异后入 Inference Engine 选型 SOP

⭐⭐ SGLang GitHub 2026-10-10/11 生产 Bug 追踪

来源: github.com/sgl-project/sglang/issues(2026-10-10~11 新开 Issue)

Bug #43488(DSV4.1 Flash + DSPARK,CUDA OOM,每 15-25 分钟崩溃): - 环境: DSV4.1 + Flash Attention + DSPARK 组合 - 症状: CUDA caching allocator 耗尽 GPU 内存,但 KV pool 仅使用 29% - 触发条件: 持续 max-batch decode 负载 - 结论: 不是 KV pool 泄漏,是 CUDA caching allocator 本身的问题 - 工程价值: 揭示了 PagedAttention/KV pool 之外的第三层内存管理(CUDA allocator)的坑

Bug #43557(PD disaggregation 模式切换,illegal memory access): - 环境: --disaggregation-mode decode 启动,经历 decode → prefill → decode 切换 - 症状: illegal memory access 崩溃 - 工程价值: Disaggregated serving(prefill/decode 分离)生产部署警示

Bug #43402(CUDA VMM multimodal transport slice 泄漏): - 场景: 请求在队列中时被 abort - 症状: multimodal transport slice 泄漏 - 工程价值: 队列管理 + abort 资源回收的生产级缺陷

Bug #43523(DeepSeekV3Detector streaming 工具调用丢失): - 场景: 两个完整工具调用在同一个 increment 到达时,第一个工具调用被静默丢弃 - 工程价值: Agent streaming 场景下的协议层面 bug

  • 保留理由: 真实生产故障,有日期标签(2026-10-10),反映当前 SGLang 版本最新 bug 状态
  • 可信度: 高(GitHub Issue,直接从 maintainer 标签判断优先级)
  • 后续行动: 归档为 SGLang 生产部署检查清单;下次版本升级前必读 release note

✅ 保留:arxiv CSys 新论文 — KV Cache 异构内存调度(2026 DAC)

来源: RPI + IBM Research,DAC 2026,KEEP: A KV-Cache-Centric Memory Management System

  • 核心方向: 不是提出具体调度策略,而是建模 KV cache 在 HBM + 高速 off-package DRAM 异构系统中的放置问题
  • 背景: NVLink/LPDDR5X 互联进步使 HBM+off-package DRAM 异构系统实用化
  • 研究问题: 如何最大化聚合带宽利用率,同时满足容量约束
  • 结论: 聚焦建模本身,不给出单一最优策略;为后续动态调度研究提供理论基础
  • 关联工作: MPCache(NeurIPs 2025,MPC-friendly KV cache eviction)、MatMoE(ICCAD 2026,动态混合精度 MoE)

另一相关论文 DUAL-BLADE(arXiv 2026-04): - NVMe-direct KV cache 卸载路径,绕过 page cache 文件系统依赖 - 实测:prefill 延迟降低 33.1%、decode 降低 42.4%、SSD 利用率提升 2.2× - 工程价值: 边缘 LLM 推理场景的 KV cache 卸载参考

  • 保留理由: KV cache 管理是 2026 推理系统核心瓶颈;RPI+IBM 联合署名可信度高
  • 可信度: 高(顶会 + IBM Research)
  • 后续行动: 关注 KEEP 论文开源代码仓

三、Cloud-Native 高价值条目

⭐⭐⭐ Cloud-OpsBench:云原生故障根因分析的 Agentic Benchmark

来源: arxiv.org/html/2603.00468v1,2026 arXiv

核心设计: - Workload: Google Online Boutique(11 个 polyglot 微服务,gRPC 通信) - Agent 任务: Root Cause Analysis(RCA)——在云基础设施故障(节点耗尽、网络分区、磁盘压力)下自动诊断 - 观测面: Prometheus 指标 + Istio + Kubernetes API 实时对象状态 + 容器日志 - 故障注入: ChaosBlade(基础设施层)+ kubectl 原子命令(配置变更) - 评估指标: 诊断准确率 + 定位延迟 + 误报率

技术栈: Locust 负载生成、Prometheus/Istio 可观测性平面、ChaosBlade 混沌工程

  • 保留理由: 第一个专门针对"Agent 自动化运维"的云原生 benchmark,有完整工具链;代表 Cloud-Native + AI Agent 交叉方向
  • 可信度: 高(arXiv,有完整方法论描述)
  • 后续行动: 关注 GitHub 开源仓;可作为 AI-Native 运维能力评估框架参考

ℹ️ AI-Native Systems 新 Benchmark:AI-NativeBench

来源: arxiv.org/html/2601.09393v1,arXiv 2026-01

方向: 从 Cloud-Native 演进到 AI-Native 系统的白盒评估标准 - 微服务 → AI workflow - 确定性 human-coded logic → LLM-driven decision - OpenTelemetry 分布式追踪 → Agent trace + evaluation

  • 建议: 与 Cloud-OpsBench 对比归档,关注两者评估体系差异

四、CSDN 高价值条目

(本日已发 2026-10-11-csdn-substack-inference-rag-highvalue.md,本期无新增 CSDN 专项搜索)

本期补充参考(通过 Substack/Medium 渠道发现): - Medium Red Buffer:vLLM & SGLang Private LLM Inference for Data Compliance(2026-04)——企业数据合规场景下的自托管推理选型 - Packt DataPro:NVIDIA Fixes Agent Mistakes. Perplexity Rethinks Retrieval. AWS Secures RAG——企业 RAG 数据治理实践


五、Reproduction(可复现性)高价值条目

✅ 保留:SGLang OOM Issue 复现路径整理

来源: GitHub Issue #9365(Tracking)和 #12496

核心经验(可复现工程规律): 1. VLM 比 LLM 更易 OOM:不是因为泄漏更严重,而是 ViT + image processor + LLM 三者叠加内存峰值 2. text-only 模型也有泄漏:gpt-oss 20B 纯文本场景可稳定复现,与 VLMs 独立 3. 复现基准命令: bash python -m sglang.launch_server --model-path openai/gpt-oss-20b --port 30324 --disable-radix-cache 4. 测试矩阵: gpt-oss 20B、Llama-3.2-3B、Qwen2.5-3B 均需覆盖 5. 未解问题: 是否影响 Llama、GLM 系列——help wanted,社区尚未覆盖

  • 保留理由: OOM 是 SGLang 生产部署第一号拦路虎,本 Issue 提供了系统化复现方法
  • 可信度: 高(GitHub Issue + 多个 maintainer 参与)
  • 后续行动: 生产 SGLang 部署应将 --disable-radix-cache 列为他因排障必查项

分类标签

database backend cloud-native csdn reproduction


本次新发现汇总

# 条目 分类 价值 可信度
1 VLDB 2026 TDSQL 72.6M QphDS database ⭐⭐ 高
2 Winder.ai SGLang vs vLLM vs llama.cpp 实测($0.56/M tokens) backend ⭐⭐⭐ 高
3 SGLang GitHub 2026-10 Bug 集中(OOM/disagg/leak) backend ⭐⭐ 高
4 RPI+IBM KEEP: KV异构内存调度建模 backend ⭐⭐ 高
5 DUAL-BLADE: NVMe-direct KV cache卸载 backend ⭐⭐ 高
6 Cloud-OpsBench: Agentic RCA Benchmark cloud-native ⭐⭐⭐ 高
7 AI-NativeBench 白盒评估框架 cloud-native ⭐⭐ 高
8 SGLang OOM Issue #9365 系统化复现方法 reproduction ⭐⭐⭐ 高

建议写入路径

  • /shared/research-kb/inbox/jay/2026-10-11T1505-database-backend-cloudnative-csdn.md(本文)

后续行动建议

  1. Cloud-OpsBench 和 AI-NativeBench 关注 arXiv 代码仓开源
  2. SGLang 0.5.20 Bug(#43488, #43557)跟踪 GitHub release note
  3. KEEP 论文(2026 DAC)关注代码开源
  4. 下次搜索扩大 CSDN 覆盖,可单独跑一次数据库内核/存储引擎专项