研究草稿 · Jay · 2026-10-11 下午(第3次)
本次主题
推理引擎实测数据更新 · KV Cache 调度新论文 · Cloud-OpsBench 云原生运维基准 · SGLang GitHub 生产 Bug 追踪 · Substack 高价值工程洞察
检索范围
- Tavily 深度搜索(Inference Engine 2026 实测、KV Cache 调度、Cloud-Native Benchmark)
- SGLang GitHub Issues(2026-10 最新生产 Bug)
- Substack(AI Agent Stack 2026、OWASP Agents 安全)
- 参考已入库:Jay 10-11 1450 engineering-filter(Inference 决策树/MCP 故障/可观测性)、10-11 1105(Vector DB/Pgvector)
一、Database 高价值条目
✅ 保留:VLDB 2026 — TDSQL 72.6M QphDS 登顶 TPC-DS
- 来源: VLDB 2026 Conference Program,
vldb.org/2026/program.html - 核心数据:
- 10,000 GB TPC-DS 集群配置:TDSQL 得分 72.6 million QphDS
- 第二名 1.81× 差距;第三名 3.82× 差距
- 单位成本优势:比第二名低 79%、比第三名低 37%(per 1000 QphDS)
- 核心技术:MPP 执行框架 + Forward Node 机制 + 向量化执行引擎 + 运行时 Filter 优化
- 保留理由: 公开 benchmark 数据,有具体数字,可作为分布式 OLAP 选型参考
- 可信度: 高(VLDB 官方会议记录)
- 后续行动: 对标分析可引用;关注国产数据库进展
ℹ️ 参考:arxiv cs.DB 2026-08 新论文(数据库方向)
- 来源:
arxiv.org/list/cs.DB/2026-08 - 已知的 VLDB 2026 收录范围: SRDS 2026(IEEE Reliable Distributed Systems)数据库相关论文
- 建议: 批量扫 arxiv cs.DB 月度列表,提取有代码仓/公开数据集的论文归档
二、Backend(Inference Engine)高价值条目
⭐⭐⭐ Inference Engine 2026 实测数据更新(Winder.ai)
来源: winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison(2026)
核心量化结论:
| Engine | 1 concurrent | 10 concurrent | 50 concurrent | TTFT@50 | $/M tokens@50 |
|---|---|---|---|---|---|
| SGLang 0.5.20 | 81 tok/s | 627 tok/s | 1,725 tok/s | 1.5s | $0.56 |
| vLLM 0.30.0 | 76 tok/s | 589 tok/s | 1,610 tok/s | 2.1s | $0.60 |
| llama.cpp b11179 | 56 tok/s | 138 tok/s | 97 tok/s | 8.2s | $10.03 |
Qwen3.8-27B(混合线性注意力模型),单卡 H100,2026-09 采集数据
关键工程判断(与上午 1450 条目互补):
- SGLang 自限速机制:caps its own concurrency to fit its state cache,仅在日志行提示,不在 API 层暴露
- vLLM 保守启动策略:序列长度超限直接拒绝启动(对比 SGLang 更宽松)
- llama.cpp 致命弱点:混合模型场景每次都重新处理完整 prompt,并发超 4 用户后性能断崖
与上午数据对比: 上午 engineering-filter 引用 SGLang 16215 tok/s(LMDeploy 16132、vLLM 12553),本条数据(1725 tok/s @ 50 concurrent)为同一集群相对并发数字,口径一致。
- 保留理由: 2026-09 最新实测,$0.56/M tokens 是目前最准确的生产成本数字,SGLang 自限速提醒是重要工程陷阱
- 可信度: 高(Winder.ai 商业平台,实测可复现)
- 后续行动: 生产成本估算工具可引用 $0.56/H100 数字;补充 Blackwell 支持差异后入 Inference Engine 选型 SOP
⭐⭐ SGLang GitHub 2026-10-10/11 生产 Bug 追踪
来源: github.com/sgl-project/sglang/issues(2026-10-10~11 新开 Issue)
Bug #43488(DSV4.1 Flash + DSPARK,CUDA OOM,每 15-25 分钟崩溃): - 环境: DSV4.1 + Flash Attention + DSPARK 组合 - 症状: CUDA caching allocator 耗尽 GPU 内存,但 KV pool 仅使用 29% - 触发条件: 持续 max-batch decode 负载 - 结论: 不是 KV pool 泄漏,是 CUDA caching allocator 本身的问题 - 工程价值: 揭示了 PagedAttention/KV pool 之外的第三层内存管理(CUDA allocator)的坑
Bug #43557(PD disaggregation 模式切换,illegal memory access):
- 环境: --disaggregation-mode decode 启动,经历 decode → prefill → decode 切换
- 症状: illegal memory access 崩溃
- 工程价值: Disaggregated serving(prefill/decode 分离)生产部署警示
Bug #43402(CUDA VMM multimodal transport slice 泄漏): - 场景: 请求在队列中时被 abort - 症状: multimodal transport slice 泄漏 - 工程价值: 队列管理 + abort 资源回收的生产级缺陷
Bug #43523(DeepSeekV3Detector streaming 工具调用丢失): - 场景: 两个完整工具调用在同一个 increment 到达时,第一个工具调用被静默丢弃 - 工程价值: Agent streaming 场景下的协议层面 bug
- 保留理由: 真实生产故障,有日期标签(2026-10-10),反映当前 SGLang 版本最新 bug 状态
- 可信度: 高(GitHub Issue,直接从 maintainer 标签判断优先级)
- 后续行动: 归档为 SGLang 生产部署检查清单;下次版本升级前必读 release note
✅ 保留:arxiv CSys 新论文 — KV Cache 异构内存调度(2026 DAC)
来源: RPI + IBM Research,DAC 2026,KEEP: A KV-Cache-Centric Memory Management System
- 核心方向: 不是提出具体调度策略,而是建模 KV cache 在 HBM + 高速 off-package DRAM 异构系统中的放置问题
- 背景: NVLink/LPDDR5X 互联进步使 HBM+off-package DRAM 异构系统实用化
- 研究问题: 如何最大化聚合带宽利用率,同时满足容量约束
- 结论: 聚焦建模本身,不给出单一最优策略;为后续动态调度研究提供理论基础
- 关联工作:
MPCache(NeurIPs 2025,MPC-friendly KV cache eviction)、MatMoE(ICCAD 2026,动态混合精度 MoE)
另一相关论文 DUAL-BLADE(arXiv 2026-04):
- NVMe-direct KV cache 卸载路径,绕过 page cache 文件系统依赖
- 实测:prefill 延迟降低 33.1%、decode 降低 42.4%、SSD 利用率提升 2.2×
- 工程价值: 边缘 LLM 推理场景的 KV cache 卸载参考
- 保留理由: KV cache 管理是 2026 推理系统核心瓶颈;RPI+IBM 联合署名可信度高
- 可信度: 高(顶会 + IBM Research)
- 后续行动: 关注 KEEP 论文开源代码仓
三、Cloud-Native 高价值条目
⭐⭐⭐ Cloud-OpsBench:云原生故障根因分析的 Agentic Benchmark
来源: arxiv.org/html/2603.00468v1,2026 arXiv
核心设计: - Workload: Google Online Boutique(11 个 polyglot 微服务,gRPC 通信) - Agent 任务: Root Cause Analysis(RCA)——在云基础设施故障(节点耗尽、网络分区、磁盘压力)下自动诊断 - 观测面: Prometheus 指标 + Istio + Kubernetes API 实时对象状态 + 容器日志 - 故障注入: ChaosBlade(基础设施层)+ kubectl 原子命令(配置变更) - 评估指标: 诊断准确率 + 定位延迟 + 误报率
技术栈: Locust 负载生成、Prometheus/Istio 可观测性平面、ChaosBlade 混沌工程
- 保留理由: 第一个专门针对"Agent 自动化运维"的云原生 benchmark,有完整工具链;代表 Cloud-Native + AI Agent 交叉方向
- 可信度: 高(arXiv,有完整方法论描述)
- 后续行动: 关注 GitHub 开源仓;可作为 AI-Native 运维能力评估框架参考
ℹ️ AI-Native Systems 新 Benchmark:AI-NativeBench
来源: arxiv.org/html/2601.09393v1,arXiv 2026-01
方向: 从 Cloud-Native 演进到 AI-Native 系统的白盒评估标准 - 微服务 → AI workflow - 确定性 human-coded logic → LLM-driven decision - OpenTelemetry 分布式追踪 → Agent trace + evaluation
- 建议: 与 Cloud-OpsBench 对比归档,关注两者评估体系差异
四、CSDN 高价值条目
(本日已发 2026-10-11-csdn-substack-inference-rag-highvalue.md,本期无新增 CSDN 专项搜索)
本期补充参考(通过 Substack/Medium 渠道发现):
- Medium Red Buffer:vLLM & SGLang Private LLM Inference for Data Compliance(2026-04)——企业数据合规场景下的自托管推理选型
- Packt DataPro:NVIDIA Fixes Agent Mistakes. Perplexity Rethinks Retrieval. AWS Secures RAG——企业 RAG 数据治理实践
五、Reproduction(可复现性)高价值条目
✅ 保留:SGLang OOM Issue 复现路径整理
来源: GitHub Issue #9365(Tracking)和 #12496
核心经验(可复现工程规律):
1. VLM 比 LLM 更易 OOM:不是因为泄漏更严重,而是 ViT + image processor + LLM 三者叠加内存峰值
2. text-only 模型也有泄漏:gpt-oss 20B 纯文本场景可稳定复现,与 VLMs 独立
3. 复现基准命令:
bash
python -m sglang.launch_server --model-path openai/gpt-oss-20b --port 30324 --disable-radix-cache
4. 测试矩阵: gpt-oss 20B、Llama-3.2-3B、Qwen2.5-3B 均需覆盖
5. 未解问题: 是否影响 Llama、GLM 系列——help wanted,社区尚未覆盖
- 保留理由: OOM 是 SGLang 生产部署第一号拦路虎,本 Issue 提供了系统化复现方法
- 可信度: 高(GitHub Issue + 多个 maintainer 参与)
- 后续行动: 生产 SGLang 部署应将
--disable-radix-cache列为他因排障必查项
分类标签
database backend cloud-native csdn reproduction
本次新发现汇总
| # | 条目 | 分类 | 价值 | 可信度 |
|---|---|---|---|---|
| 1 | VLDB 2026 TDSQL 72.6M QphDS | database | ⭐⭐ | 高 |
| 2 | Winder.ai SGLang vs vLLM vs llama.cpp 实测($0.56/M tokens) | backend | ⭐⭐⭐ | 高 |
| 3 | SGLang GitHub 2026-10 Bug 集中(OOM/disagg/leak) | backend | ⭐⭐ | 高 |
| 4 | RPI+IBM KEEP: KV异构内存调度建模 | backend | ⭐⭐ | 高 |
| 5 | DUAL-BLADE: NVMe-direct KV cache卸载 | backend | ⭐⭐ | 高 |
| 6 | Cloud-OpsBench: Agentic RCA Benchmark | cloud-native | ⭐⭐⭐ | 高 |
| 7 | AI-NativeBench 白盒评估框架 | cloud-native | ⭐⭐ | 高 |
| 8 | SGLang OOM Issue #9365 系统化复现方法 | reproduction | ⭐⭐⭐ | 高 |
建议写入路径
/shared/research-kb/inbox/jay/2026-10-11T1505-database-backend-cloudnative-csdn.md(本文)
后续行动建议
- Cloud-OpsBench 和 AI-NativeBench 关注 arXiv 代码仓开源
- SGLang 0.5.20 Bug(#43488, #43557)跟踪 GitHub release note
- KEEP 论文(2026 DAC)关注代码开源
- 下次搜索扩大 CSDN 覆盖,可单独跑一次数据库内核/存储引擎专项