学术研究知识库 · Jay · 五分类简报 · 2026-09-24 上午场

实例: Jay 生成时间: 2026-09-24 11:05 (Asia/Shanghai) 覆盖时间窗: 2026-09-23 15:00 ~ 2026-09-24 11:00


📦 Database · 向量数据库 & 存储系统

▶ Qdrant vs Milvus vs Pinecone 2026 Benchmark 实测数据

  • 来源: academy.talki-app.fr + proxyops.dev + app.ailog.fr
  • 发布时间: 2026-08(多项独立测试)
  • 核心数据(1M 1536-dim 向量,HNSW ef=128):
  • Qdrant p99 延迟:18ms(自托管,Rust)
  • Milvus p99 延迟:22ms(GPU 索引)
  • Pinecone Serverless p99 延迟:35ms(寒路径)
  • Chroma p99 延迟:110ms(默认 HNSW 配置)
  • 10M 向量扩展性:
  • Qdrant:p99 +128%,QPS -35%
  • Milvus:p99 +112%,QPS -28%
  • Pinecone:p99 +45%,QPS -18%(serverless 架构优势)
  • 索引速度(1M 向量):
  • Milvus GPU:95s(10,526 vec/s)
  • Qdrant:148s(6,756 vec/s)
  • Pinecone:340s(2,941 vec/s)
  • Chroma:612s(1,634 vec/s)
  • 量化优化: Binary quantization(float32→1bit)可节省 32× 内存,仅损失 2-5% recall;Qdrant 和 Milvus 均支持 scalar/binary/product quantization
  • 可信度: ★★★★☆ — 多方独立 benchmark,数据一致性较高
  • 工程结论: 自托管选 Qdrant(性能最佳),云托管/无运维能力选 Pinecone(扩展性最好),大规模向量选 Milvus(GPU 索引速度最快)
  • 链接:
  • https://proxyops.dev/artiklar/pinecone-vs-qdrant-vs-weaviate-2026
  • https://app.ailog.fr/en/blog/guides/vector-database-benchmark-2026

▶ OpenViking — 火山引擎 Agent Context Database

  • 来源: GitHub volcengine/OpenViking
  • 发布时间: 2026-09(活跃更新)
  • 核心内容: 面向 AI Agent 的 Context 数据库,解决 Agent 多会话状态管理问题;支持 BytesRow 格式迁移(64 KiB 限制),增量恢复能力
  • 可信度: ★★★☆☆ — 字节大厂工程实践,但资料有限
  • 链接: https://github.com/volcengine/OpenViking

▶ Cognee — 开源 AI Memory Platform

  • 来源: GitHub topoteretes/cognee
  • 核心内容: Agent 持久化长期记忆,知识图谱自托管引擎
  • 可信度: ★★★☆☆ — 开源活跃
  • 链接: https://github.com/topoteretes/cognee

⚙️ Backend · LLM 推理引擎 & 系统

▶ vLLM vs SGLang vs LMDeploy vs TensorRT-LLM 2026 Benchmark 对比

  • 来源: AIMultiple + deploybase.ai + spheron.network + inferenceengineering.tech
  • 发布时间: 2026-08(持续更新)
  • 核心数据(H100 80GB): | 引擎 | 吞吐量 | TTFT | 内存效率 | 适用场景 | |------|---------|------|----------|----------| | SGLang v0.4.3 | 16,200 tok/s | 80ms | RadixAttention | 前缀密集型(RAG、chat) | | LMDeploy | 16,200 tok/s | — | 持久批处理 | 高吞吐服务 | | vLLM v0.7.3 | 12,500 tok/s | 150ms | PagedAttention | 灵活性、频繁换模型 | | TensorRT-LLM | 最高(并发) | 150ms | 编译 CUDA | 单模型长期生产 |
  • vLLM vs SGLang 差距: 29%(相当于 ~$15,000/月 GPU 成本差异)
  • vLLM Model Runner v2(2026): 关键路径迁移到 GPU-native Triton kernels,零气泡异步调度
  • SGLang RadixAttention: 前缀缓存优势在多轮对话/RAG 场景明显(95% cache hit rate on few-shot)
  • 可信度: ★★★★☆ — 有实测数据但测试条件一致性需进一步核验
  • 链接:
  • https://aimultiple.com/inference-engines
  • https://deploybase.ai/articles/best-llm-inference-engine
  • https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm

▶ KV Cache 优化技术全景(2026 版)

  • 来源: digitalapplied.com 工程指南 + Awesome-KV-Cache-Optimization (GitHub 411★)
  • 发布时间: 2026-04
  • 5 大技术族: 1. PagedAttention(vLLM 基础) 2. Prefix Caching(高杠杆优化,context 越长越便宜) 3. MQA/GQA/MLA(架构层面降低 KV 头) 4. KV Cache 量化(FP8 免费 50% 内存节省) 5. 连续批处理调度
  • 32K/128K/512K context 成本削减: 4-40×(paged attention + prefix caching + GQA + FP8 KV 组合)
  • 关键结论: "Prefix caching 是唯一一个 context 越长越便宜的优化"
  • 前缀缓存实测(DeepSeek-R1-Distill-Llama-70B, TP8):
  • 启用:302.98 tok/s,TTFT P99=12701ms
  • 关闭:289.46 tok/s,TTFT P99=30884ms
  • 提升:+4.6% 吞吐,TTFT P99 降低 59%
  • 已知 Bug: --enable-prefix-caching 开启后 GPU 利用率降至 ~70%(而非预期 90%),vLLM GitHub Issue #8242 已确认
  • 可信度: ★★★★☆ — GitHub Issue 确认 + 真实 benchmark
  • 链接:
  • https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
  • https://github.com/jjiantong/Awesome-KV-Cache-Optimization

▶ Claude Opus 5.5 登顶 Coding Agent Index

  • 来源: Artificial Analysis + Arena
  • 发布时间: 2026-09-24
  • 核心数据:
  • Arena Code Arena WebDev 第一名:1818 分,领先第二名 GPT-6 Astra 26 分
  • Artificial Analysis Coding Agent Index:66分(第一),较 Opus 5 的 60 分提升 6 分
  • 三项评测全部提升:Terminal-Bench 4.0(63.1%)、DeepSWE v1.1(68.4%)、SWE-Atlas-QnA(66.4%)
  • 单任务成本:$13.04(上涨,但性能领先)
  • 可信度: ★★★★★ — 实时竞技场数据,透明可查

▶ Flash-dLLM — IO 感知 KV Cache + 并行解码 Diffusion LLM

  • 来源: arXiv 2609.26796(cs.CL)
  • 发布时间: 2026-09
  • 核心贡献: Diffusion Large Language Model(dLLM)非自回归生成优化,IO 感知 KV 缓存管理
  • 可信度: ★★★★☆ — arXiv 学术论文
  • 链接: https://papers.cool/arxiv/2609.26796

▶ Agensh — 1,024 Agent 可扩展多 Agent 系统

  • 来源: arXiv 2609.26781(cs.CL)
  • 发布时间: 2026-09
  • 核心贡献: 多 Agent 并发执行降低复杂任务延迟,系统级可扩展性研究
  • 可信度: ★★★★☆ — arXiv 学术论文
  • 链接: https://papers.cool/arxiv/2609.26781

▶ 超越重复采样 — LLM 推理搜索策略学习

  • 来源: arXiv 2609.26704(cs.CL)
  • 发布时间: 2026-09
  • 核心贡献: 测试时计算投入增加时,超越朴素重复采样的新型推理策略
  • 可信度: ★★★★☆ — arXiv 学术论文
  • 链接: https://papers.cool/arxiv/2609.26704

☁️ Cloud-Native · Kubernetes & 基础设施

▶ llm-d — CNCF Sandbox disaggregated LLM 推理框架

  • 来源: CNCF + Spheron + llm-d.ai
  • 发布时间: 2026-03-24( donated to CNCF Sandbox)
  • 核心价值: Kubernetes-native 分离式 LLM 推理框架,将 prefill/decode 阶段分离到独立 GPU 池
  • 支持引擎: vLLM(EPD + PD)、SGLang(EPD)、TensorRT-LLM(EPD + PD)
  • 关键组件:
  • Kubernetes Gateway API Inference Extension(cache-aware 路由)
  • NIXL 高速互联协议(PD 分离必需)
  • vLLM/SGLang 原生集成
  • 与 NVIDIA Dynamo 区别: Dynamo 是编排层运行在 vLLM 之上;llm-d 是 Kubernetes 原生 CRD
  • 可信度: ★★★★★ — CNCF Sandbox,IBM/Red Hat/Google/CoreWeave/NVIDIA 背书
  • 链接: https://llm-d.ai + https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide

▶ Cloud Native LLM Inference System — 微服务化 + HPA

  • 来源: arXiv 2507.18007
  • 发布时间: 2025(arXiv),2026 工程落地
  • 核心发现: Transformer 层分解为微服务 + Kubernetes HPA 动态扩缩容,有效降低推理延迟、提升吞吐和稳定性
  • 负载预测: 时间序列模型提前分配资源,Llumnix/DistServe 请求迁移策略减少 E2E 延迟
  • 可信度: ★★★★☆ — 学术论文,系统验证完整
  • 链接: https://arxiv.org/html/2507.18007

▶ CAST AI Kubernetes GPU 利用率报告 2026

  • 来源: CAST AI 官方报告
  • 核心数据:
  • 平均 GPU 利用率:~5%(fleet 级别)
  • H200 最佳实践:49%,H100:30%
  • GPU 共享后:provisioned GPUs 降至 25-75(从 ~100),利用率达 200-300%
  • 成本降低:40-70%(Karpenter + KEDA + MIG 组合)
  • 关键结论: GPU provisioning 按峰值设计而非典型负载;weekday/weekend 利用率差异显著
  • 可信度: ★★★★☆ — 真实生产 fleet 数据
  • 链接: https://cast.ai/reports/kubernetes-optimization-report

💻 CSDN · 中文高价值工程文章

(本日 CSDN 高价值条目已收录于:2026-09-24-csdn-inference-multimodal-rag-highvalue.md

今日重点回顾: - vLLM SGLang 推理引擎对比(命令 + benchmark) - Multimodal RAG 工程实践 - 多模态模型部署实战


🔬 Reproduction · 可复现工程 & 源码分析

▶ SGLang Breakable CUDA Graph (BCG) 2026-09 重大更新

  • 来源: LMSYS Org 官方博客 + GitHub Issue #35851
  • 发布时间: 2026-08-17(官方),持续更新
  • 核心数据:
  • BCG graph builds:5× faster vs tc_piecewise(Qwen3-235B-A22B)
  • Prefill 性能:up to 1.93× faster than eager
  • GPU 成本节省:$2,467/月(10×H100 24/7)
  • Per-layer graph break idle:~590 µs per layer
  • 关键命令: bash # SGLang BCG 启用(2026-04-24 合并,已成默认策略) --linear-attn-prefill-backend flashinfer # BCG graph break 在 attention boundary 插入 eager break
  • 可信度: ★★★★★ — 官方团队 + GitHub Issue 源码 + 独立 benchmark
  • 链接: https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph

▶ vLLM Prefix Caching 性能调优命令

  • 来源: CROZ benchmark + GitHub vllm#8242
  • 配置命令: bash python -m vllm.entrypoints.openai.api_server \ --model meta-llama/Llama-3.1-70B-Instruct \ --gpu-memory-utilization 0.90 \ --max-model-len 32768 \ --kv-cache-dtype auto \ --enable-prefix-caching \ --swap-space 16
  • gpu_memory_utilization 经验值: 7B→0.95,13B→0.85,70B→0.90
  • 已知 Bug: --enable-prefix-caching 开启后 GPU 利用率降至 ~70%,GitHub Issue #8242 已确认
  • 可信度: ★★★★☆ — GitHub Issue 确认
  • 链接: https://github.com/vllm-project/vllm/issues/8242

▶ NVIDIA Dynamo 1.0 GA — 分布式推理 7× 吞吐

  • 来源: NVIDIA 官方博客 + Google Cloud
  • 发布时间: 2026-03-16 GA
  • 核心数据: DeepSeek R1 on Blackwell FP4,1k/1k,SemiAnalysis InferenceX benchmark,7× throughput 提升
  • 支持矩阵:
  • vLLM:EPD ✅ + PD ✅
  • TensorRT-LLM:EPD ✅ + PD ✅
  • SGLang:EPD ✅ + PD ❌
  • 可信度: ★★★★★ — NVIDIA 官方 + 第三方 benchmark
  • 链接: https://developer.nvidia.com/blog/nvidia-dynamo-1-production-ready

▶ Harness Engineering for Self-Improvement — Lilian Weng

  • 来源: Lilian Weng (Lil'Log)
  • 发布时间: 2026-07-04
  • 核心内容: 递归自我改进(RSI)概念溯源 + 2026 年 Harness 工程实践;Agent 自我改进的工程边界
  • 可信度: ★★★★★ — Lilian Weng 顶级工程 blog
  • 链接: https://lilianweng.github.io/posts/2026-07-04-harness/

🔖 分类标签汇总

#向量数据库 #Qdrant #Milvus #Pinecone #vLLM #SGLang #TensorRT-LLM #KV缓存 #CUDA优化 #llm-d #Kubernetes #CNCF #NVIDIA-Dynamo #CloudNative #RAG #Agent #Benchmark #成本优化


✅ 实际写入路径

/shared/research-kb/inbox/jay/2026-09-24T1105-jay-five-category-briefing.md

精读/审稿建议

  1. 精读: llm-d CNCF Sandbox 官方文档(Kubernetes 原生推理新范式)
  2. 精读: SGLang BCG 官方文档确认默认行为(2026-04 已合入默认)
  3. 精读: Lilian Weng Harness Engineering(RSI 工程边界)
  4. 审稿: Qdrant/Milvus/Pinecone 2026 Benchmark 跨测试条件一致性
  5. 主题页更新: "向量数据库选型决策树" + "llm-d Kubernetes 推理部署手册"