Jay · 五分类简报 · 2026-09-17 晚间

实例:Jay | 时间:2026-09-17 21:05 (Asia/Shanghai) 不执行 GitHub 写入 | 如需发布请复制草稿


📌 database

⭐⭐⭐⭐⭐ PostgreSQL pgvectorscale vs Qdrant:50M 向量基准实测

  • 来源: Actian 官方博客 · 2026-09 更新
  • 标签: vector-db pgvector pgvectorscale qdrant benchmark
  • 核心数据(AWS r6id.4xlarge, 16vCPU 同等硬件): | 指标 | pgvectorscale | Qdrant | 差距 | |------|--------------|--------|------| | 吞吐量 (QPS) | 471.57 | 41.47 | Postgres 高 11.4× | | P95 延迟 | 60.42ms | 36.73ms | Qdrant 快 39% | | P99 延迟 | 74.60ms | 38.71ms | Qdrant 快 48% |
  • 关键洞察: 99% recall 下结果;PostgreSQL 在吞吐量上领先 Qdrant 超过 10 倍,但 Qdrant 在尾延迟上明显占优。结论:大多数 RAG 应用(<2M 向量)不需要专用向量数据库,用 pgvector 即可,引入专用 VDB 是规模 >10M 后的选择。
  • Instacart 案例: 从 Elasticsearch 迁移到 PostgreSQL,节省 80% 成本,写入负载降低 10 倍。
  • 生产连续写入测试: 72 小时连续写入+查询测试(Milvus 团队指出大多数 benchmark 只测索引完成后性能,而生产数据永不停)。
  • 评价: ⭐⭐⭐⭐⭐ 高价值生产数据,纠正了"专用向量库一定比 pgvector 快"的误区

⭐⭐⭐⭐⭐ Q2D-Web: Perplexity 1.9 亿文档 Agentic RAG Benchmark

  • 来源: Perplexity / explainx.ai · 2026-09-10
  • 标签: agentic-rag benchmark vector-db perplexity
  • 摘要: 首个覆盖三个生产约束的大规模检索 benchmark:1.9 亿文档语料、7 万 agent 查询、每查询约 100 个密集标签。揭示了 human-query 和 agentic-query 两个分布之间的显著差异。
  • 复现建议: 下载数据集 → 跑 RAG pipeline → 对比 NDCG@K / MRR@K / Recall@K → 与 Perplexity 官方数字交叉验证
  • 评价: ⭐⭐⭐⭐⭐ Agentic RAG 检索评测标准确立

📌 backend

⭐⭐⭐⭐⭐ SGLang Breakable CUDA Graph:2026 新默认,GPU 成本削减

  • 来源: Spheron Blog · 2026-09-06 · 源自 SGLang/LMSYS
  • 标签: sglang cuda-graph inference-engine prefill gpu-optimization
  • 核心突破:
  • Breakable CUDA Graph (BCG) = 2026-02 由 SGLang 原创提出,2026-07 升级为默认 prefill 后端
  • 将 CUDA graph 拆分为多个可捕获段,段之间允许 eager execution,避免了 monolithic graph 对动态控制流/JIT 的不兼容
  • prefill 阶段 1.7× 加速(与 Meta 联合发布)
  • BCG 比 torch.compile 的 piecewise 方法:图构建速度快 3.8-5.2×,代码量减少约 75%
  • Full CUDA Graph prefill 对 gpt-oss-120b 达到 1.93× eager 加速
  • 42-shape 捕获表在 GLM-5.2 上仅占 2.4 GB
  • 生产价值: 如果你在 2026-07 之后升级 SGLang,prefill 执行方式已自动改变。GPU 成本直接下降,无需改代码。
  • 命令示例: ```bash # BCG 现在是默认,但可手动指定 python -m sglang.launch_server \ --model-path meta-llama/Llama-3.1-8B-Instruct \ --cuda-graph-backend-prefill breakable

# 强制关闭(如遇 bug) --cuda-graph-backend-prefill=disabled ``` - LMSYS 官方技术博客: Advanced CUDA Graph Techniques in SGLang - 引用: https://github.com/sgl-project/sglang/releases · PR #19102 (BCG 初版), #22218 (prefill 扩展), #29458 (BCG 成为默认) - 评价: ⭐⭐⭐⭐⭐ 2026 年推理引擎最重要的工程默认变更之一

⭐⭐⭐⭐ SGLang vs vLLM 选型决策:2026 最新完整框架

  • 来源: Lyceum Technology · 2026-09-10
  • 标签: inference-engine sglang vllm 选型
  • 核心结论: 选引擎的正确问题不是"哪个最快",而是"哪种权衡匹配你的流量"
  • SGLang: 前缀共享型工作负载最优(agent loops、few-shot、JSON 结构化生成);RadixAttention 在 Llama 3.1 8B 前缀密集流量下 16,200 tok/s vs vLLM 12,500 tok/s(+29%);已部署于 400,000+ GPU
  • vLLM: 高模型迭代速度 + 多样化开源架构支持;开发体验最优;pip install 即可生产
  • TensorRT-LLM: 固定 batch size 编译,延迟最优但灵活性最低
  • TGI: 已进入维护模式(2025-12),不再接受新功能 PR
  • 决策矩阵: 共享系统 prompt + 短用户回合 → SGLang;每个请求完全独立 → vLLM;bursty 流量 + 动态 batch → vLLM;结构化 JSON 强制约束 → SGLang
  • GPU 成本对比(H100 SXM5): SGLang prefix-heavy 负载 $0.44/1M tokens,vLLM (APC on) $0.54/1M tokens
  • 评价: ⭐⭐⭐⭐ 工程决策必读,持续更新

⭐⭐⭐⭐ NVIDIA Dynamo 全栈优化 Agentic Inference

  • 来源: NVIDIA 官方文档 · 2026-03 发布,2026-06 更新
  • 标签: nvidia dynamo kv-cache agentic inference
  • 核心数据: Stripe agents 生成 1,300+ PRs/周;Ramp 30% 的合并 PR 来自 agents;Spotify 650+ agent 生成 PR/月;Claude Code 每个 coding session 发出数百个 API 调用,每次都携带完整对话历史
  • Dynamo KV Cache 路由: Flash Indexer 实现跨请求的 KV 路由优化;P/D disaggregation 物理层原理
  • 背景: 与 IBM Storage Scale 集成,IBM Redbook validated architecture 发布(2026-06)
  • 评价: ⭐⭐⭐⭐ NVIDIA 官方 agentic inference 完整栈,基础设施决策参考

📌 cloud-native

⭐⭐⭐⭐ Joint Cooling-Computing Control for LLM Inference in AI Datacenters

  • 来源: arXiv cs.LG 新提交 · 2026-09-15
  • 标签: datacenter llm-inference energy cloud-native
  • 摘要: LLM 推理在 AI 数据中心产生耦合控制问题:GPU serving 与设施冷却之间的联合优化。提高环境温度可减少冷却能耗和碳排放,但同时缩小热余量、引发 GPU 降频、导致 SLO 违约。研究联合冷却-计算控制:最小化每任务 GPU+冷却能耗,同时满足热安全和延迟 SLO。
  • 可信度: 高(arXiv 学术研究,数据中心方向重要)
  • 工程价值: AI 数据中心运营方需关注;延迟 SLO 与能耗优化的权衡是 2026+ 基础设施决策核心变量

📌 csdn

⭐⭐⭐⭐ LangChain 与 LangGraph 深度解析:核心差异、实战代码与场景选型(2026)

  • 来源: CSDN · weixin_41870061 · 2026-07-16
  • 标签: langchain langgraph 选型对比 实战代码
  • 核心选型矩阵: | 场景 | 推荐 | |------|------| | 单轮问答、简单 RAG | LangChain | | 多轮对话、循环推理 | LangGraph | | 多智能体协作 | LangGraph | | 生产级容错/断点续跑 | LangGraph | | 快速原型验证 | LangChain |
  • 安装命令(版本锁定): bash pip install langchain langchain-openai pip install langgraph pip install langgraph-checkpoint-sqlite
  • 评价: ⭐⭐⭐⭐ 实战导向,含可直接运行代码片段,版本号明确

⭐⭐⭐⭐ RAG 评估工具对比:LangChain vs LangGraph vs LlamaIndex vs Haystack vs DSPy

  • 来源: AIMultiple · 2026-08 更新
  • 标签: rag evaluation langchain langgraph llamaindex benchmark
  • 核心发现: 用相同组件(GPT-4.1-mini、BGE-small、Qdrant、Tavily)构建同一 agentic RAG workflow,隔离各框架真实 overhead 和 token 效率
  • Benchmark 重点: 100 queries,5 框架完整运行;Voyage AI rerank-2.5 比 Cohere Rerank v3.5 在 instruction-following 上高 10-12%
  • 复用价值: 框架选型必读,避免被营销数字误导

📌 reproduction

⭐⭐⭐⭐⭐ Tier 1 — 可立即复现

SGLang BCG 性能复现命令

# 检查当前 BCG 默认状态(SGLang ≥0.4.0 自动开启)
python -m sglang.launch_server \
  --model-path meta-llama/Llama-3.1-8B-Instruct \
  --port 8000

# 手动指定 BCG 后端
--cuda-graph-backend-prefill breakable

# 强制关闭(如遇 OOM 或 bug)
--cuda-graph-backend-prefill=disabled

# 监控指标:prefill latency 变化、GPU 利用率变化
# 对比 benchmark: 1000 ShareGPT prompts

PostgreSQL vs Qdrant 50M 向量复现路径

-- pgvectorscale 基础性能测试
SELECT * FROM vec_bench_run(
  dataset_size => 50_000_000,
  dimensions => 1536,
  metric => 'cosine',
  operations => 1000
);
-- 观测: QPS, P95/P99 latency, recall rate

Q2D-Web Agentic RAG Benchmark 复现

  • 数据: 190M docs, 70K agent queries, ~100 labels/query
  • 路径: 下载数据集 → 跑 RAG pipeline → NDCG@K / MRR@K / Recall@K → 与官方数字交叉验证

分类标签

sglang breakable-cuda-graph bcg inference-engine kv-cache vector-db pgvector pgvectorscale qdrant agentic-rag rag-evaluation langchain langgraph 选型 dynamo nvidia datacenter energy-optimization


本次检索范围

  • Tavily 深度搜索 × 5 轮(inference engine、agentic RAG、KV cache、CUDA graph、evaluation)
  • Substack 候选来源:The AI Engineer、MarsDevs、AI Mastery Course、FutureAGI
  • 学术平台:arXiv cs.LG、cs.CL 今日更新
  • 技术博客:Spheron、LMSYS、Actian、AIMultiple、Perplexity

建议写入路径

草稿路径: /shared/research-kb/inbox/jay/2026-09-17T2105-jay-five-category-evening-briefing.md

精读建议: 1. SGLang BCG (Spheron + LMSYS) — 2026 年推理引擎最重要工程默认变更,已有 PR 号可直接追溯代码 2. PostgreSQL vs Qdrant 50M benchmark (Actian) — 纠正"专用向量库一定更快"误区,Instacart 80% 成本节省案例 3. Q2D-Web Benchmark (Perplexity) — agentic RAG 评测标准建立,建议内部建立 comparable benchmark 4. LangChain vs LangGraph 选型矩阵 — 生产选型直接参考

主题页更新建议: - Inference Systems: BCG → SGLang 2026 默认更新,vLLM vs SGLang 决策矩阵 - Vector DB: pgvector vs 专用 VDB 选型决策树(<2M → pgvector,>10M → 专用) - RAG: Q2D-Web benchmark 补充 agentic RAG 评测标准,Voyage AI rerank-2.5 更新


Jay · 2026-09-17 21:05 UTC+8 · Tavily 深度搜索 + 人工筛选 · 不执行 Git 写入