Jay · 五分类简报 · 2026-09-17 晚间
实例:Jay | 时间:2026-09-17 21:05 (Asia/Shanghai) 不执行 GitHub 写入 | 如需发布请复制草稿
📌 database
⭐⭐⭐⭐⭐ PostgreSQL pgvectorscale vs Qdrant:50M 向量基准实测
- 来源: Actian 官方博客 · 2026-09 更新
- 标签:
vector-dbpgvectorpgvectorscaleqdrantbenchmark - 核心数据(AWS r6id.4xlarge, 16vCPU 同等硬件): | 指标 | pgvectorscale | Qdrant | 差距 | |------|--------------|--------|------| | 吞吐量 (QPS) | 471.57 | 41.47 | Postgres 高 11.4× | | P95 延迟 | 60.42ms | 36.73ms | Qdrant 快 39% | | P99 延迟 | 74.60ms | 38.71ms | Qdrant 快 48% |
- 关键洞察: 99% recall 下结果;PostgreSQL 在吞吐量上领先 Qdrant 超过 10 倍,但 Qdrant 在尾延迟上明显占优。结论:大多数 RAG 应用(<2M 向量)不需要专用向量数据库,用 pgvector 即可,引入专用 VDB 是规模 >10M 后的选择。
- Instacart 案例: 从 Elasticsearch 迁移到 PostgreSQL,节省 80% 成本,写入负载降低 10 倍。
- 生产连续写入测试: 72 小时连续写入+查询测试(Milvus 团队指出大多数 benchmark 只测索引完成后性能,而生产数据永不停)。
- 评价: ⭐⭐⭐⭐⭐ 高价值生产数据,纠正了"专用向量库一定比 pgvector 快"的误区
⭐⭐⭐⭐⭐ Q2D-Web: Perplexity 1.9 亿文档 Agentic RAG Benchmark
- 来源: Perplexity / explainx.ai · 2026-09-10
- 标签:
agentic-ragbenchmarkvector-dbperplexity - 摘要: 首个覆盖三个生产约束的大规模检索 benchmark:1.9 亿文档语料、7 万 agent 查询、每查询约 100 个密集标签。揭示了 human-query 和 agentic-query 两个分布之间的显著差异。
- 复现建议: 下载数据集 → 跑 RAG pipeline → 对比 NDCG@K / MRR@K / Recall@K → 与 Perplexity 官方数字交叉验证
- 评价: ⭐⭐⭐⭐⭐ Agentic RAG 检索评测标准确立
📌 backend
⭐⭐⭐⭐⭐ SGLang Breakable CUDA Graph:2026 新默认,GPU 成本削减
- 来源: Spheron Blog · 2026-09-06 · 源自 SGLang/LMSYS
- 标签:
sglangcuda-graphinference-engineprefillgpu-optimization - 核心突破:
- Breakable CUDA Graph (BCG) = 2026-02 由 SGLang 原创提出,2026-07 升级为默认 prefill 后端
- 将 CUDA graph 拆分为多个可捕获段,段之间允许 eager execution,避免了 monolithic graph 对动态控制流/JIT 的不兼容
- prefill 阶段 1.7× 加速(与 Meta 联合发布)
- BCG 比 torch.compile 的 piecewise 方法:图构建速度快 3.8-5.2×,代码量减少约 75%
- Full CUDA Graph prefill 对 gpt-oss-120b 达到 1.93× eager 加速
- 42-shape 捕获表在 GLM-5.2 上仅占 2.4 GB
- 生产价值: 如果你在 2026-07 之后升级 SGLang,prefill 执行方式已自动改变。GPU 成本直接下降,无需改代码。
- 命令示例: ```bash # BCG 现在是默认,但可手动指定 python -m sglang.launch_server \ --model-path meta-llama/Llama-3.1-8B-Instruct \ --cuda-graph-backend-prefill breakable
# 强制关闭(如遇 bug) --cuda-graph-backend-prefill=disabled ``` - LMSYS 官方技术博客: Advanced CUDA Graph Techniques in SGLang - 引用: https://github.com/sgl-project/sglang/releases · PR #19102 (BCG 初版), #22218 (prefill 扩展), #29458 (BCG 成为默认) - 评价: ⭐⭐⭐⭐⭐ 2026 年推理引擎最重要的工程默认变更之一
⭐⭐⭐⭐ SGLang vs vLLM 选型决策:2026 最新完整框架
- 来源: Lyceum Technology · 2026-09-10
- 标签:
inference-enginesglangvllm选型 - 核心结论: 选引擎的正确问题不是"哪个最快",而是"哪种权衡匹配你的流量"
- SGLang: 前缀共享型工作负载最优(agent loops、few-shot、JSON 结构化生成);RadixAttention 在 Llama 3.1 8B 前缀密集流量下 16,200 tok/s vs vLLM 12,500 tok/s(+29%);已部署于 400,000+ GPU
- vLLM: 高模型迭代速度 + 多样化开源架构支持;开发体验最优;pip install 即可生产
- TensorRT-LLM: 固定 batch size 编译,延迟最优但灵活性最低
- TGI: 已进入维护模式(2025-12),不再接受新功能 PR
- 决策矩阵: 共享系统 prompt + 短用户回合 → SGLang;每个请求完全独立 → vLLM;bursty 流量 + 动态 batch → vLLM;结构化 JSON 强制约束 → SGLang
- GPU 成本对比(H100 SXM5): SGLang prefix-heavy 负载 $0.44/1M tokens,vLLM (APC on) $0.54/1M tokens
- 评价: ⭐⭐⭐⭐ 工程决策必读,持续更新
⭐⭐⭐⭐ NVIDIA Dynamo 全栈优化 Agentic Inference
- 来源: NVIDIA 官方文档 · 2026-03 发布,2026-06 更新
- 标签:
nvidiadynamokv-cacheagenticinference - 核心数据: Stripe agents 生成 1,300+ PRs/周;Ramp 30% 的合并 PR 来自 agents;Spotify 650+ agent 生成 PR/月;Claude Code 每个 coding session 发出数百个 API 调用,每次都携带完整对话历史
- Dynamo KV Cache 路由: Flash Indexer 实现跨请求的 KV 路由优化;P/D disaggregation 物理层原理
- 背景: 与 IBM Storage Scale 集成,IBM Redbook validated architecture 发布(2026-06)
- 评价: ⭐⭐⭐⭐ NVIDIA 官方 agentic inference 完整栈,基础设施决策参考
📌 cloud-native
⭐⭐⭐⭐ Joint Cooling-Computing Control for LLM Inference in AI Datacenters
- 来源: arXiv cs.LG 新提交 · 2026-09-15
- 标签:
datacenterllm-inferenceenergycloud-native - 摘要: LLM 推理在 AI 数据中心产生耦合控制问题:GPU serving 与设施冷却之间的联合优化。提高环境温度可减少冷却能耗和碳排放,但同时缩小热余量、引发 GPU 降频、导致 SLO 违约。研究联合冷却-计算控制:最小化每任务 GPU+冷却能耗,同时满足热安全和延迟 SLO。
- 可信度: 高(arXiv 学术研究,数据中心方向重要)
- 工程价值: AI 数据中心运营方需关注;延迟 SLO 与能耗优化的权衡是 2026+ 基础设施决策核心变量
📌 csdn
⭐⭐⭐⭐ LangChain 与 LangGraph 深度解析:核心差异、实战代码与场景选型(2026)
- 来源: CSDN ·
weixin_41870061· 2026-07-16 - 标签:
langchainlanggraph选型对比实战代码 - 核心选型矩阵: | 场景 | 推荐 | |------|------| | 单轮问答、简单 RAG | LangChain | | 多轮对话、循环推理 | LangGraph | | 多智能体协作 | LangGraph | | 生产级容错/断点续跑 | LangGraph | | 快速原型验证 | LangChain |
- 安装命令(版本锁定):
bash pip install langchain langchain-openai pip install langgraph pip install langgraph-checkpoint-sqlite - 评价: ⭐⭐⭐⭐ 实战导向,含可直接运行代码片段,版本号明确
⭐⭐⭐⭐ RAG 评估工具对比:LangChain vs LangGraph vs LlamaIndex vs Haystack vs DSPy
- 来源: AIMultiple · 2026-08 更新
- 标签:
ragevaluationlangchainlanggraphllamaindexbenchmark - 核心发现: 用相同组件(GPT-4.1-mini、BGE-small、Qdrant、Tavily)构建同一 agentic RAG workflow,隔离各框架真实 overhead 和 token 效率
- Benchmark 重点: 100 queries,5 框架完整运行;Voyage AI rerank-2.5 比 Cohere Rerank v3.5 在 instruction-following 上高 10-12%
- 复用价值: 框架选型必读,避免被营销数字误导
📌 reproduction
⭐⭐⭐⭐⭐ Tier 1 — 可立即复现
SGLang BCG 性能复现命令
# 检查当前 BCG 默认状态(SGLang ≥0.4.0 自动开启)
python -m sglang.launch_server \
--model-path meta-llama/Llama-3.1-8B-Instruct \
--port 8000
# 手动指定 BCG 后端
--cuda-graph-backend-prefill breakable
# 强制关闭(如遇 OOM 或 bug)
--cuda-graph-backend-prefill=disabled
# 监控指标:prefill latency 变化、GPU 利用率变化
# 对比 benchmark: 1000 ShareGPT prompts
PostgreSQL vs Qdrant 50M 向量复现路径
-- pgvectorscale 基础性能测试
SELECT * FROM vec_bench_run(
dataset_size => 50_000_000,
dimensions => 1536,
metric => 'cosine',
operations => 1000
);
-- 观测: QPS, P95/P99 latency, recall rate
Q2D-Web Agentic RAG Benchmark 复现
- 数据: 190M docs, 70K agent queries, ~100 labels/query
- 路径: 下载数据集 → 跑 RAG pipeline → NDCG@K / MRR@K / Recall@K → 与官方数字交叉验证
分类标签
sglang breakable-cuda-graph bcg inference-engine kv-cache vector-db pgvector pgvectorscale qdrant agentic-rag rag-evaluation langchain langgraph 选型 dynamo nvidia datacenter energy-optimization
本次检索范围
- Tavily 深度搜索 × 5 轮(inference engine、agentic RAG、KV cache、CUDA graph、evaluation)
- Substack 候选来源:The AI Engineer、MarsDevs、AI Mastery Course、FutureAGI
- 学术平台:arXiv cs.LG、cs.CL 今日更新
- 技术博客:Spheron、LMSYS、Actian、AIMultiple、Perplexity
建议写入路径
草稿路径: /shared/research-kb/inbox/jay/2026-09-17T2105-jay-five-category-evening-briefing.md
精读建议:
1. SGLang BCG (Spheron + LMSYS) — 2026 年推理引擎最重要工程默认变更,已有 PR 号可直接追溯代码
2. PostgreSQL vs Qdrant 50M benchmark (Actian) — 纠正"专用向量库一定更快"误区,Instacart 80% 成本节省案例
3. Q2D-Web Benchmark (Perplexity) — agentic RAG 评测标准建立,建议内部建立 comparable benchmark
4. LangChain vs LangGraph 选型矩阵 — 生产选型直接参考
主题页更新建议: - Inference Systems: BCG → SGLang 2026 默认更新,vLLM vs SGLang 决策矩阵 - Vector DB: pgvector vs 专用 VDB 选型决策树(<2M → pgvector,>10M → 专用) - RAG: Q2D-Web benchmark 补充 agentic RAG 评测标准,Voyage AI rerank-2.5 更新
Jay · 2026-09-17 21:05 UTC+8 · Tavily 深度搜索 + 人工筛选 · 不执行 Git 写入