五类简报 · Jay · 2026-09-09 晚间版
主题:推理引擎 2026 Benchmark 实战 · Vector DB 选型决策 · MCP/A2A 协议生态 · Agentic RAG 新研究 · CSDN 工程实践
📦 一、Database(向量数据库 / 存储)
✅ 保留 · Qdrant vs Milvus 2026 选型决策指南
来源: Kunal Ganglani (2026-08-17) URL: https://www.kunalganglani.com/blog/milvus-vs-qdrant
核心数据: | 维度 | Qdrant | Milvus | |---|---|---| | 定位 | <5000万向量首选 | 亿级向量、分布式、K8s 原生 | | 延迟(p50) | ~2.1ms | ~18ms | | 延迟(p99) | ~6.3ms | 更高 | | 工程复杂度 | 单进程/Docker,运维轻量 | 需要 Kubernetes 熟练度 | | 过滤查询 | payload index 内置,极快 | 需额外配置 | | Rust 实现 | 是,内存安全 | C++/Go 混合 |
关键结论: - Qdrant:大多数 RAG 团队的正确起点——Rust 实现、单一二进制、payload index 集成过滤查询快。 - Milvus:5000万向量以上,且团队有 K8s 能力时的选择;Reddit 在 3.4亿向量场景验证了其 ingest/query 节点分离架构的优势。 - pgvector 天花板:50-100M 向量可用;超出后 HNSW 索引重建时间成为瓶颈,需迁移至专用向量库。 - 2026 生态数字:Milvus 44k+ GitHub stars,Qdrant 增速最快;MCP 已达 97M 月度 SDK 下载(2026-03)。
评价:工程选型必读。两个维度选型树:规模 <50M 且无专职 MLOps → Qdrant;规模 >100M + 有 K8s 团队 → Milvus。
后续行动:建议纳入 Vector DB 选型决策页面,标注"pgvector 天花板"阈值。
✅ 保留 · Vector DB for AI Agents 2026 八库对比
来源: Digital Applied (2026) URL: https://www.digitalapplied.com/blog/vector-databases-for-ai-agents-pinecone-qdrant-2026
分层概览: | Tier | 代表 | 适用场景 | |---|---|---| | Managed Leader | Pinecone, Vertex Vector | 零运维、规模弹性 | | 开源首选 | Qdrant, Weaviate, Milvus | 自托管、生产 RAG | | Postgres 集成 | Chroma, pgvector | 原型 + ACID 需求 | | 大规模混合 | Vespa | 百亿向量 + 混合检索 |
延迟实测(1M 向量,90% recall): - Pinecone: ~10-15ms - Qdrant: ~2.1ms p50 / ~6.3ms p99(1,200 QPS) - Weaviate: ~16ms - Milvus: ~18ms - pgvector: ~25-40ms(依赖索引类型) - Chroma: ~30ms(非超低延迟优化)
后续行动:补充向量数据库专题页对比表。
⚙️ 二、Backend(推理引擎 / LLM 架构)
✅ 保留 · vLLM vs SGLang vs LMDeploy H100 Benchmark(2026 Q2 实测)
来源: Prem AI / AIMultiple (2026-04,实测更新至 Aug 2026) URL: https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 URL2: https://aimultiple.com/inference-engines
核心数据(H100,Llama 3.1 8B-Instruct,1000 ShareGPT prompts):
| 引擎 | 吞吐量 | 首字延迟(TTFT) | 量化支持 |
|---|---|---|---|
| LMDeploy | 16,200 tok/s | 最佳 | INT4/AWQUP8 |
| SGLang | 16,200 tok/s | ~80ms | FP8/INT4/AWQ/GPTQ |
| vLLM | 12,500 tok/s | ~150ms | FP8/INT4/AWQ/GPTQ |
29% 吞吐量差距的成本:每日百万请求时,月均 GPU 节省约 $15,000(vLLM → SGLang/LMDeploy)。
SGLang vs vLLM 细分场景: - 独立请求(零前缀共享):两者几乎相同,差距仅 2-4%,在 run-to-run 方差范围内。 - 多轮对话 + 共享系统提示:SGLang RadixAttention 前缀复用优势明显(3-5x 缓存命中率提升)。 - 结构化输出(JSON/函数调用):SGLang grammar-cache 行为更激进,重复 schema 的 per-request 开销更低。 - 高并发(>128 并发):vLLM C++ 路由避免 Python GIL 竞争,吞吐量优势在高并发下显现(SGLang GitHub Issue #21061 验证)。
引擎选型决策树:
Agentic / 多轮对话 / 结构化输出 → SGLang
H100 专用集群 + 高并发独立请求 → vLLM + FlashInfer
量化模型服务 / 边缘部署 → LMDeploy
需要最快安装(pip install) + H100 性能 → LMDeploy(99.5% SGLang 峰值)
生产路径:新项目先用 vLLM 快速 MVP;业务复杂度上升(Agent、多轮)再评估迁移 SGLang;多模态场景直接 SGLang。
✅ 保留 · AWS SGLang 推理实践:Benchmark 方法论 + PD 分离
来源: 亚马逊 AWS 官方博客 URL: https://aws.amazon.com/cn/blogs/china/based-on-sglang-large-model-inference-practice
Benchmark 关键指标定义: - TTFT mean/P90:首字时间,目标通常是 mean ≤ Xs,P90 ≤ Ys - TPOT mean/P90/P99:每输出 token 时间,P99 比 mean 更能反映真实用户体验 - TTFT 和 Throughput 矛盾:高并发提升吞吐但恶化 TTFT - PD 分离核心收益:TPOT(P99 改善显著),因为 decode 不被 prefill 抢占
Mooncake TE vs NIXL KV transfer(2P2D 配置,input 100K / output 1K / rate 0.1): | 配置 | 并发 | Output tok/s | Mean TTFT(s) | Mean TPOT(ms) | 成功率 | |---|---|---|---|---|---| | 2P2D + NIXL | 128 | 31.04 | 259 | 50.76 | 100% | | 2P2D + Mooncake TE | 128 | 30.75 | 262 | 50.74 | ~20%(3.4亿向量的实验室数据) |
NCCL alltoall 实测:busbw 比 allreduce 低很多,属于正常(NCCL alltoall 无专用集合通信算法,分解为 N×N 点对点传输)。
评价:中文圈最完整的 SGLang 生产 Benchmark 实践,涵盖方法论、PD 分离调优、NCCL 坑点。建议精读 Section 3(Benchmark 实践要点)。
✅ 保留 · Ken Huang:LLM 推理前沿 10 篇系列(2026 版)
来源: Ken Huang / The AI Engineer URL: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
系列涵盖核心前沿议题: 1. 全局 Radix Tree 与前缀缓存:vLLM/SGLang 动态共享前缀检测,基于 hash 的 token 树,跨会话 system prompt 共享 2. Zhipu KVShare 与层级剪枝:跨层 KV cache 复用、稀疏层缓存、动态 token 驱逐策略(H2O、Scissorhands、StreamingLLM) 3. 低精度 KV Cache 内核:FP8 (E4M3) 和 INT4 量化 KV cache 布局,子通道缩放因子 + Triton 去量化内核 4. 层级存储分层:GPU HBM3e → Host DRAM (CXL) → 本地 PCIe Gen5 NVMe SSD → 分布式对象存储 5. Meson 分布式 KV Store:400Gbps/800Gbps RoCE v2 和 InfiniBand fabric 上的无阻塞 KV 传输 6. 解耦请求调度:基于 prompt cache 命中率和 worker 内存总线余量的动态路由 7. KV Cache 积累困境:推理 traces 连续占用 GPU HBM 数百秒,导致 active batch size 下降和严重内存碎片 8. 动态 Token 预算控制:thinking budget 可编程控制、动态上下文压缩、推测推理分支剪枝、agentic 工作负载的实时 SLA 强制执行
评价:前沿工程方向索引,每个议题都值得单独精读。建议纳入 Inference Engineering 主题页。
☁️ 三、Cloud-Native(K8s / 基础设施 / MLOps)
✅ 保留 · MCP + A2A 协议生态地图 2026
来源: Digital Applied URL: https://www.digitalapplied.com/blog/ai-agent-protocol-ecosystem-map-2026-mcp-a2a-acp-ucp
四协议分层架构: | 协议 | 层级 | 核心功能 | |---|---|---| | MCP | 工具访问层 | 标准化 agent 访问外部系统和资源,发现能力,用结构化 schema | | A2A | Agent 协调层 | Agent 间直接通信和任务委托,支持发现、授权、协商、实时协调 | | ACP | 商业交易层(开放) | Agent 自主与供应商交易结算 | | UCP | 商业交易层(Google 原生) | Google 环境内交易结算 |
关键数字: - MCP 2025-12 捐赠给 Linux Foundation AAIF; Anthropic + OpenAI + Google 联合创始 - 2026-03 MCP 达 97M 月度 SDK 下载(16 个月达到 React npm 包的规模,用了 3 年) - 2026 年主流厂商全部原生支持 MCP:Anthropic、OpenAI、Google、Microsoft、AWS、Cursor、JetBrains - 危险信号:12,000+ MCP 服务器暴露在公网,~40% 完全无认证(Atlan 2026 扫描数据) - 平均接 SaaS 工具到 AI agent 的时间:从 18 小时手工函数调用 → 4.2 小时(MCP)
MCP vs A2A 常见误区: - ❌ "MCP 服务器协调多个 agent" → MCP 只暴露工具,不编排 agent - ❌ "A2A 替代 MCP" → 互补,不是竞争 - ❌ "自己写自定义 HTTP 端点做 agent 通信" → 技术债,标准协议已生产就绪 - ✅ 企业 agent 系统同时使用多个协议,MCP 做工具访问,A2A 做 agent 间协调
后续行动:建议纳入 MCP 专题页安全警告(40% 无认证)。
💻 四、CSDN(中文技术实践)
✅ 保留 · vLLM vs SGLang 中文对比(知乎 + CSDN MCP 技术社区)
来源: 知乎、CSDN MCP 技术社区 URL: https://zhuanlan.zhihu.com/p/1970546252463735868 URL2: https://mcp.csdn.net/6a2e4df2662f9a54cb7eeb74.html
中文实测数据(综合): | 指标 | vLLM | SGLang | |---|---|---| | TTFT | 较低(123ms) | 较高(340ms) | | 吞吐量(单卡) | 35 tok/s | 460 tok/s(高并发时更高) | | 多卡提升 | ~15-25% | ~25-50% | | 缓存复用效率 | 一般 | 高(3-5 倍) |
选型建议表: | 需求场景 | 推荐框架 | 理由 | |---|---|---| | 高并发单轮推理 | vLLM | 低延迟高吞吐,单卡处理上百并发 | | 多轮对话系统 | SGLang | RadixAttention 提升缓存复用 3-5x | | 结构化输出 | SGLang | 正则约束解码,直接生成 JSON/XML | | 大模型多卡部署 | SGLang | 双卡提升 25-50%,跨 GPU 缓存共享 | | 长文本生成 | vLLM | 长上下文支持好(如 Qwen3-32B 131K tokens) |
SGLang 编程优势:函数内部维护状态、调用外部工具、嵌套子任务,适合真正"自主 Agent"。
启动命令对照:
# SGLang
python3 -m sglang.launch_server --model-path /path/model --host 0.0.0.0 --port 30000
# vLLM
python -m vllm.entrypoints.api_server --model /path/model --host 0.0.0.0 --port 8000
✅ 保留 · 阿里云 ACK 部署 vLLM/SGLang 单机推理
来源: 阿里云官方文档 URL: https://help.aliyun.com/zh/ack/cloud-native-ai-suite/user-guide/deploy-standalone-llm-inference-services
部署步骤概览:
1. 创建 ACK GPU 集群(K8s 1.22+)
2. 上传模型至 OSS(ossutil mkdir oss:///Qwen3-32B)
3. 创建 PV/PVC 存储卷
4. 部署 vLLM 或 SGLang Deployment + Service
5. 使用 Service 暴露推理 endpoint
SGLang 后端技术栈: RadixAttention(前缀缓存)+ 零开销 CPU 调度 + PD 分离 + Speculative Decoding + 连续批处理 + PagedAttention + TP/DP/PP/EP 并行 + 结构化输出 + Chunked Prefill + FP8/INT4/AWQ/GPTQ 量化 + 多 LoRA 批处理
vLLM 后端技术栈: PagedAttention + 连续批处理 + CUDA/HIP 图加速 + Chunked Prefill + Speculative Decoding + GPTQ/AWQ/INT4/FP8 量化 + FlashAttention + TP/PP/DP/EP 并行 + OpenAI 兼容 API
评价:中文云原生 AI 部署的标准参考,命令完整。
🔬 五、Reproduction(论文复现 / Benchmark 验证)
✅ 保留 · MC-Search:多模态 Agentic Search Benchmark
来源: arXiv 2603.00873v1 URL: https://arxiv.org/html/2603.00873v1
核心价值:首个评估多模态 Agentic Search(MM-R2)的 Benchmark,覆盖结构化长推理链。
关键发现: - 大多数 Agentic RAG 仍为 text-only,聚焦 multi-hop QA 或科学领域 - MM-R2 将 agentic RAG 扩展到多模态场景,要求逐步验证的推理链 - Baseline 方法:单步 RAG → 两跳变体(图像检索 caption → caption + query → 文本检索第二步) - 数据集覆盖:多模态查询 + 文本查询,step-wise verified 推理链评估
评价:多模态 Agentic RAG 评测方法论参考。建议精读 dataset scope 限制说明。
✅ 保留 · TechRAG:证据门控多模态 Agentic RAG(arXiv 2606.01613)
来源: arXiv:2606.01613 URL: https://arxiv.org/abs/2606.01613
核心贡献:证据门控多模态 RAG,用于技术文献推理。Subject: cs.IR + cs.AI + cs.MA。v2 版本。
评价:技术文献推理场景的 Agentic RAG 新架构,值得关注技术文献 RAG 方向的进展。
✅ 保留 · BRTR:Beyond Rows to Reasoning(Agentic 多模态表格)
来源: arXiv 2603.06503v1 URL: https://arxiv.org/html/2603.06503v1
核心场景:企业电子表格(含复杂表格数据、跨表依赖、嵌入视觉元素)的 Agentic RAG 分析与编辑。
生产优化建议: - Prompt caching:避免跨轮次重复处理 system prompt 和 tool 定义,多轮对话初期 token 主导时效果显著 - Semantic caching:减少重复查询模式的冗余 LLM 调用 - 工具注册表增长时:高效内存管理 + 动态工具选择,防止内存爆炸
评价:Agentic RAG 落地生产场景的具体案例,建议纳入 Agentic RAG 工程实践参考。
✅ 保留 · MM-R2: Reason Before You Retrieve
来源: arXiv 2607.22643 URL: https://arxiv.org/abs/2607.22643
核心思想:多模态 Agentic 检索框架,在检索前先推理,显式建模"检索什么"和"在哪里检索"。
评价:Agentic RAG "先推理后检索"范式的代表性工作,与传统 retrieve-then-generate 的对比值得深入研究。
📋 汇总
| 类别 | 高价值条目数 | 重点 |
|---|---|---|
| Database | 2 | Qdrant/Milvus 选型树,pgvector 天花板阈值 |
| Backend | 3 | vLLM vs SGLang vs LMDeploy Benchmark,AWS SGLang 实践,Ken Huang 10 篇系列 |
| Cloud-Native | 1 | MCP/A2A/ACP/UCP 四层协议,MCP 安全警告 |
| CSDN | 2 | vLLM vs SGLang 中文对比,阿里云 ACK 部署 |
| Reproduction | 4 | MC-Search, TechRAG, BRTR, MM-R2 |
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-09-09T2116-jay-evening-five-category-briefing.md
后续行动
- [ ] Qdrant/Milvus 选型树纳入 Vector DB 专题页
- [ ] MCP 安全警告(12k 公网暴露 + 40% 无认证)纳入 MCP 专题页
- [ ] vLLM vs SGLang 选型树纳入 Inference Engine 专题页
- [ ] BRTR 生产优化建议(prompt caching + semantic caching)纳入 Agentic RAG 工程实践