📋 五类简报 · Jay · 2026-10-04 下午版

主题: 推理引擎Benchmark · VectorDB格局 · MCP生态系统演进 · Gemma4生产落地 时间: 2026-10-04 15:05 CST 实例: Jay


一、Database(向量数据库 & 存储)

🔥 高价值条目

1. Vector DB Benchmark 2026 — 10库对比(Salt Technologies,Q1 2026)

  • 来源: https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026
  • 可信度: 高(独立技术公司,CSV/JSON方法论公开,Q1 2026数据)
  • 核心Benchmark数据(1M向量,1536维):
数据库 p50延迟 p99延迟 备注
Qdrant (OSS) 4ms 25ms Rust实现,OSS最快
Redis (OSS) 5ms 20ms 混合工作负载
Milvus (OSS) 6ms 35ms GPU加速版优势
Pinecone (Managed) 8ms 45ms 无冷启动问题
ChromaDB (OSS) 12ms 70ms 不适合超低延迟
Weaviate (OSS) 12ms 65ms GraphQL API
pgvector (OSS) 18ms 90ms SQL集成优势
  • pgvectorscale突破: 50M向量@99%召回,471 QPS — 比Qdrant快11.4倍,与Pinecone s1有竞争力(p95延迟低28倍)
  • Milvus 2.6: 内置BM25全文搜索,吞吐量比Elasticsearch高400%,可合并"ES+向量DB"双系统栈
  • 工程建议:
  • 延迟敏感(<10ms): Qdrant
  • 已有PostgreSQL基础设施: pgvector/pgvectorscale(50M向量以内)
  • 超大规模(10亿+): Milvus
  • 混合检索+GraphQL: Weaviate

2. Vector DB选型决策框架(DigitalApplied,July 2026 Review)

  • 来源: https://www.digitalapplied.com/blog/vector-databases-for-ai-agents-pinecone-qdrant-2026
  • 可信度: 高(独立技术博客,数据交叉验证)
  • 关键洞察:
  • Qdrant p99@10M向量 ≈ 12ms;Weaviate ≈ 16ms;Milvus ≈ 18ms;pgvector ≈ 25-40ms
  • Pinecone冷查询会Spike(40-80ms),适合流量稳定的业务;Qdrant无冷启动问题
  • 2026年新变量: pgvectorscale让pgvector在50M向量规模下具备生产竞争力

评价: VectorDB格局2026年稳定,Qdrant坐稳OSS头把交椅;pgvectorscale是今年最大变量,让PostgreSQL用户无需引入新系统。


二、Backend(推理引擎 & LLM系统)

🔥 高价值条目

3. vLLM vs SGLang vs LMDeploy 2026 Benchmark 全面对比

来源:
- https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - https://www.spheron.network/blog/vllm-vs-sglang-2026 - https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison - https://aimultiple.com/inference-engines

可信度: 高(多家独立Benchmark,方法论可验证,Apr 2026)

核心数据(H100,Llama 3.1 8B):

引擎 吞吐量(50并发) TTFT p50 $ / 1M输出token
SGLang ~16,200 tok/s ~42ms $0.26
vLLM ~12,500 tok/s ~45ms $0.26
TensorRT-LLM — ~54ms $0.30
llama.cpp ~703 tok/s ~98ms $1.38
Ollama ~277 tok/s ~1.7s $3.50

关键工程洞察:

  1. SGLang领先场景: 前缀重用高的负载(Agent多轮对话、系统Prompt、工具定义),RadixAttention缓存命中带来29%吞吐量优势 - 共享前缀80%+时,SGLang的TTFT p50比vLLM低37%(195ms vs 310ms @50并发)

  2. vLLM优势场景: - 唯一Prompt负载(差异仅3-5%) - 生态系统更大(92,700 GitHub stars vs SGLang 36,400,Sep 2026) - 模型支持范围更广

  3. LMDeploy: 量化模型服务性能优秀,是INT4/INT8量化场景的强选

  4. vLLM vs SGLang on Qwen3.8-27B(MoE,Aug 2026): - SGLang: 1,725 tok/s;vLLM: 1,610 tok/s(差7%) - SGLang需要配置state cache才能满速

  5. SGLang 0.4新特性: - 零开销Batch调度器,CPU调度开销从15-25%降至<2% - 对Hybrid Linear-Attention模型(Qwen3.8-27B类)效果更好

  6. 冷启动时间: vLLM ~62s;SGLang ~58s;TensorRT-LLM ~28分钟(需要编译)

工程决策树:

前缀共享率 > 60%?
  → 是:SGLang(RadixAttention优势显著)
  → 否:Unique Prompt为主?
        → 是:vLLM(生态+稳定性)或 SGLang(均可)
        → 规模 > 100B 模型:TensorRT-LLM
        → 本地/CPU:llama.cpp / Ollama

4. Gemma 4 生产落地状态(HF Blog + NVIDIA Forums,2026年持续更新)

  • 发布: 2026年4月2日,Google DeepMind,Apache 2.0
  • 规格: E2B / E4B / 26B-A4B(MoE) / 31B Dense
  • 排名: Gemma 4 31B Arena全球开源模型第3名;26B第6名;超越20倍规模的模型
  • vLLM支持状态: 需要vLLM 0.26.02+(含Transformers v5.5.0+);Gemma4不支持旧vLLM版本
  • NVIDIA NIM: Gemma 4 31B IT NVFP4(Blackwell GPU专用,FP4量化)
  • Unsloth: 提供GGUF和Navi量化变体,支持移动端QAT

工程注意事项: - Gemma 4是2026年边缘/端侧部署的首选开源模型 - E4B/E2B适合移动端和浏览器(Transformers.js支持) - 生产部署建议用26B-A4B MoE版本(性能/算力比最优)


三、Cloud-Native(K8s · 基础设施 · 云原生)

📝 中等价值条目

5. MCP生态系统2026年更新 — 已达生产就绪状态

来源:
- https://www.digitalapplied.com/blog/mcp-adoption-statistics-2026-model-context-protocol - https://workos.com/blog/everything-your-team-needs-to-know-about-mcp-in-2026 - https://blog.agentailor.com/posts/top-ai-agent-protocols-2026

可信度: 高(数据来源Anthropic官方2025-12公告,AAIF捐赠记录)

MCP 2026关键指标(May 2026快照): - 活跃公共服务器:10,000+ - 月SDK下载:97M+(Python + TypeScript) - 17个月内完成React前3年才有的采用规模

客户端支持(全面): Claude、ChatGPT、Cursor、VS Code、Zed、Gemini、GitHub Copilot、Windsurf、Microsoft Copilot

2026新增能力: - MCP Apps(2026年1月): 服务器可返回交互式HTML UI,渲染在沙箱iframe中(仪表盘、表单、可视化),是首个桥接Agent逻辑和嵌入式应用UI的协议 - A2A(Agent2Agent)协议: Google主导,Linux Foundation,Apache-2.0,填补Agent间通信标准空白 - 企业认证(WorkOS): OAuth 2.0 + SSO,成为企业级部署的关键

2026路线图重点(MCP联合创始人David Soria Parra,2026-04): - 传输层演进:无状态HTTP面向超大规模 - 长任务支持和Agent间通信 - 企业就绪 + 跨应用访问控制 - 触发器、流式处理和技能(Skills)层

与其他协议对比: | 协议 | 定位 | 主导方 | |------|------|--------| | MCP | 工具/数据源连接 | Anthropic → AAIF | | A2A | Agent间通信 | Google → Linux Foundation | | ACP(Agent Communication Protocol) | 多Agent协调 | 独立生态 |

评价: MCP已从"可选集成"演化为"Agent生产部署基础设施"。A2A的出现标志多Agent通信标准开始形成。


四、CSDN(高价值工程内容)

本日已有综合CSDN条目(2026-10-04-0820-jay-csdn-highvalue-llm-rag-agent.md),以下为下午补充。

📝 中等价值条目

6. Gemma 4 中文生态落地现状(CSDN/知乎社区,2026年Q3-Q4)

  • 可信度: 中(CSDN/知乎社区帖,需交叉验证)
  • 社区反馈要点:
  • vLLM 0.26.x对Gemma4支持已稳定(需Transformers 5.5+)
  • 26B-A4B MoE版本显存占用优化显著(4bit量化可跑在单卡A100上)
  • 中文Prompt工程需要额外微调(官方中文能力弱于英文)
  • 建议: 不单独归档,作为Gemma4生产注意事项

五、Reproduction(可复现实验 · Benchmark · 命令)

🔥 高价值条目

7. SGLang vs vLLM 前缀缓存验证命令

SGLang启用RadixAttention前缀缓存:

# 启动SGLang,prefix caching默认开启
python -m sglang.launch_server \
  --model-path <model> \
  --port 30000 \
  --mem-fraction-static 0.9 \
  --chunked-prefill-size 8192

# 验证前缀缓存命中
curl http://localhost:30000/metrics | grep prefix_cache

vLLM对比(关闭prefix caching基线):

python -m vllm.entrypoints.openai.api_server \
  --model <model> \
  --port 8000 \
  --gpu-memory-utilization 0.9 \
  --enable-prefix-caching  # 显式开启

批量推理压测脚本(基于ChatBot Arena题目):

# 使用helm scl/llm-benchmarking
from llm_benchmarking import ArenaBenchmarker

benchmarker = ArenaBenchmarker(
    engine="sglang",  # or "vllm"
    model="meta-llama/Llama-3.1-70B-Instruct",
    num_requests=1000,
    concurrency=50,
    dataset="sharegpt"
)
results = benchmarker.run()

8. pgvectorscale 50M向量Benchmark复现

环境: PostgreSQL 16 + pgvectorscale + TimescaleDB
对比: Qdrant v1.17,50M向量,1536维,99%召回率

-- pgvectorscale启用
CREATE EXTENSION vector;
CREATE EXTENSION timescaleDB;

-- 构建索引
CREATE TABLE embeddings (
  id bigserial PRIMARY KEY,
  embedding vector(1536),
  metadata jsonb
);

SELECT create_hnsw_index('embeddings', 'embedding', dim:=1536);
-- 或启用DiskANNProto索引(pgvectorscale专有)

复现结果引用来源: https://www.firecrawl.dev/blog/best-vector-databases
"pgvectorscale achieved 471 QPS at 99% recall on 50M vectors — 11.4x better than Qdrant"

9. Vector DB延迟Benchmark对照表(可剪贴到Runbook)

延迟需求        推荐方案              备注
──────────────────────────────────────────────
<5ms           Qdrant (OSS)          Rust实现
5-15ms         Redis / Milvus(GPU)   稳定性优先
10-30ms         Pinecone (Managed)    免运维
30-50ms         Weaviate / ChromaDB   原型/开发
50ms+           pgvector              SQL集成优先

📦 分类标签

vector-database qdrant pgvectorscale milvus weaviate benchmark-2026 inference-engine sglang vllm lmdeploy tensorrt-llm kvcache prefix-caching radixattention pagedattention moe gemma4 mcp a2a agent-protocol model-context-protocol enterprise-auth


💡 综合洞察

  1. 推理引擎选型2026年10月结论: SGLang在Agent/多轮/前缀重用场景已建立明确优势;vLLM在生态和模型覆盖上仍不可替代;两者差距在unique prompt下可忽略。建议:Agent平台默认SGLang,通用API平台默认vLLM。

  2. VectorDB格局2026年稳定: Qdrant坐稳OSS最低延迟;pgvectorscale是PostgreSQL用户的最大变量(50M向量以内可直接替代专用向量DB)。

  3. MCP生产就绪: 10K服务器+97M月下载标志生态成熟。A2A协议是下一个需要关注的标准化节点,预计2026年底-2027年初进入生产讨论。

  4. Gemma 4生产落地: Apache 2.0+多规格(E2B到31B)+全面框架支持,是2026年端侧/边缘部署首选开源模型。


本简报由 Jay(OpenClaw 实例)生成 · 2026-10-04 15:05 CST 检索来源:Tavily Web Search(Inference Engine Benchmarks, Vector DB Benchmark 2026, MCP Ecosystem 2026, Gemma 4 Production) 不执行GitHub写入;草稿存于 /shared/research-kb/inbox/jay/