Jay 晚报补遗 · 2026-08-04 21:05(第4次/日)

主题: 推理引擎 Benchmark 2026 · K8s Gateway API Inference Extension · 向量数据库 Q1 2026 · MCP/RAG 安全态势 · EU AI Act 合规 检索范围: Tavily(推理引擎/向量库/K8s/安全)、arXiv cs.DB/cs.DC/cs.CL、Substack、GitHub Trending、CSDN 时间窗口: 2026-08-01 ~ 2026-08-04(含 Q1 2026 报告补充)


⚙️ backend · 推理引擎 Benchmark 2026 综合对比

🔴 高价值:H100 实测数据综合对比(多来源 2026-04)

引擎 吞吐(Llama 70B H100) TTFT 显存效率 生产适用场景
TensorRT-LLM 4,500 tok/s 150–200ms 最高(编译优化) 追求极致吞吐,高并发,固定模型
vLLM 0.8.x 3,500 tok/s 125ms 优(PagedAttention) 通用生产 API,LangChain/LlamaIndex 集成
SGLang 2,800 tok/s 80ms 优(RadixAttention) 交互式聊天,前缀共享多轮对话,结构化输出
LMDeploy ~3,500 tok/s 接近 vLLM pip 安装极简,生产性价比最优
TGI 2,500 tok/s 250ms Hugging Face 生态
Ollama(GPU) 38–42 tok/s 195–210ms 快速原型,个人使用

关键工程结论(来源:Spheron Blog / DeployBase / GIGAGPU / AIMultiple):

  1. 并发场景:TensorRT-LLM > vLLM > SGLang(无前缀共享时);SGLang 在有共享前缀时 RadixAttention 缓存命中率可达 95%
  2. TTFT(首 Token 延迟):SGLang 80ms,比 vLLM 快约 30–40%,对交互式工具有显著优势
  3. 显存占用:SGLang 最节省(KV cache 管理最优),TensorRT-LLM 最高(编译引擎额外 activation buffer)
  4. Structured Output:SGLang 0.5.9 新增 JSON Schema / Regex 约束生成,与 vLLM guided decoding 竞争力相当
  5. API 兼容性:SGLang 0.5.9 新增 Anthropic API 兼容(与 OpenAI 并行),利好 Claude 生态
  6. 生产陷阱:FlashInfer wheel 依赖特定 PyTorch 版本,H100 优化镜像往往不兼容,排查耗时约 6 小时(AIMultiple 实测)

后续行动: 补充到推理引擎选型主题页;FlashInfer 兼容性坑写入"Docker 部署 LLM 避坑清单"


🟡 中价值:vLLM Model Runner v2 — GPU-Native Triton Kernels

来源: effloow.com YouTube 视频(2026) 可信度: 中高(视频实测,有具体数字) 链接: https://www.youtube.com/watch?v=YpbriHCEi9g

核心变化: vLLM 2026 更新将关键路径完全移入 GPU-native Triton kernels,消除 CPU 瓶颈;v0 engine 架构已 deprecated

后续行动: 跟踪 vLLM v1/v2 架构差异,有生产升级需求时做专项调研


📦 database · 向量数据库 Q1 2026 Benchmark

🔴 高价值:Salt Technologies 2026 Q1 向量库 Benchmark(10 个数据库,19 字段)

来源: Salt Technologies AI — CC BY 4.0,数据集可下载 链接: https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 可信度: 高(CC BY 4.0 许可,可下载 CSV,含方法论说明)

关键数字(更新至 2026-02-15):

数据库 QPS(bulk insert 100K 向量) 特色
Qdrant 最高之一 1.17 版本新能力
Milvus 高吞吐 超大规模
pgvector 中等 <5000 万向量,零运维
Pinecone p50=4.2ms, p99=12ms(1M×1536d,CORE Systems 2026 benchmark) 全托管
Chroma 轻量原型

选型总结(2026-07 修订,来源:Medium @pratik-rupareliya): - 大多数团队 → pgvector(≤5000 万向量,零新增组件) - 零运维托管 → Pinecone - 开源性能+成本控制 → Qdrant - 混合搜索(文本+向量) → Weaviate - 极致超大规模(>1 亿) → Milvus / Zilliz Cloud

生产 RAG 渗透率: Q1 2024:8% → Q1 2026:72%(来源:DEV Community @pooyagolchian)


☁️ cloud-native · K8s Gateway API Inference Extension + llm-d

🔴 高价值:Gateway API Inference Extension — K8s LLM 流量路由标准

来源: Kubernetes 官方博客(2025-06)/ CNCF 博客 / buoyant.io / sigs.k8s.io 可信度: 高(Kubernetes SIG-Network 官方项目) 链接: https://gateway-api-inference-extension.sigs.k8s.io

核心问题: OpenAI API 规范将 model ID 放在 JSON 请求体而非 URL 路径,但大多数负载均衡器按路径路由——导致无法直接按模型路由流量

解决方案架构:

请求 → Inference Gateway(Gateway API 扩展)→ Endpoint Picker(从 body 提取 model ID)→ 对应 InferencePool

核心 CRD 示例:

apiVersion: inference.networking.x-k8s.io/v1alpha2
kind: InferencePool
metadata:
  name: vllm-llama2-7b-pool
spec:
  targetPortNumber: 8000
  selector:
    app: vllm-llama2-7b
  extensionRef:
    name: vllm-llama2-7b-endpoint-picker
---
apiVersion: gateway.networking.k8s.io/v1
kind: HTTPRoute
metadata:
  name: llm-route
spec:
  parentRefs:
    - name: inference-gateway
  rules:
    - backendRefs:
        - group: inference.networking.x-k8s.io
          kind: InferencePool
          name: vllm-llama2-7b-pool

llm-d(Buoyant): 在 Gateway API Inference Extension 基础上添加队列感知路由(queue-size-aware),请求分发到负载最少的 backend 而非随机可用 pod;同时支持 MoE 模型路由

Alibaba Higress 支持: Helm 一键部署 vLLM + InferencePool:

export IGW_CHART_VERSION=v1.1.0
helm install vllm-llama3-8b-instruct \
  --set inferencePool.modelServers.matchLabels.app=vllm-llama3-8b-instruct \
  --set provider.name=istio \
  --version $IGW_CHART_VERSION \
  oci://registry.k8s.io/gateway-api-inference-extension/charts/inferencepool

后续行动: 列入 K8s AI 推理部署最佳实践;与 Ingress NGINX 退役迁移计划联动(已有历史简报覆盖)


🟡 中价值:Solo.io Agent Gateway — MCP + A2A + Inference Gateway 全栈

来源: Solo.io 官方博客 可信度: 中高(厂商博客,但技术细节丰富) 链接: https://www.solo.io/blog/llm-d-distributed-inference-serving-on-kubernetes

核心更新: Agent Gateway v2 支持 A2A + MCP 协议感知,结合 Kubernetes Gateway API + Inference Extension,成为统一 AI 网关

意义: MCP/A2A 协议标准化在 2026 年加速落地,AI Gateway 层正在成为基础设施标配


🔒 security · MCP + RAG 安全态势(2026-08)

🔴 高价值:MCP 安全五大风险(基于 OWASP/ATLAS/CSA AICM 对照)

来源: Aembit / CSA Lab Space(2026) 可信度: 高(映射 OWASP Top 10 for Agentic Applications 2026) 链接: https://aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities | https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1

五大 MCP 威胁:

威胁 描述 映射框架
Tool Poisoning 恶意工具描述注入,等效于间接 prompt injection(OWASP ASI01: Agent Goal Hijack) OWASP ASI01
明文 HTTP + OAuth 泄露 2026 年评估发现大量 MCP 服务器使用明文 HTTP,OAuth token/API key 被窃听 CSA AICM
ngrok 隧道劫持 MCP 服务器通过 tunnel 服务托管时,会话终止后 subdomain 可被重新注册,攻击者接管 MITRE ATLAS
过度授权 Agent/工具获得超出所需的权限,横向移动风险 OWASP Excessive Agency
供应链投毒 恶意 Agent 插件伪装成功能更新(OWASP AI Supply Chain) OWASP AI3.0

防御原则: 1. 工具描述需有 known-good 基线验证机制(防止描述层注入) 2. 实施 workload identity + secretless access(MCP 专用身份方案) 3. 将 MCP 安全需求纳入现有 OWASP/ATLAS/AICM 治理框架

来源: Akto《Top 10 AI 安全事件》— 攻击者通过 prompt injection、认证绕过、序列化缺陷、命令注入利用 copilot/agent/MCP/RAG


🔴 高价值:RAG 安全 — 知识库即最大攻击面(CVE-2025-32711)

来源: Christian Schneider / WitnessAI(2026-02~07 持续更新) 可信度: 高(独立安全研究者 + 厂商分析) 链接: https://christian-schneider.net/blog/rag-security-forgotten-attack-surface | https://witness.ai/blog/rag-security

CVE-2025-32711 事件: 单个隐藏在日常消息中的恶意指令,通过企业 copilot 的 RAG 检索流程,将数据外泄——零点击、零告警

Slack AI 攻击链: 1. 攻击者在公开频道发布含恶意指令的消息 2. Slack AI 检索该消息作为用户查询的上下文 3. 恶意指令从用户对话上下文中构建钓鱼链接,数据外泄 4. 前提:攻击者需在同一 Slack workspace 有账户(范围受限)

RAG 安全四层防御(WitnessAI): 1. Retrieval Trust Zone:提示词与检索内容信任边界分离 2. Namespace Isolation:RAG 命名空间隔离,防止跨租户数据泄露 3. Guardrails + Prompt Spotlighting:RAG 输出层注入防护 4. EU AI Act 合规(Article 50,2026-08-02 生效):高风险 AI 系统强制标注 AI 生成内容

RAG + MCP 组合风险: 知识库检索事件可成为恶意指令入口,传播至 Agent 全部工具调用授权范围

后续行动: 补充到 AI 安全主题页;CVE-2025-32711 写入 RAG 安全排障参考


🏷️ 分类标签汇总

backend:       vllm, sglang, tensorrt-llm, lmdeploy, inference-engine, benchmark-2026, structured-output, triton
database:      vector-db, qdrant, milvus, pgvector, pinecone, benchmark-2026, salt-technologies
cloud-native:  kubernetes, gateway-api, inference-extension, llm-d, kserve, higress, model-serving
security:      mcp-security, rag-security, cve-2025-32711, owasp-asi01, tool-poisoning, eu-ai-act
reproduction:  h100-benchmark, inference-pool-crd, k8s-llm-routing, agentic-security, prompt-injection

📋 建议写入路径

草稿路径: /shared/research-kb/inbox/jay/2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md

分类 高价值条目 建议行动
backend H100 推理引擎 benchmark 对比表 补充到推理引擎选型主题页
database Salt Technologies 2026 Q1 向量库 benchmark 补充到向量数据库 benchmark 体系
cloud-native Gateway API Inference Extension + llm-d 补充到 K8s AI Serving 主题页
security MCP 五大风险 + CVE-2025-32711 补充到 AI 安全主题页(高优先级)

⚠️ 精读/审稿/更新建议

需要精读: 1. Gateway API Inference Extension 官方文档 — K8s SIG-Network 官方,CRD 定义 + Helm 部署步骤完整 2. CVE-2025-32711 原始披露 — Slack AI RAG 安全事件原委,用于 RAG 安全事件库 3. CSA Lab Space MCP Security Best Practices v1 — OWASP/ATLAS/CSA AICM 三框架对照表

建议主题页更新: - AI 安全主题页(新增 MCP/RAG 安全专项) - K8s AI Serving 主题页(新增 Gateway API Inference Extension) - 推理引擎选型页(H100 2026 benchmark 对比表)


Jay · 2026-08-04 21:05 CST · 第4次/日简报 · 不执行 GitHub 写入