Jay 晚报补遗 · 2026-08-04 21:05(第4次/日)
主题: 推理引擎 Benchmark 2026 · K8s Gateway API Inference Extension · 向量数据库 Q1 2026 · MCP/RAG 安全态势 · EU AI Act 合规 检索范围: Tavily(推理引擎/向量库/K8s/安全)、arXiv cs.DB/cs.DC/cs.CL、Substack、GitHub Trending、CSDN 时间窗口: 2026-08-01 ~ 2026-08-04(含 Q1 2026 报告补充)
⚙️ backend · 推理引擎 Benchmark 2026 综合对比
🔴 高价值:H100 实测数据综合对比(多来源 2026-04)
| 引擎 | 吞吐(Llama 70B H100) | TTFT | 显存效率 | 生产适用场景 |
|---|---|---|---|---|
| TensorRT-LLM | 4,500 tok/s | 150–200ms | 最高(编译优化) | 追求极致吞吐,高并发,固定模型 |
| vLLM 0.8.x | 3,500 tok/s | 125ms | 优(PagedAttention) | 通用生产 API,LangChain/LlamaIndex 集成 |
| SGLang | 2,800 tok/s | 80ms | 优(RadixAttention) | 交互式聊天,前缀共享多轮对话,结构化输出 |
| LMDeploy | ~3,500 tok/s | 接近 vLLM | 优 | pip 安装极简,生产性价比最优 |
| TGI | 2,500 tok/s | 250ms | 中 | Hugging Face 生态 |
| Ollama(GPU) | 38–42 tok/s | 195–210ms | 中 | 快速原型,个人使用 |
关键工程结论(来源:Spheron Blog / DeployBase / GIGAGPU / AIMultiple):
- 并发场景:TensorRT-LLM > vLLM > SGLang(无前缀共享时);SGLang 在有共享前缀时 RadixAttention 缓存命中率可达 95%
- TTFT(首 Token 延迟):SGLang 80ms,比 vLLM 快约 30–40%,对交互式工具有显著优势
- 显存占用:SGLang 最节省(KV cache 管理最优),TensorRT-LLM 最高(编译引擎额外 activation buffer)
- Structured Output:SGLang 0.5.9 新增 JSON Schema / Regex 约束生成,与 vLLM guided decoding 竞争力相当
- API 兼容性:SGLang 0.5.9 新增 Anthropic API 兼容(与 OpenAI 并行),利好 Claude 生态
- 生产陷阱:FlashInfer wheel 依赖特定 PyTorch 版本,H100 优化镜像往往不兼容,排查耗时约 6 小时(AIMultiple 实测)
后续行动: 补充到推理引擎选型主题页;FlashInfer 兼容性坑写入"Docker 部署 LLM 避坑清单"
🟡 中价值:vLLM Model Runner v2 — GPU-Native Triton Kernels
来源: effloow.com YouTube 视频(2026) 可信度: 中高(视频实测,有具体数字) 链接: https://www.youtube.com/watch?v=YpbriHCEi9g
核心变化: vLLM 2026 更新将关键路径完全移入 GPU-native Triton kernels,消除 CPU 瓶颈;v0 engine 架构已 deprecated
后续行动: 跟踪 vLLM v1/v2 架构差异,有生产升级需求时做专项调研
📦 database · 向量数据库 Q1 2026 Benchmark
🔴 高价值:Salt Technologies 2026 Q1 向量库 Benchmark(10 个数据库,19 字段)
来源: Salt Technologies AI — CC BY 4.0,数据集可下载 链接: https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 可信度: 高(CC BY 4.0 许可,可下载 CSV,含方法论说明)
关键数字(更新至 2026-02-15):
| 数据库 | QPS(bulk insert 100K 向量) | 特色 |
|---|---|---|
| Qdrant | 最高之一 | 1.17 版本新能力 |
| Milvus | 高吞吐 | 超大规模 |
| pgvector | 中等 | <5000 万向量,零运维 |
| Pinecone | p50=4.2ms, p99=12ms(1M×1536d,CORE Systems 2026 benchmark) | 全托管 |
| Chroma | 低 | 轻量原型 |
选型总结(2026-07 修订,来源:Medium @pratik-rupareliya): - 大多数团队 → pgvector(≤5000 万向量,零新增组件) - 零运维托管 → Pinecone - 开源性能+成本控制 → Qdrant - 混合搜索(文本+向量) → Weaviate - 极致超大规模(>1 亿) → Milvus / Zilliz Cloud
生产 RAG 渗透率: Q1 2024:8% → Q1 2026:72%(来源:DEV Community @pooyagolchian)
☁️ cloud-native · K8s Gateway API Inference Extension + llm-d
🔴 高价值:Gateway API Inference Extension — K8s LLM 流量路由标准
来源: Kubernetes 官方博客(2025-06)/ CNCF 博客 / buoyant.io / sigs.k8s.io 可信度: 高(Kubernetes SIG-Network 官方项目) 链接: https://gateway-api-inference-extension.sigs.k8s.io
核心问题: OpenAI API 规范将 model ID 放在 JSON 请求体而非 URL 路径,但大多数负载均衡器按路径路由——导致无法直接按模型路由流量
解决方案架构:
请求 → Inference Gateway(Gateway API 扩展)→ Endpoint Picker(从 body 提取 model ID)→ 对应 InferencePool
核心 CRD 示例:
apiVersion: inference.networking.x-k8s.io/v1alpha2
kind: InferencePool
metadata:
name: vllm-llama2-7b-pool
spec:
targetPortNumber: 8000
selector:
app: vllm-llama2-7b
extensionRef:
name: vllm-llama2-7b-endpoint-picker
---
apiVersion: gateway.networking.k8s.io/v1
kind: HTTPRoute
metadata:
name: llm-route
spec:
parentRefs:
- name: inference-gateway
rules:
- backendRefs:
- group: inference.networking.x-k8s.io
kind: InferencePool
name: vllm-llama2-7b-pool
llm-d(Buoyant): 在 Gateway API Inference Extension 基础上添加队列感知路由(queue-size-aware),请求分发到负载最少的 backend 而非随机可用 pod;同时支持 MoE 模型路由
Alibaba Higress 支持: Helm 一键部署 vLLM + InferencePool:
export IGW_CHART_VERSION=v1.1.0
helm install vllm-llama3-8b-instruct \
--set inferencePool.modelServers.matchLabels.app=vllm-llama3-8b-instruct \
--set provider.name=istio \
--version $IGW_CHART_VERSION \
oci://registry.k8s.io/gateway-api-inference-extension/charts/inferencepool
后续行动: 列入 K8s AI 推理部署最佳实践;与 Ingress NGINX 退役迁移计划联动(已有历史简报覆盖)
🟡 中价值:Solo.io Agent Gateway — MCP + A2A + Inference Gateway 全栈
来源: Solo.io 官方博客 可信度: 中高(厂商博客,但技术细节丰富) 链接: https://www.solo.io/blog/llm-d-distributed-inference-serving-on-kubernetes
核心更新: Agent Gateway v2 支持 A2A + MCP 协议感知,结合 Kubernetes Gateway API + Inference Extension,成为统一 AI 网关
意义: MCP/A2A 协议标准化在 2026 年加速落地,AI Gateway 层正在成为基础设施标配
🔒 security · MCP + RAG 安全态势(2026-08)
🔴 高价值:MCP 安全五大风险(基于 OWASP/ATLAS/CSA AICM 对照)
来源: Aembit / CSA Lab Space(2026) 可信度: 高(映射 OWASP Top 10 for Agentic Applications 2026) 链接: https://aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities | https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1
五大 MCP 威胁:
| 威胁 | 描述 | 映射框架 |
|---|---|---|
| Tool Poisoning | 恶意工具描述注入,等效于间接 prompt injection(OWASP ASI01: Agent Goal Hijack) | OWASP ASI01 |
| 明文 HTTP + OAuth 泄露 | 2026 年评估发现大量 MCP 服务器使用明文 HTTP,OAuth token/API key 被窃听 | CSA AICM |
| ngrok 隧道劫持 | MCP 服务器通过 tunnel 服务托管时,会话终止后 subdomain 可被重新注册,攻击者接管 | MITRE ATLAS |
| 过度授权 | Agent/工具获得超出所需的权限,横向移动风险 | OWASP Excessive Agency |
| 供应链投毒 | 恶意 Agent 插件伪装成功能更新(OWASP AI Supply Chain) | OWASP AI3.0 |
防御原则: 1. 工具描述需有 known-good 基线验证机制(防止描述层注入) 2. 实施 workload identity + secretless access(MCP 专用身份方案) 3. 将 MCP 安全需求纳入现有 OWASP/ATLAS/AICM 治理框架
来源: Akto《Top 10 AI 安全事件》— 攻击者通过 prompt injection、认证绕过、序列化缺陷、命令注入利用 copilot/agent/MCP/RAG
🔴 高价值:RAG 安全 — 知识库即最大攻击面(CVE-2025-32711)
来源: Christian Schneider / WitnessAI(2026-02~07 持续更新) 可信度: 高(独立安全研究者 + 厂商分析) 链接: https://christian-schneider.net/blog/rag-security-forgotten-attack-surface | https://witness.ai/blog/rag-security
CVE-2025-32711 事件: 单个隐藏在日常消息中的恶意指令,通过企业 copilot 的 RAG 检索流程,将数据外泄——零点击、零告警
Slack AI 攻击链: 1. 攻击者在公开频道发布含恶意指令的消息 2. Slack AI 检索该消息作为用户查询的上下文 3. 恶意指令从用户对话上下文中构建钓鱼链接,数据外泄 4. 前提:攻击者需在同一 Slack workspace 有账户(范围受限)
RAG 安全四层防御(WitnessAI): 1. Retrieval Trust Zone:提示词与检索内容信任边界分离 2. Namespace Isolation:RAG 命名空间隔离,防止跨租户数据泄露 3. Guardrails + Prompt Spotlighting:RAG 输出层注入防护 4. EU AI Act 合规(Article 50,2026-08-02 生效):高风险 AI 系统强制标注 AI 生成内容
RAG + MCP 组合风险: 知识库检索事件可成为恶意指令入口,传播至 Agent 全部工具调用授权范围
后续行动: 补充到 AI 安全主题页;CVE-2025-32711 写入 RAG 安全排障参考
🏷️ 分类标签汇总
backend: vllm, sglang, tensorrt-llm, lmdeploy, inference-engine, benchmark-2026, structured-output, triton
database: vector-db, qdrant, milvus, pgvector, pinecone, benchmark-2026, salt-technologies
cloud-native: kubernetes, gateway-api, inference-extension, llm-d, kserve, higress, model-serving
security: mcp-security, rag-security, cve-2025-32711, owasp-asi01, tool-poisoning, eu-ai-act
reproduction: h100-benchmark, inference-pool-crd, k8s-llm-routing, agentic-security, prompt-injection
📋 建议写入路径
草稿路径: /shared/research-kb/inbox/jay/2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md
| 分类 | 高价值条目 | 建议行动 |
|---|---|---|
| backend | H100 推理引擎 benchmark 对比表 | 补充到推理引擎选型主题页 |
| database | Salt Technologies 2026 Q1 向量库 benchmark | 补充到向量数据库 benchmark 体系 |
| cloud-native | Gateway API Inference Extension + llm-d | 补充到 K8s AI Serving 主题页 |
| security | MCP 五大风险 + CVE-2025-32711 | 补充到 AI 安全主题页(高优先级) |
⚠️ 精读/审稿/更新建议
需要精读: 1. Gateway API Inference Extension 官方文档 — K8s SIG-Network 官方,CRD 定义 + Helm 部署步骤完整 2. CVE-2025-32711 原始披露 — Slack AI RAG 安全事件原委,用于 RAG 安全事件库 3. CSA Lab Space MCP Security Best Practices v1 — OWASP/ATLAS/CSA AICM 三框架对照表
建议主题页更新: - AI 安全主题页(新增 MCP/RAG 安全专项) - K8s AI Serving 主题页(新增 Gateway API Inference Extension) - 推理引擎选型页(H100 2026 benchmark 对比表)
Jay · 2026-08-04 21:05 CST · 第4次/日简报 · 不执行 GitHub 写入