下午简报 · Jay · 2026-07-05 15:05
本次主题
LLM 推理引擎 2026 benchmark · Cloud-Native Stack (eBPF/Wasm/K8s) · PostgreSQL vs MySQL 2026 · Agentic RAG · Substack AI Research 精要
检索范围
- Inference engine: vLLM vs SGLang vs TensorRT-LLM H100 benchmark 2026
- Cloud-native: eBPF + WebAssembly in K8s, Cilium, wasm-bpf
- Database: PostgreSQL vs MySQL 2026, pgvector, vector DB benchmark
- RAG paradigm: Agentic RAG 2026, RAG is dead debate, 20 Advanced RAG Types
- Substack: MiniMax M3, Funda AI Deep|LLM 2026, To Data & Beyond, RSS DS+AI July 2026
- Substack: Future AGI Top 5 Agentic Frameworks, Jam with AI 2026 Roadmap, Clouded Judgement multimodal
候选条目
A. LLM 推理引擎 benchmark · vLLM vs SGLang vs TensorRT-LLM(高价值)
来源: Yotta Labs / Spheron / TechSy / DeployBase / LinkedIn Modular AI 时间: 2026 年 3–6 月(持续更新) 类型: 技术对比 / Benchmark
核心内容(摘要层):
vLLM - H100 80GB FP8 下 Llama 70B ~3,500 tok/s(A100 约 2,500 tok/s) - PagedAttention KV-cache 管理,prefix 共享优,适合高并发短请求 - 生态最大:AWS/GCP/Azure 均支持,社区活跃 - TGI 已进入维护模式(2025-12),HF Inference Endpoints 默认切到 vLLM
SGLang - H100 80GB 单卡 Llama 3.3 70B ~16,200 tok/s(比 vLLM 高约 30%) - RadixAttention(前缀复用)vs PagedAttention:prefix-heavy 负载(多轮 RAG、聊天)TTFT 优势显著 - 结构化输出、多轮对话、RAG pipeline 优化更好 - 生态较小,适合 prefix 密集型生产负载
TensorRT-LLM - NVIDIA 官方,低层 GPU 优化,极限性能 - CUDA 13.1(vLLM/SGLang 用 13.0),需特定容器版本 - 部署复杂度最高,灵活度最低
H100 实测对比(Llama 3.3 70B, FP8)
| 引擎 | 吞吐 | 适用场景 |
|---|---|---|
| vLLM | ~12,500 tok/s(8B@H100) | 通用高并发,最广生态 |
| SGLang | ~16,200 tok/s(8B@H100) | 多轮对话 / RAG / 结构化输出 |
| Modular MAX | emerging | Mojo 内核,高并发密集模型 |
Fish Audio benchmark: SGLang 比 vLLM 吞吐高 16%,p99 TTFT 13.1ms vs 23.6ms(@L40)
迁移指南(来自 TechSy/HuggingFace): - 已有 TGI → 迁移 vLLM 或 SGLang,两者均为 HF 推荐生产选项 - 选 vLLM:需最广硬件支持、最大社区、生产跨云 - 选 SGLang:多轮对话、RAG prefix-heavy、结构化输出,生态接受度 OK
评价: ✅ 工程选型必读,2026 Q2 实测数据,生产决策直接参考 可信度: 高(多家独立 benchmark,HF 官方背书 TGI 迁移路径)
B. Cloud-Native · eBPF + WebAssembly 融合趋势(高价值)
来源: eunomia.dev / Cloud Native Now / Medium (yunwei356) 时间: 2025 年底至 2026 年中 类型: 技术趋势 / 架构
核心内容(摘要层):
wasm-bpf 项目 - 定义一套 eBPF 相关系统接口抽象,提供 WASM 工具链 - 目标:在 K8s 环境中用 WASM 运行时(如 WasmEdge)简化 eBPF 部署 - 核心价值:eBPF 程序可移植、安全沙箱化,解决 eBPF 部署复杂性问题
eBPF 在 Cloud-Native 2.0 的定位 - 零插桩可观测性:无需 sidecar/app 改写,直接内核层捕获 - Istio Ambient Mesh:Tetragon 运行时安全 / Cilium 网络策略 - 性能监控:Pixie(K8s 可观测性)+ eBPF 内核级事件 - 安全:Cilium Network Policy 替代 iptables,粒度更细
WasmEdge + eBPF 集成 - Wasm 的插件模型简化 eBPF 程序部署 - 双重安全:WASM 沙箱 + eBPF 权限校验 - 场景:K8s 环境中增强可观测性、访问控制
Cilium 2026 路线: - eBPF linker、eBPF libraries、dynamic linking 扩展 - Kubernetes CNI 替代传统 iptables 的事实标准
评价: ✅ 云原生基础设施工程选型参考,eBPF 已成为 K8s 网络/安全/可观测性事实标准 可信度: 中高(CNCF 项目 / 活跃开源社区)
C. Database · PostgreSQL vs MySQL 2026 综合对比(高价值)
来源: AI2SQL / Bytebase / Tech-Insider / DEV Community / OneUptime 时间: 2026 年 类型: 技术对比 / 选型指南
核心内容(摘要层):
PostgreSQL 优势(2026 趋势) - JSONB 查询速度比 MySQL 快 3–4x(3.7x 数据来自 Tech-Insider benchmark) - GIN 索引支持 JSON path 索引,嵌套结构查询效率高 - 严格 SQL 标准遵循,窗口函数、CTE、UUID 原生支持 - pgvector 原生向量搜索,生产 AI workload 首选 - 连续 3 年增长最快数据库,云平台默认选项
MySQL 优势(2026 趋势) - 简单读操作仍快 20–35%(MyISAM/InnoDB 分裂历史问题) - WordPress/PHP/电商生态惯性仍强 - JSON 支持改善(5.7+),但二进制存储和索引仍不如 PG JSONB - 8.0+ strict mode 默认开启,存量系统升级有迁移需求
2026 新差异 - Embedding Drift:向量数据库切模型时旧 vectors 失效问题(多模态 embedding 场景) - PostgreSQL 生态扩展性(extension 生态)优势更显著 - AI 集成:PG + pgvector vs MySQL HeatWave(Oracle 云专有)对比
选型决策树: - AI workload / 向量搜索 / 复杂查询 → PostgreSQL - 简单 CRUD / PHP 历史资产 / 云成本敏感 → MySQL - 需要 ACID + JSON + 向量 +GIS → PostgreSQL(无脑选)
评价: ✅ 数据库选型必读,更新到 2026 年数据,JSON/向量性能差异有实测数据支撑 可信度: 高(多源交叉验证,Bytebase 专业 DBA 平台背书)
D. RAG · Agentic RAG 2026 技术范式(高价值)
来源: DataNucleus / Turing Post / Verysell AI / Atlan / Medium 时间: 2026 年 类型: 技术范式综述
核心内容(摘要层):
传统 RAG 的局限 - "Hello World" RAG(PDF 进向量库 → retrieve → generate)2024 年已死(业界共识) - 固定 retrieve→generate 流程,无法处理复杂多跳问题 - 幻觉率高的根源:检索质量不可控、模型无法验证引用
Agentic RAG 核心机制 - 自主规划(Planning):ReAct / Tree-of-Thoughts 推理模式 - 迭代检索:不是一次检索,而是循环验证直到结果可靠 - 工具使用:决定调用哪些工具(搜索/API/计算器) - 多 agent 协作:子 agent 分工检索不同知识源 - 引用验证:强制要求答案附带来源
20 Advanced RAG Types(2026 Turing Post 分类) - 涵盖:Self-RAG、Corrective-RAG、HyDE、Flare、Active RAG 等 - 核心趋势:从"检索后生成"到"边推理边检索"
Enterprise 应用 - McKinsey State of AI 2026:27% 企业 GenAI 输出需人工审核 - Agentic RAG 可将人工审核比例降低(自动化引用验证) - 金融/医疗/法务等强合规场景采纳最积极
RAG vs Long Context(争议) - 部分观点认为 1M token context 足够时 RAG 已死 - 反方:成本 + 延迟 + 检索质量可控性,RAG 仍有价值 - 共识:混合路径(短上下文用 RAG,长任务用 LC)最实际
评价: ✅ Agentic RAG 是 2026 RAG 落地主流范式,工程实践必读 可信度: 中高(行业共识,McKinsey 数据背书)
E. Substack AI Research · 2026 年 7 月精选(高价值线索)
E1. RSS DS+AI Section · July 2026 Newsletter
来源: https://rssdsaisection.substack.com/p/july-2026-newsletter 时间: 2026-07 类型: 研究Newsletter
核心观点摘要: - Recursive Self-Improvement: Anthropic 研究 AI 自主设计下一代 AI,计算力成为瓶颈 - Gemma 4 12B: Google 发布统一多模态模型(无 encoder),encoder-free multimodal - Apple Foundation Models 3rd Gen: Apple 在 iOS/macOS 深度集成,隐私优先推理 - MiniMax M3: 百万 token 上下文 + 原生多模态 + 高效开源权重模型 - Nature 医学研究: 通用大模型 vs 专科医疗 AI——通用模型基准已超越专科工具
评价: ✅ 追踪 Google/Apple/Anthropic/MiniMax 2026 多模态进展,多模态是 2026 年主战场 可信度: 高(RSS DS+AI Section 聚合多家权威机构 newsletter)
E2. Funda AI · Deep|LLM 2026: From Illusion of Model Stagnation to Large-Scale Agent Deployment
来源: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of 时间: 2026-07 类型: 行业分析
核心观点摘要: - 市场从"模型能力停滞"幻觉转向 Agent-driven 真实需求 - 2026 = AI 从"能思考"到"能执行"的拐点年 - Mid-training + RL 的分工模式崛起(pretrain 之外的新阶段) - 长 horizon agents / 多 agent 系统 / 持续学习成工程主流 - 基础设施重新定价:计算、网络、存储需求系统性重估
评价: ✅ 宏观视角好,基础设施投资逻辑清晰,Agent 落地拐点判断值得关注 可信度: 中(付费研究 newsletter,带投资立场)
E3. Future AGI · Top 5 Agentic AI Frameworks to Watch 2026
来源: https://futureagi.substack.com/p/top-5-agentic-ai-frameworks-to-watch 时间: 2026 类型: 框架对比
核心观点摘要: - Gartner:2026 年底 40% 企业应用将内置任务特定 AI agent - 框架选择核心维度:任务分解 / 记忆 / 工具调用 / 错误恢复 / 多 agent 协调 - 5 大框架对比:各有擅长领域,选择标准实际是业务场景匹配
评价: ✅ 框架选型参考,Gartner 数据支撑,2026 agent 落地规模预测 可信度: 中(行业博客,非学术)
E4. To Data & Beyond · LLM Papers Week 12/01–17/01 2026
来源: https://todatabeyond.substack.com/p/important-llm-papers-for-the-week-504 时间: 2026-01(但内容有持续更新) 类型: 论文周报
核心条目: - BABYVISION: MLLM "能力倒置"问题——能解医学考试但不懂幼儿级视觉原语(如物体恒常性) - Social Semantic Entity Segmentation: 武汉大学+高德,卫星影像中社会语义实体(学校/公园/居住区)分割,比物理对象分割难(边界由人类活动定义而非视觉差异)
评价: ✅ 追踪 LLM/MM-LLM 能力边界研究,BABYVISION 对多模态模型评估有方法论价值 可信度: 高(学术论文解读,Ai2/清华等机构论文)
E5. Clouded Judgement · The Year of Multi-Modal (1.23.26)
来源: https://cloudedjudgement.substack.com/p/clouded-judgement-12326-the-year 时间: 2026-01 类型: 行业分析
核心观点: - 2026 年将是多模态 AI 突破年——多个趋势同时收敛 - AI 从"文本框"走向真实人类生活场景 - 多模态推理成本已降至可大规模部署水平
评价: ✅ 多模态是 2026 主轴,判断一致 可信度: 中高(科技投资分析,订阅制高质量 newsletter)
E6. Jam with AI · The 2026 Roadmap: Production AI/ML Systems
来源: https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml 时间: 2026-01 类型: 路线图
核心观点: - 2026 聚焦:System Thinking(ML 系统工程)、Advanced RAG、NLP、RecSys、MLOps - 社区驱动生产级 AI/ML 项目共建 - 重点:缩小"会做模型"和"懂生产决策"之间的 gap
评价: ✅ MLOps 工程化视角好,社区路线图 可信度: 中(社区 newsletter)
高价值条目(精读建议)
| 优先级 | 条目 | 理由 | 行动 |
|---|---|---|---|
| ⭐⭐⭐ | A. vLLM vs SGLang benchmark | 生产推理选型直接参考,多源数据交叉验证 | 精读,整理选型决策树 |
| ⭐⭐⭐ | C. PostgreSQL vs MySQL 2026 | 数据库选型必读,JSON/向量性能有实测数据 | 精读,更新选型指南 |
| ⭐⭐ | B. eBPF + Wasm in K8s | 云原生基础设施趋势,wasm-bpf 新方向 | 泛读,关注落地案例 |
| ⭐⭐ | D. Agentic RAG | 2026 RAG 落地主流范式,工程实践必知 | 精读,补充 20 种 RAG 类型 |
| ⭐⭐ | E1. RSS DS+AI July 2026 | 追踪 Google/Apple/MiniMax/Anthropic 最新多模态进展 | 泛读,追踪 Gemma 4 / MiniMax M3 |
| ⭐ | E2. Funda AI Deep|LLM 2026 | 宏观视角,Agent 落地拐点判断,投资逻辑参考 | 泛读 |
分类标签
database backend cloud-native csdn reproduction inference-engine vllm sglang rag agentic-rag postgresql mysql ebpf wasm kubernetes substack multimodal agentic-ai 2026-trends
建议写入路径
/shared/research-kb/inbox/jay/2026-07-05-1505-afternoon-briefing-database-backend-cloudnative-inference.md
是否需要精读/审稿/主题页更新
- 精读: A (vLLM vs SGLang)、C (PG vs MySQL 2026)、D (Agentic RAG)
- 审稿: 今日简报格式一致性检查
- 主题页更新: Inference Engine 选型页(vLLM/TGI 迁移路径)、PostgreSQL AI Workload 页、Agentic RAG 范式页
Jay · 2026-07-05 15:05 · Asia/Shanghai