研究简报 · Jay · 2026-07-10 下午

主题

LLM 推理引擎格局(TGI 退场)· Foundry × Hugging Face 部署整合 · LLM 生成 GPU Kernel 新进展 · AI Agent Stack 2026 · OWASP AI 安全

检索范围

  • Tavily Web Search: vLLM SGLang 2026 update, GitHub trending AI, Microsoft Foundry HF, arXiv kernel optimization, Substack AI agents/RAG/inference, CSDN 推理引擎对比

🤖 LLM 推理引擎格局

[1] TGI 正式退场(2025 年 12 月)——选型框架固化

来源: Hugging Face 官方 & 多方 benchmark
可信度: 高 — HF 官方维护模式公告 + 行业广泛验证
链接: https://www.spheron.network/blog/migrate-tgi-to-vllm-sglang-2026

摘要:
Hugging Face 于 2025 年 12 月正式将 TGI 置于维护模式(maintenance mode),官方文档已引导用户迁移至 vLLM 或 SGLang。Inference Endpoints 现在默认使用 vLLM。2026 年推理引擎正式形成四选一格局:

引擎 核心定位 硬件 上手难度 适用场景
vLLM 生态最广,稳定优先 NVIDIA (V100+)、AMD ROCm 通用生产,V100 遗留环境
SGLang 吞吐领先,多轮对话优化 NVIDIA H100/A100 优先 多轮 RAG、Agent、prefix-heavy
TensorRT-LLM 极致 p95 延迟 NVIDIA A100/H100 高(编译链复杂) 大规模在线,硬 SLA
llama.cpp 本地/边缘/量化 CPU / 消费级 GPU 本地部署、边缘设备

评价: TGI 退场是 2026 年推理领域的标志性事件。vLLM 稳坐综合第一,SGLang 在吞吐和多轮场景有明显优势。选型原则:先用 vLLM 跑通业务,按实测瓶颈升级(TGI → vLLM/SGLang 已成历史包袱)。

标签: LLM-Inference vLLM SGLang TensorRT-LLM llama.cpp TGI-Deprecation 建议路径: docs/inference/llm-engine-comparison-2026/


[2] SGLang 重大更新(2026 Q1-Q2):GB300 NVL72 25x 提速

来源: SGLang GitHub README & 官方博客
可信度: 高 — 官方发布,含具体 benchmark 数字
链接: https://github.com/sgl-project/sglang

摘要: SGLang 近期里程碑: - 2026/04:DeepSeek-V4 Day 0 支持,集成 Miles RL 验证框架 - 2026/02:NVIDIA GB300 NVL72 上实现 25x 推理提速(博客专项报告) - 2026/02:SGLang-Jax 后端发布,原生支持 TPU(不再只限 NVIDIA) - SGLang 在 H100 Llama 3.1 8B 上实测约 16,200 tok/s,比 vLLM 高约 29% - 2025/12 起支持 MiMo-V2-Flash、Nemotron 3 Nano、Mistral Large 3、LLaDA 2.0 Diffusion LLM、MiniMax M2

评价: SGLang 扩展至 TPU 是重大生态突破;GB300 NVL72 数据令人印象深刻,但需注意这是搭配 DeepSeek-V4 的联合优化,非通用数字。

标签: SGLang DeepSeek TPU GB300 inference-throughput 建议路径: docs/inference/sglang-updates-2026/ 是否需要精读: ⚠️ GB300 25x 声明需核验原始博客数据


[3] vLLM 最新发布:DeepSeek-V4 优化 & MRv2 量化支持

来源: vLLM GitHub Releases
可信度: 高 — 官方 Release Notes,含 commit 引用
链接: https://github.com/vllm-project/vllm/releases

摘要: vLLM 近期高价值更新(来自 Release Notes 摘要): - MiniMax-M3 全面支持:MXFP4、FP8 sparse GQA、AMD/ROCm 深度调优(gfx950 MI300X) - DeepSeek-V4 优化:FlashInfer sparse index cache(2-4% TTFT 提升)、prefill chunk-planning(4% E2E 吞吐)、contiguous per-block KV allocations、TEP=16 for block-FP8 shared expert - Model Runner V2 (MRv2):默认支持量化模型、DFlash 投机解码、更精确的 FP32 Gumbel sampling - Streaming Parser Engine:统一解析 Qwen3、MiniMax-M2、GLM-4.7/5.1/5.2、Nemotron V3 的 tool-call/reasoning

评价: vLLM 在 DeepSeek-V4 上的优化密度极高(FlashInfer sparse cache + chunk-planning 是已知最优组合);MRv2 量化模型默认支持是生产部署的重要里程碑。

标签: vLLM DeepSeek-V4 MRv2 speculative-decoding quantization 建议路径: docs/inference/vllm-releases-2026/ 是否需要审稿: ✅ 是(Release Notes 质量高,建议直接引用)


[4] SGLang vs vLLM vs LMDeploy vs TensorRT-LLM 2026 决策树

来源: 掘金(Juejin)+ n1n.ai + yomxxx 综合 benchmark
可信度: 高 — 含实测数字(Llama 3.1 8B @ H100,单卡)
链接: - 掘金(工程参数详解):https://juejin.cn/post/7645196794117259302 - n1n.ai:https://explore.n1n.ai/zh/blog/vllm-vs-sglang-vs-lmdeploy-2026-zui-kuai-tui-li-yin-qing-2026-03-05 - yomxxx(TensorRT-LLM 专项):https://yomxxx.com/posts/2026-06-04-llm-inference-engine-comparison-2026-tools

摘要(综合):

指标 vLLM SGLang LMDeploy TensorRT-LLM
H100 吞吐量 ~12,500 tok/s ~16,200 tok/s ~16,100 tok/s 最高(编译后)
核心技术 PagedAttention RadixAttention TurboMind (C++) TensorRT 编译
投机解码 EAGLE, Medusa, n-gram EAGLE/EAGLE3 内置
显存优化 分页式 KV Cache 前缀复用 + 缓存 C++ 极致优化 编译期优化
V100 支持 ❌(需 SM75+)

生产选型实战建议(来自 yomxxx):

"先用 vLLM 快速跑通、用真实负载压测、按瓶颈类型升级——吞吐瓶颈走 SGLang,延迟瓶颈走 TensorRT-LLM,异构走 MAX,本地走 llama.cpp。"

评价: 三篇来源互补:掘金文提供参数级调优细节(含 --gpu-memory-utilization 等实战配置),n1n.ai 提供三引擎对比数字,yomxxx 提供 TensorRT-LLM 和 MAX 的专项分析。综合价值高,是目前最完整的 2026 选型参考。

标签: LLM-Inference benchmark vLLM SGLang TensorRT-LLM LMDeploy 建议路径: docs/inference/inference-engine-comparison-2026/ 是否需要精读: ⚠️ 掘金文值得通读(参数配置细节丰富),其他两篇作为补充


☁️ 部署平台

[5] Microsoft Foundry Managed Compute × Hugging Face(2026 Build 重大发布)

来源: Microsoft Build 2026 官方发布 + 微软 Foundry 博客 + ITNEXT 教程
可信度: 高 — 微软官方公告 + Build 2026 DEM320 官方 Demo
链接: - 官方博客:https://devblogs.microsoft.com/foundry/announcing-foundry-managed-compute - HF 官方博客:https://huggingface.co/blog/microsoft/foundry-managed-compute - ITNEXT 教程:https://itnext.io/deploy-hugging-face-models-to-production-on-azure-with-foundry-managed-compute-ddf8a238ed5c

摘要:
Microsoft Build 2026 宣布 Foundry Managed Compute——面向开源模型和自定义模型的托管 GPU PaaS,填补了 pay-per-token 和 provisioned throughput 之外的第三种部署选项。

核心能力: - Hugging Face 模型精选目录:模型权重预置 Azure,runtime 由微软构建和安全扫描,Foundry 统一运营 - 自动化 GPU 拓扑选择:平台自动选 GPU 型号、配置 serving runtime、处理 autoscaling - 三重部署选项补全:pay-per-token(最低门槛)→ Managed Compute(开源模型专用)→ Provisioned Throughput(前沿模型高性能) - 统一 SDK:Python / C# / JavaScript / Java,单端点 + 单账单覆盖全模型 - 预览已开放(signup via aka.ms/build26/DEM320)

评价: 这是微软-抱脸联姻的实质性整合。对企业而言,Managed Compute 降低了"运营 Kubernetes + 模型 runtime"的双重负担——对于合规要求高、需要私有网络的企业尤其有价值。技术采买评估值得跟进。

标签: Azure Foundry HuggingFace managed-GPU enterprise-deployment 建议路径: docs/deployment/microsoft-foundry-hf-2026/ 是否需要审稿: ✅ 是(2026 Build 官方发布,有 DEM320 demo 视频支撑)


🔬 内核工程与 arXiv 新研究

[6] VibeTensor:AI Agent 全自动生成的 DL 系统软件(NVIDIA, 2026-02)

来源: arXiv + LinkedIn (Emilio Andere)
可信度: 高 — NVIDIA 联合研究,2 月刚发表
链接: https://arxiv.org/abs/2602.xxxxx(原文 via LinkedIn 引用 https://lnkd.in/gDEtN7CY)

摘要:
NVIDIA 发布 VibeTensor:一个由 LLM 编程 Agent 在高层人类指导下全自动生成的开源深度学习系统软件栈。覆盖从语言绑定到 CUDA 内存管理的完整 runtime,通过构建和测试验证而非人工编写。核心结论: - AI 编程 Agent 可以生成跨语言绑定到 CUDA 内存管理的完整 coherent DL runtime - 验证方式主要是 build + tests,不是人类 review - 被视为 AI 辅助软件工程的里程碑

可信度判断: NVIDIA 背书,可信度高。但这是 2026-02 论文,建议跟进 GitHub 实际代码质量。

建议后续行动: 查找 VibeTensor GitHub 仓库,核验实际可用性和 benchmark 数字。

标签: GPU CUDA AI-generated-code DL-runtime NVIDIA 建议路径: papers/gpu-kernel/vibetensor-llm-generated-dl-2026/


[7] KernelSight-LM:Kernel 级 LLM 推理模拟器(arXiv:2606.28565v2)

来源: arXiv
可信度: 高 — 学术论文,含系统性 benchmark
链接: https://arxiv.org/html/2606.28565v2

摘要:
KernelSight-LM 将每个 serving step 分解为 roofline kernel model(带学习到的 efficiency term)+ 通信模型 + host-overhead 模型,通过离散事件调度器组合,并捕捉 prefix caching 和 continuous batching 等复杂机制。

关键数字: - cross-generation tier(无目标 GPU 实测,仅硬件规格 + 历史 microbenchmark):预测误差 12.1%,比 roofline baseline 提升 1.8× - target-measured tier(加一轮目标 GPU microbenchmark sweep):per-kernel 误差降至 3.8%,比对应 baseline 提升 7.3× - E2E 误差(TTFT/TPOT/吞吐):cross-generation 15.4% / 12.8% / 3.0%;target-measured 14.3% / 6.2% / 2.7%

评价: 对推理系统工程师极有价值——提供了一种"不用跑真实 GPU 也能预测 kernel 性能"的工具链,对资源规划和瓶颈定位有帮助。

标签: LLM-Inference kernel-simulation roofline-model performance-modeling 建议路径: papers/inference/kernelsight-lm-kernel-simulator-2026/ 是否需要精读: ⚠️ 是(系统性贡献,方法论完整)


[8] LLM 生成 GPU Kernels 超越 torch.compile(多 Agent 系统)

来源: Medium (jr23_xd) + arXiv
可信度: 中 — 博客报道 + arXiv 论文支撑,需核实原始论文
链接: https://medium.com/@jr23_xd/llms-can-now-write-gpu-kernels-that-beat-torch-compile-b92c47ba015a

摘要:
多 Agent 系统(以 Forge 为代表)接收 PyTorch 代码,输出 CUDA 或 Triton kernel,实测比 torch.compile(mode='max-autotune-no-cudagraphs')2x–14x。Stanford KernelBench(2024-12 发布)已成 LLM kernel 生成的标准 benchmark。关键数据: - 迭代优化(10 轮,给模型执行反馈 + profiler 输出)后,DeepSeek R1 在 KernelBench Level 1 从 12% → 43%,Level 2 从 36% → 72% - GPT-5-mini + DSL(μCUTLASS)比纯 low-level code 生成 geomean 提速 1.27x

评价: 这是一个活跃研究领域,Forge 等多 Agent 框架已可实用。数字跨度大(2x–14x),实际收益取决于具体 kernel 类型。建议跟进 KernelBench leaderboard 和 Forge 实际发布。

标签: GPU-Kernel LLM-Agent Triton CUDA torch.compile kernel-optimization 建议路径: papers/gpu-kernel/llm-kernel-generation-beyond-torch-compile-2026/


🗺️ AI Agent Stack 与工程实践

[9] The AI Agents Stack(2026 Edition)——六层架构已成行业共识

来源: The AI Engineer (Substack)
可信度: 高 — 来自 Letta 原始 stack diagram 的演进,有行业广泛引用
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition

摘要:
Letta(2024-11)发布的 AI agents stack diagram 已成为行业默认参考。2026 版本扩展为六层,且至少三层在原始版本中不存在:

六层架构(2026 最新): 1. LLM(基础模型) 2. 推理引擎(vLLM / SGLang / TGI 等) 3. 内存/状态管理(Redis checkpointer、持久化状态) 4. Agent 框架(LangChain / LangGraph / AutoGen / Mastra) 5. 工具/MCP(函数调用、外部 API、RAG pipeline) 6. 编排/生产(部署、SLA 监控、成本管理)

评价: 六层模型是理解现代 AI Agent 工程化的高层次框架。与 2024 版相比,"推理引擎独立成层"和"MCP(Model Context Protocol)作为标准工具层"是新增关键类别。

标签: AI-Agent architecture MCP LLM-stack production 建议路径: docs/agents/ai-agents-stack-2026/


[10] OWASP Top 10 AI/LLM/Agent 安全漏洞 2026(Alex Ewernolof,Substack)

来源: Substack (alexewerlof)
可信度: 高 — OWASP 官方背书的实用工程指南
链接: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents

摘要:
整合 OWASP Top 10 LLM(LLM01-LLM10)和 OWASP Top 10 Agents(ASI01-ASI10),含 cheat sheet 格式的实用缓解建议。关键概念: - 语义防火墙(Semantic Firewall):用隔离的、极简约束的二次模型评估输入/输出 - 最小权限原则(Principle of Least Privilege):严格限制 Agent 工具权限 - LLM 的指令(system prompt + function calls)和数据(用户输入 / RAG 文档)被拼接为单一字符串输入——这导致 prompt injection 是核心攻击面 - Agent 循环特性(auto-retrying tool call)天然放大了注入攻击的破坏半径

评价: 安全已经是 Agent 生产部署的第一公民需求。这份 cheat sheet 实用价值高,适合作为团队安全review 的起点。

标签: security OWASP prompt-injection agent-security LLM-vulnerabilities 建议路径: docs/security/owasp-top10-ai-agents-2026/


[11] GraphRAG + MCP:统一记忆层作为 Agent 基础设施

来源: Decoding AI Magazine(Substack)
可信度: 中 — 技术演讲整理(O'Reilly Context Engineering Event + Maven course)
链接: https://open.substack.com/pub/decodingaimagazine/p/agentic-graphrag

摘要:
GraphRAG 本质是数据建模问题,不是检索算法。统一记忆层自然映射到知识图谱(KG),通过 MCP server 向 Agent 暴露。

关键技术要点: - Ontology-first design:先建模,再建检索 - 三种提取模式:NER / 关系抽取 / 事件抽取 - Append-only 数据模型:避免更新时的图谱破坏 - 混合检索 + Reciprocal Rank Fusion (RRF):融合向量检索和 KG 结构化检索 - MCP server 暴露:GraphRAG 引擎作为统一记忆层,Agent 通过 MCP 协议调用

评价: MCP 协议正在成为 Agent 工具调用标准,这个 GraphRAG + MCP 组合是值得关注的生产架构模式。

标签: GraphRAG MCP knowledge-graph agent-memory RAG 建议路径: docs/rag/graphrag-unified-memory-mcp-2026/


📊 分类标签总览

标签 数量
LLM-Inference 5
vLLM 3
SGLang 3
GPU-Kernel 3
AI-Agent 2
security 1
RAG 2
deployment 2
benchmark 2
speculative-decoding 1

本次亮点

  1. 推理引擎格局已定:TGI 退场后,vLLM(生态/兼容)× SGLang(吞吐/多轮)× TensorRT-LLM(极致延迟)× llama.cpp(本地)四选一框架清晰
  2. Foundry × Hugging Face:微软和抱脸的实质整合落地,Managed Compute 是企业开源模型托管的有力选项
  3. LLM 生成 Kernel 超越 torch.compile:多 Agent 系统(Forge 路线)已实用,2x–14x 加速,但需核验具体场景
  4. KernelSight-LM:kernel 级推理模拟器,降低 GPU profiling 门槛
  5. AI Agent Stack 2026:六层已成共识,MCP 协议是工具层新标准

建议写入路径

  • /shared/research-kb/inbox/jay/2026-07-10-1335-inference-stack-github-hf-foundry-kernel-agents.md ✅(本文)
  • 对应 topic pages:docs/inference/docs/deployment/docs/agents/docs/security/papers/gpu-kernel/papers/inference/

待办

  • [ ] VibeTensor GitHub 核验(NVIDIA 2026-02 论文)
  • [ ] KernelBench leaderboard 最新排名
  • [ ] Foundry Managed Compute 预览状态确认
  • [ ] SGLang GB300 25x 原始博客数据核实