研究简报 · Jay · 2026-07-10 下午
主题
LLM 推理引擎格局(TGI 退场)· Foundry × Hugging Face 部署整合 · LLM 生成 GPU Kernel 新进展 · AI Agent Stack 2026 · OWASP AI 安全
检索范围
- Tavily Web Search: vLLM SGLang 2026 update, GitHub trending AI, Microsoft Foundry HF, arXiv kernel optimization, Substack AI agents/RAG/inference, CSDN 推理引擎对比
🤖 LLM 推理引擎格局
[1] TGI 正式退场(2025 年 12 月)——选型框架固化
来源: Hugging Face 官方 & 多方 benchmark
可信度: 高 — HF 官方维护模式公告 + 行业广泛验证
链接: https://www.spheron.network/blog/migrate-tgi-to-vllm-sglang-2026
摘要:
Hugging Face 于 2025 年 12 月正式将 TGI 置于维护模式(maintenance mode),官方文档已引导用户迁移至 vLLM 或 SGLang。Inference Endpoints 现在默认使用 vLLM。2026 年推理引擎正式形成四选一格局:
| 引擎 | 核心定位 | 硬件 | 上手难度 | 适用场景 |
|---|---|---|---|---|
| vLLM | 生态最广,稳定优先 | NVIDIA (V100+)、AMD ROCm | 低 | 通用生产,V100 遗留环境 |
| SGLang | 吞吐领先,多轮对话优化 | NVIDIA H100/A100 优先 | 中 | 多轮 RAG、Agent、prefix-heavy |
| TensorRT-LLM | 极致 p95 延迟 | NVIDIA A100/H100 | 高(编译链复杂) | 大规模在线,硬 SLA |
| llama.cpp | 本地/边缘/量化 | CPU / 消费级 GPU | 低 | 本地部署、边缘设备 |
评价: TGI 退场是 2026 年推理领域的标志性事件。vLLM 稳坐综合第一,SGLang 在吞吐和多轮场景有明显优势。选型原则:先用 vLLM 跑通业务,按实测瓶颈升级(TGI → vLLM/SGLang 已成历史包袱)。
标签: LLM-Inference vLLM SGLang TensorRT-LLM llama.cpp TGI-Deprecation
建议路径: docs/inference/llm-engine-comparison-2026/
[2] SGLang 重大更新(2026 Q1-Q2):GB300 NVL72 25x 提速
来源: SGLang GitHub README & 官方博客
可信度: 高 — 官方发布,含具体 benchmark 数字
链接: https://github.com/sgl-project/sglang
摘要: SGLang 近期里程碑: - 2026/04:DeepSeek-V4 Day 0 支持,集成 Miles RL 验证框架 - 2026/02:NVIDIA GB300 NVL72 上实现 25x 推理提速(博客专项报告) - 2026/02:SGLang-Jax 后端发布,原生支持 TPU(不再只限 NVIDIA) - SGLang 在 H100 Llama 3.1 8B 上实测约 16,200 tok/s,比 vLLM 高约 29% - 2025/12 起支持 MiMo-V2-Flash、Nemotron 3 Nano、Mistral Large 3、LLaDA 2.0 Diffusion LLM、MiniMax M2
评价: SGLang 扩展至 TPU 是重大生态突破;GB300 NVL72 数据令人印象深刻,但需注意这是搭配 DeepSeek-V4 的联合优化,非通用数字。
标签: SGLang DeepSeek TPU GB300 inference-throughput
建议路径: docs/inference/sglang-updates-2026/
是否需要精读: ⚠️ GB300 25x 声明需核验原始博客数据
[3] vLLM 最新发布:DeepSeek-V4 优化 & MRv2 量化支持
来源: vLLM GitHub Releases
可信度: 高 — 官方 Release Notes,含 commit 引用
链接: https://github.com/vllm-project/vllm/releases
摘要: vLLM 近期高价值更新(来自 Release Notes 摘要): - MiniMax-M3 全面支持:MXFP4、FP8 sparse GQA、AMD/ROCm 深度调优(gfx950 MI300X) - DeepSeek-V4 优化:FlashInfer sparse index cache(2-4% TTFT 提升)、prefill chunk-planning(4% E2E 吞吐)、contiguous per-block KV allocations、TEP=16 for block-FP8 shared expert - Model Runner V2 (MRv2):默认支持量化模型、DFlash 投机解码、更精确的 FP32 Gumbel sampling - Streaming Parser Engine:统一解析 Qwen3、MiniMax-M2、GLM-4.7/5.1/5.2、Nemotron V3 的 tool-call/reasoning
评价: vLLM 在 DeepSeek-V4 上的优化密度极高(FlashInfer sparse cache + chunk-planning 是已知最优组合);MRv2 量化模型默认支持是生产部署的重要里程碑。
标签: vLLM DeepSeek-V4 MRv2 speculative-decoding quantization
建议路径: docs/inference/vllm-releases-2026/
是否需要审稿: ✅ 是(Release Notes 质量高,建议直接引用)
[4] SGLang vs vLLM vs LMDeploy vs TensorRT-LLM 2026 决策树
来源: 掘金(Juejin)+ n1n.ai + yomxxx 综合 benchmark
可信度: 高 — 含实测数字(Llama 3.1 8B @ H100,单卡)
链接:
- 掘金(工程参数详解):https://juejin.cn/post/7645196794117259302
- n1n.ai:https://explore.n1n.ai/zh/blog/vllm-vs-sglang-vs-lmdeploy-2026-zui-kuai-tui-li-yin-qing-2026-03-05
- yomxxx(TensorRT-LLM 专项):https://yomxxx.com/posts/2026-06-04-llm-inference-engine-comparison-2026-tools
摘要(综合):
| 指标 | vLLM | SGLang | LMDeploy | TensorRT-LLM |
|---|---|---|---|---|
| H100 吞吐量 | ~12,500 tok/s | ~16,200 tok/s | ~16,100 tok/s | 最高(编译后) |
| 核心技术 | PagedAttention | RadixAttention | TurboMind (C++) | TensorRT 编译 |
| 投机解码 | EAGLE, Medusa, n-gram | EAGLE/EAGLE3 | — | 内置 |
| 显存优化 | 分页式 KV Cache | 前缀复用 + 缓存 | C++ 极致优化 | 编译期优化 |
| V100 支持 | ✅ | ❌(需 SM75+) | — | ❌ |
生产选型实战建议(来自 yomxxx):
"先用 vLLM 快速跑通、用真实负载压测、按瓶颈类型升级——吞吐瓶颈走 SGLang,延迟瓶颈走 TensorRT-LLM,异构走 MAX,本地走 llama.cpp。"
评价: 三篇来源互补:掘金文提供参数级调优细节(含 --gpu-memory-utilization 等实战配置),n1n.ai 提供三引擎对比数字,yomxxx 提供 TensorRT-LLM 和 MAX 的专项分析。综合价值高,是目前最完整的 2026 选型参考。
标签: LLM-Inference benchmark vLLM SGLang TensorRT-LLM LMDeploy
建议路径: docs/inference/inference-engine-comparison-2026/
是否需要精读: ⚠️ 掘金文值得通读(参数配置细节丰富),其他两篇作为补充
☁️ 部署平台
[5] Microsoft Foundry Managed Compute × Hugging Face(2026 Build 重大发布)
来源: Microsoft Build 2026 官方发布 + 微软 Foundry 博客 + ITNEXT 教程
可信度: 高 — 微软官方公告 + Build 2026 DEM320 官方 Demo
链接:
- 官方博客:https://devblogs.microsoft.com/foundry/announcing-foundry-managed-compute
- HF 官方博客:https://huggingface.co/blog/microsoft/foundry-managed-compute
- ITNEXT 教程:https://itnext.io/deploy-hugging-face-models-to-production-on-azure-with-foundry-managed-compute-ddf8a238ed5c
摘要:
Microsoft Build 2026 宣布 Foundry Managed Compute——面向开源模型和自定义模型的托管 GPU PaaS,填补了 pay-per-token 和 provisioned throughput 之外的第三种部署选项。
核心能力: - Hugging Face 模型精选目录:模型权重预置 Azure,runtime 由微软构建和安全扫描,Foundry 统一运营 - 自动化 GPU 拓扑选择:平台自动选 GPU 型号、配置 serving runtime、处理 autoscaling - 三重部署选项补全:pay-per-token(最低门槛)→ Managed Compute(开源模型专用)→ Provisioned Throughput(前沿模型高性能) - 统一 SDK:Python / C# / JavaScript / Java,单端点 + 单账单覆盖全模型 - 预览已开放(signup via aka.ms/build26/DEM320)
评价: 这是微软-抱脸联姻的实质性整合。对企业而言,Managed Compute 降低了"运营 Kubernetes + 模型 runtime"的双重负担——对于合规要求高、需要私有网络的企业尤其有价值。技术采买评估值得跟进。
标签: Azure Foundry HuggingFace managed-GPU enterprise-deployment
建议路径: docs/deployment/microsoft-foundry-hf-2026/
是否需要审稿: ✅ 是(2026 Build 官方发布,有 DEM320 demo 视频支撑)
🔬 内核工程与 arXiv 新研究
[6] VibeTensor:AI Agent 全自动生成的 DL 系统软件(NVIDIA, 2026-02)
来源: arXiv + LinkedIn (Emilio Andere)
可信度: 高 — NVIDIA 联合研究,2 月刚发表
链接: https://arxiv.org/abs/2602.xxxxx(原文 via LinkedIn 引用 https://lnkd.in/gDEtN7CY)
摘要:
NVIDIA 发布 VibeTensor:一个由 LLM 编程 Agent 在高层人类指导下全自动生成的开源深度学习系统软件栈。覆盖从语言绑定到 CUDA 内存管理的完整 runtime,通过构建和测试验证而非人工编写。核心结论:
- AI 编程 Agent 可以生成跨语言绑定到 CUDA 内存管理的完整 coherent DL runtime
- 验证方式主要是 build + tests,不是人类 review
- 被视为 AI 辅助软件工程的里程碑
可信度判断: NVIDIA 背书,可信度高。但这是 2026-02 论文,建议跟进 GitHub 实际代码质量。
建议后续行动: 查找 VibeTensor GitHub 仓库,核验实际可用性和 benchmark 数字。
标签: GPU CUDA AI-generated-code DL-runtime NVIDIA
建议路径: papers/gpu-kernel/vibetensor-llm-generated-dl-2026/
[7] KernelSight-LM:Kernel 级 LLM 推理模拟器(arXiv:2606.28565v2)
来源: arXiv
可信度: 高 — 学术论文,含系统性 benchmark
链接: https://arxiv.org/html/2606.28565v2
摘要:
KernelSight-LM 将每个 serving step 分解为 roofline kernel model(带学习到的 efficiency term)+ 通信模型 + host-overhead 模型,通过离散事件调度器组合,并捕捉 prefix caching 和 continuous batching 等复杂机制。
关键数字: - cross-generation tier(无目标 GPU 实测,仅硬件规格 + 历史 microbenchmark):预测误差 12.1%,比 roofline baseline 提升 1.8× - target-measured tier(加一轮目标 GPU microbenchmark sweep):per-kernel 误差降至 3.8%,比对应 baseline 提升 7.3× - E2E 误差(TTFT/TPOT/吞吐):cross-generation 15.4% / 12.8% / 3.0%;target-measured 14.3% / 6.2% / 2.7%
评价: 对推理系统工程师极有价值——提供了一种"不用跑真实 GPU 也能预测 kernel 性能"的工具链,对资源规划和瓶颈定位有帮助。
标签: LLM-Inference kernel-simulation roofline-model performance-modeling
建议路径: papers/inference/kernelsight-lm-kernel-simulator-2026/
是否需要精读: ⚠️ 是(系统性贡献,方法论完整)
[8] LLM 生成 GPU Kernels 超越 torch.compile(多 Agent 系统)
来源: Medium (jr23_xd) + arXiv
可信度: 中 — 博客报道 + arXiv 论文支撑,需核实原始论文
链接: https://medium.com/@jr23_xd/llms-can-now-write-gpu-kernels-that-beat-torch-compile-b92c47ba015a
摘要:
多 Agent 系统(以 Forge 为代表)接收 PyTorch 代码,输出 CUDA 或 Triton kernel,实测比 torch.compile(mode='max-autotune-no-cudagraphs') 快 2x–14x。Stanford KernelBench(2024-12 发布)已成 LLM kernel 生成的标准 benchmark。关键数据:
- 迭代优化(10 轮,给模型执行反馈 + profiler 输出)后,DeepSeek R1 在 KernelBench Level 1 从 12% → 43%,Level 2 从 36% → 72%
- GPT-5-mini + DSL(μCUTLASS)比纯 low-level code 生成 geomean 提速 1.27x
评价: 这是一个活跃研究领域,Forge 等多 Agent 框架已可实用。数字跨度大(2x–14x),实际收益取决于具体 kernel 类型。建议跟进 KernelBench leaderboard 和 Forge 实际发布。
标签: GPU-Kernel LLM-Agent Triton CUDA torch.compile kernel-optimization
建议路径: papers/gpu-kernel/llm-kernel-generation-beyond-torch-compile-2026/
🗺️ AI Agent Stack 与工程实践
[9] The AI Agents Stack(2026 Edition)——六层架构已成行业共识
来源: The AI Engineer (Substack)
可信度: 高 — 来自 Letta 原始 stack diagram 的演进,有行业广泛引用
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
摘要:
Letta(2024-11)发布的 AI agents stack diagram 已成为行业默认参考。2026 版本扩展为六层,且至少三层在原始版本中不存在:
六层架构(2026 最新): 1. LLM(基础模型) 2. 推理引擎(vLLM / SGLang / TGI 等) 3. 内存/状态管理(Redis checkpointer、持久化状态) 4. Agent 框架(LangChain / LangGraph / AutoGen / Mastra) 5. 工具/MCP(函数调用、外部 API、RAG pipeline) 6. 编排/生产(部署、SLA 监控、成本管理)
评价: 六层模型是理解现代 AI Agent 工程化的高层次框架。与 2024 版相比,"推理引擎独立成层"和"MCP(Model Context Protocol)作为标准工具层"是新增关键类别。
标签: AI-Agent architecture MCP LLM-stack production
建议路径: docs/agents/ai-agents-stack-2026/
[10] OWASP Top 10 AI/LLM/Agent 安全漏洞 2026(Alex Ewernolof,Substack)
来源: Substack (alexewerlof)
可信度: 高 — OWASP 官方背书的实用工程指南
链接: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
摘要:
整合 OWASP Top 10 LLM(LLM01-LLM10)和 OWASP Top 10 Agents(ASI01-ASI10),含 cheat sheet 格式的实用缓解建议。关键概念:
- 语义防火墙(Semantic Firewall):用隔离的、极简约束的二次模型评估输入/输出
- 最小权限原则(Principle of Least Privilege):严格限制 Agent 工具权限
- LLM 的指令(system prompt + function calls)和数据(用户输入 / RAG 文档)被拼接为单一字符串输入——这导致 prompt injection 是核心攻击面
- Agent 循环特性(auto-retrying tool call)天然放大了注入攻击的破坏半径
评价: 安全已经是 Agent 生产部署的第一公民需求。这份 cheat sheet 实用价值高,适合作为团队安全review 的起点。
标签: security OWASP prompt-injection agent-security LLM-vulnerabilities
建议路径: docs/security/owasp-top10-ai-agents-2026/
[11] GraphRAG + MCP:统一记忆层作为 Agent 基础设施
来源: Decoding AI Magazine(Substack)
可信度: 中 — 技术演讲整理(O'Reilly Context Engineering Event + Maven course)
链接: https://open.substack.com/pub/decodingaimagazine/p/agentic-graphrag
摘要:
GraphRAG 本质是数据建模问题,不是检索算法。统一记忆层自然映射到知识图谱(KG),通过 MCP server 向 Agent 暴露。
关键技术要点: - Ontology-first design:先建模,再建检索 - 三种提取模式:NER / 关系抽取 / 事件抽取 - Append-only 数据模型:避免更新时的图谱破坏 - 混合检索 + Reciprocal Rank Fusion (RRF):融合向量检索和 KG 结构化检索 - MCP server 暴露:GraphRAG 引擎作为统一记忆层,Agent 通过 MCP 协议调用
评价: MCP 协议正在成为 Agent 工具调用标准,这个 GraphRAG + MCP 组合是值得关注的生产架构模式。
标签: GraphRAG MCP knowledge-graph agent-memory RAG
建议路径: docs/rag/graphrag-unified-memory-mcp-2026/
📊 分类标签总览
| 标签 | 数量 |
|---|---|
LLM-Inference |
5 |
vLLM |
3 |
SGLang |
3 |
GPU-Kernel |
3 |
AI-Agent |
2 |
security |
1 |
RAG |
2 |
deployment |
2 |
benchmark |
2 |
speculative-decoding |
1 |
本次亮点
- 推理引擎格局已定:TGI 退场后,vLLM(生态/兼容)× SGLang(吞吐/多轮)× TensorRT-LLM(极致延迟)× llama.cpp(本地)四选一框架清晰
- Foundry × Hugging Face:微软和抱脸的实质整合落地,Managed Compute 是企业开源模型托管的有力选项
- LLM 生成 Kernel 超越 torch.compile:多 Agent 系统(Forge 路线)已实用,2x–14x 加速,但需核验具体场景
- KernelSight-LM:kernel 级推理模拟器,降低 GPU profiling 门槛
- AI Agent Stack 2026:六层已成共识,MCP 协议是工具层新标准
建议写入路径
/shared/research-kb/inbox/jay/2026-07-10-1335-inference-stack-github-hf-foundry-kernel-agents.md✅(本文)- 对应 topic pages:
docs/inference/、docs/deployment/、docs/agents/、docs/security/、papers/gpu-kernel/、papers/inference/
待办
- [ ] VibeTensor GitHub 核验(NVIDIA 2026-02 论文)
- [ ] KernelBench leaderboard 最新排名
- [ ] Foundry Managed Compute 预览状态确认
- [ ] SGLang GB300 25x 原始博客数据核实