知识库草稿 · Jay · 2026-10-06 下午 · Inference 工程:RoofLang / EdgeAgent / TGI 停止维护
实例: Jay | 检索范围: arXiv · Substack (AI Engineering Insider / The AI Engineer / Ken Huang / Pragmatic Engineer) · 2026-10-06 执行 类型: 工程二次筛选 | 主题: LLM Inference Systems
一、筛选总览
| 条目 | 来源 | 保留 | 丢弃理由 | 写入 |
|---|---|---|---|---|
| TGI 停止维护(2026-03) + 引擎选型决策流程图 | The AI Engineer Substack | ✅ | — | 是 |
| RoofLang: AI 自动设计 LLM Inference 系统 | arXiv 2609.12551 | ✅ | — | 是 |
| EdgeAgent: Apple Silicon UMA 多 Agent 调度 | arXiv 2610.03394 | ✅ | — | 是 |
| Senior LLM Inference Engineer 面试大纲 | AI Engineering Insider | ⚠️ | 付费,仅免费预览;TGI 停止维护数据已在上条覆盖 | 摘要引用 |
| Disaggregated Serving (Prefill-Decode 解耦) | Ken Huang Substack Ch.6 | ⚠️ | 付费墙严重;Mooncake/DistServe 主题已见于历史 inbox | 线索保留 |
| Pragmatic Engineer: Inference 工程定义三层架构 | open.substack.com | ⚠️ | 属概念综述;无新工程数据 | 低优先级 |
二、保留条目详情
条目 A ✅ — TGI 停止维护 + 引擎决策流程图(高价值,工程行动性强)
来源: The AI Engineer Substack · "vLLM vs Ollama vs SGLang vs TensorRT-LLM Serving 2026" · Paolo Perrone
URL: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
作者: Paolo Perrone · The AI Engineer(AI 工程实战向 newsletter)
可信度: ⭐⭐⭐⭐⭐ | 工程价值: 极高(2026-03 TGI 停止维护 是重大基础设施信号)
标签: tgi deprecation vllm sglang inference-engine production
核心事实
-
TGI(Text Generation Inference)2026 年 3 月正式进入维护模式 - GitHub README 原文:
"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"- Hugging Face 官方推荐迁移目标:vLLM · SGLang · llama.cpp - 背景:TGI 是最早广泛使用的开源推理引擎,曾为 HuggingChat 和 Inference Endpoints 供能,但新功能、性能改进和模型支持已落后于 vLLM/SGLang 生态 -
SGLang vs vLLM 工程数据(H100 实测)
| 维度 | vLLM | SGLang | 结论 |
|---|---|---|---|
| 吞吐量(Llama 3.1 8B) | ~12,500 tok/s | ~16,200 tok/s | SGLang 快 29% |
| 输出 Token 速度(共享上下文) | 基准 | >2× | SGLang 在 RAG/多轮对话场景显著优势 |
| 前缀缓存(RAG 10 用户同文档) | 需重复计算 | 处理1次,9次复用 | SGLang RadixAttention 机制 |
| PagedAttention 内存浪费 | 60-80% VRAM 空 Reservation | <4% | vLLM 引入,贡献行业 |
| 100 并发 TTFT p95 尾延迟 | 最高(三者中) | 最低 | SGLang 调度更稳定 |
| 大模型(70B+)吞吐量 | 持平或略优 | 略低(<5%差) | 基本持平 |
-
TensorRT-LLM 定位 - NVIDIA 官方栈,H100 上编译后性能领先,但操作复杂度高(需编译步骤) - 适合有 NVIDIA 原厂支持资源的企业团队
-
引擎选型决策流程图(原文摘要) - 场景1:小团队 / 快速原型 / Mac 本地 → Ollama(开箱即用,模型管理简单) - 场景2:生产流量 / 高并发 / 多用户 → vLLM(PagedAttention + Continuous Batching,生态成熟) - 场景3:共享上下文多 / RAG / 多轮 / 结构化输出(JSON/函数调用) → SGLang(RadixAttention 前缀缓存原生优势) - 场景4:H100+ 有 NVIDIA 支持 / 需要极限吞吐 → TensorRT-LLM(编译开销,换性能)
工程行动建议: - 若当前生产环境使用 TGI,制定迁移计划(目标 vLLM 或 SGLang),新功能开发已停止 - RAG 场景优先评估 SGLang,前缀缓存对同文档多用户场景有结构性优势 - 70B+ 大模型无明显引擎差异,按团队熟悉度选型
引用格式:
Perrone, P. (2026). vLLM vs Ollama vs SGLang vs TensorRT-LLM Serving 2026. The AI Engineer.
https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
条目 B ✅ — RoofLang: AI 自动设计 LLM Inference 系统(arXiv 2026-09,新系统方向)
来源: arXiv · https://arxiv.org/html/2609.12551v1
标题: RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems
可信度: ⭐⭐⭐⭐ | 工程价值: 高(系统方向,GB300 实测数据)
标签: rooflang llm-inference-design automated arxiv2026 gb300
摘要与核心发现
RoofLang 是一个用 AI Agent 自动设计/优化 LLM 推理系统配置/架构的框架,核心思路是:
- 给定硬件平台(GPU 类型、内存、互联带宽)和 Workload 描述
- AI Agent 在搜索空间中探索系统配置(批大小、Tensor Parallel 度数、Prefill/Decode 是否解耦、KV Cache 策略等)
- 使用真实硬件性能反馈迭代优化
关键工程数据(GB300 / 64 GPU 配置):
| Model | Per-request 参数传输量 | Per-request KV Cache 占用 | Per-request KV Cache 流量 | Peak Batch Size | Per-decode-token 内存流量 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | 2.277 MiB | 0.192 GiB | 0.033 GiB | 65,536 | 0.035 GiB |
| GLM-5.3 | 173.618 MiB | 2.906 GiB | 0.250 GiB | 4,096 | 0.419 GiB |
| DeepSeek V4 Pro | 24.811 MiB | 0.275 GiB | 0.055 GiB | 32,768 | 0.079 GiB |
| Kimi K3 | 175.897 MiB | 1.065 GiB | 1.065 GiB | 8,192 | 1.237 GiB |
关键洞察: - DeepSeek V4 Flash 的 KV Cache 设计极度紧凑(0.192 GiB vs GLM 2.906 GiB),支撑 65K 超大 batch 和极低 per-token 内存流量 - 紧凑 KV Cache 设计是 2026 年新模型架构竞争的核心维度之一(对应 MLA / DeepSeek-V4 CSA 注意力架构压缩) - RoofLang 用 Agent 发现 DeepSeek V4 Pro 在 B300 上性能提升 6.23%–50.1%,超越人工调优 baseline
后续行动: - [ ] 核验 RoofLang GitHub 是否有开源实现(论文只引用了 GitHub 仓库但未提供链接) - [ ] 关注 InferenceBench(arXiv 2607.20468):AI Agent 优化 LLM 推理的 Benchmark - [ ] 与 DeepSeek-V4 系列论文交叉阅读:KV Cache 压缩的架构根因
引用格式:
Gai et al. (2026). RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems. arXiv:2609.12551.
https://arxiv.org/html/2609.12551v1
条目 C ✅ — EdgeAgent: Apple Silicon 统一内存多 Agent 推理调度(arXiv 2026-10,边缘推理新方向)
来源: arXiv · https://arxiv.org/html/2610.03394v1
标题: EdgeAgent: Orchestrating On-Device LLM Inference for End-User Multi-Agent Systems on CPU-GPU Unified Memory Architectures
日期: 2026-10-02(极新)
可信度: ⭐⭐⭐⭐ | 工程价值: 高(边缘推理方向,Apple Silicon 特定)
标签: edgeagent apple-silicon uma multi-agent on-device kv-cache arxiv2026
摘要与核心发现
EdgeAgent 解决的是端侧多 Agent LLM 推理问题:在 CPU-GPU 统一内存架构(如 Apple M 系列芯片)上高效调度多个并发 Agent 工作负载,每个 Agent 需要独立 KV Cache 状态。
问题背景: - 多 Agent 框架(LangGraph 2026, OpenClaw)对单设备推理的资源竞争问题 - 现有系统无法高效处理多 Agent 并发,因为 KV Cache 在 Agent 间无共享机制
核心技术贡献:
-
In-place KV Cache Freeze(原地 KV Cache 冻结) - 当 Agent 等待外部工具(API 调用、I/O)执行时,其 KV Cache 不需要写出内存 - 利用 UMA 物理共享寻址,直接冻结当前 GPU 内存位置 - 工具执行完成后,从冻结位置恢复推理,零重新 Prefill 开销
-
UMA-aware 调度器 - 感知 CPU-GPU 统一内存的物理地址布局 - 优先调度同一内存区域的 Agent,最大化 Cache 局部性
-
硬件偏移映射压缩(offset-remapping compaction) - 冻结后的 Agent KV Cache 重新映射地址,为活跃 Agent 腾出物理内存 - 恢复时通过硬件级偏移表完成地址转换,无需数据搬迁
评估结论: 该设计对 Apple Silicon + 本地推理场景(隐私敏感、无网络延迟的业务工作流)有直接价值,与主流 GPU 云端推理主题互补。
与现有 inbox 条目差异: 历史 draft 覆盖 vLLM/SGLang 生产部署,均为云端 H100 场景;本条目补充端侧 Apple Silicon 多 Agent 推理这一空白方向。
后续行动: - [ ] 核验 LangGraph 2026 多 Agent 框架的端侧支持情况 - [ ] 关注 OpenClaw(本文引用)在端侧推理的集成可能性 - [ ] 评估 MLX(Apple Silicon ML 框架)与 EdgeAgent 思想的关联
引用格式:
EdgeAgent Authors. (2026). EdgeAgent: Orchestrating On-Device LLM Inference for End-User Multi-Agent Systems on CPU-GPU Unified Memory Architectures. arXiv:2610.03394.
https://arxiv.org/html/2610.03394v1
三、丢弃条目记录
| 条目 | 丢弃理由 |
|---|---|
| AI Engineering Insider: Senior LLM Inference Engineer Interview | 付费内容,仅免费预览有框架性目录;核心 TGI 停止维护数据已在本文档条目A覆盖;面试大纲非工程实践条目 |
| Ken Huang Substack Ch.6: Disaggregated Serving (Mooncake/DistServe) | 付费墙严重;Prefill-Decode 解耦主题在历史 inbox(2026-06-13 晚间)已有初步覆盖;需订阅才能获取新数据 |
| Pragmatic Engineer: What is Inference Engineering | 概念性综述(infrastructure / runtime / serving 三层),无新实测数据;可作为新人入门引用但不进入知识库正文 |
| Starmorph: RAG Techniques Compared (Cost per Query) | 成本估算类文章(Naive RAG ~$0.001, Agentic RAG ~$0.01-0.10),适合产品/商业评估但无命令/源码/性能数据 |
| 20 Advanced RAG Types (Turing Post) | 综述分类,无工程深度;RAG 类型学文献已有其他来源覆盖 |
| RAG Techniques Compared: chunk size / overlap / contextual summaries | 工程参数建议(200-500 tokens, 10-20% overlap),数值合理但来源 starmorph.com 权威性有限,且参数建议属通用共识非新发现 |
四、本次写入汇总
| 写入路径 | 条目数 | 核心标签 |
|---|---|---|
/shared/research-kb/inbox/jay/2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md |
3条保留 + 6条丢弃记录 | tgi-deprecation rooflang edgeagent vllm sglang apple-silicon |
建议后续行动(Knowledge Base Team): 1. TGI 停止维护事件 → 更新 Inference Engine 选型指南文档(新增"历史遗留 TGI 系统迁移路径"章节) 2. RoofLang → 关注开源实现 release;与 DeepSeek-V4 MLA/KV Cache 压缩论文交叉归档 3. EdgeAgent → 建议与 Apple Silicon MLX 生态关联归档(端侧推理专题页) 4. 本次日期 2026-10-06,距离上一批次(2026-06-15)约 3.5 个月,Inference 工程方向演进快,建议月频扫描
Jay · 2026-10-06 · 工程二次筛选完成 · 无 GitHub 写入