知识库草稿 · Jay · 2026-10-06 下午 · Inference 工程:RoofLang / EdgeAgent / TGI 停止维护

实例: Jay | 检索范围: arXiv · Substack (AI Engineering Insider / The AI Engineer / Ken Huang / Pragmatic Engineer) · 2026-10-06 执行 类型: 工程二次筛选 | 主题: LLM Inference Systems


一、筛选总览

条目 来源 保留 丢弃理由 写入
TGI 停止维护(2026-03) + 引擎选型决策流程图 The AI Engineer Substack ✅ — 是
RoofLang: AI 自动设计 LLM Inference 系统 arXiv 2609.12551 ✅ — 是
EdgeAgent: Apple Silicon UMA 多 Agent 调度 arXiv 2610.03394 ✅ — 是
Senior LLM Inference Engineer 面试大纲 AI Engineering Insider ⚠️ 付费,仅免费预览;TGI 停止维护数据已在上条覆盖 摘要引用
Disaggregated Serving (Prefill-Decode 解耦) Ken Huang Substack Ch.6 ⚠️ 付费墙严重;Mooncake/DistServe 主题已见于历史 inbox 线索保留
Pragmatic Engineer: Inference 工程定义三层架构 open.substack.com ⚠️ 属概念综述;无新工程数据 低优先级

二、保留条目详情

条目 A ✅ — TGI 停止维护 + 引擎决策流程图(高价值,工程行动性强)

来源: The AI Engineer Substack · "vLLM vs Ollama vs SGLang vs TensorRT-LLM Serving 2026" · Paolo Perrone URL: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt 作者: Paolo Perrone · The AI Engineer(AI 工程实战向 newsletter) 可信度: ⭐⭐⭐⭐⭐ | 工程价值: 极高(2026-03 TGI 停止维护 是重大基础设施信号) 标签: tgi deprecation vllm sglang inference-engine production

核心事实

  1. TGI(Text Generation Inference)2026 年 3 月正式进入维护模式 - GitHub README 原文:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks" - Hugging Face 官方推荐迁移目标:vLLM · SGLang · llama.cpp - 背景:TGI 是最早广泛使用的开源推理引擎,曾为 HuggingChat 和 Inference Endpoints 供能,但新功能、性能改进和模型支持已落后于 vLLM/SGLang 生态

  2. SGLang vs vLLM 工程数据(H100 实测)

维度 vLLM SGLang 结论
吞吐量(Llama 3.1 8B) ~12,500 tok/s ~16,200 tok/s SGLang 快 29%
输出 Token 速度(共享上下文) 基准 >2× SGLang 在 RAG/多轮对话场景显著优势
前缀缓存(RAG 10 用户同文档) 需重复计算 处理1次,9次复用 SGLang RadixAttention 机制
PagedAttention 内存浪费 60-80% VRAM 空 Reservation <4% vLLM 引入,贡献行业
100 并发 TTFT p95 尾延迟 最高(三者中) 最低 SGLang 调度更稳定
大模型(70B+)吞吐量 持平或略优 略低(<5%差) 基本持平
  1. TensorRT-LLM 定位 - NVIDIA 官方栈,H100 上编译后性能领先,但操作复杂度高(需编译步骤) - 适合有 NVIDIA 原厂支持资源的企业团队

  2. 引擎选型决策流程图(原文摘要) - 场景1:小团队 / 快速原型 / Mac 本地 → Ollama(开箱即用,模型管理简单) - 场景2:生产流量 / 高并发 / 多用户 → vLLM(PagedAttention + Continuous Batching,生态成熟) - 场景3:共享上下文多 / RAG / 多轮 / 结构化输出(JSON/函数调用) → SGLang(RadixAttention 前缀缓存原生优势) - 场景4:H100+ 有 NVIDIA 支持 / 需要极限吞吐 → TensorRT-LLM(编译开销,换性能)

工程行动建议: - 若当前生产环境使用 TGI,制定迁移计划(目标 vLLM 或 SGLang),新功能开发已停止 - RAG 场景优先评估 SGLang,前缀缓存对同文档多用户场景有结构性优势 - 70B+ 大模型无明显引擎差异,按团队熟悉度选型

引用格式:

Perrone, P. (2026). vLLM vs Ollama vs SGLang vs TensorRT-LLM Serving 2026. The AI Engineer. https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt


条目 B ✅ — RoofLang: AI 自动设计 LLM Inference 系统(arXiv 2026-09,新系统方向)

来源: arXiv · https://arxiv.org/html/2609.12551v1 标题: RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems 可信度: ⭐⭐⭐⭐ | 工程价值: 高(系统方向,GB300 实测数据) 标签: rooflang llm-inference-design automated arxiv2026 gb300

摘要与核心发现

RoofLang 是一个用 AI Agent 自动设计/优化 LLM 推理系统配置/架构的框架,核心思路是:

  • 给定硬件平台(GPU 类型、内存、互联带宽)和 Workload 描述
  • AI Agent 在搜索空间中探索系统配置(批大小、Tensor Parallel 度数、Prefill/Decode 是否解耦、KV Cache 策略等)
  • 使用真实硬件性能反馈迭代优化

关键工程数据(GB300 / 64 GPU 配置):

Model Per-request 参数传输量 Per-request KV Cache 占用 Per-request KV Cache 流量 Peak Batch Size Per-decode-token 内存流量
DeepSeek V4 Flash 2.277 MiB 0.192 GiB 0.033 GiB 65,536 0.035 GiB
GLM-5.3 173.618 MiB 2.906 GiB 0.250 GiB 4,096 0.419 GiB
DeepSeek V4 Pro 24.811 MiB 0.275 GiB 0.055 GiB 32,768 0.079 GiB
Kimi K3 175.897 MiB 1.065 GiB 1.065 GiB 8,192 1.237 GiB

关键洞察: - DeepSeek V4 Flash 的 KV Cache 设计极度紧凑(0.192 GiB vs GLM 2.906 GiB),支撑 65K 超大 batch 和极低 per-token 内存流量 - 紧凑 KV Cache 设计是 2026 年新模型架构竞争的核心维度之一(对应 MLA / DeepSeek-V4 CSA 注意力架构压缩) - RoofLang 用 Agent 发现 DeepSeek V4 Pro 在 B300 上性能提升 6.23%–50.1%,超越人工调优 baseline

后续行动: - [ ] 核验 RoofLang GitHub 是否有开源实现(论文只引用了 GitHub 仓库但未提供链接) - [ ] 关注 InferenceBench(arXiv 2607.20468):AI Agent 优化 LLM 推理的 Benchmark - [ ] 与 DeepSeek-V4 系列论文交叉阅读:KV Cache 压缩的架构根因

引用格式:

Gai et al. (2026). RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems. arXiv:2609.12551. https://arxiv.org/html/2609.12551v1


条目 C ✅ — EdgeAgent: Apple Silicon 统一内存多 Agent 推理调度(arXiv 2026-10,边缘推理新方向)

来源: arXiv · https://arxiv.org/html/2610.03394v1 标题: EdgeAgent: Orchestrating On-Device LLM Inference for End-User Multi-Agent Systems on CPU-GPU Unified Memory Architectures 日期: 2026-10-02(极新) 可信度: ⭐⭐⭐⭐ | 工程价值: 高(边缘推理方向,Apple Silicon 特定) 标签: edgeagent apple-silicon uma multi-agent on-device kv-cache arxiv2026

摘要与核心发现

EdgeAgent 解决的是端侧多 Agent LLM 推理问题:在 CPU-GPU 统一内存架构(如 Apple M 系列芯片)上高效调度多个并发 Agent 工作负载,每个 Agent 需要独立 KV Cache 状态。

问题背景: - 多 Agent 框架(LangGraph 2026, OpenClaw)对单设备推理的资源竞争问题 - 现有系统无法高效处理多 Agent 并发,因为 KV Cache 在 Agent 间无共享机制

核心技术贡献:

  1. In-place KV Cache Freeze(原地 KV Cache 冻结) - 当 Agent 等待外部工具(API 调用、I/O)执行时,其 KV Cache 不需要写出内存 - 利用 UMA 物理共享寻址,直接冻结当前 GPU 内存位置 - 工具执行完成后,从冻结位置恢复推理,零重新 Prefill 开销

  2. UMA-aware 调度器 - 感知 CPU-GPU 统一内存的物理地址布局 - 优先调度同一内存区域的 Agent,最大化 Cache 局部性

  3. 硬件偏移映射压缩(offset-remapping compaction) - 冻结后的 Agent KV Cache 重新映射地址,为活跃 Agent 腾出物理内存 - 恢复时通过硬件级偏移表完成地址转换,无需数据搬迁

评估结论: 该设计对 Apple Silicon + 本地推理场景(隐私敏感、无网络延迟的业务工作流)有直接价值,与主流 GPU 云端推理主题互补。

与现有 inbox 条目差异: 历史 draft 覆盖 vLLM/SGLang 生产部署,均为云端 H100 场景;本条目补充端侧 Apple Silicon 多 Agent 推理这一空白方向。

后续行动: - [ ] 核验 LangGraph 2026 多 Agent 框架的端侧支持情况 - [ ] 关注 OpenClaw(本文引用)在端侧推理的集成可能性 - [ ] 评估 MLX(Apple Silicon ML 框架)与 EdgeAgent 思想的关联

引用格式:

EdgeAgent Authors. (2026). EdgeAgent: Orchestrating On-Device LLM Inference for End-User Multi-Agent Systems on CPU-GPU Unified Memory Architectures. arXiv:2610.03394. https://arxiv.org/html/2610.03394v1


三、丢弃条目记录

条目 丢弃理由
AI Engineering Insider: Senior LLM Inference Engineer Interview 付费内容,仅免费预览有框架性目录;核心 TGI 停止维护数据已在本文档条目A覆盖;面试大纲非工程实践条目
Ken Huang Substack Ch.6: Disaggregated Serving (Mooncake/DistServe) 付费墙严重;Prefill-Decode 解耦主题在历史 inbox(2026-06-13 晚间)已有初步覆盖;需订阅才能获取新数据
Pragmatic Engineer: What is Inference Engineering 概念性综述(infrastructure / runtime / serving 三层),无新实测数据;可作为新人入门引用但不进入知识库正文
Starmorph: RAG Techniques Compared (Cost per Query) 成本估算类文章(Naive RAG ~$0.001, Agentic RAG ~$0.01-0.10),适合产品/商业评估但无命令/源码/性能数据
20 Advanced RAG Types (Turing Post) 综述分类,无工程深度;RAG 类型学文献已有其他来源覆盖
RAG Techniques Compared: chunk size / overlap / contextual summaries 工程参数建议(200-500 tokens, 10-20% overlap),数值合理但来源 starmorph.com 权威性有限,且参数建议属通用共识非新发现

四、本次写入汇总

写入路径 条目数 核心标签
/shared/research-kb/inbox/jay/2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md 3条保留 + 6条丢弃记录 tgi-deprecation rooflang edgeagent vllm sglang apple-silicon

建议后续行动(Knowledge Base Team): 1. TGI 停止维护事件 → 更新 Inference Engine 选型指南文档(新增"历史遗留 TGI 系统迁移路径"章节) 2. RoofLang → 关注开源实现 release;与 DeepSeek-V4 MLA/KV Cache 压缩论文交叉归档 3. EdgeAgent → 建议与 Apple Silicon MLX 生态关联归档(端侧推理专题页) 4. 本次日期 2026-10-06,距离上一批次(2026-06-15)约 3.5 个月,Inference 工程方向演进快,建议月频扫描


Jay · 2026-10-06 · 工程二次筛选完成 · 无 GitHub 写入