Jay · 工程筛选报告 · 2026-08-23 晚间
主题
Substack AI 工程精选 × 推理引擎深度对比 × Agent Harness 工程 × 新兴 KV Cache 研究
检索范围:Substack(AI Engineer、MLwithDev、HowToUseAI、Opinion AI、The Sequence)
辅助来源:arXiv 2026-08 新论文(KV Cache 系统、Prefix Caching、推理调度)
时间窗口:近 7 天
一、Substack 高价值条目
🔴 强推 #1 — The AI Engineer(Paolo Perrone):推理引擎四选一决策框架
URL:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
作者:Paolo Perrone,The AI Engineer 主笔
发布日期:2026-04(工程图景仍然有效,2026-08 更新确认)
可信度:高(多家独立 benchmark 交叉引用,含 SitePoint、Particula Tech、Spheron、NVIDIA 官方数据)
核心工程数据
| 引擎 | 定位 | 核心特性 | 适合场景 |
|---|---|---|---|
| Ollama | 本地快速启动 | ollama run llama3.1 一命令运行;100K+ GitHub stars;M4 Mac 跑 Qwen 2.5 32B ≈ 15 tokens/s |
单用户、macOS/Windows 快速实验 |
| vLLM | 生产默认 | PagedAttention 防 GPU 内存浪费;硬件覆盖最广;生态最大 | 通用生产级部署首选 |
| SGLang | 前缀复用密集 | RadixAttention 前缀缓存;共享上下文吞吐量 +29%(vs vLLM) | 多轮对话、RAG pipeline、Agent 循环 |
| TensorRT-LLM | 极致 NVIDIA 性能 | 手工调优;H100 上比 vLLM 高 15-30%;需 1-2 周编译调优;仅 NVIDIA | 峰值性能优先、模型固定不变的生产场景 |
| llama.cpp | 边缘/本地 | MTP(Multi-Token Prediction)在 Qwen 3.6 27B 上 >×2 加速;Qwen 3.6 35B 上 MTP 有精度退化 | CPU/边缘/无 GPU 环境 |
重大信号:TGI(HuggingFace Text Generation Inference)已正式进入维护模式,HuggingFace 官方推荐迁移至 vLLM 或 SGLang。
工程决策树:
需要 5 分钟内跑起来?→ Ollama
多用户并发 + 请求共享上下文(聊天/RAG/Agent)?→ SGLang(+29% 吞吐)
请求完全唯一无重复?→ vLLM
NVIDIA 硬件 + 模型固定 + 愿意投入 1-2 周调优?→ TensorRT-LLM
边缘/无 GPU/CPU 优先?→ llama.cpp
社区实测(评论区):Llama.cpp MTP 在 Qwen 3.6 27B 上 >2× 加速,但 Qwen 3.6 35B 上有精度退化(社区多用户确认),作者 Laurent 在 Strix Halo(AMD)上用 llama.cpp 比 Ollama 更可控。
评价:工程选型必备参考,不再是模糊的"都差不多",而是场景驱动的量化决策框架。
标签:Inference-Engine vLLM SGLang TensorRT-LLM Ollama llama.cpp TGI-EOL Benchmark
🔴 强推 #2 — MLwithDev(Shirin Khosravi Jam):LLM Inference 101 机制解析
URL:https://jamwithai.substack.com/p/llm-inference-101
合著者:Dev Jadhav(Staff ML Systems Engineer)
发布日期:2026-08(本月)
可信度:高(arXiv 论文直引 + Databricks/NVIDIA 官方文档)
核心工程知识点
三种 Batching 策略对比: | 类型 | 机制 | 缺点 | |------|------|------| | Static | 请求凑成一组,一起跑完 | 短请求等长请求,GPU 空转 | | Dynamic | 短时间窗口收集请求再发 | 同组结束时间仍不一致 | | Continuous(In-flight) | 每个 token 步重决策批次成员 | Orca OSDI 2022 引入 |
Anyscale 基准:Continuous Batching + vLLM PagedAttention = OPT-13B A100 40GB 上 23× 吞吐(vs naive batching,数字来自单一工作负载,方向性结论泛化价值高)
四种瓶颈(图景): - Compute-bound(单 GPU,首个瓶颈) - Bandwidth-bound(单 GPU,decode 阶段) - Communication-bound(多 GPU,all-reduce 每次 layer) - Overhead-bound(小 batch + 小模型,CPU 调度开销;因此 vLLM/TensorRT-LLM 用 CUDA graph 捕获 decode step)
优化图谱(每行回答:这个技术释放了什么资源?): 涵盖 FlashAttention、Continuous Batching、PagedAttention、TensorRT-LLM、TGI、SGLang RadixAttention、投机解码、量化等。
延伸阅读清单(均为顶级资源): 1. The Illustrated Transformer — Jay Alammar 2. Transformer Inference Arithmetic — Kipply Chen(含更多数学细节) 3. PagedAttention paper — Kwon et al. SOSP 2023 4. Orca paper — Yu et al. OSDI 2022(Continuous Batching 起源) 5. Sarathi-Serve — Agrawal et al. OSDI 2024 6. LLM Inference Performance Engineering Best Practices — Databricks 7. Mastering LLM Techniques: Inference Optimization — NVIDIA
评价:工程教育级内容,机制清晰,适合作为团队内训材料或面试准备框架。
标签:Inference-Deep-Dive Continuous-Batching PagedAttention Bottleneck-Analysis Education
🔴 强推 #3 — HowToUseAI(Ida Silfverskiold):Token 节省实战深度
URL:https://howtouseai.substack.com/p/deep-dive-how-to-save-on-tokens
发布日期:2026-08
可信度:中高(vLLM 官方文档 + 实际命令)
核心工程细节
vLLM 前缀缓存机制:
prompt → 分 block 哈希(基于 token 内容+前序 token)→ K/V tensor 按 hash 存储
启用命令:--enable-prefix-caching
block size 调整:--block-size N(每 block 的 token 数,默认行为取决于引擎)
重要失效条件(踩坑点): - 空格差异 → hash 不同 → 缓存失效 - tool definition 顺序变化 → 缓存失效 - 时间戳位置不对 → 缓存失效 - 只要 token 有任何差异,K/V 必须重新计算
实际收益估算:相同的 system prompt + RAG 上下文 = 每次调用节省约 5 秒 prefill 时间(具体取决于 prefill 长度)
TTL 机制:缓存的 K/V tensor 占 GPU 内存,providers 通常设 5-10 分钟 TTL 后自动清除。
Anthropic Tool Search:
- Anthropic 高级 Tool Search:10K+ 工具定义从 55K-134K tokens 压缩到动态检索
- 仅当有工具匹配时,才将定义以 tool_reference block 内联追加到对话
- 在 4,000 工具测试中效果一般,10K+ 工具场景待进一步验证
Token 级联路由: - 先走便宜模型 → 低置信度时升级到贵模型 - LLMRouter、RouteLLM、OpenRouter Auto 等已有参考实现
评价:命令+机制+失效条件三合一,是 17:35 报告中推理引擎数据的实践补充。
标签:Token-Optimization Prefix-Caching vLLM Context-Management Cost-Engineering
🟡 中推 #4 — Opinion AI(Emerging AI):Master Inference Engineering 实战工具栈
URL:https://emergingai.substack.com/p/master-inference-engineering-the
作者:Opinion AI
发布日期:2026-08-22(昨日)
付费:部分付费
可信度:中高(列出了完整工具栈和命令清单)
核心内容
- 覆盖完整推理工程知识图谱:training vs inference、prefill vs decode、KV cache、TTFT vs token speed、model routing、prefix caching、context control、batching、agent loops、graph engineering、long-term memory、token costs、multi-GPU scaling
- 实战 vLLM 搭建:含命令、benchmark、prompt 模板
- 工具栈:vLLM + SGLang + TensorRT-LLM + NVIDIA Dynamo + LangGraph
- 提供了可视化指南视频(由 Tech Fusionist 制作)
NVIDIA trace 案例: - 一次 33 分钟 agent session → 58 个主 turn、225 个 sub-agent call、283 个独立推理请求 - 上下文从 15,000 tokens 增长到 156,000 tokens 才触发压缩
评价:内容体系完整,但付费门槛影响实用性;免费部分已披露足够信息,可作为工程检查清单使用。
标签:Inference-Engineering Tool-Stack vLLM SGLang Dynamo LangGraph
🟡 中推 #5 — Aishwarya Srinivasan:Harness Engineering 生产框架
URL:https://aishwarya.substackstack.com/p/all-you-need-to-know-about-harness(原文链接格式异常,来源于摘要引用)
来源摘要:https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness
发布日期:2026-08
可信度:中(引用 Mitchell Hashimoto 2026 定义,可交叉验证)
核心观点
Agent = Model + Harness(Mitchell Hashimoto 2026 年定义,业界已收敛)
生产失败根因:95% 的企业 AI Agent 从未进入生产环境。原型阶段演示良好,但在安全审查、可观测性、边缘情况幻觉、治理机制上失败。
Harness 三层框架:
Layer 1: Context and Orchestration(上下文 + 编排)
Layer 2: Tools, Permissions, and Governance Boundary(工具 + 权限 + 治理边界)
Layer 3: Evaluation, Observability, and Feedback Loop(评测 + 可观测性 + 反馈循环)
评价:概念框架清晰,与 17:35 的 Graphify 代码知识图谱方向互补。适合作为 Agent 生产成熟度评估的自查表。
标签:Agent-Architecture Harness-Engineering Production-Maturity Observability
二、arXiv 新研究(与 Substack 互补)
★ OmniInfer:Prefix-Cache-Aware 负载调度(arXiv 2026, SESAME '26)
URL:https://arxiv.org/html/2511.22481v2
发布:2026-04(SESAME '26),近期公开
核心贡献:
- OmniProxy 组件集成 vLLM Automatic Prefix Cache(APC)
- 调度评分公式:πP(i) = MatchP(i) − α·ρP
- MatchP = 前缀匹配得分(radix-tree lookup)
- ρP = prefill 节点即时负载(运行请求数 + token 数)
- α = 缓存局部性 vs 负载均衡的权衡系数
- 覆盖完整请求生命周期 8 个阶段:tokenize → APC matching → prefill wait → prefill scheduled → prefill running → decode wait → decode scheduled → decode running
- 实时采集:TTFT、TPOT、prompt length、前缀匹配分、队列长度、batch 执行时间、吞吐
工程意义:提供了"前缀缓存 + 负载均衡联合优化"的工程实现细节,可直接参考设计多租户推理网关。
标签:Inference-System Prefix-Caching Load-Balancing OmniProxy arXiv-2026
★ An Internet for the KV Cache(arXiv:2608.01526v1,2026-08)
URL:https://arxiv.org/html/2608.01526v1
发布日期:2026-08-03
核心观点:
- LLM 推理已从"计算问题"演化为"全局内容分发问题"
- KV Cache 应该成为基础设施级一等公民(类似 CDN)
- 跨模型、跨区域、跨 provider 的 KV Cache 调度需要:control plane + 协议 + 抽象 + 度量
- 联合优化:compression + offloading + prefetching + routing + recomputation + scheduling + model-level reuse
工程意义:概念框架论文,但指明了 2027-2028 年 KV Cache 分布式系统的研究方向。
标签:KV-Cache Distributed-Systems Infrastructure Future-Direction arXiv-2026
★ GORGO:跨区域 Prefix-Cache 感知的 LLM 路由调优
URL:https://arxiv.org/html/2602.11688v3
核心问题:一致性哈希或前缀复用路由在 bursty workload 下会导致热点 replica 队列排队(HOL blocking),反而抵消 prefix cache 的收益。
- GORGO 在线调优模型,平衡 prefix-cache 复用率 vs 跨区域延迟 vs 队列延迟
- 90% 前缀匹配的 100K token 请求 → 只需 prefill 10K token
标签:Cross-Region LLM-Routing Prefix-Cache Optimization arXiv
三、傍晚工程新闻
Groq 完成 $3.5B 估值 Series A
- 金额:$350M,Disruptive 领投,Nvidia 参投
- 战略转型:从自研 LPU 芯片 → Nvidia GPU 的推理 neocloud,运营 13 个数据中心
- 工程意义:专用推理芯片路线受挫,云推理向 Nvidia GPU 收敛
Temporal 融资谈判:$500M at $12B+ pre-money
- 产品:durable execution platform(agent 工作流失败后从断点恢复,而非重启)
- 估值对比:2026-02 估值 $5B+,本次翻倍以上
- Agent 工程意义:durable execution 是长时 Agent 的核心基础设施需求,资本市场正在确认
The Sequence Radar #919:DeepSeek V4 + Claude Fable + GPT-5.6 评测
- DeepSeek V4 Pro(SWE-bench Verified 96.40%,自评;第二,Claude Opus 5 之后)
但 LiveBench Agentic Coding 排名最末。强 patch-style coder,弱 long-horizon agent。 - Claude Fable 5 失败分析:仅 25% 的失败 run 触达了修复文件所在位置(找错地方)
- GPT-5.6 失败分析:80% 找对了文件,但修复方式错误
- 实践建议:review Claude 时审计其导航能力;review GPT 时审计其修复逻辑
标签:Model-Evaluation SWE-bench DeepSeek-V4 Claude GPT Benchmark-Analysis
四、筛选结论
| 条目 | 保留理由 | 丢弃理由 |
|---|---|---|
| The AI Engineer 推理引擎对比 | 四选一量化框架;TGI EOL 信号;社区 MTP 实测数据 | 部分内容与 17:35 报告重叠(引擎对比) |
| MLwithDev LLM Inference 101 | 机制清晰;batching 23× 基准;延伸阅读清单权威 | 背景知识为主,少有新数据 |
| HowToUseAI Token 节省 | vLLM --enable-prefix-caching 命令;失效条件列举;5 秒/call 实测 |
部分为 API 节省(OpenRouter 类),工程参考有限 |
| Opinion AI Master IE | 工具栈完整;NVIDIA trace 数据;视频资源 | 付费门槛;核心信息已从摘要获取 |
| Harness Engineering | Agent 生产成熟度自查表;95% 失败率数据 | 概念为主,缺可执行步骤 |
| OmniInfer | 调度评分公式;8 阶段请求生命周期;工程实现细节 | 系统论文,非实操命令 |
| An Internet for KV Cache | 概念框架指明方向 | 太超前,无直接工程价值 |
| GORGO | 跨区域路由调优 | 仍在 arXiv,非生产系统 |
| Groq/Temporal 融资 | 行业信号 | 非工程内容 |
五、本次写入条目
精读建议(按优先级): 1. The AI Engineer 推理引擎四选一框架 → 入「推理引擎选型」主题页 2. HowToUseAI Token 节省(含 vLLM 命令+失效条件)→ 入「推理工程实战」主题页 3. MLwithDev Inference 101 机制 + 23× batching 数据 → 入「LLM 推理原理」主题页 4. OmniInfer 调度公式 → 入「推理系统架构」参考 5. DeepSeek V4 评测分析(Claude 导航问题 / GPT 修复问题)→ 入「Agent 评测」主题页
Jay · 2026-08-23 19:50 CST · Substack 工程精选 + arXiv KV Cache + 傍晚融资新闻 · 精读条目 5 条 · 草稿输出