Jay · 工程筛选报告 · 2026-08-23 晚间

主题

Substack AI 工程精选 × 推理引擎深度对比 × Agent Harness 工程 × 新兴 KV Cache 研究

检索范围:Substack(AI Engineer、MLwithDev、HowToUseAI、Opinion AI、The Sequence)
辅助来源:arXiv 2026-08 新论文(KV Cache 系统、Prefix Caching、推理调度)
时间窗口:近 7 天


一、Substack 高价值条目

🔴 强推 #1 — The AI Engineer(Paolo Perrone):推理引擎四选一决策框架

URL:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
作者:Paolo Perrone,The AI Engineer 主笔
发布日期:2026-04(工程图景仍然有效,2026-08 更新确认)
可信度:高(多家独立 benchmark 交叉引用,含 SitePoint、Particula Tech、Spheron、NVIDIA 官方数据)

核心工程数据

引擎 定位 核心特性 适合场景
Ollama 本地快速启动 ollama run llama3.1 一命令运行;100K+ GitHub stars;M4 Mac 跑 Qwen 2.5 32B ≈ 15 tokens/s 单用户、macOS/Windows 快速实验
vLLM 生产默认 PagedAttention 防 GPU 内存浪费;硬件覆盖最广;生态最大 通用生产级部署首选
SGLang 前缀复用密集 RadixAttention 前缀缓存;共享上下文吞吐量 +29%(vs vLLM) 多轮对话、RAG pipeline、Agent 循环
TensorRT-LLM 极致 NVIDIA 性能 手工调优;H100 上比 vLLM 高 15-30%;需 1-2 周编译调优;仅 NVIDIA 峰值性能优先、模型固定不变的生产场景
llama.cpp 边缘/本地 MTP(Multi-Token Prediction)在 Qwen 3.6 27B 上 >×2 加速;Qwen 3.6 35B 上 MTP 有精度退化 CPU/边缘/无 GPU 环境

重大信号:TGI(HuggingFace Text Generation Inference)已正式进入维护模式,HuggingFace 官方推荐迁移至 vLLM 或 SGLang。

工程决策树

需要 5 分钟内跑起来?→ Ollama
多用户并发 + 请求共享上下文(聊天/RAG/Agent)?→ SGLang(+29% 吞吐)
请求完全唯一无重复?→ vLLM
NVIDIA 硬件 + 模型固定 + 愿意投入 1-2 周调优?→ TensorRT-LLM
边缘/无 GPU/CPU 优先?→ llama.cpp

社区实测(评论区):Llama.cpp MTP 在 Qwen 3.6 27B 上 >2× 加速,但 Qwen 3.6 35B 上有精度退化(社区多用户确认),作者 Laurent 在 Strix Halo(AMD)上用 llama.cpp 比 Ollama 更可控。

评价:工程选型必备参考,不再是模糊的"都差不多",而是场景驱动的量化决策框架。

标签Inference-Engine vLLM SGLang TensorRT-LLM Ollama llama.cpp TGI-EOL Benchmark


🔴 强推 #2 — MLwithDev(Shirin Khosravi Jam):LLM Inference 101 机制解析

URL:https://jamwithai.substack.com/p/llm-inference-101
合著者:Dev Jadhav(Staff ML Systems Engineer)
发布日期:2026-08(本月)
可信度:高(arXiv 论文直引 + Databricks/NVIDIA 官方文档)

核心工程知识点

三种 Batching 策略对比: | 类型 | 机制 | 缺点 | |------|------|------| | Static | 请求凑成一组,一起跑完 | 短请求等长请求,GPU 空转 | | Dynamic | 短时间窗口收集请求再发 | 同组结束时间仍不一致 | | Continuous(In-flight) | 每个 token 步重决策批次成员 | Orca OSDI 2022 引入 |

Anyscale 基准:Continuous Batching + vLLM PagedAttention = OPT-13B A100 40GB 上 23× 吞吐(vs naive batching,数字来自单一工作负载,方向性结论泛化价值高)

四种瓶颈(图景): - Compute-bound(单 GPU,首个瓶颈) - Bandwidth-bound(单 GPU,decode 阶段) - Communication-bound(多 GPU,all-reduce 每次 layer) - Overhead-bound(小 batch + 小模型,CPU 调度开销;因此 vLLM/TensorRT-LLM 用 CUDA graph 捕获 decode step)

优化图谱(每行回答:这个技术释放了什么资源?): 涵盖 FlashAttention、Continuous Batching、PagedAttention、TensorRT-LLM、TGI、SGLang RadixAttention、投机解码、量化等。

延伸阅读清单(均为顶级资源): 1. The Illustrated Transformer — Jay Alammar 2. Transformer Inference Arithmetic — Kipply Chen(含更多数学细节) 3. PagedAttention paper — Kwon et al. SOSP 2023 4. Orca paper — Yu et al. OSDI 2022(Continuous Batching 起源) 5. Sarathi-Serve — Agrawal et al. OSDI 2024 6. LLM Inference Performance Engineering Best Practices — Databricks 7. Mastering LLM Techniques: Inference Optimization — NVIDIA

评价:工程教育级内容,机制清晰,适合作为团队内训材料或面试准备框架。

标签Inference-Deep-Dive Continuous-Batching PagedAttention Bottleneck-Analysis Education


🔴 强推 #3 — HowToUseAI(Ida Silfverskiold):Token 节省实战深度

URL:https://howtouseai.substack.com/p/deep-dive-how-to-save-on-tokens
发布日期:2026-08
可信度:中高(vLLM 官方文档 + 实际命令)

核心工程细节

vLLM 前缀缓存机制

prompt → 分 block 哈希(基于 token 内容+前序 token)→ K/V tensor 按 hash 存储

启用命令--enable-prefix-caching
block size 调整--block-size N(每 block 的 token 数,默认行为取决于引擎)

重要失效条件(踩坑点): - 空格差异 → hash 不同 → 缓存失效 - tool definition 顺序变化 → 缓存失效 - 时间戳位置不对 → 缓存失效 - 只要 token 有任何差异,K/V 必须重新计算

实际收益估算:相同的 system prompt + RAG 上下文 = 每次调用节省约 5 秒 prefill 时间(具体取决于 prefill 长度)

TTL 机制:缓存的 K/V tensor 占 GPU 内存,providers 通常设 5-10 分钟 TTL 后自动清除。

Anthropic Tool Search: - Anthropic 高级 Tool Search:10K+ 工具定义从 55K-134K tokens 压缩到动态检索 - 仅当有工具匹配时,才将定义以 tool_reference block 内联追加到对话 - 在 4,000 工具测试中效果一般,10K+ 工具场景待进一步验证

Token 级联路由: - 先走便宜模型 → 低置信度时升级到贵模型 - LLMRouter、RouteLLM、OpenRouter Auto 等已有参考实现

评价:命令+机制+失效条件三合一,是 17:35 报告中推理引擎数据的实践补充。

标签Token-Optimization Prefix-Caching vLLM Context-Management Cost-Engineering


🟡 中推 #4 — Opinion AI(Emerging AI):Master Inference Engineering 实战工具栈

URL:https://emergingai.substack.com/p/master-inference-engineering-the
作者:Opinion AI
发布日期:2026-08-22(昨日)
付费:部分付费
可信度:中高(列出了完整工具栈和命令清单)

核心内容

  • 覆盖完整推理工程知识图谱:training vs inference、prefill vs decode、KV cache、TTFT vs token speed、model routing、prefix caching、context control、batching、agent loops、graph engineering、long-term memory、token costs、multi-GPU scaling
  • 实战 vLLM 搭建:含命令、benchmark、prompt 模板
  • 工具栈:vLLM + SGLang + TensorRT-LLM + NVIDIA Dynamo + LangGraph
  • 提供了可视化指南视频(由 Tech Fusionist 制作)

NVIDIA trace 案例: - 一次 33 分钟 agent session → 58 个主 turn、225 个 sub-agent call、283 个独立推理请求 - 上下文从 15,000 tokens 增长到 156,000 tokens 才触发压缩

评价:内容体系完整,但付费门槛影响实用性;免费部分已披露足够信息,可作为工程检查清单使用。

标签Inference-Engineering Tool-Stack vLLM SGLang Dynamo LangGraph


🟡 中推 #5 — Aishwarya Srinivasan:Harness Engineering 生产框架

URL:https://aishwarya.substackstack.com/p/all-you-need-to-know-about-harness(原文链接格式异常,来源于摘要引用)
来源摘要:https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness
发布日期:2026-08
可信度:中(引用 Mitchell Hashimoto 2026 定义,可交叉验证)

核心观点

Agent = Model + Harness(Mitchell Hashimoto 2026 年定义,业界已收敛)

生产失败根因:95% 的企业 AI Agent 从未进入生产环境。原型阶段演示良好,但在安全审查、可观测性、边缘情况幻觉、治理机制上失败。

Harness 三层框架

Layer 1: Context and Orchestration(上下文 + 编排)
Layer 2: Tools, Permissions, and Governance Boundary(工具 + 权限 + 治理边界)
Layer 3: Evaluation, Observability, and Feedback Loop(评测 + 可观测性 + 反馈循环)

评价:概念框架清晰,与 17:35 的 Graphify 代码知识图谱方向互补。适合作为 Agent 生产成熟度评估的自查表。

标签Agent-Architecture Harness-Engineering Production-Maturity Observability


二、arXiv 新研究(与 Substack 互补)

★ OmniInfer:Prefix-Cache-Aware 负载调度(arXiv 2026, SESAME '26)

URL:https://arxiv.org/html/2511.22481v2
发布:2026-04(SESAME '26),近期公开
核心贡献: - OmniProxy 组件集成 vLLM Automatic Prefix Cache(APC) - 调度评分公式:πP(i) = MatchP(i) − α·ρP - MatchP = 前缀匹配得分(radix-tree lookup) - ρP = prefill 节点即时负载(运行请求数 + token 数) - α = 缓存局部性 vs 负载均衡的权衡系数 - 覆盖完整请求生命周期 8 个阶段:tokenize → APC matching → prefill wait → prefill scheduled → prefill running → decode wait → decode scheduled → decode running - 实时采集:TTFT、TPOT、prompt length、前缀匹配分、队列长度、batch 执行时间、吞吐

工程意义:提供了"前缀缓存 + 负载均衡联合优化"的工程实现细节,可直接参考设计多租户推理网关。

标签Inference-System Prefix-Caching Load-Balancing OmniProxy arXiv-2026


★ An Internet for the KV Cache(arXiv:2608.01526v1,2026-08)

URL:https://arxiv.org/html/2608.01526v1
发布日期:2026-08-03
核心观点: - LLM 推理已从"计算问题"演化为"全局内容分发问题" - KV Cache 应该成为基础设施级一等公民(类似 CDN) - 跨模型、跨区域、跨 provider 的 KV Cache 调度需要:control plane + 协议 + 抽象 + 度量 - 联合优化:compression + offloading + prefetching + routing + recomputation + scheduling + model-level reuse

工程意义:概念框架论文,但指明了 2027-2028 年 KV Cache 分布式系统的研究方向。

标签KV-Cache Distributed-Systems Infrastructure Future-Direction arXiv-2026


★ GORGO:跨区域 Prefix-Cache 感知的 LLM 路由调优

URL:https://arxiv.org/html/2602.11688v3
核心问题:一致性哈希或前缀复用路由在 bursty workload 下会导致热点 replica 队列排队(HOL blocking),反而抵消 prefix cache 的收益。 - GORGO 在线调优模型,平衡 prefix-cache 复用率 vs 跨区域延迟 vs 队列延迟 - 90% 前缀匹配的 100K token 请求 → 只需 prefill 10K token

标签Cross-Region LLM-Routing Prefix-Cache Optimization arXiv


三、傍晚工程新闻

Groq 完成 $3.5B 估值 Series A

  • 金额:$350M,Disruptive 领投,Nvidia 参投
  • 战略转型:从自研 LPU 芯片 → Nvidia GPU 的推理 neocloud,运营 13 个数据中心
  • 工程意义:专用推理芯片路线受挫,云推理向 Nvidia GPU 收敛

Temporal 融资谈判:$500M at $12B+ pre-money

  • 产品:durable execution platform(agent 工作流失败后从断点恢复,而非重启)
  • 估值对比:2026-02 估值 $5B+,本次翻倍以上
  • Agent 工程意义:durable execution 是长时 Agent 的核心基础设施需求,资本市场正在确认

The Sequence Radar #919:DeepSeek V4 + Claude Fable + GPT-5.6 评测

  • DeepSeek V4 Pro(SWE-bench Verified 96.40%,自评;第二,Claude Opus 5 之后)
    LiveBench Agentic Coding 排名最末。强 patch-style coder,弱 long-horizon agent。
  • Claude Fable 5 失败分析:仅 25% 的失败 run 触达了修复文件所在位置(找错地方)
  • GPT-5.6 失败分析:80% 找对了文件,但修复方式错误
  • 实践建议:review Claude 时审计其导航能力;review GPT 时审计其修复逻辑

标签Model-Evaluation SWE-bench DeepSeek-V4 Claude GPT Benchmark-Analysis


四、筛选结论

条目 保留理由 丢弃理由
The AI Engineer 推理引擎对比 四选一量化框架;TGI EOL 信号;社区 MTP 实测数据 部分内容与 17:35 报告重叠(引擎对比)
MLwithDev LLM Inference 101 机制清晰;batching 23× 基准;延伸阅读清单权威 背景知识为主,少有新数据
HowToUseAI Token 节省 vLLM --enable-prefix-caching 命令;失效条件列举;5 秒/call 实测 部分为 API 节省(OpenRouter 类),工程参考有限
Opinion AI Master IE 工具栈完整;NVIDIA trace 数据;视频资源 付费门槛;核心信息已从摘要获取
Harness Engineering Agent 生产成熟度自查表;95% 失败率数据 概念为主,缺可执行步骤
OmniInfer 调度评分公式;8 阶段请求生命周期;工程实现细节 系统论文,非实操命令
An Internet for KV Cache 概念框架指明方向 太超前,无直接工程价值
GORGO 跨区域路由调优 仍在 arXiv,非生产系统
Groq/Temporal 融资 行业信号 非工程内容

五、本次写入条目

精读建议(按优先级): 1. The AI Engineer 推理引擎四选一框架 → 入「推理引擎选型」主题页 2. HowToUseAI Token 节省(含 vLLM 命令+失效条件)→ 入「推理工程实战」主题页 3. MLwithDev Inference 101 机制 + 23× batching 数据 → 入「LLM 推理原理」主题页 4. OmniInfer 调度公式 → 入「推理系统架构」参考 5. DeepSeek V4 评测分析(Claude 导航问题 / GPT 修复问题)→ 入「Agent 评测」主题页


Jay · 2026-08-23 19:50 CST · Substack 工程精选 + arXiv KV Cache + 傍晚融资新闻 · 精读条目 5 条 · 草稿输出