Jay · 工程实践筛选草稿 · 2026-10-09 上午

主题

LLM 系统运维工程 · vLLM Inference 基础设施 · Agent Memory 成本模型 · Agent Harness 架构

检索范围

  • Stack Overflow Blog、Network Bachelor、GMI Cloud、Medium(2026-10 月新发布)
  • Substack 候选(时间过旧,已过滤)
  • 时间:优先 2026-10 月

一、高价值-A(源码/完整流水线)

🔥 A1:Stack Overflow Blog — Part 5: LLM System Operability

  • URL: https://stackoverflow.blog/2026/10/08/part-5-operating-an-llm-system-observability-cost-routing-and-the-platform-underneath
  • 发布日期: 2026-10-08
  • 作者: Stack Overflow Blog(技术社区,工程导向)
  • 可信度: 高,6级生产成熟度模型第5级(Operability),社区验证
  • 核心工程观点: 1. Gateway 作为单一瓶颈:cost 测量、model routing、failover、kill switch 集中在 gateway 层——系统可operable的关键 2. decision_id 贯穿全链路:每个请求分配唯一 ID,连接 gateway/routing/observability/cost 四个维度 3. 跨租户隔离四原则:HMAC 非对称签名(防伪造)+ 最短 TTL(防泄漏)+ 每 hop 验证(防注入)+ 跨租户拒绝记审计日志(不只是 403) 4. Agent 平台两个失败极端:
    • 欠供给:无审计存储、无 secrets management、一个共享 god credential
    • 过供给:一个队列+三个数据库+服务网格,服务本身其实无状态 5. 传统服务 vs LLM 系统的失败不对称:传统服务错返回 500;LLM 系统出错可在规模上快速执行错误动作——operability 是运行/希望的区别 6. 实际短名单(under/over-provisioning 之间的真正选项)
  • 工程价值: ⭐⭐⭐⭐⭐ 最新 Oct 8,gateway/routing/kill-switch/identity 模型具体,生产经验
  • 版本/环境: 无特定版本依赖(架构原则)
  • 复现价值: 高,可直接带入 architecture review
  • 分类标签: LLMops Operability Gateway Multi-tenancy Observability Agent
  • 建议行动: 精读;纳入 LLM 系统运维主题页

二、高价值-B(完整工程架构)

🔥 B1:Network Bachelor — vLLM 2026 Infrastructure Engineer Guide

  • URL: https://www.networkbachelor.com/vllm-infrastructure-guide-pagedattention-kv-cache
  • 发布日期: 2026-10-03
  • 作者: Abhishek Kunal(e& enterprise,12年数据中心+AI基础设施经验)
  • 可信度: 高,资深 infra 工程师
  • 核心工程观点: 1. 四大优化已成 2026 默认(vLLM/SGLang/TensorRT-LLM 均内置):
    • PagedAttention(非连续 KV cache 分配)
    • Continuous Batching(请求进入正在运行的 batch 而非等待)
    • Chunked Prefill(平衡长 prompt 和 active decode 负载)
    • Prefix Caching(共享前缀提示的复用) 2. PagedAttention 核心数字:2023年实测系统浪费 62%~80% 的 KV cache 预分配;PagedAttention 将浪费压缩到最后一个半满 page 3. 容量规划起点改变:从 token 量、内存需求、延迟、工作负载特征出发,而非先看 GPU 数量 4. KV cache 内存公式:num_layers × 2 × num_kv_heads × head_dim × seq_len × dtype_bytes
    • 示例:Llama-3-70B @ BF16,4K context = ~1.3 GB/request(线性增长) 5. 结尾 checklist:每篇文章带可直接带入设计评审的 checklist 6. ⚠️ 版本警告:vLLM flag/默认/metric 名称在版本间变化,生产部署前需对照 docs
  • 工程价值: ⭐⭐⭐⭐⭐ infra 层硬核内容,生产直接可用
  • 版本/环境: vLLM(2026 latest);CUDA;GPU 服务器
  • 复现价值: 高,含具体计算公式和 checklist
  • 分类标签: vLLM Inference PagedAttention KV-Cache Continuous-Batching Infrastructure
  • 建议行动: 精读;vLLM 专题页参考

🔥 B2:GMI Cloud — Agent Memory Architecture in Production

  • URL: https://www.gmicloud.ai/en/blog/agent-memory-architecture-working-session-and-long-term-memory-in-production
  • 发布日期: 2026-10-04
  • 可信度: 高,内存架构专项分析
  • 核心工程观点: 1. 三层内存架构(各有存储介质、延迟、失败模式):
    • Working Memory = context window 本身(每 token 在每次 forward pass 付成本)
    • Session Memory = per-thread 状态,跨 turn 存活
    • Long-term Memory = 跨会话知识,唯一真正困难的层 2. 颠覆直觉的成本模型:提取和合并的 LLM 调用成本是存储成本的 10-100 倍——dominant cost 是推理不是存储 3. 最有效的成本决策:session 边界批量合并(40轮对话末尾合并1次 = 1次提取调用),而非每消息合并(= 40次调用) 4. 三大难点(都是写入策略问题,非检索问题):
    • 跨会话身份(cross-session identity)
    • 时序抽象(temporal abstraction at scale)
    • 内存过期(memory staleness) 5. 内存是独立架构组件:不是挂在 context window 上的 longer prompt;2026年 treat 为 first-class architectural primitive 6. 上下文窗口变大(1M+ tokens)不等于解决了内存问题;更大的窗口改变的是"什么塞进去 vs 什么按需检索"的权衡
  • 工程价值: ⭐⭐⭐⭐⭐ 成本模型颠覆直觉,生产决策依据
  • 版本/环境: 无特定版本(架构原则)
  • 复现价值: 高,成本模型直接可量化
  • 分类标签: Agent Memory-Architecture Cost-Model Session-Memory Long-term-Memory
  • 建议行动: 精读;Agent Memory 主题页核心参考

三、框架性参考(降级收录)

参考-R1:Medium — The Harness Is the Product (Agents 2026)

  • URL: https://medium.com/data-science-collective/the-harness-is-the-product-how-agents-are-actually-built-in-2026-4b751480f60c
  • 日期: 2026
  • 可信度: 中高,框架性
  • 核心观点:
  • AI 工程演进三阶段:app+LLM API → app+LLM+RAG+tools → harness(模型插中间)
  • Agent harness 13 组件:context management、memory、operations catalog(progressive discovery)、selection、tool execution、code runtime、browser、model routing、policy、identity、credentials、human approval、durable state、observability、evaluation
  • 经典 agent loop 仍然存在,只是不再是架构本身
  • 每一行代码(messages/tools/execute/while)都隐藏完整子系统
  • 工程价值: ⭐⭐⭐ 框架索引用,不含可执行细节
  • 分类标签: Agent Architecture Harness System-Design
  • 建议行动: 收录框架索引;精读价值低

四、过滤记录

条目 过滤原因
AIxFunda Substack Weekly (Feb-Mar 2026) 时间过旧(~8个月前),非当月内容;Substack 调研已由 morning draft 覆盖
YouTube: 6 Pillars of Agentic Harness 视频格式,无 transcript,无法提取工程要点
Generic "AI Agent Architecture" 宽泛指南 内容宽泛,与具身智能等 morning draft 条目重叠
InfoQ: Reusable Evaluation Frameworks QCon AI 演讲,需获取 transcript 才有工程价值

分类标签汇总

LLMops Operability Gateway Multi-tenancy Observability Agent vLLM Inference PagedAttention KV-Cache Continuous-Batching Memory-Architecture Cost-Model Session-Memory Long-term-Memory Harness Architecture

建议行动

  1. 精读:A1(Operability Part 5)、B2(Agent Memory 成本模型)——纳入对应主题页
  2. 参考:B1(vLLM Guide)——vLLM 专题页
  3. 索引收录:R1(Harness 13 组件)——Agent Architecture 框架页
  4. 后续跟进:RAGBench/AgentBench 2026-10 月 benchmark 更新;vLLM 分布式 multi-node setup

Jay · 2026-10-09T10:50 · 工程筛选草稿 · 请勿直接 push GitHub