Jay · 工程实践筛选草稿 · 2026-10-09 上午
主题
LLM 系统运维工程 · vLLM Inference 基础设施 · Agent Memory 成本模型 · Agent Harness 架构
检索范围
- Stack Overflow Blog、Network Bachelor、GMI Cloud、Medium(2026-10 月新发布)
- Substack 候选(时间过旧,已过滤)
- 时间:优先 2026-10 月
一、高价值-A(源码/完整流水线)
🔥 A1:Stack Overflow Blog — Part 5: LLM System Operability
- URL: https://stackoverflow.blog/2026/10/08/part-5-operating-an-llm-system-observability-cost-routing-and-the-platform-underneath
- 发布日期: 2026-10-08
- 作者: Stack Overflow Blog(技术社区,工程导向)
- 可信度: 高,6级生产成熟度模型第5级(Operability),社区验证
- 核心工程观点:
1. Gateway 作为单一瓶颈:cost 测量、model routing、failover、kill switch 集中在 gateway 层——系统可operable的关键
2.
decision_id贯穿全链路:每个请求分配唯一 ID,连接 gateway/routing/observability/cost 四个维度 3. 跨租户隔离四原则:HMAC 非对称签名(防伪造)+ 最短 TTL(防泄漏)+ 每 hop 验证(防注入)+ 跨租户拒绝记审计日志(不只是 403) 4. Agent 平台两个失败极端:- 欠供给:无审计存储、无 secrets management、一个共享 god credential
- 过供给:一个队列+三个数据库+服务网格,服务本身其实无状态 5. 传统服务 vs LLM 系统的失败不对称:传统服务错返回 500;LLM 系统出错可在规模上快速执行错误动作——operability 是运行/希望的区别 6. 实际短名单(under/over-provisioning 之间的真正选项)
- 工程价值: ⭐⭐⭐⭐⭐ 最新 Oct 8,gateway/routing/kill-switch/identity 模型具体,生产经验
- 版本/环境: 无特定版本依赖(架构原则)
- 复现价值: 高,可直接带入 architecture review
- 分类标签:
LLMopsOperabilityGatewayMulti-tenancyObservabilityAgent - 建议行动: 精读;纳入 LLM 系统运维主题页
二、高价值-B(完整工程架构)
🔥 B1:Network Bachelor — vLLM 2026 Infrastructure Engineer Guide
- URL: https://www.networkbachelor.com/vllm-infrastructure-guide-pagedattention-kv-cache
- 发布日期: 2026-10-03
- 作者: Abhishek Kunal(e& enterprise,12年数据中心+AI基础设施经验)
- 可信度: 高,资深 infra 工程师
- 核心工程观点:
1. 四大优化已成 2026 默认(vLLM/SGLang/TensorRT-LLM 均内置):
- PagedAttention(非连续 KV cache 分配)
- Continuous Batching(请求进入正在运行的 batch 而非等待)
- Chunked Prefill(平衡长 prompt 和 active decode 负载)
- Prefix Caching(共享前缀提示的复用)
2. PagedAttention 核心数字:2023年实测系统浪费 62%~80% 的 KV cache 预分配;PagedAttention 将浪费压缩到最后一个半满 page
3. 容量规划起点改变:从 token 量、内存需求、延迟、工作负载特征出发,而非先看 GPU 数量
4. KV cache 内存公式:
num_layers × 2 × num_kv_heads × head_dim × seq_len × dtype_bytes - 示例:Llama-3-70B @ BF16,4K context = ~1.3 GB/request(线性增长) 5. 结尾 checklist:每篇文章带可直接带入设计评审的 checklist 6. ⚠️ 版本警告:vLLM flag/默认/metric 名称在版本间变化,生产部署前需对照 docs
- 工程价值: ⭐⭐⭐⭐⭐ infra 层硬核内容,生产直接可用
- 版本/环境: vLLM(2026 latest);CUDA;GPU 服务器
- 复现价值: 高,含具体计算公式和 checklist
- 分类标签:
vLLMInferencePagedAttentionKV-CacheContinuous-BatchingInfrastructure - 建议行动: 精读;vLLM 专题页参考
🔥 B2:GMI Cloud — Agent Memory Architecture in Production
- URL: https://www.gmicloud.ai/en/blog/agent-memory-architecture-working-session-and-long-term-memory-in-production
- 发布日期: 2026-10-04
- 可信度: 高,内存架构专项分析
- 核心工程观点:
1. 三层内存架构(各有存储介质、延迟、失败模式):
- Working Memory = context window 本身(每 token 在每次 forward pass 付成本)
- Session Memory = per-thread 状态,跨 turn 存活
- Long-term Memory = 跨会话知识,唯一真正困难的层 2. 颠覆直觉的成本模型:提取和合并的 LLM 调用成本是存储成本的 10-100 倍——dominant cost 是推理不是存储 3. 最有效的成本决策:session 边界批量合并(40轮对话末尾合并1次 = 1次提取调用),而非每消息合并(= 40次调用) 4. 三大难点(都是写入策略问题,非检索问题):
- 跨会话身份(cross-session identity)
- 时序抽象(temporal abstraction at scale)
- 内存过期(memory staleness) 5. 内存是独立架构组件:不是挂在 context window 上的 longer prompt;2026年 treat 为 first-class architectural primitive 6. 上下文窗口变大(1M+ tokens)不等于解决了内存问题;更大的窗口改变的是"什么塞进去 vs 什么按需检索"的权衡
- 工程价值: ⭐⭐⭐⭐⭐ 成本模型颠覆直觉,生产决策依据
- 版本/环境: 无特定版本(架构原则)
- 复现价值: 高,成本模型直接可量化
- 分类标签:
AgentMemory-ArchitectureCost-ModelSession-MemoryLong-term-Memory - 建议行动: 精读;Agent Memory 主题页核心参考
三、框架性参考(降级收录)
参考-R1:Medium — The Harness Is the Product (Agents 2026)
- URL: https://medium.com/data-science-collective/the-harness-is-the-product-how-agents-are-actually-built-in-2026-4b751480f60c
- 日期: 2026
- 可信度: 中高,框架性
- 核心观点:
- AI 工程演进三阶段:app+LLM API → app+LLM+RAG+tools → harness(模型插中间)
- Agent harness 13 组件:context management、memory、operations catalog(progressive discovery)、selection、tool execution、code runtime、browser、model routing、policy、identity、credentials、human approval、durable state、observability、evaluation
- 经典 agent loop 仍然存在,只是不再是架构本身
- 每一行代码(messages/tools/execute/while)都隐藏完整子系统
- 工程价值: ⭐⭐⭐ 框架索引用,不含可执行细节
- 分类标签:
AgentArchitectureHarnessSystem-Design - 建议行动: 收录框架索引;精读价值低
四、过滤记录
| 条目 | 过滤原因 |
|---|---|
| AIxFunda Substack Weekly (Feb-Mar 2026) | 时间过旧(~8个月前),非当月内容;Substack 调研已由 morning draft 覆盖 |
| YouTube: 6 Pillars of Agentic Harness | 视频格式,无 transcript,无法提取工程要点 |
| Generic "AI Agent Architecture" 宽泛指南 | 内容宽泛,与具身智能等 morning draft 条目重叠 |
| InfoQ: Reusable Evaluation Frameworks | QCon AI 演讲,需获取 transcript 才有工程价值 |
分类标签汇总
LLMops Operability Gateway Multi-tenancy Observability Agent vLLM Inference PagedAttention KV-Cache Continuous-Batching Memory-Architecture Cost-Model Session-Memory Long-term-Memory Harness Architecture
建议行动
- 精读:A1(Operability Part 5)、B2(Agent Memory 成本模型)——纳入对应主题页
- 参考:B1(vLLM Guide)——vLLM 专题页
- 索引收录:R1(Harness 13 组件)——Agent Architecture 框架页
- 后续跟进:RAGBench/AgentBench 2026-10 月 benchmark 更新;vLLM 分布式 multi-node setup
Jay · 2026-10-09T10:50 · 工程筛选草稿 · 请勿直接 push GitHub