知识库草稿 · Jay · 2026-09-19

主题

LLM 推理优化 · AI Agent 工程栈 · K8s 数据库部署


一、LLM 推理优化高价值条目

1. vLLM MTP (Multi-Token Prediction) 加速 — Qwen3.8-27B 实测

来源: Hugging Face Blog (EcoHash AI, 2026-09-15)
链接: https://huggingface.co/blog/ecohash-ai/one-vllm-flag-doubled-the-concurrency-a-single-car
可信度: 高 — 实测数据完整,有对照实验和 CSV

核心发现:
Qwen3.8-27B 内置 MTP draft head,在 vLLM 中只需加一个 flag 即可开启:

--speculative-config={"method":"mtp","num_speculative_tokens":3}

单卡 (NVIDIA RTX PRO 6000 Blackwell 96GB) 实测结果: - TPOT: 22ms → 13ms (1.7x 改善) - 吞吐量: 43 tok/s → 78 tok/s (1.8x) - 同延迟 SLO 下并发上限: 32 → 64 (2x) - KV cache 反而减少 23%(因为 MTP block 自带 attention 层需要 cache)

K=3 时 acceptance length: math 3.39 / code 2.61 / chat 2.52
第一个 token acceptance: math 92% / chat 73%

评价: 这是目前最简单且收益最高的推理优化手段之一,适合生产部署。无需训练自定义 speculator,直接用模型内置的 MTP head。


2. TriAttention — KV cache 压缩 10.7x,吞吐量 2.5x

来源: GitHub WeianMao/triattention (2026-08)
链接: https://github.com/WeianMao/triattention
可信度: 高 — 已被 NVIDIA 官方合入 TensorRT-LLM

核心发现:
TriAttention 使用三角函数频域压缩 KV cache,适合长推理任务: - 10.7x KV 内存压缩 - 2.5x 吞吐量提升(AIME25 长推理测试) - 精度无损(40.8 vs 40.8 on AIME25)

已集成: - ✅ NVIDIA TensorRT-LLM (2026-08-04 官方合并) - ✅ vLLM plugin(透明集成,无需改代码) - ✅ SGLang backend - ✅ llama.cpp (AMD GPU via ROCm) - 🔲 Ollama(规划中)

关键配置:

export TRIATTN_RUNTIME_KV_BUDGET=2048  # 默认,可调
export TRIATTN_RUNTIME_DIVIDE_LENGTH=128  # 压缩触发间隔
# 注意:需要预计算 Q/K 频率统计文件

评价: 长上下文推理(Agent、RAG、长文档)的工程级解决方案,已进 NVIDIA 上游,成熟度高。


3. TIDE — Token-Informed Depth Execution(逐 Token 早退出)

来源: GitHub RightNow-AI/TIDE
链接: https://github.com/RightNow-AI/tide
可信度: 中高 — 开源,有 Benchmark,但未进主流推理服务器

核心发现:
TIDE 学习哪些 token "容易"(提前收敛)哪些 "难"(需要全部层),对容易的 token 提前退出: - 支持任意 Hugging Face 因果 LM(LLaMA、DeepSeek、Qwen、Mistral、Gemma 等) - 推理时只需加载 router.pt(~0.5M 参数),无需重新训练模型 - Decode 阶段 99% 的 reasoning token 早退出 - Prefill 最多 7.2% 加速(A100 实测)

使用方法(3 行代码):

from TIDE import TIDE, TIDEConfig
engine = TIDE(model, "router.pt", config=TIDEConfig(exit_threshold=0.85))
result = engine.generate("...")

评价: 创新性的通用推理优化思路,工程化程度较高,但需要针对每个模型单独 calibration,目前非生产推理服务器内置功能,适合自建推理 pipeline 的团队探索。


4. TensorRT-LLM DeepSeek-V4 优化 — Agentic Workload

来源: GitHub NVIDIA/TensorRT-LLM 官方博客
链接: https://github.com/NVIDIA/TensorRT-LLM/blob/main/docs/source/blogs/tech_blog/blog26_DeepSeek_V4_on_NVIDIA_Blackwell_Model_Specific_and_Agentic_Workload_Optimizations_in_TensorRT-LLM.md
可信度: 高 — NVIDIA 官方

核心发现(Part II: Agentic Workload): - KV-cache-aware routing: 通过增量 tokenization + 区块匹配分数实现对话前缀复用 - 滑动窗口缓存生命周期管理: per_request 策略避免全 prompt 缓存浪费 - 池比例调优: 可配置 pool_ratio 控制 HBM 在滑动窗口缓存和持久压缩缓存间的分配 - GB300 上 AgentPerf 配置: SLO20 达到 57.5 concurrency/GPU,SLO60 达到 19.2 CPG

Part I 结果: 相同 DeepSeek-V4 Pro 8K/1K 负载下,峰值输出吞吐量从 984 → 1618 tokens/s/GPU (+64.5%)

评价: 面向 DeepSeek-V4 生产部署的权威优化指南,Part II 的 agent 场景路由和缓存管理思路可迁移到其他 MoE 模型。


5. LLM 推理优化综合指南

来源: Hugging Face Transformers 官方文档
链接: https://huggingface.co/docs/transformers/v4.48.1/en/llm_optims
可信度: 高 — 官方文档

覆盖内容: - Static KV-cache + torch.compile(可达 4x 加速) - Speculative decoding(需小模型辅助) - FlashAttention2 / SDPA 注意力优化 - 量化(Quanto、AQLM、VPTQ、AWQ、AutoGPTQ) - Padding-free fine-tuning with torch.compile


二、AI Agent 工程栈 — 2026 现状

6. AI Agents Stack 2026 (6 层架构)

来源: The AI Engineer Substack (Paolo Perrone, 2026-03)
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
可信度: 高 — O' Reilly 2026 更新,作者为专业 AI 工程 newsletter

6 层架构: 1. Models & Inference — 模型选择与推理优化 2. Protocols & Tools — MCP (Model Context Protocol) 标准化工具连接 3. Memory & Knowledge — 记忆与知识库分离(memory 是第一性架构) 4. Frameworks & SDKs — LangGraph (v1.0) / Provider SDK / 自建 5. Eval & Observability — 2026 新成为独立层 6. Guardrails & Safety — 2026 新成为独立层

关键洞察: - MCP 2024-11 由 Anthropic 推出,已成事实标准 - 89% 的组织有 observability,但只有 62% 有详细 tracing - 框架选择原则:不要过度架构——简单任务用 Provider SDK,只有 state/branching/approvals 复杂度上来才上 LangGraph - Provider SDK 正在吸收 memory、tool calling、basic eval 到单一 API

评价: 2026 年最完整的 AI Agent 架构图,适合作为技术选型的起点。


7. AI Agent Harness 七器官解剖

来源: Micheal Lanham Substack (2026-08-11)
链接: https://micheallanham.substack.com/p/anatomy-of-an-ai-agent-harness
可信度: 中 — 工程博客,观点清晰但非学术

七器官: 1. System Prompt Assembler — 身份 + 环境事实组合 2. Tool Registry — schema 从代码 type hint/docstring 自动派生 3. Executor — 工具执行 + 错误隔离(模型幻觉工具名不崩溃) 4. Context Manager — 战略遗忘,never evict anchors / never orphan tool results 5. Session Store — 持久化状态,agent crash 后恢复 6. Permission Gate — 自主决策边界,人类审批节点 7. Stop Controller — 终止逻辑 + 预算管理

关键原则: "Every component in your harness must be justified by a specific failure it prevents."

评价: 实用主义架构设计指导,"context management 是公开知识最薄弱的领域"这一判断很有价值。


8. Harness Engineering 设计模式

来源: Ken Huang Substack (2026-08, 新书发布)
链接: https://kenhuangus.substack.com/p/harness-engineering-design-patterns
可信度: 中高 — 专业书籍作者,有系统性框架

10 个 Pattern Families: Autonomy / Identity / Intent / Context / Memory / Observability / Runtime Steering / Scalability / Data Governance / Evaluation and Hill Climbing

核心观点: 从"Software Engineering(确定性系统)"到"Harness Engineering(非确定性 Agent 系统)"的范式转移。

评价: 适合作为安全 Agent 系统的架构审查框架,但内容偏概念,需要结合具体实现案例。


9. Graph Engineering for Agentic AI

来源: Ken Huang Substack (2026-09-06, 书籍章节目录)
链接: https://kenhuangus.substack.com/p/inside-the-book-graph-engineering
可信度: 中 — 新书宣传,章节结构展示较完整

核心概念: - Execution graph(拓扑)vs Knowledge graph vs Learned computational graph(三个不同对象) - Graph topology 是"declare how an agent system is allowed to run" - 框架选择(LangGraph / ADK Workflow Runtime / AutoGen GraphFlow)只是实现细节,关键是 topology

评价: Graph Engineering 作为独立工程学科的定义有价值,但书籍刚发布,实际工程价值待验证。


10. OpenAI Agents API — 2026-09-10 重大更新

来源: Rick Hightower Substack (2026-09-16)
链接: https://rickhigh.substack.com/p/the-hosted-runtime-loop-engineering
可信度: 高 — 技术深度分析,基于官方文档实测

三个 OpenAI Surface: | Surface | Loop Runner | State | 适用场景 | |---------|-------------|-------|---------| | Agents API (新) | OpenAI 托管 Codex harness | OpenAI 侧保存 | 长时间运行任务,不想自己运维 sandbox | | Agents SDK | SDK 在应用内运行 | 你的存储 | 需要 loop 在你的部署中,带审批和 deploy | | Responses API | 应用自己调用 model | 手动管理 | 只需要 model call,自己构建 agent |

关键限制: - 数据驻留仅美国 - 不支持 Zero Data Retention - 自托管 sandbox 也不算 ZDR

架构测试:

environment={"type": "none"}  # 写操作 fence
# ① keep multi_agent off for doer turn
# ② environment.type="none" 是结构性 fence,不是靠 prompt
# ③ session.id 是 handle,不是 loop memory

评价: OpenAI Agents API 是生产 Agent 托管的重要里程碑,hosted harness 模式降低了 Agent 工程门槛,但数据合规限制需要注意。


11. vLLM vs SGLang 2026 决策树

来源: 多篇对比分析 (Dreaming.press, DeepInfra, Markaicode, Genαi, TURION.ai, OpenNash, temperature2.com, 2026-06~08)
可信度: 高 — 多方交叉验证

核心结论:

选 SGLang 的场景: - 流量高度 prefix 重叠(agent 多轮对话、RAG、带共享 system prompt 的请求) - RadixAttention 树结构自动复用共享前缀(含 branching) - structured output latency 敏感(grammar 约束在 GPU 侧计算) - 需要 multi-LoRA 高效调度

选 vLLM 的场景: - 需要最广硬件支持(NVIDIA / AMD ROCm / Intel XPU / TPU / Trainium) - 模型更迭快,需要 day-1 支持新架构 - Kubernetes 生产环境,生态工具成熟 - general chat API,多样化 prompt,低 prefix 重叠

2026 年 7 月版本状态: - vLLM v0.25.0 (Jul 11): Model Runner V2 默认为 dense models,Transformers backend 达到 parity - SGLang v0.5.15 (Jul 10): zero-overhead speculative-decoding scheduler

注意: 2024 年 LMSYS 的 SGLang 3.1x 快于 vLLM 的数据已过时,两家现在峰值吞吐量差距在 5~15%(prefix 高重叠时 SGLang 有优势)。


三、K8s 数据库部署

12. pglord — PostgreSQL on K8s 带 Web UI

来源: GitHub bigunmd/pglord
链接: https://github.com/bigunmd/pglord
可信度: 中 — 新项目 (2026-08),AGPL-3.0

核心差异: 不需要 CRD,不需要 cluster-admin 权限,namespace 级即可运行

对比主流方案: | | CRD | Web UI | HA 机制 | 大版本升级 | |--|-----|--------|---------|-----------| | pglord 0.2 | 不需要 | 嵌入式 Angular | 自研 controller | 在线(蓝绿)+ 原地 | | CloudNativePG | 需要 | 无 | 自研 controller | 原地(停机) | | Zalando | 需要 | 有 | Patroni | 原地(停机) | | Crunchy PGO | 需要 | 无 | Patroni | 停机 upgrade | | StackGres | 需要 (14个) | 有 | Patroni | 停机 upgrade |

亮点: - 可选 operator 模式(生成 PostgresCluster CRD) - 在线大版本升级(蓝绿 via 逻辑复制) - 嵌入式 Web UI,OIDC + K8s RBAC 授权

评价: 差异化明确——no-CRD requirement + 在线升级,是目前唯一同时支持蓝绿升级的开源 K8s PG 方案。


13. DoltDB Operator — 版本化数据库 on K8s

来源: GitHub dolthub/doltdb-operator
链接: https://github.com/dolthub/doltdb-operator
可信度: 中 — DoltHub 官方维护,BSD-3-Clause

DoltDB 是什么: Git 风格的版本化数据库——branch、diff、merge 和完整历史。Dolt 是 MySQL 兼容的。

Operator 功能: - 声明式 DoltDB 集群管理( StatefulSet / Service / PVC / 复制自动化) - 复制感知自动故障转移 - VolumeSnapshot 定时备份 - 无停机滚动升级 - 声明式 SQL 资源管理(Database / User / Grant)

关键 CRD: - DoltDB — 主集群资源 - Database — 逻辑数据库 - User / Grant — 权限管理 - Backup / Snapshot / BackupSchedule — 备份管理

评价: Git 版本化数据库 + K8s Operator,适合需要数据库版本化场景(数据 lineage、branching for test),但 Dolt/MySQL 兼容性需验证。


14. db-provision-operator — 多引擎 K8s 数据库声明式管理

来源: GitHub panteparak/db-provision-operator
链接: https://github.com/panteparak/db-provision-operator
可信度: 低 — 新项目 (2026-01),star 仅 2,无生产验证

支持引擎: PostgreSQL / MySQL / MariaDB / CockroachDB

功能亮点: - 漂移检测 + 纠正 - AES-256-GCM 加密备份 - 31 Prometheus metrics + 9 Grafana dashboards + OpenTelemetry tracing - 非 root 容器 + seccomp profile + SQL injection 防护

评价: 功能全面,但过于早期(star=2),不适合生产采用,可作为多引擎 CRD 设计参考。


15. CloudNativePG 1.30 — CNCF PostgreSQL K8s 方案

来源: GitHub saschpe/cloudnative-pg
链接: https://github.com/saschpe/cloudnative-pg
可信度: 高 — CNCF Sandbox,EDB 主推,KubeCon 2026 多个 talk

特点: - CNCF 官方 PostgreSQL K8s operator - 不用 Patroni,用自研 controller 直接对接 K8s API - Barman 备份(正在弃用中),支持 volume snapshot - 原地大版本升级(停机,v1.26+ 有逻辑复制在线路径) - Quorum-based 一致性集群变更

评价: 最规范的 K8s 原生 PG 方案,CNCF 背景,适合标准 K8s 环境。pglord 的在线升级优势在此方案中尚不支持。


四、分类标签

LLM推理优化 | vLLM | SGLang | TensorRT-LLM | MTP | Speculative Decoding
KV Cache压缩 | TriAttention | Long Context | Prefix Caching | RadixAttention
AI Agent | Agent Stack | MCP | Harness Engineering | Graph Engineering
Agentic AI | LangGraph | OpenAI Agents API | Loop Engineering
数据库 | PostgreSQL | Kubernetes | Operator | CloudNativePG | pglord | DoltDB
MLOps | 推理部署 | 量化 | FlashAttention | torch.compile

五、建议写入路径

路径: /shared/research-kb/inbox/jay/2026-09-19-llm-inference-agents-k8s.md

草稿结构: 已按上述格式组织,可直接发布或合并。


六、精读/审稿/主题页更新建议

🔴 精读(优先级最高)

  1. TriAttention — 已在 TensorRT-LLM 上游,生产可用,建议验证 vLLM 集成路径
  2. vLLM MTP (Qwen3.8-27B) — 一行配置换 2x 并发,适合立即测试
  3. pglord vs CloudNativePG 对比表 — K8s PG 选型决策参考

🟡 审稿(建议归档)

  1. AI Agents Stack 2026 (6层) — 作为 AI 工程知识库的年度回顾条目
  2. OpenAI Agents API 分析 — 2026-09 新发布,适合更新 Agent 基础设施主题页
  3. vLLM vs SGLang 决策树 — 推理引擎选型标准参考

🟢 归档(观察跟踪)

  1. Harness Engineering 书籍 — 刚发布,待社区验证
  2. Graph Engineering 书籍 — 同上
  3. TIDE — 思路有趣但非生产级,保持关注
  4. db-provision-operator — star=2,仅归档不推荐

七、检索元数据

  • 本次主题: LLM 推理优化 · AI Agent 工程栈 · Kubernetes 数据库部署
  • 检索范围: Exa AI 搜索 / GitHub / Hugging Face / Substack (The AI Engineer / Micheal Lanham / Ken Huang / Rick Hightower)
  • 覆盖时间: 2026-06 ~ 2026-09
  • 草稿产出时间: 2026-09-19
  • 实例: Jay