Jay 晨间研究简报 · 2026-08-11 09:35

主题

推理引擎格局 · Agent 框架洗牌 · RAG 评估体系 · KV Cache 新研究 · Substack 高价值洞察


一、推理引擎格局(2026 年 8 月)

核心格局:三足鼎立 + TGI 退场

引擎 定位 状态 H100 吞吐量 生产选型建议
vLLM 通用生产默认 活跃 ~12,500 tok/s 首次部署、单轮高吞吐
SGLang Agent/多轮/结构化输出 活跃 ~16,200 tok/s 多轮对话、Agent 流水线
LMDeploy TurboMind 优化 活跃 ~16,200 tok/s 主流模型、国产部署
TensorRT-LLM 极致性能 活跃 最高但冷启动慢 冷启动 28min、迭代场景不友好
TGI Hugging Face 原生 ⚠️ 维护模式 — 不再推荐新部署,迁往 vLLM/SGLang

来源: PremAI blog (2026-03), Yotta Labs (2026-07-13), Towards AI (2026-06-02), Deploybase (2026-03)

生产决策框架

首次部署 + 广泛兼容 → vLLM
多轮对话 + Agent 场景 → SGLang
国产模型 + TurboMind → LMDeploy
NVIDIA 生态优先 → NIM(自动选 vLLM/TensorRT-LLM/SGLang 后端)

阿里云实测数据(Qwen 系列)

  • SGLang vs vLLM:TTFT 优 15~50%,TPOT 优 10%,吞吐量优 20%
  • 双卡 TP 加速:SGLang 提升可达 50%,vLLM 提升约 50%
  • 32B 模型:单卡 Ada 无法运行 Qwen-QWQ-32B(OOM),需双卡
  • 最大并发建议:QWQ-32B-AWQ ≤ 5 并发

来源: 阿里云文档(帮助中心)

NVIDIA NIM 新动向

  • LLM 2.0 走 "one container, one backend" 哲学,基于 vLLM 确保行为可预期
  • 默认 8000 端口,OpenAI 兼容端点 + /metrics

二、Agent 框架洗牌(Q2-Q3 2026)

2026 年 8 月框架格局

框架 版本 定位 MCP/A2A 生产评分
LangGraph 1.x v0.4 (Apr 2026) 有状态图、checkpoint、人机交互 ✅ MCP, ✅ A2A 高
Microsoft Agent Framework 1.0 GA Apr 2026 企业/Microsoft 栈,AutoGen+SemanticKernel 合并 ✅ 高
CrewAI 1.14.7 角色型多 Agent 快速原型 ✅ 中(token 消耗较高)
Anthropic Claude Agent SDK — Claude 原生,Memory 原生 ✅ 高
OpenAI Agents SDK — OpenAI 原生,Platform 集成 ✅ 高
LlamaIndex Workflows 1.0 数据场景优先 ✅ 中
PydanticAI 2.0 结构化输出优先 部分 中
AutoGen / AG2 0.2 维护,AG2 pre-1.0 研究场景,AG2 仍在 beta ✅ 低(维护态)

来源: Alice Labs (2026-08), Uvik (2026-08), Pickaxe (2026), LangChain blog (2026-08)

关键事件

  • AutoGen 0.2 → 维护模式,2025-10 起;AG2 为社区 fork,预 1.0
  • Microsoft 将 AutoGen + SemanticKernel 合并为 Agent Framework 1.0(2026-04-03),支持 Python + .NET
  • LangGraph v0.4:node caching、deferred nodes、pre/post model hooks、content-block streaming(2026-08)
  • CrewAI:异步执行和前端流式输出仍有痛点,生产环境需额外验证层

Token 效率对比(2,000 次运行基准)

  • LangGraph:延迟最低,token 效率高
  • LangChain:token 效率最优
  • AutoGen:与 LangGraph 延迟相当但 token 配置不同
  • CrewAI:简单任务 token 消耗约其他框架 3×

三、RAG 评估体系(2026)

核心基准

基准 特点 适用场景
MTEB Embedding 通用基准,Hugging Face 托管 选 embedding 模型
RAGAS 检索 + 生成分解评估,LLM-as-judge 生产 RAG 评估
RAGBench 通用检索+生成,学术广泛用 综合评估
CRAG 上下文相关性 + grounding 检索密集场景
T²-RAGBench 多轮 + 任务导向 复杂对话 RAG
LegalBench-RAG 法律 QA,合规要求高 法律领域
Braintrust 集成生产数据 + 持续改进循环 工程化评估

RAG 生产最佳实践(10 步)

  1. 数据清洗 → PII 脱敏 → 格式标准化
  2. Embedding 选型:MTEB leaderboard 作起点,实测 2~3 个
  3. 向量库选型:原型 FAISS,生产 Qdrant/Milvus
  4. Chunking:256~1024 tokens,段落感知切分,20% overlap
  5. 检索:Hybrid (BM25 + dense),k=5~10,MMR 去重
  6. Re-ranking:cross-encoder 重排 top-20 → top-5
  7. 生成:LLM-as-judge 1~5 分评估(注意 judge bias)
  8. 监控:端到端延迟、token 消耗、召回率
  9. 成本优化:token 消耗是最大成本项
  10. 持续迭代:生产数据驱动评估循环

来源: DecodeTheFuture (2026), Label Your Data (2026), Braintrust (2026), Springer (2026-02)


四、KV Cache 新研究(arXiv/HotInfra 2026)

1. KV Cache Transform Coding(ICLR 2026)

  • 论文: arXiv:2511.01815
  • 方向: KV Cache 压缩存储,通过变换编码减少 KV Cache 体积
  • 会议: ICLR 2026 已接收

2. Online Scheduling with KV Cache Constraints(MIT/AAAI 2026)

  • 方向: LLM 推理在线调度,KV Cache 动态内存增长建模
  • 方法: MC-SF 算法,竞争比率常数保证
  • 对比: 传统方法基于 batch size 建模,此方法以 KV-memory 可行性为首要约束
  • 来源: arXiv / AAAI 2026

3. Memory-Centric KV Cache Server(HotInfra 2026)

  • 核心数据: PIM-DIMM vs HBM 对比
  • DeepSeek-R1-671B,32K tokens 生成
  • PIM-DIMM:679 → 1,607 tok/s(2.4×),CapEx 从 $570K 降至 $27K(20.6×)
  • OpEx:$59.23/hr → $3.53/hr
  • 结论: CXL 共享内存 KV Cache 在机架级别可行,带宽 150.7 TB/s

4. "An Internet for the KV Cache"(arXiv:2608.01526)

  • 核心论点: KV Cache 复用将 LLM 推理从"计算-存储权衡"转变为"互联网级内容管理问题"
  • 视角: LLM 是端点,KV Cache 流动是内容分发系统;呼吁网络和存储作为一等公民优化

5. L2 Cache-Oriented Async KV Cache Prefetching(AAAI 2026)

  • 问题: vLLM 推理引擎中 HBM 带宽瓶颈
  • 方案: 计算-传输重叠,L2 cache 预取,隐藏 HBM 延迟
  • 硬件-软件协同设计

6. DeepSeek V4 架构洞察(Sebastian Raschka)

  • 1M token 上下文:DeepSeek V4-Pro 仅用 V3.2 27% 单 token 推理 FLOPs,10% KV Cache 大小
  • DeepSeek V4-Flash:FLOPs 10%,KV Cache 7%(相对 V3.2)
  • 关键架构: MLA(Multi-head Latent Attention)+ DSA(DeepSeek Sparse Attention)
  • 趋势: KV Cache 小型化是 2026 年 LLM 架构设计主线

五、Substack 高价值条目

⭐⭐⭐ The AI Engineer — "The AI Agents Stack (2026 Edition)"

  • 来源: theaiengineer.substack.com
  • 核心观点:
  • Agent 技术栈 ≠ LLM 技术栈:Agent 需要状态管理、工具协议、跨会话记忆、自主推理循环、实时护栏
  • 6 层架构图:LLM → 推理引擎 → 内存/状态 → 工具/MCP → 知识/RAG → 编排
  • RAG 在 Issue #5 中深度覆盖;本期聚焦 Agent 技术栈全貌
  • 可信度: 高(AI Engineer 是 AI 工程领域高质量 newsletter)
  • 行动建议: 精读,配合 Alice Labs 框架对比表一起看

⭐⭐ Sarthaka i — "What to Expect from AI Engineering in 2026"

  • 来源: sarthakai.substack.com
  • 核心观点:
  • 2026 是小语言模型(SLM)实用化元年
  • RAG 进化方向:层级记忆、情景 vs 语义存储
  • Agent 适用:高变异、低成功标准定义任务(如 AI 编程)
  • 非 Agent 适用:可靠性、可预测性、涉及金钱/数据/用户信任的场景

⭐⭐ Context Engineering for AI Agents(todatabeyond.substack.com)

  • 核心观点:
  • Context 工程 = 控制 LLM 在每个执行步骤看到什么信息
  • 类比:LLM = CPU,Context Window = RAM,Context 工程 = 操作系统
  • 核心挑战:多源上下文(系统指令、对话历史、检索知识、工具定义/输出、scratchpad、记忆、计划、执行状态)

⭐ Brain Bytes — "The 2026 AI Agent Stack, Drawn from Scratch"

  • 来源: codingwithroby.substack.com
  • 核心观点:
  • 无零信任认知边界时,LLM 连接 RAG/MCP 是在执行 SSP(Spurious Stochastic Process)
  • 6 层 + 2 轨:模型层快速变化,避免硬编码厂商/模型名

仓库 ⭐ 描述 分类
dp-web4/SAGE 103 认知内核:冻结 LLM + 持久身份/信任/治理循环 Agent/认知架构
kherrera6219/DataLogicEngine 5 企业 AI 平台:17 轴知识框架、10 层真相引擎、多 Agent 编排、GraphRAG、MCP 集成 知识图谱/企业 AI
totalwindupflightsystems/gitreins 新 Git 原生 AI Agent 共驾——MCP server + 静态守卫 + Agent 评估器 DevOps/Agent
r4wd3r/MaLO 新 MaLO Framework:多 Agent LLM 安全运营自主框架 安全 Agent
dribulotta/Hermes-DOHAA 新 Hermes Agent 的证据门控治理和自改进层 Agent/治理
Fectivnfy112357/github-explore 新 gh CLI 的 AI 编码 Agent 封装:find_repos、多轴探索、trending、代码搜索 DevOps/Agent

分类标签

推理引擎 vLLM SGLang LMDeploy TGI维护 Agent框架 LangGraph CrewAI MicrosoftAgentFramework RAG评估 MTEB RAGAS KVCache ICLR2026 HotInfra2026 Substack TheAIEngineer SarthakaAI ContextEngineering GitHubTrending SAGE MCP


建议写入路径

/shared/research-kb/inbox/jay/2026-08-11T0935-jay-morning-briefing-inference-agents-rag-kvcache.md

后续行动建议

  1. 精读: The AI Engineer "AI Agents Stack 2026 Edition"(Substack,高价值,需要核验 6 层架构图)
  2. 关注: DeepSeek V4 MLA+DSA 架构——KV Cache 体积降至 V3.2 的 7~10%,影响深远
  3. 跟踪: Microsoft Agent Framework 1.0 正式发布后对 AutoGen 迁移路径的影响
  4. 验证: LangGraph v0.4 的 node caching 和 deferred nodes 功能是否已稳定