Jay 晨间研究简报 · 2026-08-11 09:35

主题

推理引擎格局 · Agent 框架洗牌 · RAG 评估体系 · KV Cache 新研究 · Substack 高价值洞察


一、推理引擎格局(2026 年 8 月)

核心格局:三足鼎立 + TGI 退场

引擎 定位 状态 H100 吞吐量 生产选型建议
vLLM 通用生产默认 活跃 ~12,500 tok/s 首次部署、单轮高吞吐
SGLang Agent/多轮/结构化输出 活跃 ~16,200 tok/s 多轮对话、Agent 流水线
LMDeploy TurboMind 优化 活跃 ~16,200 tok/s 主流模型、国产部署
TensorRT-LLM 极致性能 活跃 最高但冷启动慢 冷启动 28min、迭代场景不友好
TGI Hugging Face 原生 ⚠️ 维护模式 不再推荐新部署,迁往 vLLM/SGLang

来源: PremAI blog (2026-03), Yotta Labs (2026-07-13), Towards AI (2026-06-02), Deploybase (2026-03)

生产决策框架

首次部署 + 广泛兼容 → vLLM
多轮对话 + Agent 场景 → SGLang
国产模型 + TurboMind → LMDeploy
NVIDIA 生态优先 → NIM(自动选 vLLM/TensorRT-LLM/SGLang 后端)

阿里云实测数据(Qwen 系列)

  • SGLang vs vLLM:TTFT 优 15~50%,TPOT 优 10%,吞吐量优 20%
  • 双卡 TP 加速:SGLang 提升可达 50%,vLLM 提升约 50%
  • 32B 模型:单卡 Ada 无法运行 Qwen-QWQ-32B(OOM),需双卡
  • 最大并发建议:QWQ-32B-AWQ ≤ 5 并发

来源: 阿里云文档(帮助中心)

NVIDIA NIM 新动向

  • LLM 2.0 走 "one container, one backend" 哲学,基于 vLLM 确保行为可预期
  • 默认 8000 端口,OpenAI 兼容端点 + /metrics

二、Agent 框架洗牌(Q2-Q3 2026)

2026 年 8 月框架格局

框架 版本 定位 MCP/A2A 生产评分
LangGraph 1.x v0.4 (Apr 2026) 有状态图、checkpoint、人机交互 ✅ MCP, ✅ A2A
Microsoft Agent Framework 1.0 GA Apr 2026 企业/Microsoft 栈,AutoGen+SemanticKernel 合并
CrewAI 1.14.7 角色型多 Agent 快速原型 中(token 消耗较高)
Anthropic Claude Agent SDK Claude 原生,Memory 原生
OpenAI Agents SDK OpenAI 原生,Platform 集成
LlamaIndex Workflows 1.0 数据场景优先
PydanticAI 2.0 结构化输出优先 部分
AutoGen / AG2 0.2 维护,AG2 pre-1.0 研究场景,AG2 仍在 beta 低(维护态)

来源: Alice Labs (2026-08), Uvik (2026-08), Pickaxe (2026), LangChain blog (2026-08)

关键事件

  • AutoGen 0.2 → 维护模式,2025-10 起;AG2 为社区 fork,预 1.0
  • Microsoft 将 AutoGen + SemanticKernel 合并为 Agent Framework 1.0(2026-04-03),支持 Python + .NET
  • LangGraph v0.4:node caching、deferred nodes、pre/post model hooks、content-block streaming(2026-08)
  • CrewAI:异步执行和前端流式输出仍有痛点,生产环境需额外验证层

Token 效率对比(2,000 次运行基准)

  • LangGraph:延迟最低,token 效率高
  • LangChain:token 效率最优
  • AutoGen:与 LangGraph 延迟相当但 token 配置不同
  • CrewAI:简单任务 token 消耗约其他框架 3×

三、RAG 评估体系(2026)

核心基准

基准 特点 适用场景
MTEB Embedding 通用基准,Hugging Face 托管 选 embedding 模型
RAGAS 检索 + 生成分解评估,LLM-as-judge 生产 RAG 评估
RAGBench 通用检索+生成,学术广泛用 综合评估
CRAG 上下文相关性 + grounding 检索密集场景
T²-RAGBench 多轮 + 任务导向 复杂对话 RAG
LegalBench-RAG 法律 QA,合规要求高 法律领域
Braintrust 集成生产数据 + 持续改进循环 工程化评估

RAG 生产最佳实践(10 步)

  1. 数据清洗 → PII 脱敏 → 格式标准化
  2. Embedding 选型:MTEB leaderboard 作起点,实测 2~3 个
  3. 向量库选型:原型 FAISS,生产 Qdrant/Milvus
  4. Chunking:256~1024 tokens,段落感知切分,20% overlap
  5. 检索:Hybrid (BM25 + dense),k=5~10,MMR 去重
  6. Re-ranking:cross-encoder 重排 top-20 → top-5
  7. 生成:LLM-as-judge 1~5 分评估(注意 judge bias)
  8. 监控:端到端延迟、token 消耗、召回率
  9. 成本优化:token 消耗是最大成本项
  10. 持续迭代:生产数据驱动评估循环

来源: DecodeTheFuture (2026), Label Your Data (2026), Braintrust (2026), Springer (2026-02)


四、KV Cache 新研究(arXiv/HotInfra 2026)

1. KV Cache Transform Coding(ICLR 2026)

  • 论文: arXiv:2511.01815
  • 方向: KV Cache 压缩存储,通过变换编码减少 KV Cache 体积
  • 会议: ICLR 2026 已接收

2. Online Scheduling with KV Cache Constraints(MIT/AAAI 2026)

  • 方向: LLM 推理在线调度,KV Cache 动态内存增长建模
  • 方法: MC-SF 算法,竞争比率常数保证
  • 对比: 传统方法基于 batch size 建模,此方法以 KV-memory 可行性为首要约束
  • 来源: arXiv / AAAI 2026

3. Memory-Centric KV Cache Server(HotInfra 2026)

  • 核心数据: PIM-DIMM vs HBM 对比
  • DeepSeek-R1-671B,32K tokens 生成
  • PIM-DIMM:679 → 1,607 tok/s(2.4×),CapEx 从 $570K 降至 $27K(20.6×)
  • OpEx:$59.23/hr → $3.53/hr
  • 结论: CXL 共享内存 KV Cache 在机架级别可行,带宽 150.7 TB/s

4. "An Internet for the KV Cache"(arXiv:2608.01526)

  • 核心论点: KV Cache 复用将 LLM 推理从"计算-存储权衡"转变为"互联网级内容管理问题"
  • 视角: LLM 是端点,KV Cache 流动是内容分发系统;呼吁网络和存储作为一等公民优化

5. L2 Cache-Oriented Async KV Cache Prefetching(AAAI 2026)

  • 问题: vLLM 推理引擎中 HBM 带宽瓶颈
  • 方案: 计算-传输重叠,L2 cache 预取,隐藏 HBM 延迟
  • 硬件-软件协同设计

6. DeepSeek V4 架构洞察(Sebastian Raschka)

  • 1M token 上下文:DeepSeek V4-Pro 仅用 V3.2 27% 单 token 推理 FLOPs,10% KV Cache 大小
  • DeepSeek V4-Flash:FLOPs 10%,KV Cache 7%(相对 V3.2)
  • 关键架构: MLA(Multi-head Latent Attention)+ DSA(DeepSeek Sparse Attention)
  • 趋势: KV Cache 小型化是 2026 年 LLM 架构设计主线

五、Substack 高价值条目

⭐⭐⭐ The AI Engineer — "The AI Agents Stack (2026 Edition)"

  • 来源: theaiengineer.substack.com
  • 核心观点:
  • Agent 技术栈 ≠ LLM 技术栈:Agent 需要状态管理、工具协议、跨会话记忆、自主推理循环、实时护栏
  • 6 层架构图:LLM → 推理引擎 → 内存/状态 → 工具/MCP → 知识/RAG → 编排
  • RAG 在 Issue #5 中深度覆盖;本期聚焦 Agent 技术栈全貌
  • 可信度: 高(AI Engineer 是 AI 工程领域高质量 newsletter)
  • 行动建议: 精读,配合 Alice Labs 框架对比表一起看

⭐⭐ Sarthaka i — "What to Expect from AI Engineering in 2026"

  • 来源: sarthakai.substack.com
  • 核心观点:
  • 2026 是小语言模型(SLM)实用化元年
  • RAG 进化方向:层级记忆、情景 vs 语义存储
  • Agent 适用:高变异、低成功标准定义任务(如 AI 编程)
  • 非 Agent 适用:可靠性、可预测性、涉及金钱/数据/用户信任的场景

⭐⭐ Context Engineering for AI Agents(todatabeyond.substack.com)

  • 核心观点:
  • Context 工程 = 控制 LLM 在每个执行步骤看到什么信息
  • 类比:LLM = CPU,Context Window = RAM,Context 工程 = 操作系统
  • 核心挑战:多源上下文(系统指令、对话历史、检索知识、工具定义/输出、scratchpad、记忆、计划、执行状态)

⭐ Brain Bytes — "The 2026 AI Agent Stack, Drawn from Scratch"

  • 来源: codingwithroby.substack.com
  • 核心观点:
  • 无零信任认知边界时,LLM 连接 RAG/MCP 是在执行 SSP(Spurious Stochastic Process)
  • 6 层 + 2 轨:模型层快速变化,避免硬编码厂商/模型名

仓库 描述 分类
dp-web4/SAGE 103 认知内核:冻结 LLM + 持久身份/信任/治理循环 Agent/认知架构
kherrera6219/DataLogicEngine 5 企业 AI 平台:17 轴知识框架、10 层真相引擎、多 Agent 编排、GraphRAG、MCP 集成 知识图谱/企业 AI
totalwindupflightsystems/gitreins Git 原生 AI Agent 共驾——MCP server + 静态守卫 + Agent 评估器 DevOps/Agent
r4wd3r/MaLO MaLO Framework:多 Agent LLM 安全运营自主框架 安全 Agent
dribulotta/Hermes-DOHAA Hermes Agent 的证据门控治理和自改进层 Agent/治理
Fectivnfy112357/github-explore gh CLI 的 AI 编码 Agent 封装:find_repos、多轴探索、trending、代码搜索 DevOps/Agent

分类标签

推理引擎 vLLM SGLang LMDeploy TGI维护 Agent框架 LangGraph CrewAI MicrosoftAgentFramework RAG评估 MTEB RAGAS KVCache ICLR2026 HotInfra2026 Substack TheAIEngineer SarthakaAI ContextEngineering GitHubTrending SAGE MCP


建议写入路径

/shared/research-kb/inbox/jay/2026-08-11T0935-jay-morning-briefing-inference-agents-rag-kvcache.md

后续行动建议

  1. 精读: The AI Engineer "AI Agents Stack 2026 Edition"(Substack,高价值,需要核验 6 层架构图)
  2. 关注: DeepSeek V4 MLA+DSA 架构——KV Cache 体积降至 V3.2 的 7~10%,影响深远
  3. 跟踪: Microsoft Agent Framework 1.0 正式发布后对 AutoGen 迁移路径的影响
  4. 验证: LangGraph v0.4 的 node caching 和 deferred nodes 功能是否已稳定