Jay 晨间研究简报 · 2026-08-11 09:35
主题
推理引擎格局 · Agent 框架洗牌 · RAG 评估体系 · KV Cache 新研究 · Substack 高价值洞察
一、推理引擎格局(2026 年 8 月)
核心格局:三足鼎立 + TGI 退场
| 引擎 | 定位 | 状态 | H100 吞吐量 | 生产选型建议 |
|---|---|---|---|---|
| vLLM | 通用生产默认 | 活跃 | ~12,500 tok/s | 首次部署、单轮高吞吐 |
| SGLang | Agent/多轮/结构化输出 | 活跃 | ~16,200 tok/s | 多轮对话、Agent 流水线 |
| LMDeploy | TurboMind 优化 | 活跃 | ~16,200 tok/s | 主流模型、国产部署 |
| TensorRT-LLM | 极致性能 | 活跃 | 最高但冷启动慢 | 冷启动 28min、迭代场景不友好 |
| TGI | Hugging Face 原生 | ⚠️ 维护模式 | — | 不再推荐新部署,迁往 vLLM/SGLang |
来源: PremAI blog (2026-03), Yotta Labs (2026-07-13), Towards AI (2026-06-02), Deploybase (2026-03)
生产决策框架
首次部署 + 广泛兼容 → vLLM
多轮对话 + Agent 场景 → SGLang
国产模型 + TurboMind → LMDeploy
NVIDIA 生态优先 → NIM(自动选 vLLM/TensorRT-LLM/SGLang 后端)
阿里云实测数据(Qwen 系列)
- SGLang vs vLLM:TTFT 优 15~50%,TPOT 优 10%,吞吐量优 20%
- 双卡 TP 加速:SGLang 提升可达 50%,vLLM 提升约 50%
- 32B 模型:单卡 Ada 无法运行 Qwen-QWQ-32B(OOM),需双卡
- 最大并发建议:QWQ-32B-AWQ ≤ 5 并发
来源: 阿里云文档(帮助中心)
NVIDIA NIM 新动向
- LLM 2.0 走 "one container, one backend" 哲学,基于 vLLM 确保行为可预期
- 默认 8000 端口,OpenAI 兼容端点 +
/metrics
二、Agent 框架洗牌(Q2-Q3 2026)
2026 年 8 月框架格局
| 框架 | 版本 | 定位 | MCP/A2A | 生产评分 |
|---|---|---|---|---|
| LangGraph 1.x | v0.4 (Apr 2026) | 有状态图、checkpoint、人机交互 | ✅ MCP, ✅ A2A | 高 |
| Microsoft Agent Framework 1.0 | GA Apr 2026 | 企业/Microsoft 栈,AutoGen+SemanticKernel 合并 | ✅ | 高 |
| CrewAI | 1.14.7 | 角色型多 Agent 快速原型 | ✅ | 中(token 消耗较高) |
| Anthropic Claude Agent SDK | — | Claude 原生,Memory 原生 | ✅ | 高 |
| OpenAI Agents SDK | — | OpenAI 原生,Platform 集成 | ✅ | 高 |
| LlamaIndex Workflows | 1.0 | 数据场景优先 | ✅ | 中 |
| PydanticAI | 2.0 | 结构化输出优先 | 部分 | 中 |
| AutoGen / AG2 | 0.2 维护,AG2 pre-1.0 | 研究场景,AG2 仍在 beta | ✅ | 低(维护态) |
来源: Alice Labs (2026-08), Uvik (2026-08), Pickaxe (2026), LangChain blog (2026-08)
关键事件
- AutoGen 0.2 → 维护模式,2025-10 起;AG2 为社区 fork,预 1.0
- Microsoft 将 AutoGen + SemanticKernel 合并为 Agent Framework 1.0(2026-04-03),支持 Python + .NET
- LangGraph v0.4:node caching、deferred nodes、pre/post model hooks、content-block streaming(2026-08)
- CrewAI:异步执行和前端流式输出仍有痛点,生产环境需额外验证层
Token 效率对比(2,000 次运行基准)
- LangGraph:延迟最低,token 效率高
- LangChain:token 效率最优
- AutoGen:与 LangGraph 延迟相当但 token 配置不同
- CrewAI:简单任务 token 消耗约其他框架 3×
三、RAG 评估体系(2026)
核心基准
| 基准 | 特点 | 适用场景 |
|---|---|---|
| MTEB | Embedding 通用基准,Hugging Face 托管 | 选 embedding 模型 |
| RAGAS | 检索 + 生成分解评估,LLM-as-judge | 生产 RAG 评估 |
| RAGBench | 通用检索+生成,学术广泛用 | 综合评估 |
| CRAG | 上下文相关性 + grounding | 检索密集场景 |
| T²-RAGBench | 多轮 + 任务导向 | 复杂对话 RAG |
| LegalBench-RAG | 法律 QA,合规要求高 | 法律领域 |
| Braintrust | 集成生产数据 + 持续改进循环 | 工程化评估 |
RAG 生产最佳实践(10 步)
- 数据清洗 → PII 脱敏 → 格式标准化
- Embedding 选型:MTEB leaderboard 作起点,实测 2~3 个
- 向量库选型:原型 FAISS,生产 Qdrant/Milvus
- Chunking:256~1024 tokens,段落感知切分,20% overlap
- 检索:Hybrid (BM25 + dense),k=5~10,MMR 去重
- Re-ranking:cross-encoder 重排 top-20 → top-5
- 生成:LLM-as-judge 1~5 分评估(注意 judge bias)
- 监控:端到端延迟、token 消耗、召回率
- 成本优化:token 消耗是最大成本项
- 持续迭代:生产数据驱动评估循环
来源: DecodeTheFuture (2026), Label Your Data (2026), Braintrust (2026), Springer (2026-02)
四、KV Cache 新研究(arXiv/HotInfra 2026)
1. KV Cache Transform Coding(ICLR 2026)
- 论文: arXiv:2511.01815
- 方向: KV Cache 压缩存储,通过变换编码减少 KV Cache 体积
- 会议: ICLR 2026 已接收
2. Online Scheduling with KV Cache Constraints(MIT/AAAI 2026)
- 方向: LLM 推理在线调度,KV Cache 动态内存增长建模
- 方法: MC-SF 算法,竞争比率常数保证
- 对比: 传统方法基于 batch size 建模,此方法以 KV-memory 可行性为首要约束
- 来源: arXiv / AAAI 2026
3. Memory-Centric KV Cache Server(HotInfra 2026)
- 核心数据: PIM-DIMM vs HBM 对比
- DeepSeek-R1-671B,32K tokens 生成
- PIM-DIMM:679 → 1,607 tok/s(2.4×),CapEx 从 $570K 降至 $27K(20.6×)
- OpEx:$59.23/hr → $3.53/hr
- 结论: CXL 共享内存 KV Cache 在机架级别可行,带宽 150.7 TB/s
4. "An Internet for the KV Cache"(arXiv:2608.01526)
- 核心论点: KV Cache 复用将 LLM 推理从"计算-存储权衡"转变为"互联网级内容管理问题"
- 视角: LLM 是端点,KV Cache 流动是内容分发系统;呼吁网络和存储作为一等公民优化
5. L2 Cache-Oriented Async KV Cache Prefetching(AAAI 2026)
- 问题: vLLM 推理引擎中 HBM 带宽瓶颈
- 方案: 计算-传输重叠,L2 cache 预取,隐藏 HBM 延迟
- 硬件-软件协同设计
6. DeepSeek V4 架构洞察(Sebastian Raschka)
- 1M token 上下文:DeepSeek V4-Pro 仅用 V3.2 27% 单 token 推理 FLOPs,10% KV Cache 大小
- DeepSeek V4-Flash:FLOPs 10%,KV Cache 7%(相对 V3.2)
- 关键架构: MLA(Multi-head Latent Attention)+ DSA(DeepSeek Sparse Attention)
- 趋势: KV Cache 小型化是 2026 年 LLM 架构设计主线
五、Substack 高价值条目
⭐⭐⭐ The AI Engineer — "The AI Agents Stack (2026 Edition)"
- 来源: theaiengineer.substack.com
- 核心观点:
- Agent 技术栈 ≠ LLM 技术栈:Agent 需要状态管理、工具协议、跨会话记忆、自主推理循环、实时护栏
- 6 层架构图:LLM → 推理引擎 → 内存/状态 → 工具/MCP → 知识/RAG → 编排
- RAG 在 Issue #5 中深度覆盖;本期聚焦 Agent 技术栈全貌
- 可信度: 高(AI Engineer 是 AI 工程领域高质量 newsletter)
- 行动建议: 精读,配合 Alice Labs 框架对比表一起看
⭐⭐ Sarthaka i — "What to Expect from AI Engineering in 2026"
- 来源: sarthakai.substack.com
- 核心观点:
- 2026 是小语言模型(SLM)实用化元年
- RAG 进化方向:层级记忆、情景 vs 语义存储
- Agent 适用:高变异、低成功标准定义任务(如 AI 编程)
- 非 Agent 适用:可靠性、可预测性、涉及金钱/数据/用户信任的场景
⭐⭐ Context Engineering for AI Agents(todatabeyond.substack.com)
- 核心观点:
- Context 工程 = 控制 LLM 在每个执行步骤看到什么信息
- 类比:LLM = CPU,Context Window = RAM,Context 工程 = 操作系统
- 核心挑战:多源上下文(系统指令、对话历史、检索知识、工具定义/输出、scratchpad、记忆、计划、执行状态)
⭐ Brain Bytes — "The 2026 AI Agent Stack, Drawn from Scratch"
- 来源: codingwithroby.substack.com
- 核心观点:
- 无零信任认知边界时,LLM 连接 RAG/MCP 是在执行 SSP(Spurious Stochastic Process)
- 6 层 + 2 轨:模型层快速变化,避免硬编码厂商/模型名
六、GitHub Trending 今日发现
| 仓库 | ⭐ | 描述 | 分类 |
|---|---|---|---|
| dp-web4/SAGE | 103 | 认知内核:冻结 LLM + 持久身份/信任/治理循环 | Agent/认知架构 |
| kherrera6219/DataLogicEngine | 5 | 企业 AI 平台:17 轴知识框架、10 层真相引擎、多 Agent 编排、GraphRAG、MCP 集成 | 知识图谱/企业 AI |
| totalwindupflightsystems/gitreins | 新 | Git 原生 AI Agent 共驾——MCP server + 静态守卫 + Agent 评估器 | DevOps/Agent |
| r4wd3r/MaLO | 新 | MaLO Framework:多 Agent LLM 安全运营自主框架 | 安全 Agent |
| dribulotta/Hermes-DOHAA | 新 | Hermes Agent 的证据门控治理和自改进层 | Agent/治理 |
| Fectivnfy112357/github-explore | 新 | gh CLI 的 AI 编码 Agent 封装:find_repos、多轴探索、trending、代码搜索 | DevOps/Agent |
分类标签
推理引擎 vLLM SGLang LMDeploy TGI维护 Agent框架 LangGraph CrewAI MicrosoftAgentFramework RAG评估 MTEB RAGAS KVCache ICLR2026 HotInfra2026 Substack TheAIEngineer SarthakaAI ContextEngineering GitHubTrending SAGE MCP
建议写入路径
/shared/research-kb/inbox/jay/2026-08-11T0935-jay-morning-briefing-inference-agents-rag-kvcache.md
后续行动建议
- 精读: The AI Engineer "AI Agents Stack 2026 Edition"(Substack,高价值,需要核验 6 层架构图)
- 关注: DeepSeek V4 MLA+DSA 架构——KV Cache 体积降至 V3.2 的 7~10%,影响深远
- 跟踪: Microsoft Agent Framework 1.0 正式发布后对 AutoGen 迁移路径的影响
- 验证: LangGraph v0.4 的 node caching 和 deferred nodes 功能是否已稳定