五大类目研究简报 · Jay · 2026-08-12 15:05

本次主题

五大类目综合简报(晚间版)· AI 工程・推理系统・云原生・CSDN 高价值・复现线索 覆盖时间: 2026-08-12(下午场新增) 检索范围: arXiv · Hugging Face · 官方技术博客 · Substack · CSDN · Cool Papers · HotInfra · Towards AI · Mem0 · Oracle Blog · ACL Anthology


一、Database / 信息检索与向量数据库

⭐ 高价值 #D1:Agentic 搜索正在取代 RAG——关键词搜索达到 RAG 94.5% 保真度(AAAI 2026)

  • 来源: Medium · Abdullah Grewal · AAAI 2026 · arXiv:2602.23368
  • 可信度: 高(Amazon Science · AAAI 2026 正式论文)
  • 标签: #Agentic搜索 #无向量RAG #Just-in-Time检索 #RAG替代方案

核心发现: - Amazon Science 论文 "Keyword Search is All You Need"(AAAI 2026)证明:基于关键词的工具调用 Agent 达到 RAG 94.5% 保真度、88.0% 上下文召回、91.5% 答案正确率,零向量数据库 - Search-R1(arXiv:2503.09516):用强化学习训练检索策略,在 7 数据集平均上比 RAG 高 24% 相对提升(Qwen2.5-7B) - 已在生产中采用此模式的公司:Claude Code、Cursor、Windsurf、Cline、Devin、Sourcegraph Amp

Jay 评注: 这并非"RAG 已死",而是 RAG 的适用场景被精确定义了。简单文档检索、结构化知识库、多跳推理仍需要向量检索;但单文档问答、工具调用、长上下文理解场景中,agentic keyword search 已经足够好,且零维护成本。知识库架构需重新评估场景分派逻辑。

后续行动: 建议在知识库"检索架构选型"页按场景分类决策树;核验 Search-R1 开源代码。


⭐ 高价值 #D2:ACL 2026 Findings · LLM Agent Memory 综述(ACLIanthology)

核心框架(三层记忆分类,已成工业标准): 1. Episodic Memory(情景记忆):近期交互轨迹,按时间衰减加权 2. Semantic Memory(语义记忆):结构化知识,实体-关系图谱 3. Procedural Memory(程序记忆):Agent 执行策略、工具调用模式

存储架构演进(2024-2026): - 2024:纯向量存储 → 2025:向量+图谱混合 → 2026:向量+图谱+表格三元混合 - Mem0(~48k GitHub stars)采用两阶段 pipeline:LLM 抽取 → 冲突检测 + 图更新;91% lower p95 latency vs OpenAI native memory - Oracle Blog(2026):GDPR 删除权 vs EU AI Act 10年审计日志的张力,需要"可融合记忆架构"

评价: 记忆三层分类已成为 2026 年事实标准;该综述覆盖全面,可作为知识库"AI Agent 记忆架构"专题的骨干参考。


其他线索

条目 来源 备注
Mem0 Agent Memory 2026 Progress Report mem0.ai/blog · 2026-04 21 框架、20 向量存储覆盖;生产模式已成熟
OasisKV · 超越 HBM 的 KV Cache arXiv:2608.08097 · HF Daily 前瞻式稀疏预取,解码内 KV Cache 扩展
2026 年 11 大向量数据库选型 mastra.ai · 2026-08 Pinecone / Qdrant / pgvector 三分天下

二、Backend / LLM 推理系统工程

⭐ 高价值 #B1:TGI 正式进入维护模式——2026 年推理引擎选型风向标

  • 来源: Towards AI · Jun 2026 · DeployBase · Spheron
  • 可信度: 高(HuggingFace 官方指引 + 多方独立验证)
  • 标签: #TGI维护模式 #vLLM vs SGLang #推理引擎选型 #生产部署

关键事实: - TGI 官方立场(2026): 接受 minor bug fix PR,不接受新功能 PR;推荐迁移至 vLLM 或 SGLang - 推理引擎 2026 基准数据(综合多家 benchmark):

引擎 吞吐(高并发) TTFT(单请求) 内存效率 生产适合度
vLLM ~3,500 tok/s ~150ms PagedAttention <4% 碎片 ⭐⭐⭐⭐⭐
SGLang ~2,800 tok/s ~80ms RadixAttention 前缀复用 ⭐⭐⭐⭐⭐
TGI ~2,500 tok/s ~250ms 略高(功能更丰富) ⭐⭐ 仅维护
TRT-LLM 最高(B200) ~150ms 编译优化优势 ⭐⭐⭐⭐ 定制成本高

SGLang vs vLLM 场景细分(2026 共识): - 前缀共享高(多轮对话、工具调用、系统提示复用):SGLang 领先 20-30%(RadixAttention trie 复用) - 前缀唯一(单次请求、无共享 context):两者差异 <4%,在运行方差范围内 - 结构化输出 / Function Calling:SGLang 语法缓存更激进,xgrammar 默认(vLLM 2026 也默认 xgrammar)

Jay 评注: TGI 退出历史舞台是 2026 年 inference 领域最重大的生态变化。vLLM 凭借 PagedAttention 已成为生产默认;SGLang 是需要前缀复用场景的首选。新项目无理由再选 TGI。知识库"推理引擎选型"页需更新此结论。

建议: 精读 vLLM Blog 最新架构分析(2025-09);补充 SGLang RadixAttention 源码级分析。


⭐ 高价值 #B2:KV Cache 的"互联网"——内容分发视角重新定义推理系统(arXiv:2608.01526 · 2026)

  • 来源: arXiv:2608.01526 · HotInfra 2026
  • 可信度: 高(顶会级系统论文)
  • 标签: #KV Cache #内容分发 #Internet-Scale #缓存复用 #系统架构

核心论点: KV Cache 复用已将 LLM 推理从"计算-存储权衡问题"转变为"互联网级内容管理问题"。

框架核心: - LLM 推理端点化(inference as endpoint) - KV Cache 运动类比为内容分发系统(CDN / DNS / 互联网路由) - 三个一级优化资源:重计算(recompute)、存储(store)、复用(reuse) - 呼吁社区将网络和存储作为推理系统的一等公民

评价: 这是 2026 年最具系统思想高度的 KV Cache 论文。视角独特——不是优化单点,而是把 KV Cache 复用看作全球分布式缓存系统的问题。对 Mooncake、DistServe 等分解式架构有系统性解释价值。

建议: 纳入"LLM 推理系统工程"主题页,与 WRP 框架并列。


⭐ 高价值 #B3:内存中心化 KV Cache 服务器 · HotInfra 2026(成本降至 1/20)

  • 来源: HotInfra 2026 · 2026-06-28 · Khyati Kiyawat & Kevin Skadron
  • 可信度: 高(HotInfra 2026 正式论文,有详细 benchmark 数据)
  • 标签: #KV Cache服务器 #PIM-DIMM #CXL #成本优化 #内存分解

核心数据(32K tokens generation,DeepSeek-R1-671B):

指标 H100 GPU 集群(19×H100 SXM5) PIM-DIMM(23×64GB) 对比
总内存 1,520 GB 1,472 GB 持平
聚合带宽 63.7 TB/s 150.7 TB/s 2.4×
吞吐量 679 tok/s 1,607 tok/s 2.4×
CapEx(采购) $570,000 $27,664 1/20×
OpEx(云租+电费) $59.23/hr $3.53/hr 1/17×

Jay 评注: PIM(Processing-in-Memory)KV Cache 服务器在成本-性能比上相对 GPU 有数量级优势,但生态成熟度、编程复杂度和延迟敏感场景适用性仍是挑战。此数据来自 2026 年 6 月 HotInfra,对"推理成本优化"方向有重要参考价值。


其他线索

条目 来源 备注
Online Scheduling for LLM Inference with KV Cache Constraints arXiv:2502.07115 MC-SF 算法,竞争比常数;有界在线调度
LLM Inference Engineering Anatomy (vLLM Blog) vllm.ai/blog PagedAttention 调度 / batching / 分布式 / benchmark 完整指南
Async KV Cache Prefetching via L2 Cache(AAAI 2026) AAAAI/ojs 计算-传输重叠,HBM 延迟隐藏;vLLM profiling

三、Cloud-Native / 云原生基础设施

⭐ 高价值 #C1:2026 年 AI Cloud-Native 技术雷达综合评估

  • 来源: 汇总自 Cloudflare AI 付费机制 / Oracle Agent Memory 合规分析 / Koyeb → Mistral AI 收购
  • 可信度: ★★★★
  • 标签: #Cloudflare AI计费 #EU AI Act合规 #Serverless AI #Koyeb/Mistral

Cloudflare AI 付费内容(ByteByteGo): - Cloudflare Workers AI 推动 AI 厂商为 AI 爬虫/使用付费 - 机制:AI 厂商 API 爬取 → Cloudflare 拦截 → 按 token 量计费 - 对知识库爬取策略有影响

EU AI Act 2026(全面适用): - 高风险 AI 系统要求 10年审计日志 - Agent Memory 的 GDPR 删除权 vs 10年保存义务:架构冲突(Oracle Blog 指出) - 需要 convergent database(向量+图谱+关系+时序统一)

Koyeb → Mistral AI 收购: - Serverless AI inference 平台被大模型厂商整合 - 意味着:小规模 Serverless GPU inference 市场竞争加剧


四、CSDN 高价值条目

(本日 CSDN 高价值条目已在 2026-08-12 下午场(12:20)完整覆盖,链接如下:)

  • A1:QLoRA / LlamaFactory / DeepEval 工程闭环 → shebao3333 · CSDN · 精度链路/llamafactory-cli/webui/DeepEval 集成
  • A2:SITS 2026 K8s for AI 部署清单 → Algorhythm · CSDN · GPU调度/YAML/GitOps/Argo CD/热加载
  • A3:向量数据库选型代码实战(PGVector/Qdrant/Milvus) → 2502_92311356 · CSDN · HNSW 参数/生产配置

本次晚间场未发现新的 CSDN 高价值条目(与上午场去重后一致)。


五、Reproduction / 复现线索

精筛复现候选

优先级 条目 链接 复现路径
★★★★★ SGLang vs vLLM Benchmark(Sphron 2026) spheron.network 用 sharegpt 或自定义前缀集,对比 RadixAttention vs PagedAttention吞吐/TPOT
★★★★☆ "Internet for KV Cache" 论文架构图 arXiv:2608.01526 提取核心架构图 + 评估框架描述
★★★★☆ TGI → vLLM 迁移指南 Towards AI 产出一份 TGI 迁移 checklist
★★★☆☆ OasisKV 论文 arXiv:2608.08097 前瞻式稀疏预取,超 HBM KV Cache

本次简报摘要

类目 高价值条目数 最重要发现
Database 2 Agentic 搜索 94.5% RAG 保真度;ACL 2026 三层记忆标准确立
Backend 3 TGI 维护模式;KV Cache 互联网视角;PIM-DIMM 成本降至 1/20
Cloud-Native 1 EU AI Act 合规 vs GDPR 张力;Serverless GPU 整合趋势
CSDN 0(已覆盖) 下午场已精筛 K8s/微调/向量数据库三大方向
Reproduction 4 SGLang vs vLLM 对比实验优先级最高

建议写入路径: /shared/research-kb/inbox/jay/2026-08-12T1505-jay-evening-five-category-briefing.md

是否需要精读: - TGI → vLLM/SGLang 迁移:精读优先级★★★★★(2026 生态重大变化) - "Internet for KV Cache":精读优先级★★★★(系统思想高度,纳入主题页) - ACL 2026 Agent Memory 综述:精读优先级★★★★(知识库记忆架构专题骨干)


整理者:Jay · 2026-08-12 15:05 CST 去重依据:jay/inbox/2026-08-12 全天草稿(RSS上午场 / CSDN下午场)