知识库草稿 · Jay · 2026-07-17 上午场补遗

主题

数据库 · LLM 推理系统 · Agent 搜索架构 · Cloud-Native 2026 · Substack 研究线索

检索范围

  • arXiv (cs.IR / cs.AI / cs.SE / MLSys) · Substack (Sebastian Raschka / 行业 newsletter)
  • CNCF 2026 Q1 报告 · Hugging Face / GitHub · 向量数据库对比报告 · Kubernetes 平台工程趋势

DATABASE


1. AAAI 2026:关键词搜索 Agent 无需向量数据库——RAG 的范式动摇?

来源: arXiv:2602.23368 · Subramanian et al. (Amazon Science) · AAAI 2026 链接: https://arxiv.org/abs/2602.23368 发表: 2026-02(arXiv 提交) 分类标签: Database | RAG | Agentic Search | 信息检索 | 颠覆性研究 可信度: ⭐⭐⭐⭐⭐ 有 AAAI 背书,Amazon Science 出品,同一 LLM 控制变量实验

核心发现:

研究在完全相同的条件下(Claude 3 Sonnet、200K context、temperature 0.001、六个数据集)对比: - 向量 RAG:Bedrock Knowledge Base + Titan Text Embeddings V2 - Agentic 关键词搜索:ReAct loop 调用 pdfmetadatargapdfgrep(即 Linux grep 工具链)

指标 Agent 得分 RAG 得分 Agent 达成率
Faithfulness 0.81 0.86 94.5%
Context Recall 0.68 0.77 88.5%
Answer Correctness 0.59 0.65 90.8%

Anthropic 内部案例:2025 年 5 月将 Claude Code 中的向量搜索替换为 grep,性能反而"outperformed everything. By a lot"(据 Claude Code 创建者 Boris Cherny)。

工程评价: - 这篇论文的工程意义远大于学术意义——它直接质疑了向量数据库在 Agent 场景的必要性 - "Embedding + 向量搜索"并非 Agentic RAG 的必要条件,grep/rga 等工具驱动的检索在封闭域文档问答中已接近 RAG 水平 - 并不意味着向量数据库已过时:语义相似性搜索、长上下文理解、跨模态检索等场景仍依赖向量检索 - 启示:对于"精确关键词优先"的垂直领域(法务、财报、医疗),Agentic keyword search 可能是更低成本的方案

保留理由: 高影响力颠覆性研究;改变了 RAG 系统设计的底层假设;多条工业界案例佐证(Claude Code、Cursor、Windsurf、Cline、Devin);对知识库架构选型有直接指导价值。

后续行动: 关注 AgenticRAG (arXiv:2605.05538) 的对比数据;考虑是否在知识库主题页更新"向量数据库 vs Agentic Search 选型框架";注意该方向尚未在生产环境大规模验证,保留审慎态度。


2. AgenticRAG:企业知识库的场景化 Agentic 检索新架构

来源: arXiv:2605.05538v1 链接: https://arxiv.org/html/2605.05538v1 发表: 2026 分类标签: Database | Agentic RAG | 企业知识库 | RAG 评测 可信度: ⭐⭐⭐⭐ 有量化对比,在 FinanceBench 数据集上有对照实验

核心发现:

方法 FinanceBench 正确率
传统 RAG 24.24%
Agentic (keyword search tools) 32.71%
Oracle (full-page evidence) 94.00%
AgenticRAG (GPT-5-mini, search/find/open/summarize) 92.00%
AgenticRAG (Claude Sonnet 4.5) 91.78%

AgenticRAG 的工具集:search(全局搜索文档库)、find(单文档内关键词/语义定位)、open(打开并读取页面)、summarize(总结内容)。

与上一条 AAAI 2026 论文的关系:两者都指向 Agentic > 传统 RAG,但 AgenticRAG 使用 GPT-5-mini + 多工具编排,达成率更高(3.8× vs 传统 RAG)。

工程评价: - 92% vs 24% 的差距说明传统 chunk-level RAG 在长文档问答场景存在严重的信息丢失 - 工具调用架构(search → find → open → summarize)比纯 embedding 检索更适合结构化长文档 - 作者强调 Find 工具支持 optional semantic find mode,说明纯关键词+结构化文档索引在某些场景已足够

保留理由: 与 AAAI 论文形成互证,补充了"多工具 Agentic RAG > 关键词搜索 Agent"的证据链。


3. 向量数据库 2026 对比:Braintrust & PingCAP 决策框架

来源: Braintrust (2026-07-11) · PingCAP/TiDB (2026-02-25) 链接: - https://www.braintrust.dev/articles/best-vector-databases-for-rag-2026 - https://www.pingcap.com/compare/best-vector-database

分类标签: Database | Vector DB | RAG | 选型参考 可信度: ⭐⭐⭐ 中(Braintrust 为行业平台,PingCAP/TiDB 有商业倾向,但数据有参考价值)

关键结论对比框架(按场景):

场景 推荐方案
原型 / 本地开发 / <10K 文档 Chroma(轻量、零运维)
元数据过滤优先的检索 Qdrant(开源,filter 能力强)
语义+关键词混合搜索 Weaviate(原生 hybrid search)
大规模云托管 Pinecone / Zilliz(Milvus 托管版)
SQL + 向量混合负载 TiDB(HTAP + vector search)
多租户 / 企业知识库 Pinecone (serverless) / Qdrant (cloud)

工程评价: - 2026 年向量数据库进入"场景细分"阶段,没有全能冠军 - 值得关注:Qdrant 的 filter-heavy retrieval 在多租户 RAG 场景中优势明显,与 Agentic Search 趋势形成有趣对比——过滤靠 Qdrant,检索靠 Agentic


BACKEND


4. FlowPrefill:MLSys 2026 Oral——LLM 推理调度的队头阻塞问题与 5.6× 吞吐提升

来源: arXiv:2602.16603 · MLSys 2026 Oral 链接: https://arxiv.org/html/2602.16603v1 | https://github.com/HSIEHCHIACHI/FlowPrefill 作者: Hsieh et al. 发表: 2026-02;MLSys Oral 2026-05-21 分类标签: Backend | LLM Inference | 推理调度 | 吞吐优化 | MLSys 可信度: ⭐⭐⭐⭐⭐ MLSys Oral;GitHub 已开源;有真实生产 trace 评测(QwenTrace)

核心问题:

LLM Serving 在 prefill 阶段(计算密集的长输入处理)存在队头阻塞(Head-of-Line Blocking): - 长请求独占 GPU → 短请求被阻塞 → TTFT(首 token 时间)SLO 违反 - 现有分块 prefill(chunked/layered preemption)存在根本矛盾:块越小响应越快但吞吐越低,块越大吞吐越高但阻塞越严重

核心贡献:

  1. 操作符级抢占(Operator-Level Preemption):利用算子边界(qkv_proj、attn、o_proj 等)实现细粒度中断,无需固定小分块,延迟低于 4.5ms

  2. 事件驱动调度(Event-Driven Scheduling):只在请求到达或完成时触发调度决策,减少控制面开销

  3. S-EDF(SLO-Aware Earliest Deadline First):结合 SLO 截止时间的优先级调度

关键数据(QwenTrace 生产 trace):

对比基线 最大 Goodput 提升 SLO 达成能力
DistServe 最高 5.6× 支持 3.1× 更严格的 SLO
DistServe-CP2K 1.5×–3.1× 更严格 SLO
Layer-level preemption 操作符级抢占平均阻塞时间减少 3.5×–4.2× 全部延迟 < 4.5ms

支持模型:Llama3-8B、Qwen2.5-14B、Llama3-70B、Qwen3-30B-A3B(MoE)。

工程评价: - GitHub 已开源(Apache-2.0),有 PD-colocation 和 MoE 兼容性 - 对 vLLM 生产部署有直接参考价值:TTFT 优化是 2026 年 LLM Serving 的核心战场 - 操作符级抢占的实现思路值得在团队内部调度框架中借鉴

保留理由: MLSys Oral 级别,系统工程贡献扎实;5.6× goodput 提升是实打实的数字;GitHub 已开源。

后续行动: 精读操作符级抢占的实现细节;评估与 vLLM PagedAttention 的结合可能性。


5. LLM 推理优化 2026 综合指南:Zylos 研究报告关键指标

来源: Zylos.ai (2026-01-15) 链接: https://zylos.ai/research/2026-01-15-llm-inference-optimization 分类标签: Backend | LLM Inference | 量化指标 | 推理优化 可信度: ⭐⭐⭐ 中(行业研究报告,部分数据来自厂商)

关键性能数字(2026 年生产基准):

技术 典型提升
PagedAttention (vLLM) 2–4× 吞吐 vs 传统
FP8 vs FP16 30–33% 加速
Speculative Decoding 最高 3× 加速(延迟敏感场景)
Continuous Batching 23× 吞吐 vs 静态批处理
FlashAttention-3 (H100) 840 TFLOPS(85% 利用率)

2026 年推理栈格局: - vLLM + PagedAttention 仍是生产标准 - SGLang + RadixAttention 在 Agent/RAG 场景吞吐领先(长上下文多请求场景) - H100 价格回归($3–4/hr),A100 逐步退居次席 - Edge 侧:<9B 模型在垂直任务已可与云端模型竞争

保留理由: 量化指标汇总,是基础设施选型的快速参考;可作为团队内部分享的"推理优化 2026 数字卡片"。


6. Sebastian Raschka:2026 年 LLM 论文全景清单(1月–5月)

来源: Sebastian Raschka Newsletter (2026) 链接: https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1 分类标签: Backend | LLM Research | Survey | Agent | Reasoning | Inference 可信度: ⭐⭐⭐⭐⭐ AI 教育领域权威一手整理,有分类有评论

十大分类方向(2026 年至今): 1. Architecture & Model Design(混合架构:Nemotron-3 Mamba-2 混用;Arcee Trinity) 2. Efficient Training & Scaling 3. Inference Efficiency & KV Cache 4. Sparse Attention & Long Context 5. Reasoning & Test-Time Compute 6. Reinforcement Learning & RLVR 7. Agent Systems & Tool Use(重点方向) 8. Coding Agents & Software Engineering(重点方向) 9. Diffusion Language Models 10. Model Evaluation & Benchmarks

值得关注的亮点: - 混合注意力架构(Regular + Mamba-2 SSM)在 120B-A12B 参数规模展现了长上下文效率优势 - 2026 年明显趋势:从"让 Transformer 更大"转向"混合架构 + 推理效率 + Agent 工具链" - 相比 2025 年,Agent harnesses、tool use、long context、diffusion language models 方向论文密度显著增加

保留理由: 高质量研究地图,适合作为知识库主题页的论文导航;精读价值高。

后续行动: 在 LLM 系统主题页增加 2026 论文清单链接;按分类整理到知识库。


CLOUD-NATIVE


7. CNCF Q1 2026 云原生成熟度报告:AI 开发者路径洞察

来源: CNCF (2026-03) · State of Cloud Native Development Q1 2026 链接: https://www.cncf.io/wp-content/uploads/2026/03/State-of-Cloud-Native-Development-Q1-2026.pdf 分类标签: Cloud-Native | Kubernetes | Platform Engineering | AI/ML | CNCF 可信度: ⭐⭐⭐⭐⭐ CNCF 官方报告,2026 Q1 最新数据

关键数据: - 82% 的容器用户在生产环境运行 Kubernetes(较去年继续上升) - 94% 在生产、试点或评估阶段 - 66% 将 Kubernetes 用于生成式 AI 工作负载 - Gartner 预测:2026 年 >90% 的全球组织将在生产环境运行容器化应用

AI 开发者云原生成熟度路径(新发现): CNCF 首次提出 AI 开发者的独特路径——不同于传统微服务开发者:

成熟阶段 AI 开发者优先工具 关联性(lift)
入门 事件驱动架构(Event-driven) 1.31×
成长 流式服务(Streaming) 1.50×
成熟 可观测性工具(Observability) 1.25×–1.34×
高级 混沌工程(Chaos Engineering) 与可观测性负相关(0.50)

工程评价: - 可观测性在 AI 场景比传统微服务更重要——模型性能监控、数据质量追踪需要专门的 observability stack - 事件驱动架构对 AI 数据流水线(触发重训练、特征工程流式处理)有天然亲和性 - 平台工程使 Kubernetes 对开发者"不可见"(Internal Developer Platforms),这是 2026 年的大趋势

保留理由: 官方权威数据,是年度云原生状态报告的重要补充;首次给出 AI 开发者独特成熟度路径。


8. Kubernetes 2026 平台工程与安全趋势

来源: Gart Solutions · Fairwinds · Medium (orlando1409) 链接: - https://gartsolutions.com/kubernetes-and-containerization-trends - https://www.fairwinds.com/blog/kubernetes-eating-production-why-usage-keeps-climbing - https://medium.com/@orlando1409/beyond-kubernetes-platform-engineering-trends-for-2026-8f82e09e27e0

分类标签: Cloud-Native | Kubernetes | Platform Engineering | Security | FinOps | Wasm 可信度: ⭐⭐⭐ 中

2026 年 Kubernetes 关键技术趋势:

方向 关键内容
Wasm(WebAssembly) CNCF Wasm Working Group 活跃;WasmDay 专项活动;Envoy 代理过滤器已支持 Wasm;将成为容器补充技术用于 serverless/edge/插件场景
CRI-O Red Hat 主推的最小化容器运行时,攻击面小、安全加固、与 Kubernetes CRI 严格对齐;pod 启动更快;OpenShift 企业用户首选
平台工程 Internal Developer Platforms(IDP)让开发者"点击即可部署";Kubernetes 底层化;Golden Paths 最佳实践
安全 45% 漏洞发生在构建/运行时阶段;45% 承认配置错误事故;SBOM(软件物料清单)将成为供应链安全标准
FinOps Kubecost 等工具集成进 Kubernetes 平台;成本可视化成为平台内置能力
AI/ML 编排 Kubeflow + Kubernetes 深度集成;AI 驱动的工作负载调度(预测性扩缩容)进入早期生产

工程评价: - Wasm 是 2026 年最值得关注的"容器补充技术",对 serverless 函数、数据库内插件、edge 工作负载有实质价值 - 平台工程使 Kubernetes 技能需求从"运维专项"变成"平台团队专项",开发者直接接触 K8s 的机会减少 - 安全+FinOps 是 2026 年 Kubernetes 选型的两大新增决策维度

保留理由: 系统性趋势梳理;对团队基础设施规划有参考价值;SBOM 趋势值得关注。


REPRODUCTION


9. FlowPrefill GitHub 源码 + 评测代码

来源: GitHub: HSIEHCHIACHI/FlowPrefill 链接: https://github.com/HSIEHCHIACHI/FlowPrefill 许可证: Apache-2.0 状态: 主仓库已开源;PD-colocation 实验代码和基线代码因评估需要未包含在仓库中;当前仅支持 NIXL connector for KV transfer

复现价值: ⭐⭐⭐ 中高 - 核心调度框架已开源 - 基线和 PD-colocation 实验代码未包含(论文对比数据可能无法复现) - 支持 Llama3-8B / Qwen2.5-14B / Llama3-70B / Qwen3-30B-A3B


SUBSTACK / 研究线索


10. Substack 高价值线索追踪

线索 A: Abdullah Grewal (Medium/Substack) — "AI Agents Don't Need Vector Search Anymore" 来源: buzzgrewal.medium.com(2026 年 7 月) URL: https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f 核心观点: 系统性梳理 2026 Agentic Search Stack,引用 AAAI 2026 + Anthropic 内部案例 + 多家厂商决策变化 价值: 高质量综述,适合作为知识库"Agentic Search vs Vector RAG"主题页的核心参考文献

线索 B: Sebastian Raschka — LLM Research Papers 2026 List 来源: magazine.sebastianraschka.com 价值: 见上文第 6 条


本次汇总

分类 条目数 最高价值条目
Database 3 AAAI 2026 "Keyword Search is All You Need"
Backend 3 FlowPrefill (MLSys 2026 Oral, 5.6× goodput)
Cloud-Native 2 CNCF Q1 2026 AI 开发者成熟度路径
CSDN 0 今日检索未发现新 CSDN 高价值条目(上午批次已覆盖)
Reproduction 1 FlowPrefill GitHub (Apache-2.0)
Substack 2 Agentic Search Stack 综述 + Raschka 2026 论文清单

建议写入路径

主草稿路径: /shared/research-kb/inbox/jay/2026-07-17-1105-midday-briefing-db-backend-cloudnative-agentsubstack.md

后续行动建议: 1. 精读优先级:FlowPrefill 论文(推理调度)+ AAAI 2602.23368(Agentic Search) 2. 主题页更新:知识库建议增加"Agentic Search vs Vector RAG 选型框架"页面,整合 AAAI 2026 + AgenticRAG 两篇论文结论 3. CSDN:今日无新增高质量 CSDN 条目,上午批次 vLLM/LangChain/LlamaIndex 内容已覆盖主要需求 4. Substack 线索:建议跟进 Grewal 的 Agentic Search 综述文章,评估是否需要单独产出条目


Jay · 2026-07-17 11:05 AM (Asia/Shanghai) · 第 3 次知识库轮次