📋 五分类简报 · Jay · 2026-08-28 11:05

检索范围:RAG/Agent/VectorDB · Hugging Face 生态 · 推理工程 · 数据库后端 · Cloud-Native · arXiv/Substack 本轮来源:Tavily 搜索(综合 / 学术优先)/ 已有 inbox 去重 ⚠️ 本次未检出 CSDN 高价值条目(无匹配);无 reproduction 条目


🗃️ DATABASE

1. pgvector 0.8 新特性(2026 生产评估重要参考)

  • 来源:pecollective.com / Medium 精选
  • 核心变化
  • 迭代扫描(Iterative Scan):解决 filter+向量混合查询的截断问题——之前 HNSW 索引在 filter 后可能返回不足 K 条结果,现已修复,<100ms 延迟,<100M 向量场景完全够用
  • 并行 HNSW 建索引:多核机器上建索引时间减少 30-50%,对频繁重建的生产环境有意义
  • halfvec 量化:降低存储开销,适合成本敏感型项目
  • 评价:pgvector 0.8 是 2026 年生产选型的重要基线。若已有 Postgres 基础设施,优先选 pgvector 而非引入独立 VectorDB;10M-50M 向量是迁移临界点
  • 可信度:高,pecollective 评测 + 多个生产选型文章交叉印证
  • 引用https://pecollective.com/tools/pgvector

2. Vector DB 2026 选型决策框架

  • 来源:acecloud.ai / datacamp / redis.io / instaclustr 等多源综合
  • 关键结论(本轮确认):
  • Pinecone:托管生产 RAG,默认选
  • Weaviate:AI 原生混合搜索
  • Milvus/Zilliz:大规模开源向量 workloads
  • Qdrant:过滤密集型自托管 RAG
  • Elasticsearch:企业混合+多模态搜索
  • Chroma/FAISS:原型和本地实验
  • LanceDB:多模态 AI workloads
  • Redis:低延迟 AI apps + 缓存 + agent semantic memory
  • pgvector:已有 Postgres 团队,<100M 向量场景
  • 2026 重要趋势:PostgreSQL 逆袭——pgvector + pgvectorscale(HNSW + StreamingDiskANN)让 RDBMS 重新成为向量搜索首选;ACID 合规性是企业选型关键驱动
  • 可信度:高,多篇独立评测一致
  • 引用https://acecloud.ai/blog/best-vector-databases-for-multimodal-genai

3. Edge/离线部署场景的向量数据库需求

  • 来源:dev.to / actiandev
  • 核心:Pinecone/Zilliz Cloud 等托管服务不适合 air-gapped 环境;Milvus/Weaviate/Qdrant/Chroma 支持完全离线自托管;与 on-premises embedding + inference 配搭可实现全主权栈
  • 可信度:中,技术方向确认但数据新鲜度需核验

⚙️ BACKEND / INFERENCE ENGINEERING

4. vLLM vs SGLang 2026 生产选型决策框架

  • 来源:DevOpsBeast / atomic.chat / inferenceengineering.tech / jarvislabs / yottalabs / spheron
  • 核心对比
  • vLLM:PagedAttention,成熟易用(pip install + 一行 CLI),支持 NVIDIA/AMD ROCm/Google TPU/Intel Gaudi/CPU fallback,GGUF 支持,生态最广
  • SGLang:RadixAttention(前缀缓存),在 agent/coding 等共享 system prompt 场景领先;原生 constrained decoding 集成在 scheduler 层面;Grok 背后生产引擎,百级 GPU 规模
  • 决策四问(DevOpsBeast 框架): 1. 工作负载是否共享长 system prompt / tool definitions / conversation history?→ SGLang 优势 2. 是否需要严格结构化输出(guided decoding)?→ SGLang scheduler 级集成 3. 硬件是否 H100+ 且需要 TensorRT-LLM 互操作?→ TRT-LLM 备选 4. 团队是否需要最快上手("默认 vLLM" 答案对大多数团队仍成立)
  • 可信度:高,多篇独立工程评测,DevOpsBeast 总结最清晰
  • 引用https://devopsbeast.com/blog/vllm-vs-sglang-production-2026

5. NVIDIA Grove:K8s 原生化推理编排

  • 来源:spheron.network 2026-05-19
  • 核心:Grove = NVIDIA Kubernetes CRD,将 prefill/decode/router pods 封装为单一声明式资源,内置 startup ordering、gang scheduling、协同扩缩容;基于 NVIDIA DRA driver + NVLink topology-aware PodClique 放置
  • 适用场景: disaggregated LLM inference 的大规模生产集群
  • 可信度:高,Spheron 详细工程博客,有完整 YAML 示例
  • 引用https://www.spheron.network/blog/nvidia-grove-kubernetes-disaggregated-inference-guide

6. Kubernetes GPU Orchestration 2026:DRA + KAI Scheduler

  • 来源:spheron.network 2026-04-15(KubeCon Europe 2026 背景)
  • 核心:NVIDIA 向 CNCF 捐赠 DRA driver;KAI Scheduler 处理 GPU 抢占和恢复;66% organizations 在用 K8s 做 gen AI inference(2026 CNCNC Annual Survey);Spot H100 $1.03/hr vs on-demand $2.50/hr,节省约 59% GPU 成本
  • 评价:DRA 解决了 K8s 无法感知 GPU 拓扑和 NVLink 的历史问题,意义重大
  • 可信度:高,CNCF 调研数据 + 详细工程指南
  • 引用https://www.spheron.network/blog/kubernetes-gpu-orchestration-2026

☁️ CLOUD-NATIVE

7. Kubernetes AI Serving 2026:何时选 K8s

  • 来源:mlflow.org
  • 关键数据
  • 66% orgs 用 K8s 做 gen AI inference(2026 CNCF)
  • DRA + gang scheduling 解决了多 GPU AI 工作负载的主要痛点
  • KEDA cooldownPeriod 至少设 300s(GPU node provisioning 需 2-4 分钟)
  • HPA + KEDA + Karpenter 三层 autoscaling 覆盖不同维度
  • 何时用 K8s:多团队 GPU 共享 / 多模型部署 / 多云可移植性
  • 何时不用:单一模型 + 单 GPU + 无共享需求 → 托管端点更快
  • 可信度:高,MLflow 官方博客,CNCF 数据支撑
  • 引用https://mlflow.org/articles/the-role-of-kubernetes-in-ai-serving-2026-guide

🤖 HUGGING FACE / RESEARCH

8. HF Hub 2026 夏状态:开源模型格局

  • 来源:huggingface.co/blog/state-of-open-models-summer-2026
  • 关键数据
  • 2.4M+ models,730K+ datasets,~1M Spaces
  • 第二百万个 model 用时约 335 天 vs 第一个百万 1000+ 天
  • top 50 entities 占 80.2% downloads;<1B 参数小模型占 92.5% downloads
  • NLP 58.1%、CV 21.2%、Audio 15.1%
  • Qwen derivatives 每日新增 180-210 repos(非单次 launch 驱动)
  • 可信度:高,HF 官方博客

9. Qwen3.8-2.4T-A95B / Muse-Glimmer-30B / Kimi-K3 等新模型

  • 来源:HF State of Open Models Summer 2026
  • 可信度:高,HF 官方

10. Hugging Face smolagents:~50 行代码构建 MCP agent

  • 来源:metacto.com 2026 指南
  • 评价:MCP + smolagents + Inference Providers 是 HF 推荐的 mid-market 团队 agent 构建栈
  • 可信度:中,第三方教程,方向需核验

11. Substack 高价值研究线索

11a. Agentic RAG SoK 论文(arXiv 2026-03)

  • 来源:arXiv:2603.07379 + ResearchGate
  • 标题:SoK: Agentic Retrieval-Augmented Generation — Taxonomy, Architectures, Evaluation, and Research Directions
  • 核心:Systematization of Knowledge 论文,涵盖 Agentic RAG 分类体系、架构、评估方法和研究方向;2026 年 3 月发布
  • 可信度:高,arXiv 学术论文

11b. A-RAG: 分层检索接口扩展 Agentic RAG

  • 来源:arXiv:2602.03442
  • 核心:通过分层检索接口扩展 Agentic RAG,18 页 8 图
  • 可信度:高,arXiv 学术论文

11c. Ken Huang「LLM 前沿推理系统工程」10 篇系列(2026-09-04 开始)

  • 来源:kenhuangus.substack.com
  • 专栏方:DistributedApps.ai,定位为学术论文与生产工程之间的桥梁
  • 10 章课程涵盖:LLM Inference 物理基础 / Roofline 模型 / Memory Wall / 热力学极限 / 95% Decode Test-Time Compute / MW MoE 架构 / 极端量化 / 2026 生产架构栈 / TCO 优化计算器
  • 评价:工程价值高,课程体系完整,适合系统性学习
  • 可信度:中高,Substack 付费专栏预告,2026-09-04 首篇
  • 引用https://kenhuangus.substack.com/p/announcing-the-10-part-series-the

11d. The AI Agents Stack(2026 Edition)— The AI Engineer

  • 来源:theaiengineer.substack.com(Paolo Perrone)
  • 核心
  • Agent guardrails 从 output filtering 演变为 tool authorization("guardrails before action" 模式,行动执行层授权而非响应层过滤)
  • OWASP MCP Top 10 (beta) 发布,首个 tool-connected agent 安全 checklist
  • LangChain State of Agent Engineering survey:89% 生产 agent 团队有 tracing,但仅 52% 有 evals(37point gap = 生产质量风险所在)
  • 新 benchmark:Context-Bench(memory mgmt)、Recovery-Bench(error recovery)、Terminal-Bench(coding agents)
  • 可信度:高,The AI Engineer 是 AI Engineering 领域权威 Substack
  • 引用https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition

11e. "Vector Search is All You Need" 质疑(Agent-as-Retriever 范式)

  • 来源:buzzgrewal.medium.com
  • 核心:引用 AAAI 2026 论文 Subramanian et al.「Keyword search is all you need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use」
  • 结论:Claude 3 Sonnet (200K context) 同等条件下,ReAct agent 调用 pdfmetadata/rga/pdfgrep 工具集在 6 个数据集上与 Bedrock Knowledge Base + Titan Text Embeddings 性能相当
  • 生产意义:Claude Code、Cursor、Windsurf、Cline、Sourcegraph Amp 等已不再将语料索引进向量数据库;检索变成 LLM 行为而非独立系统
  • 评价:范式级观察,生产团队值得关注但需自行验证
  • 可信度:中,引用正式论文但 medium 文章非原始来源

📦 分类汇总

分类 条目数 最高价值条目
DATABASE 3 pgvector 0.8 新特性 + 2026 VectorDB 选型决策框架
BACKEND 3 vLLM vs SGLang 决策四问 + NVIDIA Grove K8s 编排
CLOUD-NATIVE 1 K8s AI Serving 2026 CNCF 数据 + DRA/KAI
HF/RESEARCH 4 HF State of Open Models Summer 2026 + Agentic RAG SoK + AI Engineer Agents Stack 2026
CSDN 0 本轮无匹配条目
REPRODUCTION 0 本轮无匹配条目

🎯 高优先级条目(建议精读)

  1. pgvector 0.8https://pecollective.com/tools/pgvector)——向量数据库选型基准,2026 生产必读
  2. DevOpsBeast vLLM vs SGLang 决策四问https://devopsbeast.com/blog/vllm-vs-sglang-production-2026)——推理引擎选型最短路径
  3. arXiv:2603.07379 Agentic RAG SoKhttps://arxiv.org/abs/2603.07379)——学术系统性综述
  4. The AI Engineer Agents Stack 2026https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition)——工程实践风向标

📁 建议写入路径

  • /shared/research-kb/inbox/jay/2026-08-28T1105-jay-five-category-briefing.md(本文)

Jay · 2026-08-28 11:05 · Asia/Shanghai 检索:Tavily(综合+学术)/ 已有 inbox 去重 ⚠️ 本轮无 CSDN 高价值条目 / 无 reproduction 条目