📋 五分类简报 · Jay · 2026-08-28 11:05
检索范围:RAG/Agent/VectorDB · Hugging Face 生态 · 推理工程 · 数据库后端 · Cloud-Native · arXiv/Substack 本轮来源:Tavily 搜索(综合 / 学术优先)/ 已有 inbox 去重 ⚠️ 本次未检出 CSDN 高价值条目(无匹配);无 reproduction 条目
🗃️ DATABASE
1. pgvector 0.8 新特性(2026 生产评估重要参考)
- 来源:pecollective.com / Medium 精选
- 核心变化:
- 迭代扫描(Iterative Scan):解决 filter+向量混合查询的截断问题——之前 HNSW 索引在 filter 后可能返回不足 K 条结果,现已修复,<100ms 延迟,<100M 向量场景完全够用
- 并行 HNSW 建索引:多核机器上建索引时间减少 30-50%,对频繁重建的生产环境有意义
halfvec量化:降低存储开销,适合成本敏感型项目- 评价:pgvector 0.8 是 2026 年生产选型的重要基线。若已有 Postgres 基础设施,优先选 pgvector 而非引入独立 VectorDB;10M-50M 向量是迁移临界点
- 可信度:高,pecollective 评测 + 多个生产选型文章交叉印证
- 引用:
https://pecollective.com/tools/pgvector
2. Vector DB 2026 选型决策框架
- 来源:acecloud.ai / datacamp / redis.io / instaclustr 等多源综合
- 关键结论(本轮确认):
- Pinecone:托管生产 RAG,默认选
- Weaviate:AI 原生混合搜索
- Milvus/Zilliz:大规模开源向量 workloads
- Qdrant:过滤密集型自托管 RAG
- Elasticsearch:企业混合+多模态搜索
- Chroma/FAISS:原型和本地实验
- LanceDB:多模态 AI workloads
- Redis:低延迟 AI apps + 缓存 + agent semantic memory
- pgvector:已有 Postgres 团队,<100M 向量场景
- 2026 重要趋势:PostgreSQL 逆袭——pgvector + pgvectorscale(HNSW + StreamingDiskANN)让 RDBMS 重新成为向量搜索首选;ACID 合规性是企业选型关键驱动
- 可信度:高,多篇独立评测一致
- 引用:
https://acecloud.ai/blog/best-vector-databases-for-multimodal-genai
3. Edge/离线部署场景的向量数据库需求
- 来源:dev.to / actiandev
- 核心:Pinecone/Zilliz Cloud 等托管服务不适合 air-gapped 环境;Milvus/Weaviate/Qdrant/Chroma 支持完全离线自托管;与 on-premises embedding + inference 配搭可实现全主权栈
- 可信度:中,技术方向确认但数据新鲜度需核验
⚙️ BACKEND / INFERENCE ENGINEERING
4. vLLM vs SGLang 2026 生产选型决策框架
- 来源:DevOpsBeast / atomic.chat / inferenceengineering.tech / jarvislabs / yottalabs / spheron
- 核心对比:
- vLLM:PagedAttention,成熟易用(pip install + 一行 CLI),支持 NVIDIA/AMD ROCm/Google TPU/Intel Gaudi/CPU fallback,GGUF 支持,生态最广
- SGLang:RadixAttention(前缀缓存),在 agent/coding 等共享 system prompt 场景领先;原生 constrained decoding 集成在 scheduler 层面;Grok 背后生产引擎,百级 GPU 规模
- 决策四问(DevOpsBeast 框架): 1. 工作负载是否共享长 system prompt / tool definitions / conversation history?→ SGLang 优势 2. 是否需要严格结构化输出(guided decoding)?→ SGLang scheduler 级集成 3. 硬件是否 H100+ 且需要 TensorRT-LLM 互操作?→ TRT-LLM 备选 4. 团队是否需要最快上手("默认 vLLM" 答案对大多数团队仍成立)
- 可信度:高,多篇独立工程评测,DevOpsBeast 总结最清晰
- 引用:
https://devopsbeast.com/blog/vllm-vs-sglang-production-2026
5. NVIDIA Grove:K8s 原生化推理编排
- 来源:spheron.network 2026-05-19
- 核心:Grove = NVIDIA Kubernetes CRD,将 prefill/decode/router pods 封装为单一声明式资源,内置 startup ordering、gang scheduling、协同扩缩容;基于 NVIDIA DRA driver + NVLink topology-aware PodClique 放置
- 适用场景: disaggregated LLM inference 的大规模生产集群
- 可信度:高,Spheron 详细工程博客,有完整 YAML 示例
- 引用:
https://www.spheron.network/blog/nvidia-grove-kubernetes-disaggregated-inference-guide
6. Kubernetes GPU Orchestration 2026:DRA + KAI Scheduler
- 来源:spheron.network 2026-04-15(KubeCon Europe 2026 背景)
- 核心:NVIDIA 向 CNCF 捐赠 DRA driver;KAI Scheduler 处理 GPU 抢占和恢复;66% organizations 在用 K8s 做 gen AI inference(2026 CNCNC Annual Survey);Spot H100 $1.03/hr vs on-demand $2.50/hr,节省约 59% GPU 成本
- 评价:DRA 解决了 K8s 无法感知 GPU 拓扑和 NVLink 的历史问题,意义重大
- 可信度:高,CNCF 调研数据 + 详细工程指南
- 引用:
https://www.spheron.network/blog/kubernetes-gpu-orchestration-2026
☁️ CLOUD-NATIVE
7. Kubernetes AI Serving 2026:何时选 K8s
- 来源:mlflow.org
- 关键数据:
- 66% orgs 用 K8s 做 gen AI inference(2026 CNCF)
- DRA + gang scheduling 解决了多 GPU AI 工作负载的主要痛点
- KEDA cooldownPeriod 至少设 300s(GPU node provisioning 需 2-4 分钟)
- HPA + KEDA + Karpenter 三层 autoscaling 覆盖不同维度
- 何时用 K8s:多团队 GPU 共享 / 多模型部署 / 多云可移植性
- 何时不用:单一模型 + 单 GPU + 无共享需求 → 托管端点更快
- 可信度:高,MLflow 官方博客,CNCF 数据支撑
- 引用:
https://mlflow.org/articles/the-role-of-kubernetes-in-ai-serving-2026-guide
🤖 HUGGING FACE / RESEARCH
8. HF Hub 2026 夏状态:开源模型格局
- 来源:huggingface.co/blog/state-of-open-models-summer-2026
- 关键数据:
- 2.4M+ models,730K+ datasets,~1M Spaces
- 第二百万个 model 用时约 335 天 vs 第一个百万 1000+ 天
- top 50 entities 占 80.2% downloads;<1B 参数小模型占 92.5% downloads
- NLP 58.1%、CV 21.2%、Audio 15.1%
- Qwen derivatives 每日新增 180-210 repos(非单次 launch 驱动)
- 可信度:高,HF 官方博客
9. Qwen3.8-2.4T-A95B / Muse-Glimmer-30B / Kimi-K3 等新模型
- 来源:HF State of Open Models Summer 2026
- 可信度:高,HF 官方
10. Hugging Face smolagents:~50 行代码构建 MCP agent
- 来源:metacto.com 2026 指南
- 评价:MCP + smolagents + Inference Providers 是 HF 推荐的 mid-market 团队 agent 构建栈
- 可信度:中,第三方教程,方向需核验
11. Substack 高价值研究线索
11a. Agentic RAG SoK 论文(arXiv 2026-03)
- 来源:arXiv:2603.07379 + ResearchGate
- 标题:SoK: Agentic Retrieval-Augmented Generation — Taxonomy, Architectures, Evaluation, and Research Directions
- 核心:Systematization of Knowledge 论文,涵盖 Agentic RAG 分类体系、架构、评估方法和研究方向;2026 年 3 月发布
- 可信度:高,arXiv 学术论文
11b. A-RAG: 分层检索接口扩展 Agentic RAG
- 来源:arXiv:2602.03442
- 核心:通过分层检索接口扩展 Agentic RAG,18 页 8 图
- 可信度:高,arXiv 学术论文
11c. Ken Huang「LLM 前沿推理系统工程」10 篇系列(2026-09-04 开始)
- 来源:kenhuangus.substack.com
- 专栏方:DistributedApps.ai,定位为学术论文与生产工程之间的桥梁
- 10 章课程涵盖:LLM Inference 物理基础 / Roofline 模型 / Memory Wall / 热力学极限 / 95% Decode Test-Time Compute / MW MoE 架构 / 极端量化 / 2026 生产架构栈 / TCO 优化计算器
- 评价:工程价值高,课程体系完整,适合系统性学习
- 可信度:中高,Substack 付费专栏预告,2026-09-04 首篇
- 引用:
https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
11d. The AI Agents Stack(2026 Edition)— The AI Engineer
- 来源:theaiengineer.substack.com(Paolo Perrone)
- 核心:
- Agent guardrails 从 output filtering 演变为 tool authorization("guardrails before action" 模式,行动执行层授权而非响应层过滤)
- OWASP MCP Top 10 (beta) 发布,首个 tool-connected agent 安全 checklist
- LangChain State of Agent Engineering survey:89% 生产 agent 团队有 tracing,但仅 52% 有 evals(37point gap = 生产质量风险所在)
- 新 benchmark:Context-Bench(memory mgmt)、Recovery-Bench(error recovery)、Terminal-Bench(coding agents)
- 可信度:高,The AI Engineer 是 AI Engineering 领域权威 Substack
- 引用:
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
11e. "Vector Search is All You Need" 质疑(Agent-as-Retriever 范式)
- 来源:buzzgrewal.medium.com
- 核心:引用 AAAI 2026 论文 Subramanian et al.「Keyword search is all you need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use」
- 结论:Claude 3 Sonnet (200K context) 同等条件下,ReAct agent 调用
pdfmetadata/rga/pdfgrep工具集在 6 个数据集上与 Bedrock Knowledge Base + Titan Text Embeddings 性能相当 - 生产意义:Claude Code、Cursor、Windsurf、Cline、Sourcegraph Amp 等已不再将语料索引进向量数据库;检索变成 LLM 行为而非独立系统
- 评价:范式级观察,生产团队值得关注但需自行验证
- 可信度:中,引用正式论文但 medium 文章非原始来源
📦 分类汇总
| 分类 | 条目数 | 最高价值条目 |
|---|---|---|
| DATABASE | 3 | pgvector 0.8 新特性 + 2026 VectorDB 选型决策框架 |
| BACKEND | 3 | vLLM vs SGLang 决策四问 + NVIDIA Grove K8s 编排 |
| CLOUD-NATIVE | 1 | K8s AI Serving 2026 CNCF 数据 + DRA/KAI |
| HF/RESEARCH | 4 | HF State of Open Models Summer 2026 + Agentic RAG SoK + AI Engineer Agents Stack 2026 |
| CSDN | 0 | 本轮无匹配条目 |
| REPRODUCTION | 0 | 本轮无匹配条目 |
🎯 高优先级条目(建议精读)
- pgvector 0.8(
https://pecollective.com/tools/pgvector)——向量数据库选型基准,2026 生产必读 - DevOpsBeast vLLM vs SGLang 决策四问(
https://devopsbeast.com/blog/vllm-vs-sglang-production-2026)——推理引擎选型最短路径 - arXiv:2603.07379 Agentic RAG SoK(
https://arxiv.org/abs/2603.07379)——学术系统性综述 - The AI Engineer Agents Stack 2026(
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition)——工程实践风向标
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-08-28T1105-jay-five-category-briefing.md(本文)
Jay · 2026-08-28 11:05 · Asia/Shanghai 检索:Tavily(综合+学术)/ 已有 inbox 去重 ⚠️ 本轮无 CSDN 高价值条目 / 无 reproduction 条目