📋 Jay · 知识库简报 · 2026-10-02

检索时间:2026-10-02 11:05 (UTC+8) 检索范围:arXiv · Substack · GitHub Trending · Medium · 技术博客


🗃️ Database

向量数据库 2026 趋势:pgvector 崛起,架构回归

核心洞察

2026 年向量数据库市场出现重大结构性转变:云原生专用向量数据库的热度正在回落,PostgreSQL + pgvector 组合成为工程团队的首选方案。

关键数据 - 工程对话从「用 Pinecone」演变为「用 PostgreSQL 就够了」 - pgvector 目前支撑 OpenAI ChatGPT 和 API 的部分基础设施 - 多模态数据(文本 + 图像 + 视频 + 高维向量)正在打破传统「大多数是表格」的存储假设

技术趋势 - 多模态 Lakehouse 兴起:Lance 格式支持时间旅行、零拷贝数据演化、代码/数据/embedding 版本控制,解决 Parquet 对 AI 训练瓶颈问题 - 架构合并(Database Consolidation):单一多模态平台同时处理 BI 顺序扫描和 AI 训练随机访问 - pgvector + PostgreSQL 17+:事务安全 + 分析能力 + 熟悉生态 = 生产级 RAG 首选 - Multi-model serving:向量 DB 从配角变为 AI Agent 基础设施核心

代表性条目 | 条目 | 来源 | 评价 | |------|------|------| | Vector Database 2026 格局分析 | DEV Community (actiandev) | 市场分析,pgvector 趋势明确 | | Lance 多模态 Lakehouse | Gradient Flow Substack | 多模态数据架构深度 | | pgvector 生产级 RAG 选型 | Medium Pratik K Rupareliya | 15 种向量 DB 对比表 | | Agentic Lakehouse (LanceDB) | ACM SAO Workshop 2026 | 学术前沿,PDF |

建议:Agent 记忆层选型时优先评估 pgvector/LanceDB,专用向量 DB 仅在 billion-scale 时考虑迁移。


⚙️ Backend / Inference

Agentic RAG 系统工程:多层记忆架构成熟

arXiv 重要论文

  1. Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation (arXiv:2602.02007 v4, 2026-05-12) - 核心:解耦(Decoupling)和聚合(Aggregation)替代传统 RAG 检索 - 联合作者:Zhanghao Hu, Qinglin Zhu 等(8 人) - 评价:⭐⭐⭐⭐ 高优先级,理解 Agent 长期记忆必读

  2. MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks (arXiv:2602.16313) - 多会话 agent 记忆 benchmark - 评价:⭐⭐⭐⭐ 工程实用性高

  3. Agentic Memory: Unified Long/Short-term Memory Management (arXiv:2601.01885) - 统一长期/短期记忆管理框架 - 评价:⭐⭐⭐ 系统性梳理

  4. Graph-based Agent Memory: Taxonomy, Techniques, and Applications (arXiv:2602.05665) - 图结构 agent 记忆分类学 - 评价:⭐⭐⭐⭐ 架构选型参考

  5. SoK: Agentic RAG: Taxonomy, Architectures, Evaluation (arXiv:2603.07379v1) - Agentic RAG 系统化综述 - 覆盖 Memory、Orchestration、Evaluation 全面

Production RAG 2026 实践框架:GROUNDED

Medium 上 Vishal Mysore 提出的 GROUNDED Framework 涵盖: - Groundedness:RAG 的根本目标 - Routing:查询路由决定是否触发检索 - Optimize:KV-cache 复用、块重排序、去重 - Unify:统一索引 - N-ary retrieval:超越二元图关系的 n 元超边检索(HyperRAG) - Decompose:查询分解 - Evaluate:持续评估

上下文索引 & Cache-aware 检索(ragboost / ContextPilot, arXiv:2511.03475): - 块重排序使 KV-cache 复用,第二次相似查询变为 cache hit - 生产级 RAG 质量最大瓶颈是检索质量,不是模型选择

评价:生产 RAG 是检索问题,不是 LLM 问题——选好 chunk 策略、索引、排序比换模型更重要。


☸️ Cloud-Native

Kubernetes 2026:AI 原生基础设施元年

KubeSummit 2026 台北(2026-09-10~11)主题:从 Cloud Native 到 AI Native

核心趋势(2026 Kubernetes Playbook, Fairwinds)

  1. GPU 调度成熟:NVIDIA/AMD/Intel 加速器支持完善;KubeAI、RunPod 让 LLM 推理部署变得 trivial
  2. 自愈集群:健康信号标准化 → 控制器/operator 自动化处理反复出现的故障模式
  3. 多集群管理:应用跨越多个集群而非每集群一个应用;流量路由、策略执行、身份、遥测统一
  4. AI 工作负载主流化:无状态(63%)与有状态(58%)应用接近平衡,Kubernetes 成为数据密集型平台
  5. Wasm 支持:K8s v1.33+ 开始接纳 WebAssembly 容器
  6. 安全实践:SBOM 生成/验证、OPA/Kyverno Policy-as-Code、运行时安全(Falco)

架构转变 - AI MLOps 平台在 Kubernetes 上协调 bursty 训练 Job 和高流量持续推理 Service - GitOps + Platform Engineering 是 AI Native 平台工程的核心 - 边缘/混合云架构成为主流(Kubernetes Federation)

Enterprise 数据:93% 的组织已在使用或评估 Kubernetes(Voice of Kubernetes Report 2026)


📦 GitHub / 工具生态

2026 AI 工程工具链精选

本地 AI 基础设施 - Ollama:一条命令跑 Llama/DeepSeek,本地 AI 革命核心工具 - nanochat(Andrej Karpathy):最小可读 LLM 训练全流程——tokenization → pretraining → finetuning → inference → chat UI - Open WebUI:开源本地 AI Web 界面

Agent 框架 & 低代码 - Langflow:LangChain 上层拖拽式低代码 AI 应用平台;常见用例:RAG pipeline、原型多 agent 对话、Chatbot - OpenClaw:本地 AI Agent 基础设施(本次任务运行环境)

工程实践工具 - Aider:终端 AI 结对编程,每次 AI 修改自动 commit - CursorCopilot:支持 100+ 语言、全代码库上下文,适合重构和遗留代码 - Firecrawl:Web context API(Perplexity 旗下 Bumblebee)

2026 AI Engineer 能力要求

能够把模型变成工作系统——读取数据、调用工具、记忆上下文、正确检索、结构化输出、可测试/可部署/可监控/可改进。


📝 Substack 高价值专栏

TheSequence Opinion #904:AI 工程时代到来

作者:Jesus Rodriguez

核心观点 - 2026 年前沿模型发布,架构图看起来「奇怪地熟悉」——Transformer + MoE - 真正进步在别处:数据质量、长上下文、强化学习、合成任务、工具调用、记忆、验证、自适应推理预算、Agent 编排 - 「Scaling 没有结束,只是escaped」(Scaling did not end. It escaped.) - 当前 AI 进步 = 更好数据 + 更长上下文 + 更强 RL + 合成任务 + 工具使用 + Agent 编排的组合

Data Engineering for Machine Users(Gradient Flow / Ben Lorica)

核心洞察 - 多模态 AI 打破了过去十年「大多数是表格」的存储假设 - 一行数据现在包含:文本、图像、视频、高维向量——这些是主要数据,不是次要资产 - 多模态 Lakehouse 是架构答案:Lance 格式解决 BI 扫描和 AI 训练随机访问的双重需求 - PARR Stack(Prompt + Assistant + RAG + Response)正在成为 Production AI 标准

AI Agents Simplified:Q1 2026 更新

  • Claude Opus 4.7(Anthropic):高级软件工程、长时间任务可靠性、高分辨率多模态感知
  • Opus 4.7 严格遵循显式指令,几乎不跳过步骤;多模态工作流受益于更高输入分辨率
  • Gemma 4(Google):多模态语言模型,计算效率和推理能力并重,包含无 encoder 设计
  • Muse Spark 1.1(Meta):Agentic 任务增强,工具调用、编码、多模态理解提升
  • Cohere Aya Vision 8B:23 种语言 OCR/字幕/视觉推理,16K 上下文

The 2026 AI Engineer Roadmap(Opinion AI)

能力层级 1. 软件工程基础(不是在 AI 炒作之前学 AI) 2. LLM API / 结构化 Prompt / JSON 输出 3. 工具调用(Tool Calling) 4. RAG(不是默认方案,是有选择地使用) 5. Agent(不神秘,是有约束的自主系统) 6. MCP(Model Context Protocol)生态 7. 生产安全:Prompt Injection、Evals、部署、监控


🏷️ 分类标签

database/vector-db, backend/rag, backend/inference, 
cloud-native/kubernetes, cloud-native/gpu-scheduling,
github/ollama, github/nanochat, github/langflow,
substack/ai-engineering, substack/vecdb,
arxiv/agentic-rag, arxiv/agent-memory

📁 建议写入路径

  • 草稿:/shared/research-kb/inbox/jay/2026-10-02-jay-five-category-briefing.md
  • 后续可合并至 /shared/research-kb/review/ 进行去重审稿
  • 本次未读取其他实例草稿(近期内容均来自 2026-09,未与本次 10-02 重复)

🔬 精读/审稿建议

优先级 条目 建议
⭐⭐⭐⭐ arXiv:2602.02007(Agent Memory 解耦与聚合) 精读,理解 Agent 记忆架构
⭐⭐⭐⭐ GROUNDED Framework(Medium) 快速浏览,生产 RAG 实践参考
⭐⭐⭐ arXiv:2602.16313(MemoryArena benchmark) 审稿,了解 benchmark 覆盖范围
⭐⭐⭐ K8s 2026 Playbook(Fairwinds) 了解 AI + K8s 集成趋势
⭐⭐ TheSequence #904 观点类,了解 AI 工程趋势即可

Jay · 知识库简报 · 2026-10-02 · 第一次发布