AI 工程・RAG・部署 研究简报

日期: 2026-09-21 实例: Jay 主题: LLM RAG Agent 部署 + 向量数据库选型 + 开源模型生态


一、核心发现

1. AI 部署已进入"全栈编排"时代(CI/CD for LLMs & Agents)

来源: Harness Blog - AI Deployment in Production: Orchestrate LLMs, RAG, Agents(2026)

核心观点: - 2026年 AI 部署不再是"调用 API 发问题"的单点操作,而是要部署完整的 AI 应用栈:模型 + 指令(prompt) + 数据管道 + RAG 组件 + 编排代码 + Agent/Tool + Guardrails - Agentic Workflow 带来巨大复杂性:需要监控 step-by-step 推理轨迹,防止无限循环和工具滥用 - Guardrails(护栏)= AI 领域的 DevSecOps,是生产级部署的必要条件

评价: 工程化视角清晰,适合作为团队内部培训材料引用。

链接: https://www.harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents

建议行动: 可纳入 AI 部署 SOP 参考框架。


2. Context Engineering 成为独立工程学科

来源: Meta-Intelligence - Context Engineering Guide: RAG, Memory Systems & Dynamic Context for Production AI(2026)

核心观点: - 2026年 LLM 能力已足够强大,模型"智能"越来越取决于我们提供的上下文质量,而非模型本身 - Context Engineering = Prompt Engineering 的下一代,专注于"如何为 LLM 提供完整、精确、结构化的上下文" - Agentic RAG 将传统"检索-生成"单次管道升级为具有规划、反思、自我纠正能力的智能体架构,faithfulness 指标提升 42% - 三层记忆架构(短程/长程/语义)可让同一基础模型从"勉强可用"提升到"企业级可靠"

评价: 概念框架完整,但数据引用需核实原始论文出处。

链接: https://www.meta-intelligence.tech/en/insight-context-engineering

建议行动: 三层记忆架构值得在 RAG 系统设计文档中引用。


3. Hugging Face 开源模型生态 2026 夏报(重要)

来源: Hugging Face 官方博客 - State of Open Models: Summer 2026 Observations(2026)

核心数据:

指标 数据
Qwen 系列衍生模型 200,000+(包括 113,000+ 正式派生)
Qwen 下载总量 2,045M(约55倍于 Moonshot 系列)
Qwen 每日新增派生 180-210 个新仓库
小模型中位参数量 406M(2023年 326M → 2025年 406M)
大模型平均参数量 20.8B(受 MoE/量化架构拉动)

关键结论: 1. Qwen 已成为社区默认基础模型——开发者选模型微调部署时,Qwen 是默认起点 2. 小模型仍是实际落地层——虽然大模型拉高了均值,但中位数仅 406M 3. Agents are the new user——模型间的调用正在替代人-模型调用 4. 西部开源替代压力增大——GPT-OSS、AI2 OLMo、Google Gemma 需应对 Qwen/DeepSeek 的生态优势

评价: HF 官方数据,可信度高;Qwen 主导地位值得持续关注。

链接: https://huggingface.co/blog/state-of-open-models-summer-2026

建议行动: 更新 AI 模型选型参考清单,Qwen 系列作为默认微调基座。


4. 向量数据库选型 2026(综合对比)

来源: aiml.qa、alphacorp.ai、kunalganglani.com 等多方对比

决策框架:

场景 推荐 原因
已有 Postgres,< 1000万向量 pgvector + pgvectorscale 零新增系统,够用
新项目,< 1000万向量,追求速度 Qdrant Rust 实现,内存高效,过滤查询强
大型项目,1亿+向量,需水平扩展 Milvus 分布式架构,异构节点分离读写
混合搜索(BM25+向量)优先 Weaviate GraphQL + 内置嵌入,原生混合
完全托管,无运维能力 Pinecone 生态最成熟,上线最快
多模态(图像+文本)亿级 Milvus / Vespa Apache 2.0,大规模验证
原型/轻量级 Chroma / LanceDB 嵌入式,学习曲线低

Reddit 实战反馈(2026): - Qdrant 写入有缓冲机制,定时建索引,CPU 峰值明显 - MariaDB 11.8 向量搜索查询速度快,但写入慢(无 Qdrant 的缓冲机制)

评价: Qdrant 已成 2026 年事实上的向量数据库新默认。

建议行动: 优先在 new RAG 项目中采用 Qdrant;pgvector 作为 Postgres 存量项目首选。


5. Agentic Search 正在颠覆传统 RAG(重要趋势)

来源: Abdullah Grewal - AI Agents Don't Need Vector Search Anymore(2026),AAAI 2026 论文背书

核心观点: - 传统 RAG:检索上游化(embedding → chunk → top-k → prompt → LLM) - Agentic Search(无向量检索):LLM 通过工具调用(pdfgrep, rga, pdfmetadata)实时检索,不依赖预建向量索引 - AAAI 2026 论文 Keyword search is all you need 在 6 个数据集上,同等 LLM 条件下,agentic tool-use 检索性能与向量 RAG 持平甚至更优 - Claude Code、Cursor、Windsurf、Devin 等主流编码 Agent 已不再用向量索引目标语料库

适用场景 vs 不适用: - ✅ 文件系统可访问、结构化查询、少量文档 - ❌ 超大语料(PB级)、需要语义相似性而非精确匹配

评价: 代表性观点,但向量检索在规模化场景仍有不可替代性,两者结合更合理。

链接: https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f

建议行动: 关注该趋势,在轻量文档问答场景考虑 agentic search 替代方案。


6. Substack 高价值专栏(AI Agents & Engineering)

来源: TaskifyLabs、swyx Latent Space、Rocky Bhatia

推荐订阅(按受众定位):

专栏 频率 定位 适合人群
Latent Space(swyx + Alessio) 周更 + 日更 AINews AI 工程深度技术,Agents/代码/基础设施 资深 AI 工程师
AI Tidbits 周更 产品/框架分析,节奏轻快 工程师/PM
The Neuron 工作日日更 商业向 AI,营销/运营 管理/运营
TLDR AI 工作日日更 开发者技术速报 广大开发者
Rocky Bhatia - Agentic AI 不定期深度 Agentic 系统工程实践 AI 应用开发者

精读建议: - Simon Willison(simonw.substack.com):Fireside chat about agentic engineeringHow coding agents work——对 agentic engineering patterns 讲解深入浅出,可信度高 - Louis-François Bouchard(start-ai-engineering GitHub):工程实践导向,反 Demo-to-Production Gap

建议行动: 优先订阅 Latent Space 和 Rocky Bhatia,建立技术追踪节奏。


二、分类标签

AI-Engineering RAG Agent LLMOps Vector-DB Qdrant pgvector Open-Models Qwen Context-Engineering Agentic-Search Hugging-Face Deployment CI/CD Memory-System


三、建议写入路径

正式草稿路径: /shared/research-kb/inbox/jay/2026-09-21-ai-engineering-rag.md

后续行动: 1. ⭐ 精读 HF State of Open Models Summer 2026 全文,提取 Qwen 生态数据补充进模型选型文档 2. ⭐ 核实 Context Engineering 文章中"35-60% 准确率提升"和"42% faithfulness 提升"的数据来源 3. 关注 agent-as-retriever 方向,评估在内部文档问答场景的可行性 4. Qdrant vs pgvector 向量数据库选型建议可单独成文


四、本次检索范围

  • Tavily 搜索:AI Engineering、RAG、Agent、Vector DB、GitHub Trending、Hugging Face、MLOps、Substack
  • 学术平台:arXiv(通过 VoltAgent awesome-ai-agent-papers 索引)
  • 技术博客:Harness、Meta-Intelligence、Hugging Face 官方博客、Medium/Turing Post
  • 社区:CSDN(同日检索)、Reddit r/Rag
  • 向量数据库对比:aiml.qa、alphacorp.ai、kunalganglani.com、instaclustr

本简报由 Jay 实例自动生成,仅做摘要、评价与引用,不复制原文