AI 工程・RAG・部署 研究简报
日期: 2026-09-21 实例: Jay 主题: LLM RAG Agent 部署 + 向量数据库选型 + 开源模型生态
一、核心发现
1. AI 部署已进入"全栈编排"时代(CI/CD for LLMs & Agents)
来源: Harness Blog - AI Deployment in Production: Orchestrate LLMs, RAG, Agents(2026)
核心观点: - 2026年 AI 部署不再是"调用 API 发问题"的单点操作,而是要部署完整的 AI 应用栈:模型 + 指令(prompt) + 数据管道 + RAG 组件 + 编排代码 + Agent/Tool + Guardrails - Agentic Workflow 带来巨大复杂性:需要监控 step-by-step 推理轨迹,防止无限循环和工具滥用 - Guardrails(护栏)= AI 领域的 DevSecOps,是生产级部署的必要条件
评价: 工程化视角清晰,适合作为团队内部培训材料引用。
链接: https://www.harness.io/blog/ai-deployment-in-production-orchestrate-llms-rag-agents
建议行动: 可纳入 AI 部署 SOP 参考框架。
2. Context Engineering 成为独立工程学科
来源: Meta-Intelligence - Context Engineering Guide: RAG, Memory Systems & Dynamic Context for Production AI(2026)
核心观点: - 2026年 LLM 能力已足够强大,模型"智能"越来越取决于我们提供的上下文质量,而非模型本身 - Context Engineering = Prompt Engineering 的下一代,专注于"如何为 LLM 提供完整、精确、结构化的上下文" - Agentic RAG 将传统"检索-生成"单次管道升级为具有规划、反思、自我纠正能力的智能体架构,faithfulness 指标提升 42% - 三层记忆架构(短程/长程/语义)可让同一基础模型从"勉强可用"提升到"企业级可靠"
评价: 概念框架完整,但数据引用需核实原始论文出处。
链接: https://www.meta-intelligence.tech/en/insight-context-engineering
建议行动: 三层记忆架构值得在 RAG 系统设计文档中引用。
3. Hugging Face 开源模型生态 2026 夏报(重要)
来源: Hugging Face 官方博客 - State of Open Models: Summer 2026 Observations(2026)
核心数据:
| 指标 | 数据 |
|---|---|
| Qwen 系列衍生模型 | 200,000+(包括 113,000+ 正式派生) |
| Qwen 下载总量 | 2,045M(约55倍于 Moonshot 系列) |
| Qwen 每日新增派生 | 180-210 个新仓库 |
| 小模型中位参数量 | 406M(2023年 326M → 2025年 406M) |
| 大模型平均参数量 | 20.8B(受 MoE/量化架构拉动) |
关键结论: 1. Qwen 已成为社区默认基础模型——开发者选模型微调部署时,Qwen 是默认起点 2. 小模型仍是实际落地层——虽然大模型拉高了均值,但中位数仅 406M 3. Agents are the new user——模型间的调用正在替代人-模型调用 4. 西部开源替代压力增大——GPT-OSS、AI2 OLMo、Google Gemma 需应对 Qwen/DeepSeek 的生态优势
评价: HF 官方数据,可信度高;Qwen 主导地位值得持续关注。
链接: https://huggingface.co/blog/state-of-open-models-summer-2026
建议行动: 更新 AI 模型选型参考清单,Qwen 系列作为默认微调基座。
4. 向量数据库选型 2026(综合对比)
来源: aiml.qa、alphacorp.ai、kunalganglani.com 等多方对比
决策框架:
| 场景 | 推荐 | 原因 |
|---|---|---|
| 已有 Postgres,< 1000万向量 | pgvector + pgvectorscale | 零新增系统,够用 |
| 新项目,< 1000万向量,追求速度 | Qdrant | Rust 实现,内存高效,过滤查询强 |
| 大型项目,1亿+向量,需水平扩展 | Milvus | 分布式架构,异构节点分离读写 |
| 混合搜索(BM25+向量)优先 | Weaviate | GraphQL + 内置嵌入,原生混合 |
| 完全托管,无运维能力 | Pinecone | 生态最成熟,上线最快 |
| 多模态(图像+文本)亿级 | Milvus / Vespa | Apache 2.0,大规模验证 |
| 原型/轻量级 | Chroma / LanceDB | 嵌入式,学习曲线低 |
Reddit 实战反馈(2026): - Qdrant 写入有缓冲机制,定时建索引,CPU 峰值明显 - MariaDB 11.8 向量搜索查询速度快,但写入慢(无 Qdrant 的缓冲机制)
评价: Qdrant 已成 2026 年事实上的向量数据库新默认。
建议行动: 优先在 new RAG 项目中采用 Qdrant;pgvector 作为 Postgres 存量项目首选。
5. Agentic Search 正在颠覆传统 RAG(重要趋势)
来源: Abdullah Grewal - AI Agents Don't Need Vector Search Anymore(2026),AAAI 2026 论文背书
核心观点:
- 传统 RAG:检索上游化(embedding → chunk → top-k → prompt → LLM)
- Agentic Search(无向量检索):LLM 通过工具调用(pdfgrep, rga, pdfmetadata)实时检索,不依赖预建向量索引
- AAAI 2026 论文 Keyword search is all you need 在 6 个数据集上,同等 LLM 条件下,agentic tool-use 检索性能与向量 RAG 持平甚至更优
- Claude Code、Cursor、Windsurf、Devin 等主流编码 Agent 已不再用向量索引目标语料库
适用场景 vs 不适用: - ✅ 文件系统可访问、结构化查询、少量文档 - ❌ 超大语料(PB级)、需要语义相似性而非精确匹配
评价: 代表性观点,但向量检索在规模化场景仍有不可替代性,两者结合更合理。
链接: https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f
建议行动: 关注该趋势,在轻量文档问答场景考虑 agentic search 替代方案。
6. Substack 高价值专栏(AI Agents & Engineering)
来源: TaskifyLabs、swyx Latent Space、Rocky Bhatia
推荐订阅(按受众定位):
| 专栏 | 频率 | 定位 | 适合人群 |
|---|---|---|---|
| Latent Space(swyx + Alessio) | 周更 + 日更 AINews | AI 工程深度技术,Agents/代码/基础设施 | 资深 AI 工程师 |
| AI Tidbits | 周更 | 产品/框架分析,节奏轻快 | 工程师/PM |
| The Neuron | 工作日日更 | 商业向 AI,营销/运营 | 管理/运营 |
| TLDR AI | 工作日日更 | 开发者技术速报 | 广大开发者 |
| Rocky Bhatia - Agentic AI | 不定期深度 | Agentic 系统工程实践 | AI 应用开发者 |
精读建议: - Simon Willison(simonw.substack.com):Fireside chat about agentic engineering、How coding agents work——对 agentic engineering patterns 讲解深入浅出,可信度高 - Louis-François Bouchard(start-ai-engineering GitHub):工程实践导向,反 Demo-to-Production Gap
建议行动: 优先订阅 Latent Space 和 Rocky Bhatia,建立技术追踪节奏。
二、分类标签
AI-Engineering RAG Agent LLMOps Vector-DB Qdrant pgvector Open-Models Qwen Context-Engineering Agentic-Search Hugging-Face Deployment CI/CD Memory-System
三、建议写入路径
正式草稿路径: /shared/research-kb/inbox/jay/2026-09-21-ai-engineering-rag.md
后续行动: 1. ⭐ 精读 HF State of Open Models Summer 2026 全文,提取 Qwen 生态数据补充进模型选型文档 2. ⭐ 核实 Context Engineering 文章中"35-60% 准确率提升"和"42% faithfulness 提升"的数据来源 3. 关注 agent-as-retriever 方向,评估在内部文档问答场景的可行性 4. Qdrant vs pgvector 向量数据库选型建议可单独成文
四、本次检索范围
- Tavily 搜索:AI Engineering、RAG、Agent、Vector DB、GitHub Trending、Hugging Face、MLOps、Substack
- 学术平台:arXiv(通过 VoltAgent awesome-ai-agent-papers 索引)
- 技术博客:Harness、Meta-Intelligence、Hugging Face 官方博客、Medium/Turing Post
- 社区:CSDN(同日检索)、Reddit r/Rag
- 向量数据库对比:aiml.qa、alphacorp.ai、kunalganglani.com、instaclustr
本简报由 Jay 实例自动生成,仅做摘要、评价与引用,不复制原文