研究知识库草稿 · Jay · 2026-09-12 晚场

实例: Jay
产出时间: 2026-09-12 17:35 (Asia/Shanghai)
主题: Agentic Stack 工程实践 · Vector DB 选型趋势 · HF 开源生态报告 · Colibri 推理引擎 · Agentic RAG 学术脉络


📌 本次检索范围

维度 来源
学术 arXiv (Agentic RAG, TRiSM, RADIANT-LLM, Alternate Agentic Architecture)
GitHub Build 2026 repos, Colibri, Langflow, Dify, HF trending
Hugging Face State of Open Source Spring 2026 报告
Substack The AI Engineer, Simon Willison (Agentic Engineering Patterns), Rocky Bhatia, FutureAGI
Vector DB 2026 选型对比 (pgvector, Qdrant, Weaviate, Milvus, LanceDB)
推理引擎 vLLM V1 / Korea Meetup 2026 / Prefill-Decode disaggregation

🔴 高价值条目


1. Substack · The AI Engineer: AI Agents Stack 2026 Edition

来源: theaiengineer.substack.com · "The AI Agents Stack: LLM to Production (2026)"
发布时间: 2026(具体日期待核)
可信度: 高 · 工程社区一手观察,LangChain State of Agent 报告交叉验证
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition

核心观点摘要: - 2026 年 Agent 技术栈分层已稳定:编排框架 → Memory → Knowledge(RAG) → Tools(MCP) → Deployment → Observability → Governance - MCP (Model Context Protocol) 正成为 Agent 工具连接的"USB 口":任何 MCP-compatible Agent 均可调用标准工具,Lock-in 风险低;但安全治理是 demo-to-production 的核心 Gap(2026 年初已报告 30+ CVEs,43% 为 shell 注入) - 部署层仍是 DIY:LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra,是"最计划外工程时间"的所在 - 生产 Agent 分两类场景: - 单步工具调用(查天气、搜文档):状态无需管理,无 Session 记忆 - 多步工作流(端到端退款处理 / PR 审查 / 工单分诊):需 LangGraph + MCP + Eval;步骤相互依赖,中途可能失败,需人工审批节点 - 关键工程建议:部署前先建 Eval,因为 Agent 在静默失败时破坏最大

评价:工程视角清晰,MCP 安全数据(30+ CVEs)是重要风险信号,值得纳入 AI 工程安全议题。
后续行动:核验 LangChain 2026 Agent 现状报告原文,更新 Agent 架构主题页。


2. Substack · Simon Willison: Agentic Engineering Patterns

来源: simonw.substack.com · "Agentic Engineering Patterns" 系列
发布时间: 2026-03 起持续更新
可信度: 高 · Simon Willison 是 Web AI 领域知名独立研究者,代码可复现
链接: https://simonw.substack.com/p/fireside-chat-about-agentic-engineering

核心观点摘要(来自 fireside chat): - AI 应帮助人类产生更好代码,而非仅替代人工编程——质量维度不能被吞吐量牺牲 - Subagents 模式:主 Agent 分解任务,子 Agent 并行或串行执行子任务,结果汇总 - Leanstral(Mistral 发布):针对 Lean 4 形式化验证语言专项调优的开源模型,代表"垂直领域专用 LLM"趋势

评价:Simon 的观点偏保守稳健,强调工程质量和 human-in-the-loop,与当下"全自动化 Agent"热潮形成有益平衡。
后续行动:列入 AI Engineering 精选阅读列表。


3. Substack · Rocky Bhatia: How to Learn Agentic AI in 2026

来源: rockybhatia.substack.com
发布时间: 2026(推测 Q1-Q2)
可信度: 中高 · 工程路线图型内容
链接: https://rockybhatia.substack.com/p/how-to-learn-agentic-ai-in-2026

核心观点摘要: - 学习 Agentic AI 的正确顺序(非学术纯度,而是生产失败概率排序): 1. LLM fundamentals 2. Retrieval systems(RAG) 3. Workflow orchestration 4. Tool execution 5. Memory architectures 6. Planning & reasoning 7. Reliability engineering ← 生产失败最常见根源 8. Security + governance 9. Multi-agent coordination 10. Operational economics - 核心论点:不要把 Agent 看作"更智能的 Chatbot";Chatbot 被动响应,Agent 主动操作——这个框架差异导致巨大的架构和可观测性设计差异 - 生产事故最常见原因:Reliability engineering 章节是需要重写最多的部分,因为教训是反直觉的

评价:路线图实用,Reliability engineering 排序靠前反映真实生产痛苦。
后续行动:建议作为 AI 工程培训参考资料。


4. Hugging Face · State of Open Source Spring 2026

来源: huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
发布时间: 2026 年春(推测 2026-03~04)
可信度: 高 · HF 官方生态报告,数据来源于 Hub 实际使用统计
链接: https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026

核心观点摘要: - 地理政治化平衡加速:西方组织越来越多寻求中国模型(Qwen、DeepSeek)的商业可部署替代品;GPT-OSS (OpenAI)、OLMo (AI2)、Gemma (Google) 面临能否复制 Qwen/DeepSeek 采纳势头的关键考验 - 小模型的边缘化: autonomy 向边缘靠近,降低对中心化云提供商的依赖;嵌入式和端侧模型在 2026 年显著增长 - 机器人与科学领域的开源扩展:开源 AI 正在从语言/图像生成向物理和实验领域扩展(机器人控制、科学实验自动化),意味着基础设施和协作规范正在被重新用于新模态 - EuroBERT 发布:多语言双向注意力编码器,欧洲自研基础模型的重要里程碑

评价:地理政治分析有深度,对中国开源模型生态的描述客观。Edge AI 趋势与其他信号源(Vector DB 边缘部署 gap、Colibri)吻合。
后续行动:建议精读全文,更新 HF 生态主题页。


5. GitHub · Colibri: Pure-C MoE Inference Engine for 744B GLM

来源: GitHub (仓库名待核,基于 Analytics Vidhya 报道)
发布时间: 2026 年中
可信度: 中 · 技术亮点极高,但需要官方 repo 确认细节
链接: https://github.com/topics/build-2026 (Microsoft Build 2026 仓库集)

核心观点摘要: - Colibri 是一个零依赖纯 C 推理引擎,能在约 25GB RAM 的消费级机器上运行 GLM-5.2(744B 参数 MoE 模型) - 核心技术:流式专家(streaming experts)从磁盘按需加载,突破单机内存限制 - 定位受众:本地 LLM 爱好者和关注无云基础设施运行前沿规模模型的人群 - 评价:工程上令人印象深刻的壮举,将极大模型压缩到极小 footprint

评价:纯 C 实现无外部依赖,生产部署安全性高;流式专家加载是 MoE 部署的重要工程突破。需找官方 repo 验证细节。
后续行动:检索 Colibri 官方 GitHub 仓库;可能值得写入"LLM 推理优化"主题页。


6. Vector Database · 2026 选型趋势:数据库整合与边缘部署 Gap

来源: DEV Community + GroovyWeb + Medium 生产决策指南
发布时间: 2026 年中
可信度: 中高 · 综合多个工程社区的实测数据
链接(汇总): - https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo - https://www.groovyweb.co/blog/top-10-ai-vector-databases-2026

核心观点摘要:

趋势一:数据库整合(Multimodal Platforms Win) - 2026 年不再追求"专用向量数据库",而是向扩展关系型数据库回归(pgvector 是最大赢家) - Gartner 预测:55% 的深度神经网络数据分析将在边缘发生 - 8/10 的向量数据库已支持原生混合搜索(vector + keyword + metadata filtering)

趋势二:边缘部署 Gap - 云端 Vector DB 能力成熟,但边缘场景(离线、隐私敏感、低延迟)生态系统不完善 - 边缘 AI 推理与向量检索结合是下一个待填补的基础设施缺口

主流向量数据库快速选型:

数据库 类型 最佳场景 延迟 开源
pgvector Postgres 扩展 原型/PoC/中小规模
Qdrant 向量专用 低延迟生产,混合搜索 2.8ms (最低)
Weaviate 向量专用 混合搜索,语义搜索 2.8ms
Milvus 向量专用 亿级向量,GPU 加速 高吞吐
Pinecone 全托管 SaaS 大规模生产,无需运维
LanceDB 嵌入式/端侧 多模态 AI,进程内运行
Vespa 搜索+向量混合 大规模搜索+推荐+排序

工程建议(2026版): - 新 RAG 项目 / 原型阶段 / <10 万向量 → pgvector(免费、零运维) - 生产级低延迟 / 混合搜索 → Qdrant(延迟最优,实测 2.8ms) - 亿级规模 / GPU 加速需求 → Milvus + Zilliz Cloud - 多模态 / 嵌入式场景 → LanceDB(进程内,无网络开销)

评价:Qdrant 的延迟数据来自官方有方法论的 benchmark(DBPedia 1M vectors),可信度较高。pgvector 作为默认选择已被多个来源交叉验证。边缘部署 Gap 是新观察,与 HF State of OS 的 Edge 小模型趋势吻合。
后续行动:建议写入"向量数据库选型指南"主题页。


7. arXiv · Agentic RAG 综述与alternate架构

来源: arXiv
发布时间: 2026

7a. Agentic RAG: A Survey (arXiv:2501.09136)
链接: https://arxiv.org/html/2501.09136v1
可信度: 高 · 学术综述

核心观点: - 传统 RAG(retrieve-then-generate)局限:静态检索管道,无法处理复杂多跳查询、无法自适应检索策略 - Agentic RAG 将 LLM 提升为编排者:可分解复杂查询、选择工具/检索策略、执行多跳搜索、验证中间结果后生成最终答案 - Taxonomy:Lightweight agentic RAG → Complex agentic RAG → Hierarchical agentic architectures

7b. An Alternate Agentic AI Architecture (It's About the Data) (arXiv:2604.21413)
链接: https://arxiv.org/html/2604.21413v1
发布时间: Aug 24, 2026
可信度: 高 · 企业 AI 架构反思型论文
核心观点: - 核心论点:企业 AI 不是 prompt 工程问题,而是系统问题 - 重新引入显式查询结构、wrapper-based mediation、基于成本的优化,以获得 Agentic 搜索的广度,同时保持企业环境的可追溯性、确定性和信任 - LLM-centric 架构(让 LLM 负责解析 NL + 编排工作流)在原型阶段优雅,生产环境暴露脆弱性

7c. RADIANT-LLM: Nuclear Engineering Domain Agentic RAG (arXiv:2604.22755)
链接: https://arxiv.org/html/2604.22755v1
可信度: 中高 · 垂直领域工程应用

核心观点: - 为核技术安全决策支持设计的本地优先(local-first)Agentic RAG 框架 - Visual-RAG pipeline:PDF/图像 → 多模态知识库 → 本地冻结 LMM + RAG - 解决核领域特殊需求:3S(安全/保障/安保)约束、信息安全、幻觉风险

7d. TRiSM for Agentic AI (arXiv:2506.04133)
链接: https://arxiv.org/html/2506.04133v4
可信度: 高 · EU AI Act 合规框架

核心观点: - TRiSM = Trust, Risk, Security Management for Agentic AI - EU AI Act 2026 年全面生效:高风险系统需要持续风险评估、技术文档(Annex IV)、日志追溯(Art. 11-12)、人类监督(Art. 14) - Privacy-by-design 原则:用户同意层、隐私配置模块、记忆重daction 模块成为 Agentic AI 架构标配

评价:arXiv 2026 年的 Agentic RAG 研究形成了从通用综述→企业架构反思→垂直领域应用→合规框架的完整脉络。7b 的"企业 AI 是系统问题而非 prompt 工程问题"与 7d 的合规要求形成正交约束:可追溯性+确定性+安全性。
后续行动:建议精读 7b 和 7d,交叉引用,写入"Agentic RAG 工程指南"主题页。


8. vLLM V1 · Korea Meetup 2026 & Prefill-Decode Disaggregation

来源: vllm.ai/blog + 官方文档
发布时间: 2026 年
链接: https://vllm.ai/blog

核心观点摘要:

vLLM V1 Engine(默认 since v0.8.0): - 相比 V0 提升 up to 1.7× throughput - 关键特性:FlashAttention 3 + piecewise CUDA graphs + near-zero-overhead prefix caching(即使 0% cache-hit 率,吞吐下降 <1%) - 清洁的 tensor parallelism + multiprocessing API server

Prefill-Decode Disaggregation(单节点版): - 在 8-GPU AMD MI300X 节点(使用 MORI-IO)上实现单节点 prefill/decode 分离 - KV cache 高效传输,稳定 ITL(Inter-Token Latency),提升 goodput

Kubernetes 生产部署要点: - vLLM /health 只确认引擎进程存活,不验证 GPU 前向传播能力 - 建议:readinessProbe initialDelaySeconds=120, livenessProbe initialDelaySeconds=180(模型加载耗时) - 生产级版本建议:vLLM production-stack(Helm chart available)

NVIDIA NIM(企业封装选项): - 自动选择 TensorRT-LLM / vLLM / SGLang 后端 - NIM LLM 2.0 转向"one container, one backend"(基于 vLLM),行为可预测 - 默认 8000 端口,OpenAI 兼容 API + /metrics

评价:vLLM V1 成熟度已高,prefix caching 开销<1% 是重大工程改进,降低了 cacheMiss 的性能惩罚。K8s 探针延迟建议是实际坑点。
后续行动:建议更新"vLLM 生产部署清单"工具文档。


📊 分类标签

AI-Agent Agentic-RAG MCP Vector-DB vLLM HuggingFace OpenSource-AI EU-AI-Act LLM-Deployment Edge-AI Inference-Optimization MoE LangChain Security Observability


💡 建议写入路径

优先级 文件 操作
/shared/research-kb/inbox/jay/2026-09-12-agentic-stack-vector-db-hf-state.md 写入本文件
更新 Agentic-RAG-Engineering 主题页 待后续任务
更新 Vector-DB-Selection-Guide 主题页 待后续任务
更新 HF 生态/开源 AI 主题页 待后续任务

✅ 本次精读/审稿/更新建议

条目 动作 原因
7b (Alternate Agentic Architecture) 建议精读 "企业 AI 是系统问题"论点深刻,影响架构决策
7d (TRiSM) 建议精读 EU AI Act 2026 生效前合规必读
HF State of OS Spring 2026 建议精读全文 地理政治分析和 Edge 趋势交叉验证价值高
5 (Colibri) 需找官方 repo 验证 报道细节需原始来源核实
6 (Vector DB 选型) 建议写入主题页 多个来源交叉验证,实用性高
4 (HF State of OS) 建议写入主题页 HF 官方数据,权威性高

本草案由 Jay 实例自动生成 · 2026-09-12 17:35 CST 遵循 Substack 研究规则:只记录作者/专栏名、原文链接、发布时间、核心观点、可信度判断,不复制原文