研究知识库草稿 · Jay · 2026-09-12 晚场
实例: Jay
产出时间: 2026-09-12 17:35 (Asia/Shanghai)
主题: Agentic Stack 工程实践 · Vector DB 选型趋势 · HF 开源生态报告 · Colibri 推理引擎 · Agentic RAG 学术脉络
📌 本次检索范围
| 维度 | 来源 |
|---|---|
| 学术 | arXiv (Agentic RAG, TRiSM, RADIANT-LLM, Alternate Agentic Architecture) |
| GitHub | Build 2026 repos, Colibri, Langflow, Dify, HF trending |
| Hugging Face | State of Open Source Spring 2026 报告 |
| Substack | The AI Engineer, Simon Willison (Agentic Engineering Patterns), Rocky Bhatia, FutureAGI |
| Vector DB | 2026 选型对比 (pgvector, Qdrant, Weaviate, Milvus, LanceDB) |
| 推理引擎 | vLLM V1 / Korea Meetup 2026 / Prefill-Decode disaggregation |
🔴 高价值条目
1. Substack · The AI Engineer: AI Agents Stack 2026 Edition
来源: theaiengineer.substack.com · "The AI Agents Stack: LLM to Production (2026)"
发布时间: 2026(具体日期待核)
可信度: 高 · 工程社区一手观察,LangChain State of Agent 报告交叉验证
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
核心观点摘要: - 2026 年 Agent 技术栈分层已稳定:编排框架 → Memory → Knowledge(RAG) → Tools(MCP) → Deployment → Observability → Governance - MCP (Model Context Protocol) 正成为 Agent 工具连接的"USB 口":任何 MCP-compatible Agent 均可调用标准工具,Lock-in 风险低;但安全治理是 demo-to-production 的核心 Gap(2026 年初已报告 30+ CVEs,43% 为 shell 注入) - 部署层仍是 DIY:LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra,是"最计划外工程时间"的所在 - 生产 Agent 分两类场景: - 单步工具调用(查天气、搜文档):状态无需管理,无 Session 记忆 - 多步工作流(端到端退款处理 / PR 审查 / 工单分诊):需 LangGraph + MCP + Eval;步骤相互依赖,中途可能失败,需人工审批节点 - 关键工程建议:部署前先建 Eval,因为 Agent 在静默失败时破坏最大
评价:工程视角清晰,MCP 安全数据(30+ CVEs)是重要风险信号,值得纳入 AI 工程安全议题。
后续行动:核验 LangChain 2026 Agent 现状报告原文,更新 Agent 架构主题页。
2. Substack · Simon Willison: Agentic Engineering Patterns
来源: simonw.substack.com · "Agentic Engineering Patterns" 系列
发布时间: 2026-03 起持续更新
可信度: 高 · Simon Willison 是 Web AI 领域知名独立研究者,代码可复现
链接: https://simonw.substack.com/p/fireside-chat-about-agentic-engineering
核心观点摘要(来自 fireside chat): - AI 应帮助人类产生更好代码,而非仅替代人工编程——质量维度不能被吞吐量牺牲 - Subagents 模式:主 Agent 分解任务,子 Agent 并行或串行执行子任务,结果汇总 - Leanstral(Mistral 发布):针对 Lean 4 形式化验证语言专项调优的开源模型,代表"垂直领域专用 LLM"趋势
评价:Simon 的观点偏保守稳健,强调工程质量和 human-in-the-loop,与当下"全自动化 Agent"热潮形成有益平衡。
后续行动:列入 AI Engineering 精选阅读列表。
3. Substack · Rocky Bhatia: How to Learn Agentic AI in 2026
来源: rockybhatia.substack.com
发布时间: 2026(推测 Q1-Q2)
可信度: 中高 · 工程路线图型内容
链接: https://rockybhatia.substack.com/p/how-to-learn-agentic-ai-in-2026
核心观点摘要: - 学习 Agentic AI 的正确顺序(非学术纯度,而是生产失败概率排序): 1. LLM fundamentals 2. Retrieval systems(RAG) 3. Workflow orchestration 4. Tool execution 5. Memory architectures 6. Planning & reasoning 7. Reliability engineering ← 生产失败最常见根源 8. Security + governance 9. Multi-agent coordination 10. Operational economics - 核心论点:不要把 Agent 看作"更智能的 Chatbot";Chatbot 被动响应,Agent 主动操作——这个框架差异导致巨大的架构和可观测性设计差异 - 生产事故最常见原因:Reliability engineering 章节是需要重写最多的部分,因为教训是反直觉的
评价:路线图实用,Reliability engineering 排序靠前反映真实生产痛苦。
后续行动:建议作为 AI 工程培训参考资料。
4. Hugging Face · State of Open Source Spring 2026
来源: huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
发布时间: 2026 年春(推测 2026-03~04)
可信度: 高 · HF 官方生态报告,数据来源于 Hub 实际使用统计
链接: https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026
核心观点摘要: - 地理政治化平衡加速:西方组织越来越多寻求中国模型(Qwen、DeepSeek)的商业可部署替代品;GPT-OSS (OpenAI)、OLMo (AI2)、Gemma (Google) 面临能否复制 Qwen/DeepSeek 采纳势头的关键考验 - 小模型的边缘化: autonomy 向边缘靠近,降低对中心化云提供商的依赖;嵌入式和端侧模型在 2026 年显著增长 - 机器人与科学领域的开源扩展:开源 AI 正在从语言/图像生成向物理和实验领域扩展(机器人控制、科学实验自动化),意味着基础设施和协作规范正在被重新用于新模态 - EuroBERT 发布:多语言双向注意力编码器,欧洲自研基础模型的重要里程碑
评价:地理政治分析有深度,对中国开源模型生态的描述客观。Edge AI 趋势与其他信号源(Vector DB 边缘部署 gap、Colibri)吻合。
后续行动:建议精读全文,更新 HF 生态主题页。
5. GitHub · Colibri: Pure-C MoE Inference Engine for 744B GLM
来源: GitHub (仓库名待核,基于 Analytics Vidhya 报道)
发布时间: 2026 年中
可信度: 中 · 技术亮点极高,但需要官方 repo 确认细节
链接: https://github.com/topics/build-2026 (Microsoft Build 2026 仓库集)
核心观点摘要: - Colibri 是一个零依赖纯 C 推理引擎,能在约 25GB RAM 的消费级机器上运行 GLM-5.2(744B 参数 MoE 模型) - 核心技术:流式专家(streaming experts)从磁盘按需加载,突破单机内存限制 - 定位受众:本地 LLM 爱好者和关注无云基础设施运行前沿规模模型的人群 - 评价:工程上令人印象深刻的壮举,将极大模型压缩到极小 footprint
评价:纯 C 实现无外部依赖,生产部署安全性高;流式专家加载是 MoE 部署的重要工程突破。需找官方 repo 验证细节。
后续行动:检索 Colibri 官方 GitHub 仓库;可能值得写入"LLM 推理优化"主题页。
6. Vector Database · 2026 选型趋势:数据库整合与边缘部署 Gap
来源: DEV Community + GroovyWeb + Medium 生产决策指南
发布时间: 2026 年中
可信度: 中高 · 综合多个工程社区的实测数据
链接(汇总):
- https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo
- https://www.groovyweb.co/blog/top-10-ai-vector-databases-2026
核心观点摘要:
趋势一:数据库整合(Multimodal Platforms Win) - 2026 年不再追求"专用向量数据库",而是向扩展关系型数据库回归(pgvector 是最大赢家) - Gartner 预测:55% 的深度神经网络数据分析将在边缘发生 - 8/10 的向量数据库已支持原生混合搜索(vector + keyword + metadata filtering)
趋势二:边缘部署 Gap - 云端 Vector DB 能力成熟,但边缘场景(离线、隐私敏感、低延迟)生态系统不完善 - 边缘 AI 推理与向量检索结合是下一个待填补的基础设施缺口
主流向量数据库快速选型:
| 数据库 | 类型 | 最佳场景 | 延迟 | 开源 |
|---|---|---|---|---|
| pgvector | Postgres 扩展 | 原型/PoC/中小规模 | 中 | ✅ |
| Qdrant | 向量专用 | 低延迟生产,混合搜索 | 2.8ms (最低) | ✅ |
| Weaviate | 向量专用 | 混合搜索,语义搜索 | 2.8ms | ✅ |
| Milvus | 向量专用 | 亿级向量,GPU 加速 | 高吞吐 | ✅ |
| Pinecone | 全托管 SaaS | 大规模生产,无需运维 | 低 | ❌ |
| LanceDB | 嵌入式/端侧 | 多模态 AI,进程内运行 | 低 | ✅ |
| Vespa | 搜索+向量混合 | 大规模搜索+推荐+排序 | 中 | ✅ |
工程建议(2026版): - 新 RAG 项目 / 原型阶段 / <10 万向量 → pgvector(免费、零运维) - 生产级低延迟 / 混合搜索 → Qdrant(延迟最优,实测 2.8ms) - 亿级规模 / GPU 加速需求 → Milvus + Zilliz Cloud - 多模态 / 嵌入式场景 → LanceDB(进程内,无网络开销)
评价:Qdrant 的延迟数据来自官方有方法论的 benchmark(DBPedia 1M vectors),可信度较高。pgvector 作为默认选择已被多个来源交叉验证。边缘部署 Gap 是新观察,与 HF State of OS 的 Edge 小模型趋势吻合。
后续行动:建议写入"向量数据库选型指南"主题页。
7. arXiv · Agentic RAG 综述与alternate架构
来源: arXiv
发布时间: 2026
7a. Agentic RAG: A Survey (arXiv:2501.09136)
链接: https://arxiv.org/html/2501.09136v1
可信度: 高 · 学术综述
核心观点: - 传统 RAG(retrieve-then-generate)局限:静态检索管道,无法处理复杂多跳查询、无法自适应检索策略 - Agentic RAG 将 LLM 提升为编排者:可分解复杂查询、选择工具/检索策略、执行多跳搜索、验证中间结果后生成最终答案 - Taxonomy:Lightweight agentic RAG → Complex agentic RAG → Hierarchical agentic architectures
7b. An Alternate Agentic AI Architecture (It's About the Data) (arXiv:2604.21413)
链接: https://arxiv.org/html/2604.21413v1
发布时间: Aug 24, 2026
可信度: 高 · 企业 AI 架构反思型论文
核心观点:
- 核心论点:企业 AI 不是 prompt 工程问题,而是系统问题
- 重新引入显式查询结构、wrapper-based mediation、基于成本的优化,以获得 Agentic 搜索的广度,同时保持企业环境的可追溯性、确定性和信任
- LLM-centric 架构(让 LLM 负责解析 NL + 编排工作流)在原型阶段优雅,生产环境暴露脆弱性
7c. RADIANT-LLM: Nuclear Engineering Domain Agentic RAG (arXiv:2604.22755)
链接: https://arxiv.org/html/2604.22755v1
可信度: 中高 · 垂直领域工程应用
核心观点: - 为核技术安全决策支持设计的本地优先(local-first)Agentic RAG 框架 - Visual-RAG pipeline:PDF/图像 → 多模态知识库 → 本地冻结 LMM + RAG - 解决核领域特殊需求:3S(安全/保障/安保)约束、信息安全、幻觉风险
7d. TRiSM for Agentic AI (arXiv:2506.04133)
链接: https://arxiv.org/html/2506.04133v4
可信度: 高 · EU AI Act 合规框架
核心观点: - TRiSM = Trust, Risk, Security Management for Agentic AI - EU AI Act 2026 年全面生效:高风险系统需要持续风险评估、技术文档(Annex IV)、日志追溯(Art. 11-12)、人类监督(Art. 14) - Privacy-by-design 原则:用户同意层、隐私配置模块、记忆重daction 模块成为 Agentic AI 架构标配
评价:arXiv 2026 年的 Agentic RAG 研究形成了从通用综述→企业架构反思→垂直领域应用→合规框架的完整脉络。7b 的"企业 AI 是系统问题而非 prompt 工程问题"与 7d 的合规要求形成正交约束:可追溯性+确定性+安全性。
后续行动:建议精读 7b 和 7d,交叉引用,写入"Agentic RAG 工程指南"主题页。
8. vLLM V1 · Korea Meetup 2026 & Prefill-Decode Disaggregation
来源: vllm.ai/blog + 官方文档
发布时间: 2026 年
链接: https://vllm.ai/blog
核心观点摘要:
vLLM V1 Engine(默认 since v0.8.0): - 相比 V0 提升 up to 1.7× throughput - 关键特性:FlashAttention 3 + piecewise CUDA graphs + near-zero-overhead prefix caching(即使 0% cache-hit 率,吞吐下降 <1%) - 清洁的 tensor parallelism + multiprocessing API server
Prefill-Decode Disaggregation(单节点版): - 在 8-GPU AMD MI300X 节点(使用 MORI-IO)上实现单节点 prefill/decode 分离 - KV cache 高效传输,稳定 ITL(Inter-Token Latency),提升 goodput
Kubernetes 生产部署要点: - vLLM /health 只确认引擎进程存活,不验证 GPU 前向传播能力 - 建议:readinessProbe initialDelaySeconds=120, livenessProbe initialDelaySeconds=180(模型加载耗时) - 生产级版本建议:vLLM production-stack(Helm chart available)
NVIDIA NIM(企业封装选项): - 自动选择 TensorRT-LLM / vLLM / SGLang 后端 - NIM LLM 2.0 转向"one container, one backend"(基于 vLLM),行为可预测 - 默认 8000 端口,OpenAI 兼容 API + /metrics
评价:vLLM V1 成熟度已高,prefix caching 开销<1% 是重大工程改进,降低了 cacheMiss 的性能惩罚。K8s 探针延迟建议是实际坑点。
后续行动:建议更新"vLLM 生产部署清单"工具文档。
📊 分类标签
AI-Agent Agentic-RAG MCP Vector-DB vLLM HuggingFace OpenSource-AI EU-AI-Act LLM-Deployment Edge-AI Inference-Optimization MoE LangChain Security Observability
💡 建议写入路径
| 优先级 | 文件 | 操作 |
|---|---|---|
| 高 | /shared/research-kb/inbox/jay/2026-09-12-agentic-stack-vector-db-hf-state.md |
写入本文件 |
| 中 | 更新 Agentic-RAG-Engineering 主题页 |
待后续任务 |
| 中 | 更新 Vector-DB-Selection-Guide 主题页 |
待后续任务 |
| 低 | 更新 HF 生态/开源 AI 主题页 | 待后续任务 |
✅ 本次精读/审稿/更新建议
| 条目 | 动作 | 原因 |
|---|---|---|
| 7b (Alternate Agentic Architecture) | 建议精读 | "企业 AI 是系统问题"论点深刻,影响架构决策 |
| 7d (TRiSM) | 建议精读 | EU AI Act 2026 生效前合规必读 |
| HF State of OS Spring 2026 | 建议精读全文 | 地理政治分析和 Edge 趋势交叉验证价值高 |
| 5 (Colibri) | 需找官方 repo 验证 | 报道细节需原始来源核实 |
| 6 (Vector DB 选型) | 建议写入主题页 | 多个来源交叉验证,实用性高 |
| 4 (HF State of OS) | 建议写入主题页 | HF 官方数据,权威性高 |
本草案由 Jay 实例自动生成 · 2026-09-12 17:35 CST 遵循 Substack 研究规则:只记录作者/专栏名、原文链接、发布时间、核心观点、可信度判断,不复制原文