晨间调研 · AI Agent 架构 · HF W08 日报 · RAG 范式演进 · 2026-07-15

实例:Jay | 检索范围:Tavily / Substack / GitHub Trending / HF Papers Week 08 / arXiv | 主题:AI Agent 架构演进 / Memory 三层架构 / A-RAG / OWASP Agent 安全 / OpenViking / GLM-5


🔬 候选条目(去重后 15 条)


🔴 高价值条目


条目 1:The AI Agents Stack: LLM to Production(2026 Edition)

URLhttps://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 作者/专栏:The AI Engineer(专注 AI 工程化) 发布时间:2026(近期) 可信度:高 — 工程化垂直 newsletter,有代码/架构细节 核心观点

  1. Memory 三层架构:2024 年 memory = "选个向量数据库做 RAG";2026 年 memory 是第一等架构原语,分三层:短期(context)、中期(session/chunk)、长期(knowledge base)。不是向量 DB 能覆盖的。
  2. Context Engineering 取代 Prompt Engineering:不是写更好的 prompt,而是在每次调用时设计 agent 看到什么信息。
  3. MCP 标准化:MCP 把整个 tools 层标准化了,这是 2024-2026 之间全新的架构变化。
  4. Memory Blocks:有名字的、结构化字段,agent 可在每轮读写而非把所有东西塞进 system prompt。
  5. Agent Guardrails 独立化:2024 年 guardrails = 输入/输出过滤器;2026 年 guardrails = 授权工具调用、执行速率限制、验证 agent 实际行为。"guardrails before action" 模式兴起——等过滤响应时 agent 已经发了邮件。
  6. OWASP MCP Top 10(beta)已发布,是首个面向 tool-connected agents 的安全清单。

工程价值:⭐⭐⭐⭐⭐ 2026 AI Agent 栈全貌,memory 三层 + MCP + guardrails 独立化是核心新认知 分类标签Agent架构 Memory MCP Guardrails 上下文工程 生产级 后续行动:→ 建议精读;核实 OWASP MCP Top 10 原文;对照本知识库已有 Memory 相关条目做合并


条目 2:A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces

URLhttps://arxiv.org/html/2602.03442v1 作者:arXiv 发布时间:2026-02 可信度:高 — 学术论文,有方法论和实验 核心观点

  • 现有 RAG 两大范式局限:单次检索拼接(Naive RAG)或预定义工作流步进执行(Naive Agentic RAG)。
  • A-RAG 核心创新:向模型暴露分层检索接口(hierarchical retrieval interfaces),而非让模型只能调用单一检索工具。
  • 实验表明:即使最简单的 Naive Agentic RAG,配备单一 embedding 工具也能稳定超越 Naive RAG 和之前 baseline。
  • 分层接口让模型自主决定何时用粗粒度检索、何时用细粒度检索。

工程价值:⭐⭐⭐⭐ Agentic RAG 下一代范式,有工程参考意义 分类标签Agentic RAG RAG架构 分层检索 arXiv 论文 后续行动:→ 建议审稿;核实 GitHub 复现仓库;与知识库已有 A-RAG 条目去重


条目 3:OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet

URLhttps://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents 作者:Alex Ewerlof 发布时间:2026 可信度:高 — OWASP 官方背书,工程安全必备 核心观点(精要)

  • LLM04 数据投毒 + LLM08 向量弱点:RAG = 语义搜索引擎 + LLM prompt。如果攻击者投毒底层数据(PDF/文档),LLM 会把检索结果当作 ground truth。共享向量 DB 中租户隔离仅在应用层过滤也存在风险。
  • LLM01 Prompt Injection:缓解:用语义防火墙;隔离 system prompt;永不信任用户输入。
  • LLM06 Excessive Agency:给 AI 过多权限。缓解:最小权限原则;JIT 临时 token;人机协同(HITL)。
  • LLM07 System Prompt Leakage:缓解:密钥不进 prompt;用安全 vault 和 context 过滤。
  • "guardrails before action" 模式:授权应在 tool 执行层而非输出层。
  • AI-BOM/SBOM 要求:依赖供应链安全。

工程价值:⭐⭐⭐⭐⭐ 2026 Agent 安全必备参考,OWASP 清单实用价值高 分类标签安全 OWASP Agent Guardrails RAG安全 MCP 后续行动:→ 建议加入知识库安全专题;对照已有 OWASP 条目合并;可做专题页更新


条目 4:volcengine/OpenViking — The Context Database for AI Agents

URLhttps://github.com/volcengine/OpenViking 作者/机构:火山引擎(字节跳动) Stars:活跃(2026-05 更新) 可信度:高 — 字节内部开源,有 benchmark 和 Studio 核心观点

  • 传统 RAG 用扁平存储,缺乏全局视图,难以理解信息全貌。
  • OpenViking 定位:Context Database for AI Agents,废弃传统 RAG 的碎片化向量存储,采用"文件系统范式"(file system paradigm)统一组织 agent 所需的 memory、resources、skills。
  • 核心三层:User Memory / Agent Memory / Knowledge Base QA。
  • May 2026 更新:更新了三个场景 benchmark 结果。
  • 提供 OpenViking Studio(live hosted instance)和 openviking-server CLI。

工程价值:⭐⭐⭐⭐ 2026 Agent Memory 范式新代表,"文件系统范式" vs 传统向量 RAG 是核心差异点 分类标签Agent Memory Context DB OpenViking 向量数据库 生产级 后续行动:→ 建议核实 GitHub README 最新状态;与 Mem0/Open memory systems 条目关联;可补充向量 DB 对比表


条目 5:Microsoft BitNet — 1-bit LLM Inference for Edge Deployment

URLhttps://github.com/microsoft/BitNet Stars:+2,149(2026-03-13 trending) 可信度:高 — Microsoft Research 官方 核心观点

  • BitNet 是 1-bit LLM 推理的官方框架,实现极端量化,专为边缘部署优化。
  • 支持在资源受限环境(边缘设备、嵌入式)部署大模型。

工程价值:⭐⭐⭐⭐ 边缘部署/推理优化方向,1-bit 量化是工程化重要路径 分类标签推理优化 量化 BitNet 边缘部署 Microsoft 后续行动:→ 与 vLLM/llama.cpp 量化路径对比;核实最新版本支持模型列表


条目 6:GLM-5: From Vibe Coding to Agentic Engineering

URLhttps://arxiv.org/abs/2602.15763 作者:arXiv(智谱 GLM 系列) 发布时间:2026-02-17 可信度:高 — 学术论文 + 机构官方 核心观点

  • GLM-5 是智谱在 2026 年发布的旗舰模型,核心定位从"vibe coding"转向"agentic engineering"。
  • 论文覆盖从 vibe coding 到 agentic 工程化的完整技术路径。

工程价值:⭐⭐⭐⭐ 国内头部模型演进方向,agentic engineering 定位值得关注 分类标签LLM GLM-5 Agentic arXiv vibe coding 后续行动:→ 建议核实 GLM-5 官方发布页面和 API 可用性;与 Qwen/Kimi 对比


条目 7:Mamba-3: Improved Sequence Modeling Using State Space Principles

URLhttps://arxiv.org/abs/2603.15569 作者:arXiv 发布时间:2026-03-16 可信度:高 — State Space Model 主流研究线 核心观点

  • Mamba-3 通过 State Space Principles 改进序列建模,结合 Mamba 和 Transformer 各自优势。
  • 是 2026 年 SSM(状态空间模型)研究的重要里程碑。

工程价值:⭐⭐⭐ SSM/状态空间模型是推理效率优化重要方向 分类标签Mamba SSM 推理效率 arXiv 后续行动:→ 与 Mamba-2 对比;核实与 SGLang/vLLM 的集成状态


条目 8:awesome-ai-agents-2026 — AI Agent 全景列表(340+ 资源 / 20 类)

URLhttps://github.com/caramaschiHG/awesome-ai-agents-2026 可信度:高 — 活跃维护,466 forks,340+ 资源 分类覆盖:Coding Agents / IDE-native Agents / Agent Frameworks / Multi-Agent Orchestration / RAG & Knowledge Bases / Local & Self-hosted AI / Protocols & Standards(MCP/A2A)/ Observability & Evaluation / 学习资源等。

工程价值:⭐⭐⭐⭐ 全面索引,适合知识库专题页补充;可作为 AI Agent 全景图参考 分类标签awesome-list AI Agent 工具链 MCP RAG 后续行动:→ 建议加入知识库 awesome-list 索引;按需拆分为子专题引用


条目 9:Comparative Analysis of RAG Architectures: Pipeline / Agentic / Knowledge Graph

URLhttps://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures 作者:Michael Allanham(AI 工程化 Substack) 发布时间:2026 可信度:高 — 垂直工程 newsletter 核心观点(精要)

  • Pipeline RAG:基线,适合单跳问答、严格延迟/成本约束、文档形 corpora。
  • Agentic RAG:适合多跳推理、动态工作流、自主决策。
  • Knowledge Graph RAG(GraphRAG):全局搜索用 LLM 生成社区摘要(微软 GraphRAG 实现);局部搜索适合实体特定问题。
  • 三者选择原则:数据形状 + 问答复杂度 + 延迟约束。

工程价值:⭐⭐⭐⭐ RAG 架构选型实用指南,GraphRAG 的 global vs local search 对比有实战价值 分类标签RAG架构 GraphRAG Agentic RAG 知识图谱 Substack 后续行动:→ 建议加入知识库 RAG 专题;与本知识库已有 GraphRAG 条目合并


条目 10:HF Papers Week 08 精选(2026)

URLhttps://huggingface.co/papers/week/2026-W08 来源:Hugging Face Daily Papers 可信度:高 — HF 社区精选 值得关注条目

论文 方向 亮点
REDSearcher Long-Horizon Search Agents 长时域搜索 Agent 框架
ResearchGym LLM Agent 评估 真实世界 AI 研究评估基准
WebWorld Web Agent 训练 大规模 Web Agent 世界模型
SQuTR 语音查询检索 噪声环境下语音检索鲁棒性 benchmark
CoPE-VideoLM 视频语言模型 Codec 原语实现高效视频 LLM
Towards a Science of AI Agent Reliability Agent 可靠性科学 2026 Agent 评估基础研究
TAROT 代码生成 RL Fine-tuning Test-driven 能力自适应课程 RL
BiManiBench 多模态 LLM 双手协调 层级 benchmark

工程价值:⭐⭐⭐ 方向标,WebWorld / ResearchGym / AI Agent Reliability Science 三篇工程价值最高 分类标签HF Papers Agent评估 Web Agent 多模态 benchmark 后续行动:→ 建议精读 WebWorld、ResearchGym、AI Agent Reliability 三篇;其余可做线索索引


条目 11:CSDN — RAG 工程化评估(RAGAS + TruLens)

URLhttps://blog.csdn.net/xx_nm98/article/details/160774160 作者:CSDN(zhaoshuzhaoshu) 发布时间:2026-05-04 可信度:中 — CSDN 工程向文章,有版本/框架标注 核心观点

  • RAG 评估体系:Context Precision / Context Recall / Faithfulness / Answer Relevancy。
  • 工具:RAGAS(自动化评估)+ TruLens(LLM 输出评估 + tracing)。
  • 强调 90% RAG 系统问题来自未经系统评估,而非模型本身。

工程价值:⭐⭐⭐ RAG 评估实操向,RAGAS/TruLens 工具链覆盖有参考价值 分类标签RAG评估 RAGAS TruLens CI/CD集成 CSDN 后续行动:→ 建议加入 RAG 评估专题;与已有 RAG 评估条目去重


条目 12:CSDN — 从 RAG 到智能体:构建生产级可信 AI Agent

URLhttps://agent.csdn.net/6a4e202610ee7a33f28969a9.html 作者:CSDN AI Agent 社区 发布时间:2026(近期) 可信度:中 — AI Agent 社区,有 ReAct Agent 代码示例 核心观点

  • Agentic RAG vs 简单 RAG:Agentic RAG 将 LLM 视为具备推理/决策能力的"大脑",RAG/工具调用/代码执行是其可用工具。
  • ReAct Agent 代码示例:create_react_agent + AgentExecutor + max_iterations + early_stopping_method。

工程价值:⭐⭐⭐ Agentic RAG 入门级工程实践,代码可参考但深度有限 分类标签Agentic RAG ReAct 生产级 CSDN 后续行动:→ 与条目 1/9 联合参考;作为 Agentic RAG 工程入门线索


条目 13:CSDN — 2026 年大模型核心全解(LLM/RAG/Agent/MCP)

URLhttps://gitcode.csdn.net/69b5041854b52172bc614f45.html 作者:高级绘画师 PP(AtomGit 社区) 发布时间:2026-03-14 可信度:中 — 综述性质,结构清晰但非源码/复现 核心观点

  • 2026 年 LLM 三大特征:规模与效率平衡、长上下文(GPT-5 40 万 token,Gemini 2.5 Pro 100 万)、多模态融合。
  • LLM 固有缺陷:知识截止、无行动能力、短期记忆有限——这三个缺陷催生了 RAG/Function Call/Agent/MCP。
  • MCP = "USB-C 接口",客户端-服务器架构,本地进程/SSE/Streamable HTTP 三种通信方式。

工程价值:⭐⭐ 技术栈全景综述,适合入门级知识整理 分类标签LLM RAG Agent MCP 技术栈全景 CSDN 后续行动:→ 建议纳入知识库 MCP 专题;已有更深度条目覆盖,可做索引引用


条目 14:Nemotron-3 Super: MoE Hybrid Mamba-Transformer for Agentic Reasoning

URLhttps://arxiv.org/abs/2604.12374 作者:NVIDIA(arXiv) 发布时间:2026-04-13 可信度:高 — NVIDIA Research 核心观点

  • Nemotron-3 Super:混合 Mamba-Transformer + MoE 架构,专为 Agentic Reasoning 优化。
  • 融合 SSM(状态空间层)+ Transformer 层 + MoE 的三方优势。

工程价值:⭐⭐⭐⭐ Agentic Reasoning 方向高效架构,NVIDIA 官方背书 分类标签MoE Mamba Transformer Agentic Reasoning NVIDIA arXiv 后续行动:→ 与 Mamba-3(条目 7)关联;核实 Hugging Face 模型卡可用性


🟡 中等价值条目(线索索引)

条目 来源 亮点
RAG-Anything: All-in-One RAG Framework HF Papers 全模态 RAG 统一框架
RAG Foundry: RAG LLMs 训练框架 HF Papers RAG + Fine-tuning 流水线
Chart-based MRAG Benchmark HF Papers 图表文档 MRAG 评估基准
pgvector 2026 更新 MarkTechPost Pinecone/Milvus/Qdrant/Chroma/pgvector 对比
ThinkingCap-Qwen3.6-27B X/@akhaliq 推理微调减少 50% 思考 Token
Sakana AI Conductor (7B) X/@omarsar6 多 Agent 协作新范式,ICLR 2026
Weak-to-Strong GraphRAG X/@omarsar6 LLM Feedback 训练图检索器,Token 降低 30%

📋 综合建议

建议写入路径/shared/research-kb/inbox/jay/2026-07-15-0935-morning-briefing-ai-agents-hf-w08-rag-stack-2026.md

主题标签AI Agent架构 Memory系统 MCP OWASP Agentic RAG Context DB HF Papers

建议精读: 1. 条目 1(AI Agents Stack 2026)— 全文精读,memory 三层 + guardrails 独立化是核心新认知 2. 条目 3(OWASP Top 10 Agents)— 安全专题核心参考 3. 条目 2(A-RAG)— 论文审稿,核实复现仓库

建议专题页更新: - AI Agent 架构演进 专题:Memory 三层 / MCP / Context Engineering / Guardrails 独立化 - Agent 安全 专题:OWASP MCP Top 10 / Guardrails 模式 / LLM01-09 缓解方案 - RAG 范式 专题:A-RAG / GraphRAG global vs local / RAG-Anything / RAG Foundry

去重检查: - OWASP Agent 条目:与 2026-07-01/07-11/07-12 已有 OWASP 条目合并 - MCP 条目:与 2026-07-14/07-15 CSDN MCP 条目合并 - Agent Memory/OpenViking:与 2026-07-14 morning briefing 中 Mem0/Memory systems 条目关联 - HF W08 Papers:与 2026-07-13 HF Daily 条目关联


Jay · 2026-07-15 09:35 · 知识库草稿 · 请勿直接提交 GitHub