晨间调研 · AI Agent 架构 · HF W08 日报 · RAG 范式演进 · 2026-07-15
实例:Jay | 检索范围:Tavily / Substack / GitHub Trending / HF Papers Week 08 / arXiv | 主题:AI Agent 架构演进 / Memory 三层架构 / A-RAG / OWASP Agent 安全 / OpenViking / GLM-5
🔬 候选条目(去重后 15 条)
🔴 高价值条目
条目 1:The AI Agents Stack: LLM to Production(2026 Edition)
URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
作者/专栏:The AI Engineer(专注 AI 工程化)
发布时间:2026(近期)
可信度:高 — 工程化垂直 newsletter,有代码/架构细节
核心观点:
- Memory 三层架构:2024 年 memory = "选个向量数据库做 RAG";2026 年 memory 是第一等架构原语,分三层:短期(context)、中期(session/chunk)、长期(knowledge base)。不是向量 DB 能覆盖的。
- Context Engineering 取代 Prompt Engineering:不是写更好的 prompt,而是在每次调用时设计 agent 看到什么信息。
- MCP 标准化:MCP 把整个 tools 层标准化了,这是 2024-2026 之间全新的架构变化。
- Memory Blocks:有名字的、结构化字段,agent 可在每轮读写而非把所有东西塞进 system prompt。
- Agent Guardrails 独立化:2024 年 guardrails = 输入/输出过滤器;2026 年 guardrails = 授权工具调用、执行速率限制、验证 agent 实际行为。"guardrails before action" 模式兴起——等过滤响应时 agent 已经发了邮件。
- OWASP MCP Top 10(beta)已发布,是首个面向 tool-connected agents 的安全清单。
工程价值:⭐⭐⭐⭐⭐ 2026 AI Agent 栈全貌,memory 三层 + MCP + guardrails 独立化是核心新认知
分类标签:Agent架构 Memory MCP Guardrails 上下文工程 生产级
后续行动:→ 建议精读;核实 OWASP MCP Top 10 原文;对照本知识库已有 Memory 相关条目做合并
条目 2:A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces
URL:https://arxiv.org/html/2602.03442v1
作者:arXiv
发布时间:2026-02
可信度:高 — 学术论文,有方法论和实验
核心观点:
- 现有 RAG 两大范式局限:单次检索拼接(Naive RAG)或预定义工作流步进执行(Naive Agentic RAG)。
- A-RAG 核心创新:向模型暴露分层检索接口(hierarchical retrieval interfaces),而非让模型只能调用单一检索工具。
- 实验表明:即使最简单的 Naive Agentic RAG,配备单一 embedding 工具也能稳定超越 Naive RAG 和之前 baseline。
- 分层接口让模型自主决定何时用粗粒度检索、何时用细粒度检索。
工程价值:⭐⭐⭐⭐ Agentic RAG 下一代范式,有工程参考意义
分类标签:Agentic RAG RAG架构 分层检索 arXiv 论文
后续行动:→ 建议审稿;核实 GitHub 复现仓库;与知识库已有 A-RAG 条目去重
条目 3:OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet
URL:https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
作者:Alex Ewerlof
发布时间:2026
可信度:高 — OWASP 官方背书,工程安全必备
核心观点(精要):
- LLM04 数据投毒 + LLM08 向量弱点:RAG = 语义搜索引擎 + LLM prompt。如果攻击者投毒底层数据(PDF/文档),LLM 会把检索结果当作 ground truth。共享向量 DB 中租户隔离仅在应用层过滤也存在风险。
- LLM01 Prompt Injection:缓解:用语义防火墙;隔离 system prompt;永不信任用户输入。
- LLM06 Excessive Agency:给 AI 过多权限。缓解:最小权限原则;JIT 临时 token;人机协同(HITL)。
- LLM07 System Prompt Leakage:缓解:密钥不进 prompt;用安全 vault 和 context 过滤。
- "guardrails before action" 模式:授权应在 tool 执行层而非输出层。
- AI-BOM/SBOM 要求:依赖供应链安全。
工程价值:⭐⭐⭐⭐⭐ 2026 Agent 安全必备参考,OWASP 清单实用价值高
分类标签:安全 OWASP Agent Guardrails RAG安全 MCP
后续行动:→ 建议加入知识库安全专题;对照已有 OWASP 条目合并;可做专题页更新
条目 4:volcengine/OpenViking — The Context Database for AI Agents
URL:https://github.com/volcengine/OpenViking
作者/机构:火山引擎(字节跳动)
Stars:活跃(2026-05 更新)
可信度:高 — 字节内部开源,有 benchmark 和 Studio
核心观点:
- 传统 RAG 用扁平存储,缺乏全局视图,难以理解信息全貌。
- OpenViking 定位:Context Database for AI Agents,废弃传统 RAG 的碎片化向量存储,采用"文件系统范式"(file system paradigm)统一组织 agent 所需的 memory、resources、skills。
- 核心三层:User Memory / Agent Memory / Knowledge Base QA。
- May 2026 更新:更新了三个场景 benchmark 结果。
- 提供 OpenViking Studio(live hosted instance)和 openviking-server CLI。
工程价值:⭐⭐⭐⭐ 2026 Agent Memory 范式新代表,"文件系统范式" vs 传统向量 RAG 是核心差异点
分类标签:Agent Memory Context DB OpenViking 向量数据库 生产级
后续行动:→ 建议核实 GitHub README 最新状态;与 Mem0/Open memory systems 条目关联;可补充向量 DB 对比表
条目 5:Microsoft BitNet — 1-bit LLM Inference for Edge Deployment
URL:https://github.com/microsoft/BitNet
Stars:+2,149(2026-03-13 trending)
可信度:高 — Microsoft Research 官方
核心观点:
- BitNet 是 1-bit LLM 推理的官方框架,实现极端量化,专为边缘部署优化。
- 支持在资源受限环境(边缘设备、嵌入式)部署大模型。
工程价值:⭐⭐⭐⭐ 边缘部署/推理优化方向,1-bit 量化是工程化重要路径
分类标签:推理优化 量化 BitNet 边缘部署 Microsoft
后续行动:→ 与 vLLM/llama.cpp 量化路径对比;核实最新版本支持模型列表
条目 6:GLM-5: From Vibe Coding to Agentic Engineering
URL:https://arxiv.org/abs/2602.15763
作者:arXiv(智谱 GLM 系列)
发布时间:2026-02-17
可信度:高 — 学术论文 + 机构官方
核心观点:
- GLM-5 是智谱在 2026 年发布的旗舰模型,核心定位从"vibe coding"转向"agentic engineering"。
- 论文覆盖从 vibe coding 到 agentic 工程化的完整技术路径。
工程价值:⭐⭐⭐⭐ 国内头部模型演进方向,agentic engineering 定位值得关注
分类标签:LLM GLM-5 Agentic arXiv vibe coding
后续行动:→ 建议核实 GLM-5 官方发布页面和 API 可用性;与 Qwen/Kimi 对比
条目 7:Mamba-3: Improved Sequence Modeling Using State Space Principles
URL:https://arxiv.org/abs/2603.15569
作者:arXiv
发布时间:2026-03-16
可信度:高 — State Space Model 主流研究线
核心观点:
- Mamba-3 通过 State Space Principles 改进序列建模,结合 Mamba 和 Transformer 各自优势。
- 是 2026 年 SSM(状态空间模型)研究的重要里程碑。
工程价值:⭐⭐⭐ SSM/状态空间模型是推理效率优化重要方向
分类标签:Mamba SSM 推理效率 arXiv
后续行动:→ 与 Mamba-2 对比;核实与 SGLang/vLLM 的集成状态
条目 8:awesome-ai-agents-2026 — AI Agent 全景列表(340+ 资源 / 20 类)
URL:https://github.com/caramaschiHG/awesome-ai-agents-2026
可信度:高 — 活跃维护,466 forks,340+ 资源
分类覆盖:Coding Agents / IDE-native Agents / Agent Frameworks / Multi-Agent Orchestration / RAG & Knowledge Bases / Local & Self-hosted AI / Protocols & Standards(MCP/A2A)/ Observability & Evaluation / 学习资源等。
工程价值:⭐⭐⭐⭐ 全面索引,适合知识库专题页补充;可作为 AI Agent 全景图参考
分类标签:awesome-list AI Agent 工具链 MCP RAG
后续行动:→ 建议加入知识库 awesome-list 索引;按需拆分为子专题引用
条目 9:Comparative Analysis of RAG Architectures: Pipeline / Agentic / Knowledge Graph
URL:https://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures
作者:Michael Allanham(AI 工程化 Substack)
发布时间:2026
可信度:高 — 垂直工程 newsletter
核心观点(精要):
- Pipeline RAG:基线,适合单跳问答、严格延迟/成本约束、文档形 corpora。
- Agentic RAG:适合多跳推理、动态工作流、自主决策。
- Knowledge Graph RAG(GraphRAG):全局搜索用 LLM 生成社区摘要(微软 GraphRAG 实现);局部搜索适合实体特定问题。
- 三者选择原则:数据形状 + 问答复杂度 + 延迟约束。
工程价值:⭐⭐⭐⭐ RAG 架构选型实用指南,GraphRAG 的 global vs local search 对比有实战价值
分类标签:RAG架构 GraphRAG Agentic RAG 知识图谱 Substack
后续行动:→ 建议加入知识库 RAG 专题;与本知识库已有 GraphRAG 条目合并
条目 10:HF Papers Week 08 精选(2026)
URL:https://huggingface.co/papers/week/2026-W08
来源:Hugging Face Daily Papers
可信度:高 — HF 社区精选
值得关注条目:
| 论文 | 方向 | 亮点 |
|---|---|---|
| REDSearcher | Long-Horizon Search Agents | 长时域搜索 Agent 框架 |
| ResearchGym | LLM Agent 评估 | 真实世界 AI 研究评估基准 |
| WebWorld | Web Agent 训练 | 大规模 Web Agent 世界模型 |
| SQuTR | 语音查询检索 | 噪声环境下语音检索鲁棒性 benchmark |
| CoPE-VideoLM | 视频语言模型 | Codec 原语实现高效视频 LLM |
| Towards a Science of AI Agent Reliability | Agent 可靠性科学 | 2026 Agent 评估基础研究 |
| TAROT | 代码生成 RL Fine-tuning | Test-driven 能力自适应课程 RL |
| BiManiBench | 多模态 LLM 双手协调 | 层级 benchmark |
工程价值:⭐⭐⭐ 方向标,WebWorld / ResearchGym / AI Agent Reliability Science 三篇工程价值最高
分类标签:HF Papers Agent评估 Web Agent 多模态 benchmark
后续行动:→ 建议精读 WebWorld、ResearchGym、AI Agent Reliability 三篇;其余可做线索索引
条目 11:CSDN — RAG 工程化评估(RAGAS + TruLens)
URL:https://blog.csdn.net/xx_nm98/article/details/160774160
作者:CSDN(zhaoshuzhaoshu)
发布时间:2026-05-04
可信度:中 — CSDN 工程向文章,有版本/框架标注
核心观点:
- RAG 评估体系:Context Precision / Context Recall / Faithfulness / Answer Relevancy。
- 工具:RAGAS(自动化评估)+ TruLens(LLM 输出评估 + tracing)。
- 强调 90% RAG 系统问题来自未经系统评估,而非模型本身。
工程价值:⭐⭐⭐ RAG 评估实操向,RAGAS/TruLens 工具链覆盖有参考价值
分类标签:RAG评估 RAGAS TruLens CI/CD集成 CSDN
后续行动:→ 建议加入 RAG 评估专题;与已有 RAG 评估条目去重
条目 12:CSDN — 从 RAG 到智能体:构建生产级可信 AI Agent
URL:https://agent.csdn.net/6a4e202610ee7a33f28969a9.html
作者:CSDN AI Agent 社区
发布时间:2026(近期)
可信度:中 — AI Agent 社区,有 ReAct Agent 代码示例
核心观点:
- Agentic RAG vs 简单 RAG:Agentic RAG 将 LLM 视为具备推理/决策能力的"大脑",RAG/工具调用/代码执行是其可用工具。
- ReAct Agent 代码示例:create_react_agent + AgentExecutor + max_iterations + early_stopping_method。
工程价值:⭐⭐⭐ Agentic RAG 入门级工程实践,代码可参考但深度有限
分类标签:Agentic RAG ReAct 生产级 CSDN
后续行动:→ 与条目 1/9 联合参考;作为 Agentic RAG 工程入门线索
条目 13:CSDN — 2026 年大模型核心全解(LLM/RAG/Agent/MCP)
URL:https://gitcode.csdn.net/69b5041854b52172bc614f45.html
作者:高级绘画师 PP(AtomGit 社区)
发布时间:2026-03-14
可信度:中 — 综述性质,结构清晰但非源码/复现
核心观点:
- 2026 年 LLM 三大特征:规模与效率平衡、长上下文(GPT-5 40 万 token,Gemini 2.5 Pro 100 万)、多模态融合。
- LLM 固有缺陷:知识截止、无行动能力、短期记忆有限——这三个缺陷催生了 RAG/Function Call/Agent/MCP。
- MCP = "USB-C 接口",客户端-服务器架构,本地进程/SSE/Streamable HTTP 三种通信方式。
工程价值:⭐⭐ 技术栈全景综述,适合入门级知识整理
分类标签:LLM RAG Agent MCP 技术栈全景 CSDN
后续行动:→ 建议纳入知识库 MCP 专题;已有更深度条目覆盖,可做索引引用
条目 14:Nemotron-3 Super: MoE Hybrid Mamba-Transformer for Agentic Reasoning
URL:https://arxiv.org/abs/2604.12374
作者:NVIDIA(arXiv)
发布时间:2026-04-13
可信度:高 — NVIDIA Research
核心观点:
- Nemotron-3 Super:混合 Mamba-Transformer + MoE 架构,专为 Agentic Reasoning 优化。
- 融合 SSM(状态空间层)+ Transformer 层 + MoE 的三方优势。
工程价值:⭐⭐⭐⭐ Agentic Reasoning 方向高效架构,NVIDIA 官方背书
分类标签:MoE Mamba Transformer Agentic Reasoning NVIDIA arXiv
后续行动:→ 与 Mamba-3(条目 7)关联;核实 Hugging Face 模型卡可用性
🟡 中等价值条目(线索索引)
| 条目 | 来源 | 亮点 |
|---|---|---|
| RAG-Anything: All-in-One RAG Framework | HF Papers | 全模态 RAG 统一框架 |
| RAG Foundry: RAG LLMs 训练框架 | HF Papers | RAG + Fine-tuning 流水线 |
| Chart-based MRAG Benchmark | HF Papers | 图表文档 MRAG 评估基准 |
| pgvector 2026 更新 | MarkTechPost | Pinecone/Milvus/Qdrant/Chroma/pgvector 对比 |
| ThinkingCap-Qwen3.6-27B | X/@akhaliq | 推理微调减少 50% 思考 Token |
| Sakana AI Conductor (7B) | X/@omarsar6 | 多 Agent 协作新范式,ICLR 2026 |
| Weak-to-Strong GraphRAG | X/@omarsar6 | LLM Feedback 训练图检索器,Token 降低 30% |
📋 综合建议
建议写入路径:/shared/research-kb/inbox/jay/2026-07-15-0935-morning-briefing-ai-agents-hf-w08-rag-stack-2026.md
主题标签:AI Agent架构 Memory系统 MCP OWASP Agentic RAG Context DB HF Papers
建议精读: 1. 条目 1(AI Agents Stack 2026)— 全文精读,memory 三层 + guardrails 独立化是核心新认知 2. 条目 3(OWASP Top 10 Agents)— 安全专题核心参考 3. 条目 2(A-RAG)— 论文审稿,核实复现仓库
建议专题页更新:
- AI Agent 架构演进 专题:Memory 三层 / MCP / Context Engineering / Guardrails 独立化
- Agent 安全 专题:OWASP MCP Top 10 / Guardrails 模式 / LLM01-09 缓解方案
- RAG 范式 专题:A-RAG / GraphRAG global vs local / RAG-Anything / RAG Foundry
去重检查: - OWASP Agent 条目:与 2026-07-01/07-11/07-12 已有 OWASP 条目合并 - MCP 条目:与 2026-07-14/07-15 CSDN MCP 条目合并 - Agent Memory/OpenViking:与 2026-07-14 morning briefing 中 Mem0/Memory systems 条目关联 - HF W08 Papers:与 2026-07-13 HF Daily 条目关联
Jay · 2026-07-15 09:35 · 知识库草稿 · 请勿直接提交 GitHub