研究草稿 · 2026-06-27 · Jay

本次主题: Agentic RAG 系统化认知 / Hugging Face 生态更新 / GitHub AI 仓库 2026 中期格局


一、Agentic RAG:从固定管道到自主规划

1.1 核心范式转变(2026 Q2 共识)

传统 RAG(Naïve RAG)→ 增强 RAG(CRAG、Self-RAG、RaCoT、INSIGHT-RAG)→ Agentic RAG

关键区分(来自 arXiv 系统化论文 arXiv:2603.07379):

维度 Workflow RAG Agentic RAG
策略选择 外部规则/分类器 LLM 自主动态决策
迭代执行 固定轮次 自适应轮次,中间结果驱动
工具编排 预定义 运行时按需选择

三个判断原则: 1. Autonomous Strategy:LLM 是否能动态选择和编排高层策略(是否/何时/如何检索、分解、验证、重规划),而非被预定义工作流约束 2. Iterative Execution:是否支持多轮执行且轮数根据中间结果自适应,而非严格单次 3. Hierarchical Delegation:多智能体生态中是否有专门的协调者/调度者模式

1.2 A-RAG:层级检索接口(arXiv:2602.03442)

论文识别出当前主流方法的局限:大多数 Agentic RAG 依赖预定义 agent 工作流——即论文所称的 "Workflow RAG",而非真正自主。

A-RAG 提出通过层级检索接口扩展 Agentic RAG,在 Multi-Hop 推理任务上显著优于基线。基准测试(MuSiQue、HotpotQA、2Wiki、Med)显示 HippoRAG2 在多跳场景中表现突出,MA-RAG 在协作推理上有优势。

评价:这篇论文的核心贡献是将"真 Agentic"和"伪 Agentic"做了可操作的区分,对工程选型有直接指导价值。

1.3 Agentic RAG 能力评测基准 RAGCap-Bench(arXiv:2510.13910v2)

来自 state-of-the-art 系统的输出分析,识别 Agentic RAG 工作流中的常见任务和核心能力: - 中间推理能力的细粒度评测 - 多跳问题的迭代检索评测 - 已收录:OpenAI Deep Research、Gemini Deep Research、Perplexity Deep Research 等生产系统

1.4 多智能体 RAG 与进化编排(arXiv:2604.00901)

多智能体 RAG 中编排层级的进化模式: - 动态调整 Agent Prompt(AdaptOrch,arXiv:2602.16873) - 记忆增强的多轮多智能体框架 MEMO(arXiv:2603.09022) - 验证-重规划框架 Verified Multi-Agent Orchestration(arXiv:2603.11445)


二、Agent 原生记忆系统:独立数据管理问题

2.1 论文:Are We Ready For An Agent-Native Memory System?(arXiv:2606.24775)

核心观点:当前 Agent 记忆被当作 LLM pipeline 的算法组件,而非独立的数据管理和系统基础设施。

论文从数据管理视角重新定义 Agent 记忆: - 时间轴:短期记忆(会话内 volatile state)vs 长期记忆(跨会话持久化) - 功能轴:情景记忆(Episodic)、语义记忆(Semantic)、程序记忆(Procedural)、用户偏好

三个 Benchmark: 1. MemoryAgentBench:跨会话事实连接和推理 2. DB-Bench:数据库操作程序执行评测

评价:这是 Agent 记忆领域第一篇明确将记忆作为"数据管理对象"而非"算法技巧"的论文。工程意义在于:向量数据库厂商(如 Milvus、Qdrant、LanceDB)需要认真对待 Agent 记忆这一垂直场景。


三、Hugging Face 生态更新(2026 年中)

3.1 TRL v1.3 发布(2026 年 4 月)

TRL 正式进入生产稳定期。v1.3 新增内容:

Qwen 3.6 系列支持: - Qwen/Qwen3.6-27BQwen/Qwen3.6-35G-A3B 训练支持 - 新增 preserve_thinking flag 和 tool-arg 字符串化调整 - 新增 qwen3_6.jinjaqwen3_6_training.jinja 模板

实验性 TPO Trainer(Triple Preference Optimization): - 在 DPO 基础上增加 reference(黄金 completion) - Arena-Hard、MixEval-Hard、MMLU-Pro、GSM8K 上比 DPO/SimPO 高 7-19 点 - 数据效率更高

Speculative Decoding: - trl vllm-serve 新增 --speculative_config JSON 参数 - 支持原生 MTP heads(Qwen3 Next)、Eagle3 drafts

SSDTrainer(Simple Self-Distillation):新增自蒸馏训练器

3.2 PEFT beyond LoRA(Hugging Face Blog,2026-06-18)

HF 官方 PEFT 团队发布博文,系统对比 LoRA 竞争者:

方法 核心思想 状态
DoRA 权重分解 + 方向自适应 正式支持
QLoRA 4-bit NF4 量化 + LoRA 成熟
LoRA+ 独立学习率适配 社区
AdaLoRA 自适应秩分配 社区
OFT (v2) 正交分解更新 社区 PR 审查中
DEFT 低秩 + 补空间投影 论文阶段

关键洞察:LoRA 仍是生产首选,但 DoRA 在保持低参数量下有精度优势,值得跟进。

3.3 smolagents 持续活跃

Hugging Face 官方 Agent 框架,定位:最小化抽象、代码优先、安全沙箱执行。

当前状态: - CodeAgent 支持 Blaxel、E2B、Modal、Docker 沙箱 - Hub 一键分享/拉取 Tools 和 Agents - LiteLLM 集成支持任意 LLM Provider - 多模态支持(文本、视觉、视频、音频)

3.4 Hugging Face Spring 2026 生态报告要点

  • Hub 规模:295 万模型(2026 年 6 月),首个百万耗时 1000+ 天,第二个百万仅 335 天
  • 新兴子社区:机器人(LeRobot + Pollen Robotics 收购)、科学(Thousand Worlds benchmark)
  • 西部厂商寻求中国模型替代品(DeepSeek、Qwen)以确保商用合规性

四、GitHub AI 仓库 2026 中期格局

Top 15(2026 年 6 月)

排名 仓库 Stars 月增 类别
1 AutoGPT 175.3k +23 AI Agents
2 Ollama 147.9k +105 Inference
3 LangChain 116.7k +82 AI Agents
4 Dify 111.5k +123 LLM Tools
5 Open WebUI 106.0k +126 Inference
6 llama.cpp 90.6k +164 Inference
7 gpt4all 73.2k +2 Inference
8 zed (coding agents) 68.7k +48 Coding Agents
9 RAGFlow 61.5k +58 RAG
10 OpenHands 60.7k +118 Coding Agents
11 MetaGPT 59.7k +19 AI Agents
12 opencode 55.6k +358 Coding Agents
13 cline 49.0k +55 Coding Agents
14 Microsoft AutoGen 48.3k +30 AI Agents
15 openai/codex 44.8k +225 Coding Agents

值得关注的rising stars

  • goose(Block, Rust):可扩展 CLI Agent,+169 stars/月
  • github-mcp-server:GitHub 官方 MCP Server,+23 stars/月
  • codegraph(52k stars):代码知识图谱,为 Claude Code/Codex 等 Agent 减少 token 消耗
  • nanochat(Karpathy, 55k stars):最小可读的 LLM 训练全栈实现
  • ml-intern(HF, 8.1k stars):自主 ML 工程师 Agent

基础设施层稳定

  • Vector DB:Milvus(40.7k)、Chroma(22.4k)、Qdrant(未列出但持续活跃)
  • LLM Tools:Flowise(42.5k)、LlamaIndex(43.2k)、Haystack(21.9k)
  • Inference:llamafile(Mozilla-Ocho, 21.4k)、FastChat(37.9k)

五、AI 部署技术栈最佳实践(Northflank Blog)

2026 年生产 AI 应用推荐架构

前端(Next.js/React)
    ↓
后端 API(FastAPI/Node.js)+ RAG/Agent 编排
    ↓
┌─────────────────┬──────────────────┐
│  PostgreSQL     │   Vector Store    │
│  (pgvector)     │ (Qdrant/Milvus)  │
│  应用状态+向量   │   RAG Embeddings │
└─────────────────┴──────────────────┘
    ↓
模型推理
├─ Hosted API(Claude/GPT/Gemini):适合早期和大多数生产场景
└─ Self-hosted(vLLM/sglang):适合规模化的成本优化、数据主权、定制微调
    ↓
后台任务(Celery/Redis):长时运行 Agent 任务、向量索引更新

pgvector 位置更新:对于早期和中期应用,PostgreSQL + pgvector 已在单一数据库中同时覆盖 OLTP 和向量搜索,大幅简化运维。


六、Substack 高价值来源记录

6.1 The Neural Maze · AI Systems Engineer Journey

  • 专栏定位:AI 系统工程师角色定义,从 RAG → AI Agents → RecSys → MLOps 的完整路径
  • 核心观点:AI Systems Engineer = "拥有决策系统全链路的人",覆盖数据、模型(训练/微调/提示)、服务、评估、监控、迭代
  • RAG 工程细节(Antonio Zarauz Moreno,IEEE-CAI 2026 Tutorial):ColPali + 多向量检索 + 多模态生成 + 带边界框和页引用的答案
  • Agentic AI 系统:LLM 作为协调者,动态决定工具调用,而非单次 LLM 调用
  • 可信度:高——IEEE-CAI 2026 学术教程背书
  • 链接:https://theneuralmaze.substack.com/p/welcome-to-the-ai-systems-engineer

6.2 Jam with AI · RAG 基础设施

  • Phase 1:构建 ArXiv 论文研究助手(PDF 解析 + 嵌入搜索 + 本地/云端 LLM)
  • Phase 2:AI Agents(LangGraph、工具、记忆)
  • Phase 5:MLOps & LLMOps(部署、观察、评估、扩展)
  • 可信度:高——38k 订阅者社区驱动课程体系
  • 链接:https://jamwithai.substack.com/p/the-infrastructure-that-powers-rag

6.3 AI with Aish · RAG 2026 完整指南

  • Advanced Chunking:语义分块(cosine distance 阈值)+ Parent-Document 策略(子块精确 + 父文档丰富)
  • Hybrid Search + RRF:BM25(关键词)+ 向量语义 + 倒数排名融合
  • Cross-Encoder Reranking:Top-100 → Cohere Rerank 3.5/BGE-Reranker → Top-5-10 送 LLM
  • 2026 Pipeline:混合检索 100 条候选 → 重排序 → 精排 5-10 条
  • 可信度:中高——技术细节有代码实现支撑
  • 链接:https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-rag-in

6.4 Jam with AI · 2026 生产 AI/ML 路线图

  • Q2 2026:AI Agents 课程 + RAG 延续课程
  • Q3-Q4 2026:NLP 微调课程(社区驱动,免费)+ RecSys with MLOps
  • 可信度:中高——社区课程,非纯商业推广
  • 链接:https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml

6.5 ByteByteGo · Top AI GitHub Repositories 2026

  • Dify 深度分析:生产就绪的 Agentic Workflow 开发平台,工作流构建器 + RAG 管道 + 多模型支持 + MCP 集成
  • Langflow 深度分析:LangChain 之上的低代码可视化拖拽,拖拽式构建 Chain、工具、记忆模块、数据源
  • 可信度:高——ByteByteGo 在系统设计领域有高质量积累
  • 链接:https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026

七、分类标签

agentic-rag multi-agent-rag hf-trl hf-peft smolagents github-trending agent-memory knowledge-engineering llmops rag-pipeline embedding reranking deployment-stack


八、后续行动建议

  1. Agentic RAG 选型判断树(优先级:高) - 输入复杂度低 → Naive RAG + 单次检索 - 固定多跳 → Enhanced RAG(CRAG/Self-RAG) - 开放式多跳 + 工具多样 → Agentic RAG(A-RAG / HippoRAG2) - 多智能体协作 → Multi-Agent RAG + MEMO 记忆层

  2. TRL v1.3 跟进(优先级:中) - TPO Trainer 值得关注,在 Arena-Hard 上有 7-19 点提升 - Qwen 3.6 已在 TRL 官方支持列表

  3. Agent 原生记忆层选型(优先级:中) - 观察 Mem0、LanceDB、Qdrant 的 Agent 专用接口更新

  4. Substack 精读队列: - The Neural Maze(AI Systems Engineer Role) - AI with Aish(RAG 2026 Pipeline 细节) - ByteByteGo(Dify/Langflow 工程分析)


草稿完成时间:2026-06-27 09:35 CST · Jay · 未经过精读验证