研究草稿 · 2026-06-27 · Jay
本次主题: Agentic RAG 系统化认知 / Hugging Face 生态更新 / GitHub AI 仓库 2026 中期格局
一、Agentic RAG:从固定管道到自主规划
1.1 核心范式转变(2026 Q2 共识)
传统 RAG(Naïve RAG)→ 增强 RAG(CRAG、Self-RAG、RaCoT、INSIGHT-RAG)→ Agentic RAG
关键区分(来自 arXiv 系统化论文 arXiv:2603.07379):
| 维度 | Workflow RAG | Agentic RAG |
|---|---|---|
| 策略选择 | 外部规则/分类器 | LLM 自主动态决策 |
| 迭代执行 | 固定轮次 | 自适应轮次,中间结果驱动 |
| 工具编排 | 预定义 | 运行时按需选择 |
三个判断原则: 1. Autonomous Strategy:LLM 是否能动态选择和编排高层策略(是否/何时/如何检索、分解、验证、重规划),而非被预定义工作流约束 2. Iterative Execution:是否支持多轮执行且轮数根据中间结果自适应,而非严格单次 3. Hierarchical Delegation:多智能体生态中是否有专门的协调者/调度者模式
1.2 A-RAG:层级检索接口(arXiv:2602.03442)
论文识别出当前主流方法的局限:大多数 Agentic RAG 依赖预定义 agent 工作流——即论文所称的 "Workflow RAG",而非真正自主。
A-RAG 提出通过层级检索接口扩展 Agentic RAG,在 Multi-Hop 推理任务上显著优于基线。基准测试(MuSiQue、HotpotQA、2Wiki、Med)显示 HippoRAG2 在多跳场景中表现突出,MA-RAG 在协作推理上有优势。
评价:这篇论文的核心贡献是将"真 Agentic"和"伪 Agentic"做了可操作的区分,对工程选型有直接指导价值。
1.3 Agentic RAG 能力评测基准 RAGCap-Bench(arXiv:2510.13910v2)
来自 state-of-the-art 系统的输出分析,识别 Agentic RAG 工作流中的常见任务和核心能力: - 中间推理能力的细粒度评测 - 多跳问题的迭代检索评测 - 已收录:OpenAI Deep Research、Gemini Deep Research、Perplexity Deep Research 等生产系统
1.4 多智能体 RAG 与进化编排(arXiv:2604.00901)
多智能体 RAG 中编排层级的进化模式: - 动态调整 Agent Prompt(AdaptOrch,arXiv:2602.16873) - 记忆增强的多轮多智能体框架 MEMO(arXiv:2603.09022) - 验证-重规划框架 Verified Multi-Agent Orchestration(arXiv:2603.11445)
二、Agent 原生记忆系统:独立数据管理问题
2.1 论文:Are We Ready For An Agent-Native Memory System?(arXiv:2606.24775)
核心观点:当前 Agent 记忆被当作 LLM pipeline 的算法组件,而非独立的数据管理和系统基础设施。
论文从数据管理视角重新定义 Agent 记忆: - 时间轴:短期记忆(会话内 volatile state)vs 长期记忆(跨会话持久化) - 功能轴:情景记忆(Episodic)、语义记忆(Semantic)、程序记忆(Procedural)、用户偏好
三个 Benchmark: 1. MemoryAgentBench:跨会话事实连接和推理 2. DB-Bench:数据库操作程序执行评测
评价:这是 Agent 记忆领域第一篇明确将记忆作为"数据管理对象"而非"算法技巧"的论文。工程意义在于:向量数据库厂商(如 Milvus、Qdrant、LanceDB)需要认真对待 Agent 记忆这一垂直场景。
三、Hugging Face 生态更新(2026 年中)
3.1 TRL v1.3 发布(2026 年 4 月)
TRL 正式进入生产稳定期。v1.3 新增内容:
Qwen 3.6 系列支持:
- Qwen/Qwen3.6-27B、Qwen/Qwen3.6-35G-A3B 训练支持
- 新增 preserve_thinking flag 和 tool-arg 字符串化调整
- 新增 qwen3_6.jinja 和 qwen3_6_training.jinja 模板
实验性 TPO Trainer(Triple Preference Optimization):
- 在 DPO 基础上增加 reference(黄金 completion)
- Arena-Hard、MixEval-Hard、MMLU-Pro、GSM8K 上比 DPO/SimPO 高 7-19 点
- 数据效率更高
Speculative Decoding:
- trl vllm-serve 新增 --speculative_config JSON 参数
- 支持原生 MTP heads(Qwen3 Next)、Eagle3 drafts
SSDTrainer(Simple Self-Distillation):新增自蒸馏训练器
3.2 PEFT beyond LoRA(Hugging Face Blog,2026-06-18)
HF 官方 PEFT 团队发布博文,系统对比 LoRA 竞争者:
| 方法 | 核心思想 | 状态 |
|---|---|---|
| DoRA | 权重分解 + 方向自适应 | 正式支持 |
| QLoRA | 4-bit NF4 量化 + LoRA | 成熟 |
| LoRA+ | 独立学习率适配 | 社区 |
| AdaLoRA | 自适应秩分配 | 社区 |
| OFT (v2) | 正交分解更新 | 社区 PR 审查中 |
| DEFT | 低秩 + 补空间投影 | 论文阶段 |
关键洞察:LoRA 仍是生产首选,但 DoRA 在保持低参数量下有精度优势,值得跟进。
3.3 smolagents 持续活跃
Hugging Face 官方 Agent 框架,定位:最小化抽象、代码优先、安全沙箱执行。
当前状态: - CodeAgent 支持 Blaxel、E2B、Modal、Docker 沙箱 - Hub 一键分享/拉取 Tools 和 Agents - LiteLLM 集成支持任意 LLM Provider - 多模态支持(文本、视觉、视频、音频)
3.4 Hugging Face Spring 2026 生态报告要点
- Hub 规模:295 万模型(2026 年 6 月),首个百万耗时 1000+ 天,第二个百万仅 335 天
- 新兴子社区:机器人(LeRobot + Pollen Robotics 收购)、科学(Thousand Worlds benchmark)
- 西部厂商寻求中国模型替代品(DeepSeek、Qwen)以确保商用合规性
四、GitHub AI 仓库 2026 中期格局
Top 15(2026 年 6 月)
| 排名 | 仓库 | Stars | 月增 | 类别 |
|---|---|---|---|---|
| 1 | AutoGPT | 175.3k | +23 | AI Agents |
| 2 | Ollama | 147.9k | +105 | Inference |
| 3 | LangChain | 116.7k | +82 | AI Agents |
| 4 | Dify | 111.5k | +123 | LLM Tools |
| 5 | Open WebUI | 106.0k | +126 | Inference |
| 6 | llama.cpp | 90.6k | +164 | Inference |
| 7 | gpt4all | 73.2k | +2 | Inference |
| 8 | zed (coding agents) | 68.7k | +48 | Coding Agents |
| 9 | RAGFlow | 61.5k | +58 | RAG |
| 10 | OpenHands | 60.7k | +118 | Coding Agents |
| 11 | MetaGPT | 59.7k | +19 | AI Agents |
| 12 | opencode | 55.6k | +358 | Coding Agents |
| 13 | cline | 49.0k | +55 | Coding Agents |
| 14 | Microsoft AutoGen | 48.3k | +30 | AI Agents |
| 15 | openai/codex | 44.8k | +225 | Coding Agents |
值得关注的rising stars
- goose(Block, Rust):可扩展 CLI Agent,+169 stars/月
- github-mcp-server:GitHub 官方 MCP Server,+23 stars/月
- codegraph(52k stars):代码知识图谱,为 Claude Code/Codex 等 Agent 减少 token 消耗
- nanochat(Karpathy, 55k stars):最小可读的 LLM 训练全栈实现
- ml-intern(HF, 8.1k stars):自主 ML 工程师 Agent
基础设施层稳定
- Vector DB:Milvus(40.7k)、Chroma(22.4k)、Qdrant(未列出但持续活跃)
- LLM Tools:Flowise(42.5k)、LlamaIndex(43.2k)、Haystack(21.9k)
- Inference:llamafile(Mozilla-Ocho, 21.4k)、FastChat(37.9k)
五、AI 部署技术栈最佳实践(Northflank Blog)
2026 年生产 AI 应用推荐架构
前端(Next.js/React)
↓
后端 API(FastAPI/Node.js)+ RAG/Agent 编排
↓
┌─────────────────┬──────────────────┐
│ PostgreSQL │ Vector Store │
│ (pgvector) │ (Qdrant/Milvus) │
│ 应用状态+向量 │ RAG Embeddings │
└─────────────────┴──────────────────┘
↓
模型推理
├─ Hosted API(Claude/GPT/Gemini):适合早期和大多数生产场景
└─ Self-hosted(vLLM/sglang):适合规模化的成本优化、数据主权、定制微调
↓
后台任务(Celery/Redis):长时运行 Agent 任务、向量索引更新
pgvector 位置更新:对于早期和中期应用,PostgreSQL + pgvector 已在单一数据库中同时覆盖 OLTP 和向量搜索,大幅简化运维。
六、Substack 高价值来源记录
6.1 The Neural Maze · AI Systems Engineer Journey
- 专栏定位:AI 系统工程师角色定义,从 RAG → AI Agents → RecSys → MLOps 的完整路径
- 核心观点:AI Systems Engineer = "拥有决策系统全链路的人",覆盖数据、模型(训练/微调/提示)、服务、评估、监控、迭代
- RAG 工程细节(Antonio Zarauz Moreno,IEEE-CAI 2026 Tutorial):ColPali + 多向量检索 + 多模态生成 + 带边界框和页引用的答案
- Agentic AI 系统:LLM 作为协调者,动态决定工具调用,而非单次 LLM 调用
- 可信度:高——IEEE-CAI 2026 学术教程背书
- 链接:https://theneuralmaze.substack.com/p/welcome-to-the-ai-systems-engineer
6.2 Jam with AI · RAG 基础设施
- Phase 1:构建 ArXiv 论文研究助手(PDF 解析 + 嵌入搜索 + 本地/云端 LLM)
- Phase 2:AI Agents(LangGraph、工具、记忆)
- Phase 5:MLOps & LLMOps(部署、观察、评估、扩展)
- 可信度:高——38k 订阅者社区驱动课程体系
- 链接:https://jamwithai.substack.com/p/the-infrastructure-that-powers-rag
6.3 AI with Aish · RAG 2026 完整指南
- Advanced Chunking:语义分块(cosine distance 阈值)+ Parent-Document 策略(子块精确 + 父文档丰富)
- Hybrid Search + RRF:BM25(关键词)+ 向量语义 + 倒数排名融合
- Cross-Encoder Reranking:Top-100 → Cohere Rerank 3.5/BGE-Reranker → Top-5-10 送 LLM
- 2026 Pipeline:混合检索 100 条候选 → 重排序 → 精排 5-10 条
- 可信度:中高——技术细节有代码实现支撑
- 链接:https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-rag-in
6.4 Jam with AI · 2026 生产 AI/ML 路线图
- Q2 2026:AI Agents 课程 + RAG 延续课程
- Q3-Q4 2026:NLP 微调课程(社区驱动,免费)+ RecSys with MLOps
- 可信度:中高——社区课程,非纯商业推广
- 链接:https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml
6.5 ByteByteGo · Top AI GitHub Repositories 2026
- Dify 深度分析:生产就绪的 Agentic Workflow 开发平台,工作流构建器 + RAG 管道 + 多模型支持 + MCP 集成
- Langflow 深度分析:LangChain 之上的低代码可视化拖拽,拖拽式构建 Chain、工具、记忆模块、数据源
- 可信度:高——ByteByteGo 在系统设计领域有高质量积累
- 链接:https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026
七、分类标签
agentic-rag multi-agent-rag hf-trl hf-peft smolagents github-trending agent-memory knowledge-engineering llmops rag-pipeline embedding reranking deployment-stack
八、后续行动建议
-
Agentic RAG 选型判断树(优先级:高) - 输入复杂度低 → Naive RAG + 单次检索 - 固定多跳 → Enhanced RAG(CRAG/Self-RAG) - 开放式多跳 + 工具多样 → Agentic RAG(A-RAG / HippoRAG2) - 多智能体协作 → Multi-Agent RAG + MEMO 记忆层
-
TRL v1.3 跟进(优先级:中) - TPO Trainer 值得关注,在 Arena-Hard 上有 7-19 点提升 - Qwen 3.6 已在 TRL 官方支持列表
-
Agent 原生记忆层选型(优先级:中) - 观察 Mem0、LanceDB、Qdrant 的 Agent 专用接口更新
-
Substack 精读队列: - The Neural Maze(AI Systems Engineer Role) - AI with Aish(RAG 2026 Pipeline 细节) - ByteByteGo(Dify/Langflow 工程分析)
草稿完成时间:2026-06-27 09:35 CST · Jay · 未经过精读验证