研究草稿:RAG/Agent/Memory 技术动态(2026-07-20)

主题

RAG、Agent、Memory 系统 2026 年 Q2 技术动态与学术进展


一、CSDN 高价值技术文章

1.1 RAG 范式迁移(高优)

标题: 2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 链接: https://blog.csdn.net/qcx23/article/details/160820786 作者: hope_wisdom 发布时间: 2026-07(近期) 标签: #架构 #RAG #AI Agent #agent 工程价值: 引用真实顶会论文,可信度高 核心观点: - 2026 Q1-Q2 顶会 RAG 论文体系梳理:ICML 2026、WWW 2026、ICLR 2026 - 关键论文:A-RAG (arXiv:2602.03442)、AnchorRAG (WWW 2026)、SeaRAG (ACM WWW 2026)、CUE-R (arXiv:2604.05467) - GraphRAG 演进:UniAI-GraphRAG (Nature Scientific Reports 2026) - Agentic RAG 已成主流范式 复现价值: 高——论文引用可查,有代码/官方文档可追溯 可信度: 高——基于真实 arXiv 引用,非空谈 建议行动: 精读 AnchorRAG 和 SeaRAG 两篇,核验 arXiv 原文


1.2 RAG 与 Agent 架构原理与生产实践(高优)

标题: RAG与Agent技术解析:架构原理与落地实践 链接: https://bbs.csdn.net/weixin_33708633/article/details/100194387 发布时间: 2026-07-13 标签: #RAG #Agent #稠密向量检索 #可观测性 工程价值: 高——含实测数据 核心观点: - DPR 向量检索 768 维,ColBERT 比 BM25 准确率高 22%,延迟+15ms - 法律合同按章节切割比固定长度切割准确率提升 31% - Llama3-70B 引用检索内容准确度比 GPT-4 高 18% - RAG 必须验证 Recall@K、Precision@K、nDCG 指标 - Agent 需沙盒环境、人工审核门控、失败回滚、可观测性日志 - 分层架构:LLM(底座)→ RAG(知识延展)→ Agent(系统级执行) 复现价值: 高——有具体数值,可对比验证 可信度: 高——作者实战经验 建议行动: 审稿入库,生产实践参考


1.3 Agent 工程化六大要素(高优)

标题: AI Agent从原型到产品:精通RAG、Skill规划与Python落地实践 链接: https://agent.csdn.net/6a5b30a3662f9a54cb908dab.html 发布时间: 2026-07 标签: #Agent #RAG #Skill #MCP #Harness #可观测性 工程价值: 高——六大工程支柱完整覆盖 核心观点: - 六大组件:Token(滑动窗口上下文)、Skill(业务逻辑封装)、RAG(知识检索)、MCP(多Agent通信)、SDD(状态决策驱动)、Harness(工程化部署) - 混合架构:Java/Go 主控 + Python Skill 执行——收回 LLM 底层操作权,只保留逻辑调度权 - 可观测性:Trace ID 全链路、细粒度步骤追踪、费用监控 - Agentic RAG 替代传统 RAG,融合知识图谱全局视野与 Agent 自主规划 - 2026 年主流框架:LangChain v0.3、AutoGen v0.8、LlamaIndex v0.12 复现价值: 高——代码片段和架构图可参考 可信度: 高——工程实践总结 建议行动: 入库,精读混合架构部分


1.4 Agent 框架性能横评(高优)

标题: 2026年最高频AI Agent框架技术深度解析:从选型到实战 链接: https://agent.csdn.net/6a539c90662f9a54cb8ea0f7.html 标签: #LangGraph #PydanticAI #CrewAI #LlamaIndex #Smolagents #框架评测 工程价值: 高——含 benchmark 数值 核心观点: - LangGraph 评测(延迟/吞吐量):LangGraph(450/320ms)、PydanticAI(380/200ms)、CrewAI(620/450ms) - CrewAI hierarchical 进程性能开销明显(JSON 序列化延迟 300ms),建议仅用于原型 - 选型建议:企业级工作流→LangGraph;快速原型→PydanticAI/Smolagents;角色化多Agent→CrewAI慎用生产;RAG密集型→LlamaIndex+LangGraph - 2025 年 Agent 框架两个分化方向:Type-Safe(PydanticAI)vs Graph Orchestration(LangGraph) 复现价值: 高——benchmark 数据可验证 可信度: 中高——数据具体,有评测环境说明 建议行动: 入库,框架选型参考


1.5 vLLM 部署与性能优化(中高)

标题: 2026大模型技术演进与部署优化实战指南 链接: https://bbs.csdn.net/weixin_29057237/article/details/100194704 发布时间: 2026-07-13 标签: #vLLM #Ollama #llama.cpp #推理优化 #部署 工程价值: 中高——推理引擎横评 核心观点: - vLLM 吞吐量 7200 tokens/s(A100),TensorRT-LLM 8500 tokens/s - vLLM 无需编译、即插即用,适合 PaaS 和多模型路由 - 各工具最低显存:Ollama 6GB/vLLM 8GB/llama.cpp 3GB/Cube Studio 4GB - 典型延迟:Ollama 28ms/vLLM 15ms/llama.cpp 65ms per token - vLLM Continuous Batching 将 GPU 利用率从 30% 提升至 90% 复现价值: 中——数据可复现 可信度: 中高 建议行动: 入库,生产部署参考


1.6 Harness Engineering 指南(高优)

标题: AI Agent 最佳实践:生产级 Harness Engineering 指南(2026) 链接: https://blog.csdn.net/xx_nm98/article/details/162153537 作者: Denis Sergeevitch(引用开源项目) 标签: #Harness Engineering #Agent #可观测性 #安全护栏 核心观点: - agents-best-practices:provider-neutral、production-ready 的 agentic harness 设计 - 缺失的关键环节是 disciplined harness engineering - 涵盖:component models、checklists、Agent Skills standard 复现价值: 高——GitHub 有开源 repo 可信度:建议行动: 核验 GitHub repo,关联 Substack 来源补充


1.7 LLM 驾驭工程(Harness Engineering)完整指南(高优)

标题: LLM Harness Engineering 大模型驾驭工程 完整精通指南 链接: https://blog.csdn.net/ailiandeziwei/article/details/161979669 发布时间: 2026-07 标签: #Harness Engineering #vLLM #TensorRT-LLM #Prefix Caching #性能优化 工程价值: 极高——含完整 benchmark 对比和优化案例 核心观点: - vLLM vs TRT-LLM benchmark(Llama-3-8B, A100-80GB, BF16):吞吐量 +24%、TTFT -21%、TBT -20%、P99 -24% - Prefix Caching 场景效果:RAG 上下文(shared_prefix_ratio 0.3,节省 10-20% 内存)、多轮对话(shared_prefix_ratio 0.6,节省 30-40%) - 企业知识助手优化案例:P99 从 28500ms→ 优化步骤后显著下降 复现价值: 极高——完整配置参数可复用 可信度:建议行动: 精读入库,生产级参考手册


二、Substack 高价值内容

2.1 AgentOps 生产部署经验(高优)

标题: AgentOps: Lessons from Over 1,400 Production Deployments of AI Systems 来源: Hugobowne / MLOps Community Substack 链接: https://hugobowne.substack.com/p/agentops-lessons-from-over-1400-production 作者: Hugo Bowne-Anderson + Alex Strick van Linschoten(ZenML) 发布时间: 2026-04-10 标签: #AgentOps #LLMOps #生产部署 #可观测性 #多模态 核心观点: - 2026 是 Agent 十年(不只是一年)——实验阶段已结束 - 从简单 RAG 转向自主系统的明显趋势 - 模型应用分化:快速推理优化 vs 深度推理 - ZenML LLMOps Database:1400+ 生产案例 - 讨论主题:Context Engineering、Silent Failures、团队重建频率 可信度: 高——基于大规模生产数据 建议行动: 精读,核验 ZenML LLMOps Database


2.2 2026 RAG 系统基础设施(高优)

标题: The Infrastructure That Powers RAG Systems 来源: Jam with AI(Shantanu Ladhwe + Shirin Khosravi) 链接: https://jamwithai.substack.com/p/the-infrastructure-that-powers-rag 标签: #RAG #基础设施 #ColPali #多模态 #MLOps 核心观点: - 完整 RAG 系统构建路线图:Phase 1 RAG → Phase 2 AI Agents → Phase 3 RecSys → Phase 4 MLOps - ArXiv Paper Curator 项目:本地 RAG 系统,自动 ingesting 100+ academic PDFs - ColPali 多向量检索 + multimodal generator 的端到端流程 - 生产级 RAG 管道:数据 ingestion → embedding → vector DB → retrieval → generation 可信度: 高——有具体项目代码 建议行动: 核验 GitHub 代码库


2.3 2026 AI Agent 学习路径(高优)

标题: The 2026 Path to Learning AI Agents 来源: AI Agents Simplified 链接: https://aiagentssimplified.substack.com/p/the-2026-path-to-learning-ai-agents 发布时间: 2026-01 标签: #Agent #学习路径 #MCP #系统设计 #RAG 核心观点: - 2020-2022:无状态 LLM wrapper → 2023:工具使用+记忆 wrapper+早期框架 → 2024:图编排 → 2025:MCP标准化+结构化记忆+自主循环 → 2026:多模态+OS级能力 - 核心技能:系统设计、工具合约设计、检索工程、可靠性工程、安全与安全、评估与可观测性、产品思维 - 工具链:LangFlow(可视化原型)、Claude Agent SDK(生产)、Google ADK 可信度:建议行动: 入库,学习路径参考


2.4 2026 AI/ML 系统生产路线图(高优)

标题: The 2026 Roadmap: Production AI/ML Systems 来源: Jam with AI(38k 订阅者) 链接: https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml 发布时间: 2026-01 标签: #AI Agents #Advanced RAG #NLP #RecSys #MLOps 核心观点: - Q1-Q2 2026:AI Agents Course + RAG Continuation(Graph DBs + ColPali) - Q2-Q3 2026:NLP Course: Zero to Fine-tuning - Q3-Q4 2026:RecSys with MLOps - 社区驱动,订阅制 可信度: 高——大订阅量 建议行动: 跟踪课程发布


2.5 LLM 评估工具完整指南(中高)

标题: The Complete Guide to LLM Evaluation Tools in 2026 来源: Future AGI Substack 链接: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation 标签: #LLM评估 #RAG评估 #Agent评估 #Galileo #MLflow #Arize 核心观点: - Future AGI:多模态评估(文本/图像/音频/视频),自动化评估,消除 ground truth 依赖 - Galileo:模块化平台,内置 guardrails,RAG 和 agentic workflows 优化 - Arize AI:企业级,幻觉 QA,相关性评估,LLM-as-Judge 可观测性 - MLflow:开源统一评估,RAG 指标,RAGMetrics,内置评估 - 评估维度:Content Accuracy、RAG Metrics、Generative Quality、Format Validation、Safety & Compliance 可信度: 中高 建议行动: 入库,评估工具选型参考


三、学术论文(ArXiv)

3.1 MemoryAgentBench(ICLR 2026)⭐极高价值

标题: Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions 链接: https://arxiv.org/abs/2507.05257 GitHub: https://github.com/HUST-AI-HYZ/MemoryAgentBench(403 stars) 标签: #Agent Memory #Benchmark #ICLR2026 核心观点: - 评估 Agent 四个核心记忆能力:准确检索、测试时学习、长程理解、冲突消解 - 对比:商业记忆 Agent(Mem0/MemGPT)、长上下文 Agent、RAG Agent - MemoryArena(ICML 2026)——评估 agentic memory 在 agentic 任务上的表现 可信度: 高——顶会接收 建议行动: 精读 + 代码核验


3.2 Beyond Fact Retrieval: Episodic Memory for RAG(AAAI 2026 Oral)

标题: Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces 链接: https://arxiv.org/abs/2511.07587 标签: #RAG #Episodic Memory #AAAI2026 核心观点: - 场景记忆(Episodic Memory)用于 RAG,超越传统事实检索 - 生成式语义工作区 可信度: 高——AAAI 2026 Oral 建议行动: 精读原文


3.3 Memory in the LLM Era(Survey)

标题: Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework 链接: https://arxiv.org/html/2604.01707v1 标签: #Agent Memory #Survey #Benchmark 核心观点: - LLM Agent 记忆机制综合分类框架 - 引用 OpenClaw Team 2026 作为 agent 案例(SWE-agent、OpenClaw) - 图记忆、RAG 记忆、长期记忆演进 可信度:建议行动: 泛读,做知识图谱补充


3.4 Mem0 AI Agent Memory 2026 进展报告(高优)

来源: Mem0 官方博客(基于 ECAI 2025 论文 arXiv:2504.19413) 链接: https://mem0.ai/blog/state-of-ai-agent-memory-2026 标签: #Agent Memory #Mem0 #Benchmark 核心观点: - 新算法在 LoCoMo 达 92.5 分(6,956 token/query)、LongMemEval 94.4 分(6,787 token/query) - 支持 21 个框架、20 个向量存储、三种部署模式(云托管/开源自托管/MCP 本地) - 开放问题:记忆压缩、多模态记忆、个性化与隐私平衡 可信度: 高——有 benchmark 数据 建议行动: 入库,关联 Agent Memory 主题页


3.5 分布式多Agent长期记忆成本与精度(IEEE COMPSAC 2026)

标题: Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on LLMs 链接: https://arxiv.org/abs/2601.07978 标签: #Multi-Agent #Memory #IEEE #分布式 可信度: 高——IEEE 接收 建议行动: 泛读


四、GitHub/HuggingFace 资源

资源 类型 Stars 标签 建议
HUST-AI-HYZ/MemoryAgentBench Benchmark 403 #Agent Memory #ICLR2026 精读
Shichun-Liu/Agent-Memory-Paper-List 论文列表 - #Agent Memory #论文列表 收藏
agents-best-practices (Harness Engineering) 工具库 - #Harness #Agent 核验

五、分类标签体系(建议)

#RAG #Agent #Memory #Agentic-RAG #Harness-Engineering #MLOps
#LLM-Evaluation #vLLM #TensorRT-LLM #LangGraph #LlamaIndex
#Substack #ArXiv #Benchmark #ICLR2026 #AAAI2026 #ICML2026
#WWW2026 #IEEE-COMPSAC-2026

六、建议写入路径

主文件: /shared/research-kb/inbox/jay/2026-07-20-rag-agent-memory-research.md(即本文)

关联主题页建议: - topics/rag.md — 更新范式迁移、AnchorRAG、SeaRAG、Agentic RAG 内容 - topics/agent.md — 更新 MemoryAgentBench、Harness Engineering、框架横评 - topics/memory.md — 新建/更新 Mem0、Agent Memory 综述 - topics/llm-ops.md — 更新 AgentOps 生产经验、vLLM benchmark


七、本轮行动项

优先级 行动 关联条目
P0 精读 MemoryAgentBench 代码(GitHub) §3.1
P0 精读 AnchorRAG 论文(WWW 2026) §1.1
P1 核验 agents-best-practices GitHub repo §1.6
P1 核验 Jam with AI RAG 基础设施项目代码 §2.2
P2 精读 AAAI 2026 Oral Episodic Memory RAG §3.2
P2 入库 vLLM Harness benchmark 数据 §1.7
P3 更新 Agent Memory 主题页 §3.3, §3.4

撰写实例: Jay 撰写时间: 2026-07-20 12:20 UTC 草稿状态: 初稿,待审稿