研究草稿:RAG/Agent/Memory 技术动态(2026-07-20)
主题
RAG、Agent、Memory 系统 2026 年 Q2 技术动态与学术进展
一、CSDN 高价值技术文章
1.1 RAG 范式迁移(高优)
标题: 2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 链接: https://blog.csdn.net/qcx23/article/details/160820786 作者: hope_wisdom 发布时间: 2026-07(近期) 标签: #架构 #RAG #AI Agent #agent 工程价值: 引用真实顶会论文,可信度高 核心观点: - 2026 Q1-Q2 顶会 RAG 论文体系梳理:ICML 2026、WWW 2026、ICLR 2026 - 关键论文:A-RAG (arXiv:2602.03442)、AnchorRAG (WWW 2026)、SeaRAG (ACM WWW 2026)、CUE-R (arXiv:2604.05467) - GraphRAG 演进:UniAI-GraphRAG (Nature Scientific Reports 2026) - Agentic RAG 已成主流范式 复现价值: 高——论文引用可查,有代码/官方文档可追溯 可信度: 高——基于真实 arXiv 引用,非空谈 建议行动: 精读 AnchorRAG 和 SeaRAG 两篇,核验 arXiv 原文
1.2 RAG 与 Agent 架构原理与生产实践(高优)
标题: RAG与Agent技术解析:架构原理与落地实践 链接: https://bbs.csdn.net/weixin_33708633/article/details/100194387 发布时间: 2026-07-13 标签: #RAG #Agent #稠密向量检索 #可观测性 工程价值: 高——含实测数据 核心观点: - DPR 向量检索 768 维,ColBERT 比 BM25 准确率高 22%,延迟+15ms - 法律合同按章节切割比固定长度切割准确率提升 31% - Llama3-70B 引用检索内容准确度比 GPT-4 高 18% - RAG 必须验证 Recall@K、Precision@K、nDCG 指标 - Agent 需沙盒环境、人工审核门控、失败回滚、可观测性日志 - 分层架构:LLM(底座)→ RAG(知识延展)→ Agent(系统级执行) 复现价值: 高——有具体数值,可对比验证 可信度: 高——作者实战经验 建议行动: 审稿入库,生产实践参考
1.3 Agent 工程化六大要素(高优)
标题: AI Agent从原型到产品:精通RAG、Skill规划与Python落地实践 链接: https://agent.csdn.net/6a5b30a3662f9a54cb908dab.html 发布时间: 2026-07 标签: #Agent #RAG #Skill #MCP #Harness #可观测性 工程价值: 高——六大工程支柱完整覆盖 核心观点: - 六大组件:Token(滑动窗口上下文)、Skill(业务逻辑封装)、RAG(知识检索)、MCP(多Agent通信)、SDD(状态决策驱动)、Harness(工程化部署) - 混合架构:Java/Go 主控 + Python Skill 执行——收回 LLM 底层操作权,只保留逻辑调度权 - 可观测性:Trace ID 全链路、细粒度步骤追踪、费用监控 - Agentic RAG 替代传统 RAG,融合知识图谱全局视野与 Agent 自主规划 - 2026 年主流框架:LangChain v0.3、AutoGen v0.8、LlamaIndex v0.12 复现价值: 高——代码片段和架构图可参考 可信度: 高——工程实践总结 建议行动: 入库,精读混合架构部分
1.4 Agent 框架性能横评(高优)
标题: 2026年最高频AI Agent框架技术深度解析:从选型到实战 链接: https://agent.csdn.net/6a539c90662f9a54cb8ea0f7.html 标签: #LangGraph #PydanticAI #CrewAI #LlamaIndex #Smolagents #框架评测 工程价值: 高——含 benchmark 数值 核心观点: - LangGraph 评测(延迟/吞吐量):LangGraph(450/320ms)、PydanticAI(380/200ms)、CrewAI(620/450ms) - CrewAI hierarchical 进程性能开销明显(JSON 序列化延迟 300ms),建议仅用于原型 - 选型建议:企业级工作流→LangGraph;快速原型→PydanticAI/Smolagents;角色化多Agent→CrewAI慎用生产;RAG密集型→LlamaIndex+LangGraph - 2025 年 Agent 框架两个分化方向:Type-Safe(PydanticAI)vs Graph Orchestration(LangGraph) 复现价值: 高——benchmark 数据可验证 可信度: 中高——数据具体,有评测环境说明 建议行动: 入库,框架选型参考
1.5 vLLM 部署与性能优化(中高)
标题: 2026大模型技术演进与部署优化实战指南 链接: https://bbs.csdn.net/weixin_29057237/article/details/100194704 发布时间: 2026-07-13 标签: #vLLM #Ollama #llama.cpp #推理优化 #部署 工程价值: 中高——推理引擎横评 核心观点: - vLLM 吞吐量 7200 tokens/s(A100),TensorRT-LLM 8500 tokens/s - vLLM 无需编译、即插即用,适合 PaaS 和多模型路由 - 各工具最低显存:Ollama 6GB/vLLM 8GB/llama.cpp 3GB/Cube Studio 4GB - 典型延迟:Ollama 28ms/vLLM 15ms/llama.cpp 65ms per token - vLLM Continuous Batching 将 GPU 利用率从 30% 提升至 90% 复现价值: 中——数据可复现 可信度: 中高 建议行动: 入库,生产部署参考
1.6 Harness Engineering 指南(高优)
标题: AI Agent 最佳实践:生产级 Harness Engineering 指南(2026) 链接: https://blog.csdn.net/xx_nm98/article/details/162153537 作者: Denis Sergeevitch(引用开源项目) 标签: #Harness Engineering #Agent #可观测性 #安全护栏 核心观点: - agents-best-practices:provider-neutral、production-ready 的 agentic harness 设计 - 缺失的关键环节是 disciplined harness engineering - 涵盖:component models、checklists、Agent Skills standard 复现价值: 高——GitHub 有开源 repo 可信度: 高 建议行动: 核验 GitHub repo,关联 Substack 来源补充
1.7 LLM 驾驭工程(Harness Engineering)完整指南(高优)
标题: LLM Harness Engineering 大模型驾驭工程 完整精通指南 链接: https://blog.csdn.net/ailiandeziwei/article/details/161979669 发布时间: 2026-07 标签: #Harness Engineering #vLLM #TensorRT-LLM #Prefix Caching #性能优化 工程价值: 极高——含完整 benchmark 对比和优化案例 核心观点: - vLLM vs TRT-LLM benchmark(Llama-3-8B, A100-80GB, BF16):吞吐量 +24%、TTFT -21%、TBT -20%、P99 -24% - Prefix Caching 场景效果:RAG 上下文(shared_prefix_ratio 0.3,节省 10-20% 内存)、多轮对话(shared_prefix_ratio 0.6,节省 30-40%) - 企业知识助手优化案例:P99 从 28500ms→ 优化步骤后显著下降 复现价值: 极高——完整配置参数可复用 可信度: 高 建议行动: 精读入库,生产级参考手册
二、Substack 高价值内容
2.1 AgentOps 生产部署经验(高优)
标题: AgentOps: Lessons from Over 1,400 Production Deployments of AI Systems 来源: Hugobowne / MLOps Community Substack 链接: https://hugobowne.substack.com/p/agentops-lessons-from-over-1400-production 作者: Hugo Bowne-Anderson + Alex Strick van Linschoten(ZenML) 发布时间: 2026-04-10 标签: #AgentOps #LLMOps #生产部署 #可观测性 #多模态 核心观点: - 2026 是 Agent 十年(不只是一年)——实验阶段已结束 - 从简单 RAG 转向自主系统的明显趋势 - 模型应用分化:快速推理优化 vs 深度推理 - ZenML LLMOps Database:1400+ 生产案例 - 讨论主题:Context Engineering、Silent Failures、团队重建频率 可信度: 高——基于大规模生产数据 建议行动: 精读,核验 ZenML LLMOps Database
2.2 2026 RAG 系统基础设施(高优)
标题: The Infrastructure That Powers RAG Systems 来源: Jam with AI(Shantanu Ladhwe + Shirin Khosravi) 链接: https://jamwithai.substack.com/p/the-infrastructure-that-powers-rag 标签: #RAG #基础设施 #ColPali #多模态 #MLOps 核心观点: - 完整 RAG 系统构建路线图:Phase 1 RAG → Phase 2 AI Agents → Phase 3 RecSys → Phase 4 MLOps - ArXiv Paper Curator 项目:本地 RAG 系统,自动 ingesting 100+ academic PDFs - ColPali 多向量检索 + multimodal generator 的端到端流程 - 生产级 RAG 管道:数据 ingestion → embedding → vector DB → retrieval → generation 可信度: 高——有具体项目代码 建议行动: 核验 GitHub 代码库
2.3 2026 AI Agent 学习路径(高优)
标题: The 2026 Path to Learning AI Agents 来源: AI Agents Simplified 链接: https://aiagentssimplified.substack.com/p/the-2026-path-to-learning-ai-agents 发布时间: 2026-01 标签: #Agent #学习路径 #MCP #系统设计 #RAG 核心观点: - 2020-2022:无状态 LLM wrapper → 2023:工具使用+记忆 wrapper+早期框架 → 2024:图编排 → 2025:MCP标准化+结构化记忆+自主循环 → 2026:多模态+OS级能力 - 核心技能:系统设计、工具合约设计、检索工程、可靠性工程、安全与安全、评估与可观测性、产品思维 - 工具链:LangFlow(可视化原型)、Claude Agent SDK(生产)、Google ADK 可信度: 高 建议行动: 入库,学习路径参考
2.4 2026 AI/ML 系统生产路线图(高优)
标题: The 2026 Roadmap: Production AI/ML Systems 来源: Jam with AI(38k 订阅者) 链接: https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml 发布时间: 2026-01 标签: #AI Agents #Advanced RAG #NLP #RecSys #MLOps 核心观点: - Q1-Q2 2026:AI Agents Course + RAG Continuation(Graph DBs + ColPali) - Q2-Q3 2026:NLP Course: Zero to Fine-tuning - Q3-Q4 2026:RecSys with MLOps - 社区驱动,订阅制 可信度: 高——大订阅量 建议行动: 跟踪课程发布
2.5 LLM 评估工具完整指南(中高)
标题: The Complete Guide to LLM Evaluation Tools in 2026 来源: Future AGI Substack 链接: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation 标签: #LLM评估 #RAG评估 #Agent评估 #Galileo #MLflow #Arize 核心观点: - Future AGI:多模态评估(文本/图像/音频/视频),自动化评估,消除 ground truth 依赖 - Galileo:模块化平台,内置 guardrails,RAG 和 agentic workflows 优化 - Arize AI:企业级,幻觉 QA,相关性评估,LLM-as-Judge 可观测性 - MLflow:开源统一评估,RAG 指标,RAGMetrics,内置评估 - 评估维度:Content Accuracy、RAG Metrics、Generative Quality、Format Validation、Safety & Compliance 可信度: 中高 建议行动: 入库,评估工具选型参考
三、学术论文(ArXiv)
3.1 MemoryAgentBench(ICLR 2026)⭐极高价值
标题: Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions 链接: https://arxiv.org/abs/2507.05257 GitHub: https://github.com/HUST-AI-HYZ/MemoryAgentBench(403 stars) 标签: #Agent Memory #Benchmark #ICLR2026 核心观点: - 评估 Agent 四个核心记忆能力:准确检索、测试时学习、长程理解、冲突消解 - 对比:商业记忆 Agent(Mem0/MemGPT)、长上下文 Agent、RAG Agent - MemoryArena(ICML 2026)——评估 agentic memory 在 agentic 任务上的表现 可信度: 高——顶会接收 建议行动: 精读 + 代码核验
3.2 Beyond Fact Retrieval: Episodic Memory for RAG(AAAI 2026 Oral)
标题: Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces 链接: https://arxiv.org/abs/2511.07587 标签: #RAG #Episodic Memory #AAAI2026 核心观点: - 场景记忆(Episodic Memory)用于 RAG,超越传统事实检索 - 生成式语义工作区 可信度: 高——AAAI 2026 Oral 建议行动: 精读原文
3.3 Memory in the LLM Era(Survey)
标题: Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework 链接: https://arxiv.org/html/2604.01707v1 标签: #Agent Memory #Survey #Benchmark 核心观点: - LLM Agent 记忆机制综合分类框架 - 引用 OpenClaw Team 2026 作为 agent 案例(SWE-agent、OpenClaw) - 图记忆、RAG 记忆、长期记忆演进 可信度: 高 建议行动: 泛读,做知识图谱补充
3.4 Mem0 AI Agent Memory 2026 进展报告(高优)
来源: Mem0 官方博客(基于 ECAI 2025 论文 arXiv:2504.19413) 链接: https://mem0.ai/blog/state-of-ai-agent-memory-2026 标签: #Agent Memory #Mem0 #Benchmark 核心观点: - 新算法在 LoCoMo 达 92.5 分(6,956 token/query)、LongMemEval 94.4 分(6,787 token/query) - 支持 21 个框架、20 个向量存储、三种部署模式(云托管/开源自托管/MCP 本地) - 开放问题:记忆压缩、多模态记忆、个性化与隐私平衡 可信度: 高——有 benchmark 数据 建议行动: 入库,关联 Agent Memory 主题页
3.5 分布式多Agent长期记忆成本与精度(IEEE COMPSAC 2026)
标题: Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on LLMs 链接: https://arxiv.org/abs/2601.07978 标签: #Multi-Agent #Memory #IEEE #分布式 可信度: 高——IEEE 接收 建议行动: 泛读
四、GitHub/HuggingFace 资源
| 资源 | 类型 | Stars | 标签 | 建议 |
|---|---|---|---|---|
| HUST-AI-HYZ/MemoryAgentBench | Benchmark | 403 | #Agent Memory #ICLR2026 | 精读 |
| Shichun-Liu/Agent-Memory-Paper-List | 论文列表 | - | #Agent Memory #论文列表 | 收藏 |
| agents-best-practices (Harness Engineering) | 工具库 | - | #Harness #Agent | 核验 |
五、分类标签体系(建议)
#RAG #Agent #Memory #Agentic-RAG #Harness-Engineering #MLOps
#LLM-Evaluation #vLLM #TensorRT-LLM #LangGraph #LlamaIndex
#Substack #ArXiv #Benchmark #ICLR2026 #AAAI2026 #ICML2026
#WWW2026 #IEEE-COMPSAC-2026
六、建议写入路径
主文件: /shared/research-kb/inbox/jay/2026-07-20-rag-agent-memory-research.md(即本文)
关联主题页建议:
- topics/rag.md — 更新范式迁移、AnchorRAG、SeaRAG、Agentic RAG 内容
- topics/agent.md — 更新 MemoryAgentBench、Harness Engineering、框架横评
- topics/memory.md — 新建/更新 Mem0、Agent Memory 综述
- topics/llm-ops.md — 更新 AgentOps 生产经验、vLLM benchmark
七、本轮行动项
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| P0 | 精读 MemoryAgentBench 代码(GitHub) | §3.1 |
| P0 | 精读 AnchorRAG 论文(WWW 2026) | §1.1 |
| P1 | 核验 agents-best-practices GitHub repo | §1.6 |
| P1 | 核验 Jam with AI RAG 基础设施项目代码 | §2.2 |
| P2 | 精读 AAAI 2026 Oral Episodic Memory RAG | §3.2 |
| P2 | 入库 vLLM Harness benchmark 数据 | §1.7 |
| P3 | 更新 Agent Memory 主题页 | §3.3, §3.4 |
撰写实例: Jay 撰写时间: 2026-07-20 12:20 UTC 草稿状态: 初稿,待审稿