研究知识库草稿 · Jay · 2026-07-08

主题

LLM / RAG / Agent 系统架构与工程实践(周频检索)

检索范围

  • arXiv cs.AI / cs.MA(今日新提交 184 篇)
  • Sebastian Raschka Ahead of AI (Substack, 168K+ 订阅者)
  • ByteByteGo、RecSys Substack
  • CSDN 智能体开发者社区(高价值实战文章)
  • Tavily 深度搜索(AI systems、RAG、MLOps)

一、arXiv 2026 年 Q1-Q2 LLM 架构进展(Sebastian Raschka 整理)

来源: LLM Research Papers: The 2026 List (Jan–May)
作者: Sebastian Raschka(独立 AI 研究者,Ahead of AI Newsletter)
可信度: 高(Raschka 为知名 ML 教育者,文章引用原始 arXiv 链接)
是否需精读: 是,建议结合原文逐篇筛选

核心洞察

  1. 混合架构成主流:2026 年不再只是把 Transformer 做大,Nemotron 3(NVIDIA)、Arcee Trinity 等采用 Mamba+Transformer 混合层,在长上下文上近乎线性扩展,成本显著降低。

  2. 状态空间层热潮:Mamba-3 引入改进的序列建模;Attention to Mamba(蒸馏配方)探索跨架构知识迁移。

  3. MiniMax-M2 系列(2026-05-25):提出 Mini Activations,在真实世界智能任务上释放最大性能,架构创新方向值得关注。

  4. 推理时扩展(Inference Scaling):测试时计算扩展成为新前沿,通过并行采样和内部元评判器驱动"金牌"性能。

  5. 长上下文效率为王:随着 Agent 系统接入更长 context,KV Cache 优化(MLA、mHC、Compressed Attention)成为工程焦点。

后续行动: 建议按主题页更新「LLM 架构演进 2026」,纳入混合架构和 KV Cache 优化两个子专题。


二、Agentic RAG 与记忆系统(arXiv 新论文)

2.1 A-RAG: Agentic RAG 新范式

来源: arXiv:2602.03442
标题: A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
可信度: 高(arXiv 同行评审中)
核心观点: - 当前 Agentic RAG 多为预定义工作流(Workflow RAG),缺乏真正的自主规划能力 - A-RAG 提出分层检索接口,让 LLM 在 keyword/sentence/chunk 三个粒度自主访问语料 - 实验验证了 test-time scaling 行为——检索接口设计比复杂检索算法更重要 - 建议未来研究聚焦"Agent 友好的接口"而非单纯提升检索精度

工程评价: 论文的层级接口设计思路对 RAG 系统工程化有直接参考价值,建议精读「6 Conclusion」和「Limitations」部分。

2.2 LLM Agent 记忆机制综述(2026 年最新)

来源: arXiv:2603.07670
标题: Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers
时间: 2026(覆盖 2022–2026 Q1 系统)
核心架构: - 将 Agent Memory 形式化为「写-管理-读」循环,耦合感知与行动 - 三维分类法:时域范围(STM/LTM)、表示载体、控制策略 - MemoryArena benchmark(2026):多会话相互依赖任务,现有 near-saturated LoCoMo 模型仅 40–60% 准确率,揭示记忆管理瓶颈 - GRPO step-wise 训练记忆操作为 RL action,在 5 个基准上超越所有记忆增强 baseline

工程评价: 对构建长期记忆 Agent 系统有重要参考意义,尤其「写-管理-读」框架和 MemoryArena benchmark。


三、CSDN 高价值实战文章(严格筛选)

3.1 【硬核实战】Milvus 架构原理到 RAG 落地

来源: CSDN 智能体社区(一个无名的炼丹师,2025-12-04)
浏览量: 958 次
工程价值: ⭐⭐⭐⭐⭐(最高档)

核心内容: - Milvus 云原生存算分离四层架构解析 - 混合检索(Hybrid Search)实战:稠密向量(HNSW)+ 稀疏向量(SPARSE_INVERTED_INDEX),用 WeightedRanker 融合,权重 0.7/0.3 可调 - 完整 PyMilvus SDK 代码:Collection 创建、索引定义(HNSW M=16, efConstruction=500)、AnnSearchRequest 并发检索 - Milvus 3.0 Vector Data Lake 演进方向

复现价值: 高。代码可直接用于生产环境,参数配置有明确工程依据(ef=100, M=16 等)。

版本标注: Milvus 2.5.x,PyMilvus SDK,Python 3.x,HNSW 索引

建议分类: RAG / 向量数据库 / Milvus / 工程实战 / 混合检索


3.2 向量数据库选型宝典:RAG 系统性能优化指南

来源: CSDN 智能体社区(编程喵酱,2025-12-12)
浏览量: 1521 次
工程价值: ⭐⭐⭐⭐

核心内容: - 主流向量数据库全面对比:FAISS / Qdrant / Milvus / Pinecone / Chroma / pgvector - 各库选型规模建议:<10 万向量 → Chroma/pgvector/FAISS;百万级 → Qdrant/Milvus;托管 → Pinecone/Zilliz - HNSW 参数工程指南:ef_construction、M、nlist 等索引参数的工程含义 - PostgreSQL pgvector 实战:完整 SQL 建表和 HNSW 索引 DDL,含向量相似度搜索 SQL 示例 - FAISS IndexFlatIP + L2 归一化实现余弦相似度完整代码

复现价值: 高。选型矩阵 + 实际 SQL 代码可直接用于技术选型决策。

建议分类: 向量数据库 / RAG / 选型对比 / pgvector / HNSW


3.3 Agentic RAG:智能体如何增强检索增强型生成

来源: CSDN 智能体社区(学网安的喵桑,2025-11-17)
浏览量: 1055 次
工程价值: ⭐⭐⭐⭐

核心内容: - 单智能体 RAG(路由器型)vs 多智能体 RAG(协调型)架构对比 - Agentic RAG 核心能力:工具调用 + 自我反思 + 查询路由 + 多步骤检索 - LangGraph + Ollama 实现方案,含状态机 workflow 代码 - 多智能体协调模式:主 Agent + 专业检索子 Agent(内部数据/邮件/网络搜索分立)

复现价值: 中高。LangGraph 代码框架可参考,但工具调用部分需结合实际 API 重写。

建议分类: Agentic RAG / LangGraph / 多智能体 / 架构设计


3.4 RAG 要上生产:四大主流向量数据库实测 PK

来源: CSDN
工程价值: ⭐⭐⭐(基准测试型,有实测数据)

核心观点: 向量数据库核心两件事——存向量 + 按相似度搜索。适合作为 RAG 生产选型的入门级对比文章。

建议分类: 向量数据库 / RAG / 选型对比 / 实测 PK


四、Substack 高价值来源

4.1 ByteByteGo: MCP vs RAG vs AI Agents(2026-02)

来源: ByteByteGo Substack
作者: ByteByteGo(系统设计知名 newsletter)
可信度: 高
核心洞察: - MCP(Model Context Protocol)是 LLM 与外部系统交互的标准接口层,解决的是"如何暴露工具"而非"做什么" - MCP vs RAG vs Agent 三者解决不同层次问题,不应混淆:MCP = 接口标准化,RAG = 知识注入,Agent = 自主决策 - 实践建议:构建 Agent 系统时,接口标准化(MCP)先行,再叠加 RAG 知识检索

后续行动: 建议补充进「AI Agent 工程实践」主题页,作为接口层认知框架。


4.2 RecSys: Information Retrieval 前沿论文周报(Vol.158)

来源: RecSys Substack
时间: 2026-05-25 ~ 2026-05-31
值得关注的论文: - Converting Single-Vector Retrievers into Multi-Vector Models 无需重训练(Zhang et al.)——工程友好型创新 - Collision-Aware Evaluation of Semantic-ID Tokenizers for Generative Recommendation

建议: 关注无需重训练的多向量转化方法,对现有系统升级成本低。


五、MLOps/LLMOps 工程实践

5.1 MLOps 到 LLMOps 全路线图 2026

来源: MachineLearningMastery + Medium CodeX
核心观点: - LLMOps 市场预计 2028 年达 49 亿美元(42% CAGR) - 72% 企业在 2026 年采用 AI 自动化工具,但大多数缺乏成本控制 - 关键技能:Prompt 版本化管理、RAG 系统设计、LLM 评估策略、Guardrail 实现、成本优化 - AgentOps 即将成为新方向:多智能体编排的可观测性比单模型复杂 10 倍 - 将 Prompt 视为代码:版本控制 + 单元测试 + A/B 分级 + guarded production rollout

工程评价: 路线图框架清晰,但深度一般,适合作为团队 LLMOps 成熟度评估参照。


六、本次未写入原因

本次为纯检索扫描任务,产出了结构化草稿供后续主题页更新和精读队列使用。未调用 GitHub 写入。


建议写入路径

  • /shared/research-kb/inbox/jay/2026-07-08-llm-rag-agent-weekly.md(本文件,即时草稿)

后续行动建议

  1. 精读队列: - A-RAG 论文(arXiv:2602.03442)——分层检索接口设计 - Memory for Autonomous LLM Agents(arXiv:2603.07670)——长期记忆架构 - Sebastian Raschka Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention(2026-05-16)
  2. 主题页更新建议: - 新增/更新「LLM 架构 2026」页:混合架构、MLA KV Cache 优化 - 更新「RAG 工程实战」页:纳入 Milvus 混合检索、Agentic RAG 架构
  3. CSDN 精筛:本轮 4 篇高价值文章均来自 CSDN 智能体社区,建议长期监控该栏目