知识库草稿 · Jay · 2026-07-05

主题:LLM 工程化 · RAG 实战 · Agent 系统 · 2026 前沿

📌 本次检索范围

  • CSDN 高价值技术文章(vLLM / SGLang / LangChain / LlamaIndex / QLoRA / DeepSeek / Qwen)
  • arXiv 2026 年 5–6 月最新论文(RAG / Agent / LLM Systems / Multimodal)
  • Substack 高质量 Newsletter(Sebastian Raschka · Simon Willison · AI and Academia)
  • 主流技术报告(MiniMax-M2 / Nemotron 3 Super / Step-DeepResearch / LiberCoder)

🔬 高价值条目(严格筛选)


【CSDN 高价值】⭐⭐⭐⭐⭐

1. CSDN · 《2026年LLM微调实战指南:QLoRA、GRPO与Unsloth工程落地》

  • URL: https://devpress.csdn.net/amd/6a3b417710ee7a33f2818ef2.html
  • 作者: 跟着老范学模型(AMD 开发者社区)
  • 可信度: 高 · 工程实操 · 2026 年 · 有实测数据
  • 核心观点:
  • RTX 5090 + vLLM 默认 FP8 精度与 QLoRA bfloat16 训练模型不匹配,导致每次请求 CUDA kernel 重编译,延迟 +1.2s
  • 解决方案:Unsloth save_pretrained_gguf() 导出 q4_k_m 格式,llama.cpp --n-gpu-layers 45 分载 GPU/CPU,实测延迟从 8.2s 降至 1.7s,显存 6.3GB
  • 2026 年数据集必须包含"负样本锚点"——安全边界数据,用于划定模型"什么不该做"
  • 数据质量检测:用 Qwen3.6-27B 自身做质检,ROUGE-L 方差 >0.3 剔除,噪声率从 12% 压至 1.8%
  • 合成数据范式:上传 PDF → 自动解析监管要点 → 生成10种用户提问变体 → 本地模型重写,20分钟产出 2000 条 SFT 数据
  • 部署即监控:Ollama Modelfile 嵌入自定义 health check,每5分钟 curl 探针,接 Grafana 告警
  • 工程价值: 直接可复现,命令 / 参数 / 脚本均已提供
  • 建议写入: 技术深度 → LLM微调部署 → QLoRA工程化 路径

2. CSDN · 《2025年LLM推理实战指南:性能优化、对齐新范式与本地部署》

  • URL: https://bbs.csdn.net/weixin_30099989/article/details/100153155
  • 可信度: 高 · 18个月实测 37个模型 · 4类硬件平台 · 6家客户落地
  • 核心观点:
  • 2025年 RTX 4090(24GB)+ vLLM PagedAttention 已是消费级部署标准
  • 显存优化:NF4量化 / AWQ / GPTQ 将70B模型从140GB压至20GB;FlashAttention-2减少KV Cache 30%
  • vLLM Chunked Prefill 支持 128K tokens 上下文下显存线性增长(非平方膨胀)
  • 2025年量化主流:FP4混合精度 / E4M3浮点格式 / 稀疏化剪枝(MoE Top-2 Gating)
  • 推理框架分层:入门 Ollama / 进阶 llama.cpp / 生产 vLLM
  • 工程价值: 硬件选型表 + 量化方案对比表 + 框架选型建议
  • 建议写入: 技术深度 → LLM推理部署 → 硬件选型与量化 路径

3. CSDN · 《RAG实战路线图:从检索到生成的关键环节与调优策略》

  • URL: https://bbs.csdn.net/weixin_33443333/article/details/100159962
  • 时间: 2026-06-24 · CC 4.0 BY-SA
  • 可信度: 高 · 17个落地项目经验 · 真实排障经历
  • 核心观点:
  • 检索结果和生成答案像两条平行线——典型问题:语义匹配 vs 关键词召回失调
  • PDF解析用 fitz(PyMuPDF)而非 PyPDF2;页眉页脚按位置+内容规则过滤
  • llama-index-core + llama-index-embeddings- + llama-index-vector-stores- 三个包覆盖95%需求,不装全家桶
  • Chunking 策略:Late Chunking(先 Embedding 后切分)保留全局语义
  • 混合检索 = BM25 + Dense Retrieval;重排序用 ColBERTv2
  • Strands Agents 框架(LangChain 生态):ToolRegistry + MemoryManager + PromptEngine + WorkflowExecutor 分层设计
  • 代码价值: 有可直接运行的 Python 代码片段(PDF解析 / Chunking / RAG 流水线)
  • 建议写入: 技术深度 → RAG → 生产级调优 路径

4. CSDN · 《推理框架横评:vLLM / TGI / TensorRT-LLM / SGLang 全面对比》

  • URL: https://blog.csdn.net/weixin_37647148/article/details/161914538
  • 可信度: 高 · 生产级横评数据
  • 核心观点:
  • vLLM:通用推理主流,70B模型吞吐量提升24倍,HuggingFace原生支持
  • SGLang:面向交互的"编程增强器",对 Agent 场景有专项优化
  • TGI:HuggingFace官方,适合追求稳定性
  • TRT-LLM:NVIDIA自有生态,生产延迟最低但迁移成本高
  • 建议写入: 工具对比 → 推理框架选型 路径

5. CSDN · 《Sglang+Vllm+Qwen3.5企业级部署案例实操》

  • URL: https://blog.csdn.net/starzhou/article/details/158290747
  • 可信度: 中高 · 企业级实操案例
  • 核心观点:
  • SGLang 主分支支持 Qwen3.5;安装命令已提供
  • 张量并行(Tensor Parallelism)配置方法
  • 建议写入: 技术深度 → SGLang部署 → Qwen3.5实操 路径

6. CSDN · 《LLaMA-Factory微调(LoRA)Qwen2.5实战》

  • URL: https://adg.csdn.net/696f5083437a6b403369ff4e.html
  • 可信度: 高 · 有完整环境配置 + 命令 + JSON 数据格式 + 启动脚本
  • 核心观点:
  • SFT / PT(增量预训练)/ DPO/ORPO 三类微调阶段对比及数据格式说明
  • 完整安装命令:pip install -e .[metrics] + pip install flash-attn --no-build-isolation
  • 数据格式:Alpaca JSON 格式 {"instruction": "...", "input": "", "output": "..."}
  • LoRA API 部署:--template qwen --api-port 8000
  • 工程价值: 完整 Windows 脚本 + Linux 命令,可直接复用
  • 建议写入: 技术深度 → LLaMA-Factory → Qwen2.5 LoRA实操 路径

7. CSDN · 《DeepSeek实战指南:vLLM与SGLang本地部署》

  • URL: https://bbs.csdn.net/weixin_34122532/article/details/100159757
  • 可信度: 高 · 全生命周期覆盖
  • 核心观点:
  • vLLM 部署 DeepSeek-V3:推荐 v0.6.0+ / CUDA ≥12.1 / PyTorch ≥2.3
  • 常见陷阱:模型下载不完整导致 tokenizer 加载异常 / 输出乱码
  • PagedAttention 机制:逻辑页(Page)切分 KV 缓存,显存碎片率大幅降低
  • LoRA 适配器热加载 + 连续批处理(Continuous Batching)
  • 建议写入: 技术深度 → DeepSeek部署 → vLLM/SGLang 路径

【arXiv 高价值论文】⭐⭐⭐⭐⭐


1. arXiv · MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

  • URL: https://arxiv.org/abs/2605.26494
  • 时间: 2026-05-25(Sebastian Raschka 2026年论文清单收录)
  • 作者: MiniMax AI
  • 可信度: 高 · 旗舰开源 MoE 系列 · Agent 原生设计
  • 核心观点:
  • 全注意力(Full Attention)作为反趋势实践:团队测试了滑动窗口注意力变体(类似 Xiaomi MiMo、Gaemma 4 等),发现效率收益不足以抵消生产质量权衡,最终选择全注意力
  • 线性/稀疏注意力的生产落地困难:线性注意力在论文中降低长上下文成本有吸引力,但在真实 Agent 生产系统中部署难度大
  • Agent 原生数据管道:可验证轨迹大规模构建,覆盖 Agentic Coding 和 Agentic Cowork
  • Forge RL 系统:windowed-FIFO 调度 + prefix-tree 合并 + 训练-推理-Agent 解耦
  • 旗舰 M2: 229.9B 总参 / 9.8B 激活 / token
  • 工程洞察: 2026 年应谨慎追逐稀疏/线性注意力架构,生产稳定性优先于理论效率
  • 建议写入: 前沿论文 → LLM架构 → MoE与Agent原生设计 路径

2. arXiv · Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers

  • URL: https://arxiv.org/abs/2603.07670
  • 可信度: 高 · 2022–2026 年 Agent Memory 系统综述
  • 核心观点:
  • Agent Memory = Write–Manage–Read 循环,紧耦合感知与行动
  • Memory-R1:GRPO 训练 specialized sub-agents 自主决定何时 Add/Update/Delete memory,在5个 benchmark 超越所有 memory-augmented 基线
  • Agentic Memory(2026):统一 STM/LTM 策略,memory ops 训练为 RL actions
  • HippoRAG:知识图谱上传播激活机制,模拟人类联想记忆,多跳推理性能大幅提升
  • MemoRAG:在长上下文中构建全局记忆图谱,支持 Agent 提取结构化洞察
  • 三维分类:时间范围 / 表征底座 / 控制策略
  • 建议写入: 前沿论文 → Agent系统 → Memory机制 路径

3. arXiv · A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

  • URL: https://arxiv.org/abs/2602.03442
  • 可信度: 高 · 18页 · 8图 · Agentic RAG 规模化方案
  • 核心观点:
  • Agentic RAG = 多步决策过程(非静态 retrieve-then-generate pipeline)
  • LLM 可规划、编排检索、管理记忆、调用工具、检查中间证据、决定是否需要更多检索
  • 2026 年 SoK 论文将 Agentic RAG 定义为碎片化但日益重要的架构
  • 建议写入: 前沿论文 → RAG → Agentic RAG 路径

4. arXiv · RAG-driven Multi-Agent LLM Framework with Task Decomposition for Beyond 5G Auto-Configuration

  • URL: https://arxiv.org/abs/2606.01222
  • 时间: 2026-06 · 已接收至 ICT 2026
  • 可信度: 中高 · 工业场景落地(OAI 5G emulator 验证)
  • 核心观点:
  • 任务分解 + RAG + 闭环自验证 组合框架,配置成功率提升 22.7%
  • 语义 RAG 管道确保输出与技术标准和厂商手册对齐
  • 配置生成 / 闭环验证 / 网络部署 三层模块化架构
  • 建议写入: 前沿论文 → 多Agent系统 → RAG驱动工业自动化 路径

5. arXiv · Governing Evolving Memory in LLM Agents: SSGM Framework

  • URL: https://arxiv.org/abs/2603.11768
  • 可信度: 高 · 2026 年 Memory 治理框架
  • 核心观点:
  • 从静态存储 → 自适应自优化 Memory 系统范式转换
  • SSGM(Stability and Safety Governed Memory)框架
  • Memory-R1:RL (PPO) 驱动 memory ops 自适应更新
  • Mem0 / AtomMem:动态固化机制,通过 atomic operations 优化存储结构
  • A-MEM:Zettelkasten 方法,记忆作为原子笔记动态建立关联链接
  • HippoRAG:传播激活机制,类人联想记忆
  • 建议写入: 前沿论文 → Agent系统 → Memory治理与安全 路径

6. arXiv · Awesome-Search-Agent-Papers(精选列表)

  • URL: https://github.com/YunjiaXi/Awesome-Search-Agent-Papers
  • 高价值收录(2026年5–6月):
  • LatentRAG(2026.5):Latent Reasoning + Retrieval,Agentic RAG 高效化
  • LongSeeker(2026.5):长程搜索 Agent 的弹性上下文编排
  • OpenSeeker-v2(2026.5):高信息密度搜索轨迹训练
  • DynaTree(2026.5):时敏新闻检索的动态 Agentic 检索树
  • AgenticRAG(2026.5):企业知识库 Agentic Retrieval
  • DuMate-DeepResearch(2026.6):递归搜索 + 评分驱动的可审计多 Agent 系统
  • ActiveMem(2026.6):长程 LLM 推理的分布式主动记忆
  • MARDoc(2026.6):多模态长文档 QA 的 Memory-Aware 细化 Agent
  • 建议写入: 前沿论文 → Agent系统 → 搜索Agent精选列表 路径

【Substack 高质量 Newsletter】⭐⭐⭐⭐


1. Ahead of AI — Sebastian Raschka · LLM Architecture & ML Research

  • URL: https://magazine.sebastianraschka.com/
  • 订阅量: 189K+
  • 内容风格: 30–90分钟深度阅读 · 图表 + 代码 + 原文引用
  • 本次重点:
  • MiniMax-M2 Series 技术报告解读(见上文 arXiv 部分)
  • 2026 年 1–5 月 LLM 论文清单:含 Nemotron 3 Super(混合 Mamba-Transformer MoE)、Mamba-3、Attention Residuals、Gated DeltaNet-2 等架构论文
  • 架构趋势:2026 年不只是把 Transformer 做大,混合架构(attention + SSM)成为主流
  • Long Context 效率为王:更多 Agent 接入,context 越来越长,Hybrid 架构在长上下文场景更高效
  • 可信度: 极高 · 前 Lightning AI 研究员 · 《Build a LLM From Scratch》作者
  • 建议写入: Newsletter精选 → Ahead of AI → 2026架构趋势 路径

2. Simon Willison — LLM Predictions 2026

  • URL: https://simonw.substack.com/p/llm-predictions-for-2026-shared-with
  • 订阅量: 63K+
  • 核心观点:
  • OpenAI ChatGPT 每周 8000 万活跃用户(2025年10月数据)
  • AI 辅助编程改变开发者习惯:以前需要2-4小时,现在30分钟可搞定
  • AI 帮助管理层重新开始写代码(Jaana Dogan,Google Principal Engineer)
  • 2026预测要点:多模态进展、3D建模、结构化输出格式(深度推理)、AI生成AI代码的递归问题
  • 可信度: 高 · 知名独立开发者 · Datasette / SQLite核心贡献者
  • 建议写入: Newsletter精选 → Simon Willison → 2026预测 路径

3. AI and Academia — Horizon Scanning

  • URL: https://aiandacademia.substack.com/
  • 本次重点:
  • Agentic Computing 加速:Moltbook、Claude Agent Teams、Amazon Virtual Teams 等多 Agent 协作系统涌现
  • AI 进入硬件:Quark 头显等新形态
  • Recursive AI 趋势:OpenAI 和 Anthropic 用 AI 生成 AI 代码,引发业界关注
  • 书籍扫描:AI 训练数据需求推动专业内容库商业化
  • 可信度: 中高 · 学术视角 · 学术会议 RSS DS+AI Section
  • 建议写入: Newsletter精选 → AI and Academia → AgenticComputing 路径

4. The Batch — Andrew Ng · Weekly Research Roundup

  • 角色: 执行者 / ML工程师 推荐栈:TLDR AI(每日)+ Ahead of AI(双周)+ Latent Space AINews
  • 订阅量: 大量订阅者
  • 内容风格: Andrew Ng 个人编辑 + DeepLearning.AI 编辑团队 · 适合学习者
  • 建议写入: Newsletter精选 → The Batch → 工程应用 路径

📊 分类标签

LLM微调 QLoRA GRPO Unsloth vLLM SGLang RAG Agentic RAG GraphRAG 多模态RAG LangChain LlamaIndex LLaMA-Factory DeepSeek Qwen MoE Agent Memory Memory-R1 MiniMax-M2 ICLR2026 arXiv2026 Substack CSDN工程化


📁 建议写入路径

草稿文件路径:/shared/research-kb/inbox/jay/2026-07-05-llm-rag-agent-research.md

建议同步建立: - /shared/research-kb/inbox/jay/2026-07-05-arxiv-rag-agent-survey.md(arXiv专项深度摘要) - /shared/research-kb/inbox/jay/2026-07-05-substack-ai-newsletters.md(Newsletter精选摘要)


🔍 后续行动建议

需要精读

  1. MiniMax-M2 arXiv 2605.26494 — MoE Agent 原生设计,Agent Memory 机制,Forge RL 系统
  2. Memory for Autonomous LLM Agents (2603.07670) — Agent Memory 综述,三维分类体系
  3. SSGM Framework (2603.11768) — Memory 治理与安全,Memory-R1 等最新系统

需要审稿

  1. CSDN RAG实战路线图 (2026-06-24) — 17个项目经验,内容详实,需核实代码片段可复现性
  2. CSDN QLoRA微调+Unsloth部署 (AMD社区) — 工程数据需与官方 benchmark 交叉验证

主题页更新建议

  1. LLM微调部署 主题页:纳入 QLoRA+Unsloth 2026 新范式(RTX 5090 + llama.cpp GGUF 导出)
  2. RAG 主题页:更新 Agentic RAG 架构图 + Late Chunking + ColBERTv2 重排序
  3. Agent系统 主题页:新增 Agent Memory 分类(Memory-R1 / HippoRAG / MemoRAG)
  4. 推理框架 主题页:vLLM vs SGLang vs TGI vs TRT-LLM 四象限选型表

⚠️ 本次未写入文件原因

  • 本次检索发现大量高价值内容,已整理为完整草稿(含评价、链接、可复现性评估)
  • GitHub 写入由单独同步任务串行处理
  • 如需正式提交,请触发知识库同步工作流

Jay · 2026-07-05 16:20 (Asia/Shanghai) · 第3次高频检索