知识库草稿 · Jay · 2026-07-05
主题:LLM 工程化 · RAG 实战 · Agent 系统 · 2026 前沿
📌 本次检索范围
- CSDN 高价值技术文章(vLLM / SGLang / LangChain / LlamaIndex / QLoRA / DeepSeek / Qwen)
- arXiv 2026 年 5–6 月最新论文(RAG / Agent / LLM Systems / Multimodal)
- Substack 高质量 Newsletter(Sebastian Raschka · Simon Willison · AI and Academia)
- 主流技术报告(MiniMax-M2 / Nemotron 3 Super / Step-DeepResearch / LiberCoder)
🔬 高价值条目(严格筛选)
【CSDN 高价值】⭐⭐⭐⭐⭐
1. CSDN · 《2026年LLM微调实战指南:QLoRA、GRPO与Unsloth工程落地》
- URL:
https://devpress.csdn.net/amd/6a3b417710ee7a33f2818ef2.html - 作者: 跟着老范学模型(AMD 开发者社区)
- 可信度: 高 · 工程实操 · 2026 年 · 有实测数据
- 核心观点:
- RTX 5090 + vLLM 默认 FP8 精度与 QLoRA bfloat16 训练模型不匹配,导致每次请求 CUDA kernel 重编译,延迟 +1.2s
- 解决方案:
Unsloth save_pretrained_gguf()导出 q4_k_m 格式,llama.cpp--n-gpu-layers 45分载 GPU/CPU,实测延迟从 8.2s 降至 1.7s,显存 6.3GB - 2026 年数据集必须包含"负样本锚点"——安全边界数据,用于划定模型"什么不该做"
- 数据质量检测:用 Qwen3.6-27B 自身做质检,ROUGE-L 方差 >0.3 剔除,噪声率从 12% 压至 1.8%
- 合成数据范式:上传 PDF → 自动解析监管要点 → 生成10种用户提问变体 → 本地模型重写,20分钟产出 2000 条 SFT 数据
- 部署即监控:Ollama
Modelfile嵌入自定义 health check,每5分钟curl探针,接 Grafana 告警 - 工程价值: 直接可复现,命令 / 参数 / 脚本均已提供
- 建议写入:
技术深度 → LLM微调部署 → QLoRA工程化路径
2. CSDN · 《2025年LLM推理实战指南:性能优化、对齐新范式与本地部署》
- URL:
https://bbs.csdn.net/weixin_30099989/article/details/100153155 - 可信度: 高 · 18个月实测 37个模型 · 4类硬件平台 · 6家客户落地
- 核心观点:
- 2025年 RTX 4090(24GB)+ vLLM PagedAttention 已是消费级部署标准
- 显存优化:NF4量化 / AWQ / GPTQ 将70B模型从140GB压至20GB;FlashAttention-2减少KV Cache 30%
- vLLM Chunked Prefill 支持 128K tokens 上下文下显存线性增长(非平方膨胀)
- 2025年量化主流:FP4混合精度 / E4M3浮点格式 / 稀疏化剪枝(MoE Top-2 Gating)
- 推理框架分层:入门 Ollama / 进阶 llama.cpp / 生产 vLLM
- 工程价值: 硬件选型表 + 量化方案对比表 + 框架选型建议
- 建议写入:
技术深度 → LLM推理部署 → 硬件选型与量化路径
3. CSDN · 《RAG实战路线图:从检索到生成的关键环节与调优策略》
- URL:
https://bbs.csdn.net/weixin_33443333/article/details/100159962 - 时间: 2026-06-24 · CC 4.0 BY-SA
- 可信度: 高 · 17个落地项目经验 · 真实排障经历
- 核心观点:
- 检索结果和生成答案像两条平行线——典型问题:语义匹配 vs 关键词召回失调
- PDF解析用
fitz(PyMuPDF)而非 PyPDF2;页眉页脚按位置+内容规则过滤 llama-index-core+llama-index-embeddings-+llama-index-vector-stores-三个包覆盖95%需求,不装全家桶- Chunking 策略:Late Chunking(先 Embedding 后切分)保留全局语义
- 混合检索 = BM25 + Dense Retrieval;重排序用 ColBERTv2
- Strands Agents 框架(LangChain 生态):ToolRegistry + MemoryManager + PromptEngine + WorkflowExecutor 分层设计
- 代码价值: 有可直接运行的 Python 代码片段(PDF解析 / Chunking / RAG 流水线)
- 建议写入:
技术深度 → RAG → 生产级调优路径
4. CSDN · 《推理框架横评:vLLM / TGI / TensorRT-LLM / SGLang 全面对比》
- URL:
https://blog.csdn.net/weixin_37647148/article/details/161914538 - 可信度: 高 · 生产级横评数据
- 核心观点:
- vLLM:通用推理主流,70B模型吞吐量提升24倍,HuggingFace原生支持
- SGLang:面向交互的"编程增强器",对 Agent 场景有专项优化
- TGI:HuggingFace官方,适合追求稳定性
- TRT-LLM:NVIDIA自有生态,生产延迟最低但迁移成本高
- 建议写入:
工具对比 → 推理框架选型路径
5. CSDN · 《Sglang+Vllm+Qwen3.5企业级部署案例实操》
- URL:
https://blog.csdn.net/starzhou/article/details/158290747 - 可信度: 中高 · 企业级实操案例
- 核心观点:
- SGLang 主分支支持 Qwen3.5;安装命令已提供
- 张量并行(Tensor Parallelism)配置方法
- 建议写入:
技术深度 → SGLang部署 → Qwen3.5实操路径
6. CSDN · 《LLaMA-Factory微调(LoRA)Qwen2.5实战》
- URL:
https://adg.csdn.net/696f5083437a6b403369ff4e.html - 可信度: 高 · 有完整环境配置 + 命令 + JSON 数据格式 + 启动脚本
- 核心观点:
- SFT / PT(增量预训练)/ DPO/ORPO 三类微调阶段对比及数据格式说明
- 完整安装命令:
pip install -e .[metrics]+pip install flash-attn --no-build-isolation - 数据格式:Alpaca JSON 格式
{"instruction": "...", "input": "", "output": "..."} - LoRA API 部署:
--template qwen --api-port 8000 - 工程价值: 完整 Windows 脚本 + Linux 命令,可直接复用
- 建议写入:
技术深度 → LLaMA-Factory → Qwen2.5 LoRA实操路径
7. CSDN · 《DeepSeek实战指南:vLLM与SGLang本地部署》
- URL:
https://bbs.csdn.net/weixin_34122532/article/details/100159757 - 可信度: 高 · 全生命周期覆盖
- 核心观点:
- vLLM 部署 DeepSeek-V3:推荐 v0.6.0+ / CUDA ≥12.1 / PyTorch ≥2.3
- 常见陷阱:模型下载不完整导致 tokenizer 加载异常 / 输出乱码
- PagedAttention 机制:逻辑页(Page)切分 KV 缓存,显存碎片率大幅降低
- LoRA 适配器热加载 + 连续批处理(Continuous Batching)
- 建议写入:
技术深度 → DeepSeek部署 → vLLM/SGLang路径
【arXiv 高价值论文】⭐⭐⭐⭐⭐
1. arXiv · MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence
- URL:
https://arxiv.org/abs/2605.26494 - 时间: 2026-05-25(Sebastian Raschka 2026年论文清单收录)
- 作者: MiniMax AI
- 可信度: 高 · 旗舰开源 MoE 系列 · Agent 原生设计
- 核心观点:
- 全注意力(Full Attention)作为反趋势实践:团队测试了滑动窗口注意力变体(类似 Xiaomi MiMo、Gaemma 4 等),发现效率收益不足以抵消生产质量权衡,最终选择全注意力
- 线性/稀疏注意力的生产落地困难:线性注意力在论文中降低长上下文成本有吸引力,但在真实 Agent 生产系统中部署难度大
- Agent 原生数据管道:可验证轨迹大规模构建,覆盖 Agentic Coding 和 Agentic Cowork
- Forge RL 系统:windowed-FIFO 调度 + prefix-tree 合并 + 训练-推理-Agent 解耦
- 旗舰 M2: 229.9B 总参 / 9.8B 激活 / token
- 工程洞察: 2026 年应谨慎追逐稀疏/线性注意力架构,生产稳定性优先于理论效率
- 建议写入:
前沿论文 → LLM架构 → MoE与Agent原生设计路径
2. arXiv · Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers
- URL:
https://arxiv.org/abs/2603.07670 - 可信度: 高 · 2022–2026 年 Agent Memory 系统综述
- 核心观点:
- Agent Memory = Write–Manage–Read 循环,紧耦合感知与行动
- Memory-R1:GRPO 训练 specialized sub-agents 自主决定何时 Add/Update/Delete memory,在5个 benchmark 超越所有 memory-augmented 基线
- Agentic Memory(2026):统一 STM/LTM 策略,memory ops 训练为 RL actions
- HippoRAG:知识图谱上传播激活机制,模拟人类联想记忆,多跳推理性能大幅提升
- MemoRAG:在长上下文中构建全局记忆图谱,支持 Agent 提取结构化洞察
- 三维分类:时间范围 / 表征底座 / 控制策略
- 建议写入:
前沿论文 → Agent系统 → Memory机制路径
3. arXiv · A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
- URL:
https://arxiv.org/abs/2602.03442 - 可信度: 高 · 18页 · 8图 · Agentic RAG 规模化方案
- 核心观点:
- Agentic RAG = 多步决策过程(非静态 retrieve-then-generate pipeline)
- LLM 可规划、编排检索、管理记忆、调用工具、检查中间证据、决定是否需要更多检索
- 2026 年 SoK 论文将 Agentic RAG 定义为碎片化但日益重要的架构
- 建议写入:
前沿论文 → RAG → Agentic RAG路径
4. arXiv · RAG-driven Multi-Agent LLM Framework with Task Decomposition for Beyond 5G Auto-Configuration
- URL:
https://arxiv.org/abs/2606.01222 - 时间: 2026-06 · 已接收至 ICT 2026
- 可信度: 中高 · 工业场景落地(OAI 5G emulator 验证)
- 核心观点:
- 任务分解 + RAG + 闭环自验证 组合框架,配置成功率提升 22.7%
- 语义 RAG 管道确保输出与技术标准和厂商手册对齐
- 配置生成 / 闭环验证 / 网络部署 三层模块化架构
- 建议写入:
前沿论文 → 多Agent系统 → RAG驱动工业自动化路径
5. arXiv · Governing Evolving Memory in LLM Agents: SSGM Framework
- URL:
https://arxiv.org/abs/2603.11768 - 可信度: 高 · 2026 年 Memory 治理框架
- 核心观点:
- 从静态存储 → 自适应自优化 Memory 系统范式转换
- SSGM(Stability and Safety Governed Memory)框架
- Memory-R1:RL (PPO) 驱动 memory ops 自适应更新
- Mem0 / AtomMem:动态固化机制,通过 atomic operations 优化存储结构
- A-MEM:Zettelkasten 方法,记忆作为原子笔记动态建立关联链接
- HippoRAG:传播激活机制,类人联想记忆
- 建议写入:
前沿论文 → Agent系统 → Memory治理与安全路径
6. arXiv · Awesome-Search-Agent-Papers(精选列表)
- URL:
https://github.com/YunjiaXi/Awesome-Search-Agent-Papers - 高价值收录(2026年5–6月):
LatentRAG(2026.5):Latent Reasoning + Retrieval,Agentic RAG 高效化LongSeeker(2026.5):长程搜索 Agent 的弹性上下文编排OpenSeeker-v2(2026.5):高信息密度搜索轨迹训练DynaTree(2026.5):时敏新闻检索的动态 Agentic 检索树AgenticRAG(2026.5):企业知识库 Agentic RetrievalDuMate-DeepResearch(2026.6):递归搜索 + 评分驱动的可审计多 Agent 系统ActiveMem(2026.6):长程 LLM 推理的分布式主动记忆MARDoc(2026.6):多模态长文档 QA 的 Memory-Aware 细化 Agent- 建议写入:
前沿论文 → Agent系统 → 搜索Agent精选列表路径
【Substack 高质量 Newsletter】⭐⭐⭐⭐
1. Ahead of AI — Sebastian Raschka · LLM Architecture & ML Research
- URL:
https://magazine.sebastianraschka.com/ - 订阅量: 189K+
- 内容风格: 30–90分钟深度阅读 · 图表 + 代码 + 原文引用
- 本次重点:
- MiniMax-M2 Series 技术报告解读(见上文 arXiv 部分)
- 2026 年 1–5 月 LLM 论文清单:含 Nemotron 3 Super(混合 Mamba-Transformer MoE)、Mamba-3、Attention Residuals、Gated DeltaNet-2 等架构论文
- 架构趋势:2026 年不只是把 Transformer 做大,混合架构(attention + SSM)成为主流
- Long Context 效率为王:更多 Agent 接入,context 越来越长,Hybrid 架构在长上下文场景更高效
- 可信度: 极高 · 前 Lightning AI 研究员 · 《Build a LLM From Scratch》作者
- 建议写入:
Newsletter精选 → Ahead of AI → 2026架构趋势路径
2. Simon Willison — LLM Predictions 2026
- URL:
https://simonw.substack.com/p/llm-predictions-for-2026-shared-with - 订阅量: 63K+
- 核心观点:
- OpenAI ChatGPT 每周 8000 万活跃用户(2025年10月数据)
- AI 辅助编程改变开发者习惯:以前需要2-4小时,现在30分钟可搞定
- AI 帮助管理层重新开始写代码(Jaana Dogan,Google Principal Engineer)
- 2026预测要点:多模态进展、3D建模、结构化输出格式(深度推理)、AI生成AI代码的递归问题
- 可信度: 高 · 知名独立开发者 · Datasette / SQLite核心贡献者
- 建议写入:
Newsletter精选 → Simon Willison → 2026预测路径
3. AI and Academia — Horizon Scanning
- URL:
https://aiandacademia.substack.com/ - 本次重点:
- Agentic Computing 加速:Moltbook、Claude Agent Teams、Amazon Virtual Teams 等多 Agent 协作系统涌现
- AI 进入硬件:Quark 头显等新形态
- Recursive AI 趋势:OpenAI 和 Anthropic 用 AI 生成 AI 代码,引发业界关注
- 书籍扫描:AI 训练数据需求推动专业内容库商业化
- 可信度: 中高 · 学术视角 · 学术会议 RSS DS+AI Section
- 建议写入:
Newsletter精选 → AI and Academia → AgenticComputing路径
4. The Batch — Andrew Ng · Weekly Research Roundup
- 角色: 执行者 / ML工程师 推荐栈:TLDR AI(每日)+ Ahead of AI(双周)+ Latent Space AINews
- 订阅量: 大量订阅者
- 内容风格: Andrew Ng 个人编辑 + DeepLearning.AI 编辑团队 · 适合学习者
- 建议写入:
Newsletter精选 → The Batch → 工程应用路径
📊 分类标签
LLM微调 QLoRA GRPO Unsloth vLLM SGLang RAG Agentic RAG GraphRAG 多模态RAG LangChain LlamaIndex LLaMA-Factory DeepSeek Qwen MoE Agent Memory Memory-R1 MiniMax-M2 ICLR2026 arXiv2026 Substack CSDN工程化
📁 建议写入路径
草稿文件路径:/shared/research-kb/inbox/jay/2026-07-05-llm-rag-agent-research.md
建议同步建立:
- /shared/research-kb/inbox/jay/2026-07-05-arxiv-rag-agent-survey.md(arXiv专项深度摘要)
- /shared/research-kb/inbox/jay/2026-07-05-substack-ai-newsletters.md(Newsletter精选摘要)
🔍 后续行动建议
需要精读
- MiniMax-M2 arXiv 2605.26494 — MoE Agent 原生设计,Agent Memory 机制,Forge RL 系统
- Memory for Autonomous LLM Agents (2603.07670) — Agent Memory 综述,三维分类体系
- SSGM Framework (2603.11768) — Memory 治理与安全,Memory-R1 等最新系统
需要审稿
- CSDN RAG实战路线图 (2026-06-24) — 17个项目经验,内容详实,需核实代码片段可复现性
- CSDN QLoRA微调+Unsloth部署 (AMD社区) — 工程数据需与官方 benchmark 交叉验证
主题页更新建议
- LLM微调部署 主题页:纳入 QLoRA+Unsloth 2026 新范式(RTX 5090 + llama.cpp GGUF 导出)
- RAG 主题页:更新 Agentic RAG 架构图 + Late Chunking + ColBERTv2 重排序
- Agent系统 主题页:新增 Agent Memory 分类(Memory-R1 / HippoRAG / MemoRAG)
- 推理框架 主题页:vLLM vs SGLang vs TGI vs TRT-LLM 四象限选型表
⚠️ 本次未写入文件原因
- 本次检索发现大量高价值内容,已整理为完整草稿(含评价、链接、可复现性评估)
- GitHub 写入由单独同步任务串行处理
- 如需正式提交,请触发知识库同步工作流
Jay · 2026-07-05 16:20 (Asia/Shanghai) · 第3次高频检索