知识库草稿 · Jay · 2026-10-09

主题

RAG / Context Engine / LLM系统 · CSDN高价值技术分享 + arXiv 2026 Agent/RAG新论文 + Substack工程洞察


一、CSDN高价值条目(严格筛选,含源码/命令/版本/复现经验)

🔷 条目 1|从RAG到Context Engine:2025实战总结与2026落地指南

  • URL: https://blog.csdn.net/yangshangwei/article/details/156135340
  • 来源: CSDN博客,CC 4.0 BY-SA版权协议
  • 发布: 2025年(修改时间2026)
  • 核心观点:
  • RAG在2026年从"检索增强生成组件"升级为面向Agent的"上下文引擎(Context Engine)",接管知识库、Memory和Tool Retrieval三类上下文
  • 长上下文/KV Cache/Grep各有限制,无法在成本/灵活性/可治理性上全面替代RAG
  • 现代RAG = 知识入口,KV Cache = 高频问答,Context Engine = 企业Agent中台
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 含端到端Python代码(ingest_document / tree_rag_retrieve / build_kg_from_doc)
  • ✅ 含RAG vs KV Cache vs 长上下文对比表
  • ✅ 含Embedding Model原理(向量等价变换,几何直觉)
  • ✅ 适合作为"Context Engine"主题页的技术骨架
  • 版本/环境: Python, 未指定具体依赖版本(需实地核查)
  • 分类标签: RAG Context Engine LLM应用 2025实战 2026演进
  • 建议写入: /shared/research-kb/review/rag-context-engine-2026.md
  • 是否精读: 是(Context Engine概念框架与代码示例可直接引用)

🔷 条目 2|26.RAG实战:从向量数据库到GraphRAG

  • URL: https://blog.csdn.net/weixin_37647148/article/details/162175188
  • 发布: 2026-06-22(原创)
  • 阅读量: 297
  • 核心观点:
  • 完整RAG技术栈对比:Embedding选型(BGE-M3/OpenAI/Voyage 3)、向量库横评(Milvus/Qdrant/Chroma/Pinecone)、Rerank模型
  • 2023朴素RAG → 2026 Agentic RAG演进路径,含多跳检索+自反思
  • PDF解析工具对比:LlamaParse(商业) vs MinerU(国产开源)
  • GraphRAG / Adaptive RAG / Self-RAG进阶方案横向对比
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 含完整架构图(用户问题→embedding→检索→rerank→LLM生成)
  • ✅ 含Milvus实战代码(Python)
  • ✅ 含Embedding模型选型对比表(BGE-M3为中文首选)
  • ✅ 含切片策略代码(RecursiveCharacterTextSplitter / HierarchicalNodeParser)
  • ✅ 含生产级RAG推荐栈:LlamaIndex/LangChain + Milvus + BGE + vLLM
  • 分类标签: RAG GraphRAG 向量数据库 Milvus BGE 2026 工程实践
  • 建议写入: /shared/research-kb/review/rag-engineering-2026.md
  • 是否精读: 是(向量库选型表+代码可直接用于主题页更新)

🔷 条目 3|CUDA Kernel优化原理与SGLang中的实现机制

  • URL: https://blog.csdn.net/daydayup858/article/details/153785678
  • 发布: 2026-03-11(原创)
  • 阅读量: 594
  • 核心观点:
  • CUDA Kernel级别优化原理(未详细展开,需精读)
  • SGLang中Page Attention机制源码解析
  • 分页缓存设计:(num_pages, page_size, num_head_kv, head_dim)
  • 内存对齐检查代码:alignment = 16 // q.element_size()
  • 断言验证:分页表类型检查、多头注意力分组检查、设备检查
  • 性能数据:vLLM QPS=18.7(Llama2-13B),SGLang首token延迟降低40%
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 源码级assert断言示例(可作为CUDA Kernel开发参考)
  • ✅ 含性能对比数据
  • ✅ SGLang/vLLM推理优化主题核心文献
  • 版本/环境: Python + CUDA,未标注具体版本
  • 分类标签: CUDA SGLang 推理优化 Kernel vLLM PageAttention 2026
  • 建议写入: /shared/research-kb/review/llm-inference-optimization-2026.md
  • 是否精读: 是(推理优化主题页核心条目,源码级)

🔷 条目 4|大模型技术全景:从LLM到RAG的实战解析

  • URL: https://bbs.csdn.net/weixin_32377497/article/details/100226833
  • 发布: 2026-07-25(修改)
  • 核心观点:
  • 医疗场景:CT/医学本体+动态知识图谱+RAG,支持循证等级标注回答
  • 金融场景:"四轮驱动"混合检索架构(向量检索+关键词检索+SQL检索+规则引擎)
  • 效果数据:法条引用准确率 71% → 93%,响应速度 8.2s → 3.5s
  • 踩坑实录:PDF水印误识别(图像预处理解决方案)、法规时效性(每周自动检测)、幻觉控制(强制标注法条编号)
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 含量化评测数据(医疗/金融两个场景)
  • ✅ 含生产级踩坑记录(PDF解析/幻觉控制)
  • ✅ 混合检索架构值得参考
  • 分类标签: RAG 金融RAG 医疗RAG 混合检索 评测 踩坑实录
  • 建议写入: /shared/research-kb/review/rag-domain-applications-2026.md
  • 是否精读: 建议(场景化RAG落地参考,踩坑部分值得摘录)

🔷 条目 5|LLM大模型系统学习指南与实战解析

  • URL: https://bbs.csdn.net/weixin_42530570/article/details/100218836
  • 发布: 2026-07-22(修改)
  • 核心观点:
  • 三层架构梳理:基础架构层(计算图/自动微分/分布式训练)→ 模型工程层(PEFT/预训练数据流水线)→ 应用开发层(RAG/Agent/评估)
  • Ollama命令示例:模型管理基础操作
  • 技术栈:Flash Attention、QLoRA、vLLM、PagedAttention、量化部署
  • 强调"小模型+好工具+强工程"实践范式
  • 工程价值: ⭐⭐⭐⭐
  • ✅ 含Ollama命令示例
  • ✅ 含LLM技术栈全景图(三层结构可参考)
  • ⚠️ 文章为学习路径类,非实操深度文章
  • 分类标签: LLM系统 学习路径 Ollama vLLM PEFT 2026
  • 建议写入: /shared/research-kb/review/llm-engineering-learning-path-2026.md
  • 是否精读: 参考(三层架构框架可作为主题页目录参考)

🔷 条目 6|纯C语言从零实现GPT-2:Transformer底层原理+逐模块代码

  • URL: https://blog.csdn.net/chen1415886044/article/details/164404678
  • 核心观点:
  • 纯C语言实现GPT-2,零依赖,作为逐步引入CUDA优化的基准代码
  • 逐模块实现Transformer:Attention/FFN/LayerNorm/残差连接
  • 教学向,目标是"啃透Transformer底层原理"
  • 工程价值: ⭐⭐⭐⭐⭐
  • ✅ 源码级实现(纯C,无框架依赖)
  • ✅ 可复现,可作为CUDA优化前基准
  • ✅ 注意力机制/QKV矩阵几何意义/RoPE旋转编码可配套学习
  • 分类标签: Transformer GPT-2 C语言 原理 CUDA优化基准 教学
  • 建议写入: /shared/research-kb/review/transformer-implementation-c.md
  • 是否精读: 建议(原理类,适合作为Transformer源码学习伴侣)

🔷 条目 7|2025最火AI工程实战库:从LLM到RAG全栈项目代码解析

  • URL: https://blog.csdn.net/gitblog_01148/article/details/151070908
  • 发布: 2026-01-30(原创),2026-03-19最后推荐
  • 核心观点: ai-engineering-hub项目解析,含database-memory-agent(MongoDB Atlas+RAG+Voyage AI)、multiplatform_deep_researcher(MCP多智能体)等实战项目
  • 工程价值: ⭐⭐⭐(CC 4.0,项目汇总性质,可作为索引参考)
  • 分类标签: AI工程 开源项目 RAG Multi-Agent MCP
  • 建议写入: /shared/research-kb/review/ai-engineering-hub-2026.md
  • 是否精读: 快速浏览(项目索引价值)

二、arXiv 2026年新论文(Agent/RAG方向)

📄 Retrieval-Augmented LLM Agents: Learning to Learn from Experience

  • URL: https://arxiv.org/abs/2603.18272
  • 会议: EMNLP 2026 - Main Conference
  • 作者: EMNLP 2026 accepted paper
  • 核心观点: LLM Agent通过RAG从经验中学习,检索增强的自主Agent框架
  • 可信度: 高(顶会接受)
  • 分类标签: arXiv RAG LLM Agent EMNLP2026
  • 后续行动: 需精读全文,核验实验设置和Baseline对比

📄 Fine-tuning with RAG for Improving LLM Learning of New Skills

  • URL: https://arxiv.org/abs/2510.01375
  • 会议: ICLR 2026(审稿中)
  • 核心观点: 将RAG与Fine-tuning结合,提升LLM学习新技能的能力
  • 可信度: 待定(审稿中)
  • 分类标签: arXiv RAG Fine-tuning ICLR2026
  • 后续行动: 跟踪审稿结果,核验实验设计

📄 AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training(2026.7)

  • URL: arXiv(从Awesome-Search-Agent-Papers列表引用)
  • 核心观点: 两阶段训练的Agentic LLM-RAG框架,用于知识图谱事实验证
  • 可信度: 待核验
  • 分类标签: arXiv Agentic RAG 知识图谱 2026

📄 ECHO: Prune to act, trace to learn with selective turn memory(2026.6)

  • URL: arXiv
  • 核心观点: 选择性记忆管理,用于Agentic RL中的动作剪枝
  • 分类标签: arXiv Agent RL Memory 2026

📄 GraphPO: Graph-based Policy Optimization for Reasoning Models(2026.6)

  • URL: arXiv
  • 核心观点: 图结构策略优化,用于推理模型
  • 分类标签: arXiv Graph RL Reasoning 2026

📄 CIGPO: Contextual Information-Gain Policy Optimization(2026.7)

  • 核心观点: 信息增益策略优化,多轮证据阅读Agent
  • 分类标签: arXiv Agent Policy Optimization 2026

📄 PATS: Policy-Aware Training Scaffolding for Agentic RL(2026.7)

  • 分类标签: arXiv Agentic RL Training 2026

📄 AREX: Towards a Recursively Self-Improving Agent(2026.7)

  • 分类标签: arXiv Self-Improving Agent Deep Research 2026

三、Substack高价值条目

📧 The AI Agents Stack: LLM to Production(2026 Edition)

  • URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者/专栏: The AI Engineers(业界工程技术博客)
  • 发布: 2026年
  • 核心观点: 1. 2024→2026三大变化:MCP标准化工具连接层、推理模型改变单步vs多步Agent权衡、Memory成为一等公民架构原语 2. Memory三层分级(不再只是向量库+RAG):短时/长时/ episodic 3. Context Engineering替代Prompt Engineering:不是写更好提示,而是设计每次调用时Agent看到什么信息 4. Agent Guardrails新范式:在工具执行层授权,而非输出层过滤("guardrails before action"模式) 5. OWASP MCP Top 10(beta)发布,首个工具连接Agent安全清单 6. 6层技术栈框架:LLM → Memory → Tools → Orchestration → Evaluation → Guardrails
  • 可信度: 高(业界工程化视角,与本文RAG条目高度互补)
  • 工程价值: ⭐⭐⭐⭐⭐
  • 后续行动: 结合条目1(Context Engine)补充主题页;Memory三层分级值得单独条目
  • 分类标签: Substack AI Agent Memory MCP Guardrails Context Engineering 2026

📧 AIxFunda · Top LLM, RAG and Agent Updates(March Week 1, 2026)

  • URL: https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-5f9
  • 作者: Kalyan KS
  • 核心观点:
  • Olmo Hybrid 7B:Gated DeltaNet+Attention 3:1混合,节省75%注意力计算,512 GPU训练
  • Sarvam-30B/105B:印度训练,Apache 2.0,22种印度语言,MoE架构
  • GPT-5.3/5.4发布,Claude登顶App下载榜,ChatGPT卸载率+295%
  • Codex Desktop:Windows原生沙盒,OS级工具调用控制
  • 可信度: 中(资讯汇编类)
  • 后续行动: 存档,不做深度引用
  • 分类标签: Substack AI资讯 模型发布 2026

📧 Future AGI · The Complete Guide to LLM Evaluation Tools in 2026

  • URL: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation
  • 核心观点: RAG评估工具横评
  • Future AGI:多模态评估,自动评估无需ground truth
  • Galileo:RAG/Agentic流程评估,实时安全监控
  • Arize AI:企业级,幻觉检测,RAG工作流可观测性
  • MLflow:开源,统一评估
  • Patronus AI:幻觉检测/自定义评分/安全检查
  • 可信度: 中(商业平台视角)
  • 后续行动: 可作为RAG评估主题页补充,与条目2(Ragas)配合
  • 分类标签: Substack RAG评估 工具横评 2026

📧 The Strategy Stack · AI Agents for Strategists: Value Stack & Deployment(2026)

  • URL: https://thestrategystack.substack.com/p/the-stack-to-enlightnment-on-ai-agents
  • 核心观点:
  • JPMorgan LLM Suite:20万员工部署,超级用户培训策略
  • Mayo Clinic急诊室效率提升案例
  • 多智能体自动驾驶系统
  • DeepMind+BioNTech AI实验助手
  • 可信度: 中低(行业案例汇编,部分描述待核验)
  • 后续行动: 案例仅供参考,不做技术细节引用
  • 分类标签: Substack AI Agent 行业案例 金融 医疗 2026

四、主题分类与标签体系

主题 核心标签 主要条目
RAG工程实践 RAG 向量库 Milvus BGE 条目1,2,4
LLM系统/部署 LLM系统 vLLM Ollama 推理优化 条目3,5
Transformer原理 Transformer GPT-2 C语言 CUDA 条目6
AI Agent架构 Agent Memory Context Engineering MCP Substack-THEAI
RAG评估 RAG评估 工具横评 Substack-FutureAGI
模型发布动态 模型发布 AI资讯 Substack-AIxFunda

五、本次写入建议

建议写入文件(待同步任务合并至 /shared/research-kb/review/):

  1. /shared/research-kb/inbox/jay/2026-10-09-rag-context-engine-csdn.md ← 本文件本体
  2. 新建草稿: - 2026-10-09-rag-engineering-csdn-highvalue.md — 条目2深度摘要 - 2026-10-09-agent-stack-2026-substack.md — Substack-THEAI深度摘要 - 2026-10-09-arxiv-agent-rag-2026.md — arXiv论文索引

本次操作:仅写入当前草稿文件,不执行GitHub写入。


六、后续行动建议

优先级 行动 关联条目
🔴 高 精读条目2(RAG实战:从向量数据库到GraphRAG),更新RAG主题页 条目2
🔴 高 精读条目3(CUDA Kernel/SGLang),更新推理优化主题页 条目3
🔴 高 精读arXiv EMNLP 2026 RAG Agent论文(2603.18272) arXiv#1
🟡 中 结合Substack-THEAI补充Agent Stack主题页(6层框架+Memory三级) Substack#1
🟡 中 精读条目6(GPT-2纯C实现),作为原理学习材料归档 条目6
🟢 低 条目7作为AI工程开源项目索引,暂存待用 条目7

草稿完成时间:2026-10-09 12:20 UTC+8 / 04:20 UTC 实例:Jay · 知识库高频运营任务 · 每日第3次执行