知识库草稿 · Jay · 2026-10-09
主题
RAG / Context Engine / LLM系统 · CSDN高价值技术分享 + arXiv 2026 Agent/RAG新论文 + Substack工程洞察
一、CSDN高价值条目(严格筛选,含源码/命令/版本/复现经验)
🔷 条目 1|从RAG到Context Engine:2025实战总结与2026落地指南
- URL: https://blog.csdn.net/yangshangwei/article/details/156135340
- 来源: CSDN博客,CC 4.0 BY-SA版权协议
- 发布: 2025年(修改时间2026)
- 核心观点:
- RAG在2026年从"检索增强生成组件"升级为面向Agent的"上下文引擎(Context Engine)",接管知识库、Memory和Tool Retrieval三类上下文
- 长上下文/KV Cache/Grep各有限制,无法在成本/灵活性/可治理性上全面替代RAG
- 现代RAG = 知识入口,KV Cache = 高频问答,Context Engine = 企业Agent中台
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 含端到端Python代码(ingest_document / tree_rag_retrieve / build_kg_from_doc)
- ✅ 含RAG vs KV Cache vs 长上下文对比表
- ✅ 含Embedding Model原理(向量等价变换,几何直觉)
- ✅ 适合作为"Context Engine"主题页的技术骨架
- 版本/环境: Python, 未指定具体依赖版本(需实地核查)
- 分类标签:
RAGContext EngineLLM应用2025实战2026演进 - 建议写入:
/shared/research-kb/review/rag-context-engine-2026.md - 是否精读: 是(Context Engine概念框架与代码示例可直接引用)
🔷 条目 2|26.RAG实战:从向量数据库到GraphRAG
- URL: https://blog.csdn.net/weixin_37647148/article/details/162175188
- 发布: 2026-06-22(原创)
- 阅读量: 297
- 核心观点:
- 完整RAG技术栈对比:Embedding选型(BGE-M3/OpenAI/Voyage 3)、向量库横评(Milvus/Qdrant/Chroma/Pinecone)、Rerank模型
- 2023朴素RAG → 2026 Agentic RAG演进路径,含多跳检索+自反思
- PDF解析工具对比:LlamaParse(商业) vs MinerU(国产开源)
- GraphRAG / Adaptive RAG / Self-RAG进阶方案横向对比
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 含完整架构图(用户问题→embedding→检索→rerank→LLM生成)
- ✅ 含Milvus实战代码(Python)
- ✅ 含Embedding模型选型对比表(BGE-M3为中文首选)
- ✅ 含切片策略代码(RecursiveCharacterTextSplitter / HierarchicalNodeParser)
- ✅ 含生产级RAG推荐栈:LlamaIndex/LangChain + Milvus + BGE + vLLM
- 分类标签:
RAGGraphRAG向量数据库MilvusBGE2026工程实践 - 建议写入:
/shared/research-kb/review/rag-engineering-2026.md - 是否精读: 是(向量库选型表+代码可直接用于主题页更新)
🔷 条目 3|CUDA Kernel优化原理与SGLang中的实现机制
- URL: https://blog.csdn.net/daydayup858/article/details/153785678
- 发布: 2026-03-11(原创)
- 阅读量: 594
- 核心观点:
- CUDA Kernel级别优化原理(未详细展开,需精读)
- SGLang中Page Attention机制源码解析
- 分页缓存设计:(num_pages, page_size, num_head_kv, head_dim)
- 内存对齐检查代码:alignment = 16 // q.element_size()
- 断言验证:分页表类型检查、多头注意力分组检查、设备检查
- 性能数据:vLLM QPS=18.7(Llama2-13B),SGLang首token延迟降低40%
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 源码级assert断言示例(可作为CUDA Kernel开发参考)
- ✅ 含性能对比数据
- ✅ SGLang/vLLM推理优化主题核心文献
- 版本/环境: Python + CUDA,未标注具体版本
- 分类标签:
CUDASGLang推理优化KernelvLLMPageAttention2026 - 建议写入:
/shared/research-kb/review/llm-inference-optimization-2026.md - 是否精读: 是(推理优化主题页核心条目,源码级)
🔷 条目 4|大模型技术全景:从LLM到RAG的实战解析
- URL: https://bbs.csdn.net/weixin_32377497/article/details/100226833
- 发布: 2026-07-25(修改)
- 核心观点:
- 医疗场景:CT/医学本体+动态知识图谱+RAG,支持循证等级标注回答
- 金融场景:"四轮驱动"混合检索架构(向量检索+关键词检索+SQL检索+规则引擎)
- 效果数据:法条引用准确率 71% → 93%,响应速度 8.2s → 3.5s
- 踩坑实录:PDF水印误识别(图像预处理解决方案)、法规时效性(每周自动检测)、幻觉控制(强制标注法条编号)
- 工程价值: ⭐⭐⭐⭐
- ✅ 含量化评测数据(医疗/金融两个场景)
- ✅ 含生产级踩坑记录(PDF解析/幻觉控制)
- ✅ 混合检索架构值得参考
- 分类标签:
RAG金融RAG医疗RAG混合检索评测踩坑实录 - 建议写入:
/shared/research-kb/review/rag-domain-applications-2026.md - 是否精读: 建议(场景化RAG落地参考,踩坑部分值得摘录)
🔷 条目 5|LLM大模型系统学习指南与实战解析
- URL: https://bbs.csdn.net/weixin_42530570/article/details/100218836
- 发布: 2026-07-22(修改)
- 核心观点:
- 三层架构梳理:基础架构层(计算图/自动微分/分布式训练)→ 模型工程层(PEFT/预训练数据流水线)→ 应用开发层(RAG/Agent/评估)
- Ollama命令示例:模型管理基础操作
- 技术栈:Flash Attention、QLoRA、vLLM、PagedAttention、量化部署
- 强调"小模型+好工具+强工程"实践范式
- 工程价值: ⭐⭐⭐⭐
- ✅ 含Ollama命令示例
- ✅ 含LLM技术栈全景图(三层结构可参考)
- ⚠️ 文章为学习路径类,非实操深度文章
- 分类标签:
LLM系统学习路径OllamavLLMPEFT2026 - 建议写入:
/shared/research-kb/review/llm-engineering-learning-path-2026.md - 是否精读: 参考(三层架构框架可作为主题页目录参考)
🔷 条目 6|纯C语言从零实现GPT-2:Transformer底层原理+逐模块代码
- URL: https://blog.csdn.net/chen1415886044/article/details/164404678
- 核心观点:
- 纯C语言实现GPT-2,零依赖,作为逐步引入CUDA优化的基准代码
- 逐模块实现Transformer:Attention/FFN/LayerNorm/残差连接
- 教学向,目标是"啃透Transformer底层原理"
- 工程价值: ⭐⭐⭐⭐⭐
- ✅ 源码级实现(纯C,无框架依赖)
- ✅ 可复现,可作为CUDA优化前基准
- ✅ 注意力机制/QKV矩阵几何意义/RoPE旋转编码可配套学习
- 分类标签:
TransformerGPT-2C语言原理CUDA优化基准教学 - 建议写入:
/shared/research-kb/review/transformer-implementation-c.md - 是否精读: 建议(原理类,适合作为Transformer源码学习伴侣)
🔷 条目 7|2025最火AI工程实战库:从LLM到RAG全栈项目代码解析
- URL: https://blog.csdn.net/gitblog_01148/article/details/151070908
- 发布: 2026-01-30(原创),2026-03-19最后推荐
- 核心观点: ai-engineering-hub项目解析,含database-memory-agent(MongoDB Atlas+RAG+Voyage AI)、multiplatform_deep_researcher(MCP多智能体)等实战项目
- 工程价值: ⭐⭐⭐(CC 4.0,项目汇总性质,可作为索引参考)
- 分类标签:
AI工程开源项目RAGMulti-AgentMCP - 建议写入:
/shared/research-kb/review/ai-engineering-hub-2026.md - 是否精读: 快速浏览(项目索引价值)
二、arXiv 2026年新论文(Agent/RAG方向)
📄 Retrieval-Augmented LLM Agents: Learning to Learn from Experience
- URL: https://arxiv.org/abs/2603.18272
- 会议: EMNLP 2026 - Main Conference
- 作者: EMNLP 2026 accepted paper
- 核心观点: LLM Agent通过RAG从经验中学习,检索增强的自主Agent框架
- 可信度: 高(顶会接受)
- 分类标签:
arXivRAGLLM AgentEMNLP2026 - 后续行动: 需精读全文,核验实验设置和Baseline对比
📄 Fine-tuning with RAG for Improving LLM Learning of New Skills
- URL: https://arxiv.org/abs/2510.01375
- 会议: ICLR 2026(审稿中)
- 核心观点: 将RAG与Fine-tuning结合,提升LLM学习新技能的能力
- 可信度: 待定(审稿中)
- 分类标签:
arXivRAGFine-tuningICLR2026 - 后续行动: 跟踪审稿结果,核验实验设计
📄 AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training(2026.7)
- URL: arXiv(从Awesome-Search-Agent-Papers列表引用)
- 核心观点: 两阶段训练的Agentic LLM-RAG框架,用于知识图谱事实验证
- 可信度: 待核验
- 分类标签:
arXivAgentic RAG知识图谱2026
📄 ECHO: Prune to act, trace to learn with selective turn memory(2026.6)
- URL: arXiv
- 核心观点: 选择性记忆管理,用于Agentic RL中的动作剪枝
- 分类标签:
arXivAgentRLMemory2026
📄 GraphPO: Graph-based Policy Optimization for Reasoning Models(2026.6)
- URL: arXiv
- 核心观点: 图结构策略优化,用于推理模型
- 分类标签:
arXivGraphRLReasoning2026
📄 CIGPO: Contextual Information-Gain Policy Optimization(2026.7)
- 核心观点: 信息增益策略优化,多轮证据阅读Agent
- 分类标签:
arXivAgentPolicy Optimization2026
📄 PATS: Policy-Aware Training Scaffolding for Agentic RL(2026.7)
- 分类标签:
arXivAgentic RLTraining2026
📄 AREX: Towards a Recursively Self-Improving Agent(2026.7)
- 分类标签:
arXivSelf-Improving AgentDeep Research2026
三、Substack高价值条目
📧 The AI Agents Stack: LLM to Production(2026 Edition)
- URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 作者/专栏: The AI Engineers(业界工程技术博客)
- 发布: 2026年
- 核心观点: 1. 2024→2026三大变化:MCP标准化工具连接层、推理模型改变单步vs多步Agent权衡、Memory成为一等公民架构原语 2. Memory三层分级(不再只是向量库+RAG):短时/长时/ episodic 3. Context Engineering替代Prompt Engineering:不是写更好提示,而是设计每次调用时Agent看到什么信息 4. Agent Guardrails新范式:在工具执行层授权,而非输出层过滤("guardrails before action"模式) 5. OWASP MCP Top 10(beta)发布,首个工具连接Agent安全清单 6. 6层技术栈框架:LLM → Memory → Tools → Orchestration → Evaluation → Guardrails
- 可信度: 高(业界工程化视角,与本文RAG条目高度互补)
- 工程价值: ⭐⭐⭐⭐⭐
- 后续行动: 结合条目1(Context Engine)补充主题页;Memory三层分级值得单独条目
- 分类标签:
SubstackAI AgentMemoryMCPGuardrailsContext Engineering2026
📧 AIxFunda · Top LLM, RAG and Agent Updates(March Week 1, 2026)
- URL: https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-5f9
- 作者: Kalyan KS
- 核心观点:
- Olmo Hybrid 7B:Gated DeltaNet+Attention 3:1混合,节省75%注意力计算,512 GPU训练
- Sarvam-30B/105B:印度训练,Apache 2.0,22种印度语言,MoE架构
- GPT-5.3/5.4发布,Claude登顶App下载榜,ChatGPT卸载率+295%
- Codex Desktop:Windows原生沙盒,OS级工具调用控制
- 可信度: 中(资讯汇编类)
- 后续行动: 存档,不做深度引用
- 分类标签:
SubstackAI资讯模型发布2026
📧 Future AGI · The Complete Guide to LLM Evaluation Tools in 2026
- URL: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation
- 核心观点: RAG评估工具横评
- Future AGI:多模态评估,自动评估无需ground truth
- Galileo:RAG/Agentic流程评估,实时安全监控
- Arize AI:企业级,幻觉检测,RAG工作流可观测性
- MLflow:开源,统一评估
- Patronus AI:幻觉检测/自定义评分/安全检查
- 可信度: 中(商业平台视角)
- 后续行动: 可作为RAG评估主题页补充,与条目2(Ragas)配合
- 分类标签:
SubstackRAG评估工具横评2026
📧 The Strategy Stack · AI Agents for Strategists: Value Stack & Deployment(2026)
- URL: https://thestrategystack.substack.com/p/the-stack-to-enlightnment-on-ai-agents
- 核心观点:
- JPMorgan LLM Suite:20万员工部署,超级用户培训策略
- Mayo Clinic急诊室效率提升案例
- 多智能体自动驾驶系统
- DeepMind+BioNTech AI实验助手
- 可信度: 中低(行业案例汇编,部分描述待核验)
- 后续行动: 案例仅供参考,不做技术细节引用
- 分类标签:
SubstackAI Agent行业案例金融医疗2026
四、主题分类与标签体系
| 主题 | 核心标签 | 主要条目 |
|---|---|---|
| RAG工程实践 | RAG 向量库 Milvus BGE |
条目1,2,4 |
| LLM系统/部署 | LLM系统 vLLM Ollama 推理优化 |
条目3,5 |
| Transformer原理 | Transformer GPT-2 C语言 CUDA |
条目6 |
| AI Agent架构 | Agent Memory Context Engineering MCP |
Substack-THEAI |
| RAG评估 | RAG评估 工具横评 |
Substack-FutureAGI |
| 模型发布动态 | 模型发布 AI资讯 |
Substack-AIxFunda |
五、本次写入建议
建议写入文件(待同步任务合并至 /shared/research-kb/review/):
/shared/research-kb/inbox/jay/2026-10-09-rag-context-engine-csdn.md← 本文件本体- 新建草稿:
-
2026-10-09-rag-engineering-csdn-highvalue.md— 条目2深度摘要 -2026-10-09-agent-stack-2026-substack.md— Substack-THEAI深度摘要 -2026-10-09-arxiv-agent-rag-2026.md— arXiv论文索引
本次操作:仅写入当前草稿文件,不执行GitHub写入。
六、后续行动建议
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| 🔴 高 | 精读条目2(RAG实战:从向量数据库到GraphRAG),更新RAG主题页 | 条目2 |
| 🔴 高 | 精读条目3(CUDA Kernel/SGLang),更新推理优化主题页 | 条目3 |
| 🔴 高 | 精读arXiv EMNLP 2026 RAG Agent论文(2603.18272) | arXiv#1 |
| 🟡 中 | 结合Substack-THEAI补充Agent Stack主题页(6层框架+Memory三级) | Substack#1 |
| 🟡 中 | 精读条目6(GPT-2纯C实现),作为原理学习材料归档 | 条目6 |
| 🟢 低 | 条目7作为AI工程开源项目索引,暂存待用 | 条目7 |
草稿完成时间:2026-10-09 12:20 UTC+8 / 04:20 UTC 实例:Jay · 知识库高频运营任务 · 每日第3次执行