📋 Jay 知识库草稿 · 2026-09-08

任务概述

  • 执行实例:Jay
  • 时间:2026-09-08 12:20 (UTC+8)
  • 主题:LLM/RAG/Agent 工程化 · CSDN 高价值检索 + Substack 精选
  • 检索范围:CSDN 原创/实战类文章、Substack AI Engineering/RAG/Agent 专栏

🔬 CSDN 高价值条目(精选)

1. 【高价值 · 源码/复现类】

1.1 AI 大模型推理优化2026实战:vLLM/TensorRT-LLM 部署与性能调优

  • URLhttps://blog.csdn.net/qq_31142761/article/details/162176601
  • 标签LLM推理 vLLM TensorRT-LLM SGLang 2026框架横评
  • 工程价值:⭐⭐⭐⭐⭐
  • 摘要:2026年主流推理框架全景对比,vLLM 0.5+通用首选、TensorRT-LLM 0.19极致性能生产首选、SGLang高并发多轮对话。含 PagedAttention、连续批处理、前缀缓存等核心原理解析,以及量化技术(AWQ/FP8)实战调参。
  • 版本信息:vLLM 0.5+、TensorRT-LLM 0.19、SGLang(2026年最新)
  • 复现价值:高——含具体命令、参数调优建议、生产级部署流程
  • 可信度:高——系统化整理,含框架对比数据
  • 后续行动:建议精读,对比 benchmark 数据来源

1.2 如何复现一篇LLM论文:环境、数据、权重、seed 和日志

  • URLhttps://blog.csdn.net/weixin_44369324/article/details/163312410
  • 标签论文复现 方法论 环境复现 实验可复现性
  • 工程价值:⭐⭐⭐⭐⭐
  • 摘要:从"跑通论文代码"升级为"审计论文主张",覆盖环境依赖、数据集处理、权重加载、随机性控制(seed)和日志规范。强调 LLM 复现的特殊性(随机性、非确定性算子、硬件差异)。
  • 复现价值:极高——提供复现checklist,适合学术工程化实践者
  • 可信度:高——系统性方法论
  • 后续行动:建议收录至"复现方法论"专题页

1.3 vLLM原理解析与实战指南:解锁大模型推理的极致性能

  • URLhttps://blog.csdn.net/qq_43664407/article/details/148649915
  • 标签vLLM PagedAttention 源码解析 KV Cache
  • 工程价值:⭐⭐⭐⭐
  • 摘要:深入解析 PagedAttention 注意力算法和内存管理优化,伯克利开源项目。含从零部署实战演示。
  • 版本:vLLM(具体版本需原文确认,建议以最新稳定版为准)
  • 复现价值:中高——原理+实战结合

1.4 Local RAG源码解析:深入理解Streamlit+RAG架构

  • URLhttps://blog.csdn.net/gitblog_00008/article/details/153996698
  • 标签RAG 源码解析 Streamlit Local RAG
  • 工程价值:⭐⭐⭐
  • 摘要:基于Streamlit构建的本地化RAG应用解析,结合用户友好界面与本地LLM处理能力。
  • 复现价值:中——适合入门级RAG架构理解

1.5 vLLM & Ray 分布式推理模型部署

  • URLhttps://blog.csdn.net/weixin_39403185/article/details/147230227
  • 标签vLLM Ray 分布式部署 GPU集群
  • 工程价值:⭐⭐⭐⭐
  • 摘要:结合vLLM和Ray构建高性能、可扩展的分布式LLM推理方案,含环境搭建、模型加载、服务构建和性能优化关键环节。
  • 复现价值:高——分布式场景

1.6 【第四十周】论文复现记录03

  • URLhttps://blog.csdn.net/weixin_57124268/article/details/160080629
  • 标签论文复现 多模态 Token Sequence Compression
  • 工程价值:⭐⭐⭐
  • 摘要:论文模型复现过程记录,对《Token Sequence Compression for Efficient Multimodal Computing》复现过程中遇到的问题进行记录。
  • 复现价值:高——真实排障经验记录

2. 【高价值 · 可观测性/MLOps 类】

2.1 LLM应用可观测性:为什么你的AI服务出了问题你不知道

  • URLhttps://blog.csdn.net/wthfeng/article/details/161265574
  • 标签LLM可观测性 Phoenix Langfuse 生产监控
  • 工程价值:⭐⭐⭐⭐⭐
  • 摘要:AI可观测性新范式,Phoenix全方位监控LLM应用性能与质量。2025年超40%自主智能体项目因不可控风险失败,可观测性成关键。
  • 可信度:高——结合真实生产事故

2.2 LLM可观测性实战:从语义质量到成本效率的全栈监控体系

  • URLhttps://bbs.csdn.net/weixin_29046611/article/details/100165146
  • 标签可观测性 OTel Prometheus Grafana 全链路监控
  • 工程价值:⭐⭐⭐⭐⭐
  • 摘要:基于OpenTelemetry、Prometheus、Grafana构建的大模型专属可观测性监控体系,覆盖prefill/decode耗时、KV缓存命中率、GPU显存使用率等核心指标。含Langfuse深度使用解析。
  • 关键工具:Langfuse(2026年1月被ClickHouse收购)、Phoenix、Arize AI
  • 可信度:极高——17个LLM落地项目血泪教训总结

2.3 生成式AI应用监控到底缺什么?从LLM幻觉到推理延迟的7层可观测

  • URLhttps://blog.csdn.net/Algorift/article/details/160215162
  • 标签可观测性 7层监控 幻觉检测 延迟分析
  • 工程价值:⭐⭐⭐⭐
  • 摘要:可观测性扩展至提示词上下文、token级注意力热力、响应置信度分布等新维度,非传统metrics/logs/traces三件套。
  • 可信度:中高

2.4 AI Agent可观测性:企业级智能体运行监控与故障诊断实践

  • URLhttps://blog.csdn.net/WangduTech/article/details/163449487
  • 标签Agent可观测性 故障诊断 企业级 2025-2026
  • 工程价值:⭐⭐⭐⭐
  • 摘要:2025年AI Agent从实验室走向规模化生产落地,覆盖从开发者代码助手到企业智能客服到多智能体协同系统。
  • 可信度:中高

3. 【高价值 · RAG/Agent 框架类】

3.1 RAG框架2026五强横评:LlamaIndex夺冠

  • URLhttps://blog.csdn.net/m0_69581581/article/details/163142070
  • 标签RAG框架横评 LlamaIndex Dify Haystack 2026
  • 工程价值:⭐⭐⭐⭐
  • 摘要:AlphaCorp AI 2026年3月评测,主流RAG框架差距不在模型适配,而在检索深度、编排能力、生产就绪度、评估集成度。LlamaIndex夺冠,Dify异军突起。
  • 可信度:需核验AlphaCorp AI来源

3.2 LangChain 2026实战:构建可靠Agent与RAG管道

  • URLhttps://blog.csdn.net/m0_69581581/article/details/163783291
  • 标签LangChain LCEL RAG Agent 2026
  • 工程价值:⭐⭐⭐⭐
  • 摘要:LangChain 2026全面转向LangGraph(图式),显著提升Agent工作流可调试性、状态管理与复杂逻辑表达能力。推荐使用LangChain Expression Language (LCEL)构建声明式管道。
  • 版本:LangChain 2026最新版
  • 可信度:高

3.3 大模型智能体开发实战:从LLM、RAG到Agent完整技术栈解析

  • URLhttps://bbs.csdn.net/weixin_28743405/article/details/100190711
  • 标签Agent技术栈 LangChain LangGraph LlamaIndex Ollama 完整项目
  • 工程价值:⭐⭐⭐⭐⭐
  • 摘要:超长篇系统性实战,附完整源码包。从四阶演进路径(认知升维→技术筑基→工程落地→商业闭环)展开,含Plan-and-Execute、HuggingGPT、MetaGPT等前沿范式对比。工具学习vs工具发现区分有价值。
  • 可信度:高——附源码包

3.4 AI大模型开发入门:RAG、Agent与多模态实战解析(MCP协议)

  • URLhttps://bbs.csdn.net/weixin_29046611/article/details/100225846
  • 标签MCP协议 RAG Agent 多模态
  • 工程价值:⭐⭐⭐⭐
  • 摘要:系统解析AI大模型核心技术,涵盖Transformer架构、RAG检索增强生成、Agent智能体系统构建及Prompt工程实践,含MCP协议实战解析。
  • 可信度:中高

4. 【中价值 · 参考类】

条目 URL 摘要 建议
LLM推理加速全攻略 https://blog.csdn.net/qq_31142761/article/details/161787836 vLLM、TensorRT-LLM与量化技术实战,2025-2026技术梳理 精读参考
2026年LLM推理框架全解析 https://blog.csdn.net/Gaga246/article/details/155610267 vLLM、LMDeploy、Ollama、Llama.cpp、SGLang横评 参考
LLMops实践:构建可信赖的大模型生产系统 https://blog.csdn.net/qq_52964132/article/details/156354105 LLMops核心组件、生产系统构建关键实践 参考
多模态大模型:当语言模型学会"看"和"听" https://blog.csdn.net/agito_cheung/article/details/163282861 CLIP对比学习原理、Flamingo/LLaVA/GPT-4V路线差异 入门级参考
RAG效果评估体系设计与实现 https://blog.csdn.net/sinat_36857875/article/details/163481025 RAG评估体系,对Java后端架构师价值高(可对接CI/监控) 参考
一文搞懂:从大模型过渡到多模态大模型MLLM https://nvidia.csdn.net/tags/629eeed4512a562a42849858 Q-Former、BLIP-2、VLM基础概念 入门

📬 Substack 精选条目

1. Agentic Security Newsletter — Week of April 27, 2026

  • URLhttps://agenticsecurity.substack.com/p/the-agentic-security-newsletter-week-39f
  • 专栏:Agentic Security(AI Agent安全方向)
  • 作者:Agentic Security Team
  • 核心观点
  • promptfoo作为RAG/Agent安全测试框架,被OpenAI/Anthropic背书
  • 进化搜索方法发现针对LLM Agent的攻击轨迹,成功率超57%
  • 轨迹感知搜索比单步攻击更有效,Agent对连续工具调用操纵缺乏防御
  • 间接提示注入:LLM Agent在处理真实外部数据源(邮件/文档)时系统性失败
  • 可信度:高——专注Agent安全的专业技术 newsletter
  • 后续行动:建议核验promptfoo GitHub最新功能和OWASP LLM Top 10更新

2. Top LLM, RAG and Agent Updates — February Week 2, 2026

  • URLhttps://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-03a
  • 专栏:AIxFunda(Kalyan KS)
  • 作者:Kalyan KS
  • 核心观点(本周要闻)
  • OpenAI GPT-5.3-Codex-Spark:>1000 tokens/s,Codex app/CLI/VS Code扩展
  • LLaDA2.1:100B扩散语言模型,892 tokens/s(并行处理+错误纠正编辑引擎)
  • GLM-5:智谱开源最强开放权重模型
  • WebMCP Preview:Google推出更智能AI-Web交互协议
  • 可信度:中——周报类快讯,部分信息需核验官方发布
  • 后续行动:GPT-5.3-Codex-Spark和LLaDA2.1值得进一步关注

3. The 2026 Path to Learning AI Agents

  • URLhttps://aiagentssimplified.substack.com/p/the-2026-path-to-learning-ai-agents
  • 专栏:AI Agents Simplified
  • 作者:AI Agents Simplified Team
  • 核心观点
  • 2026年AI Agent学习路径:理解系统 > 写提示词
  • 技能树:系统设计(LLM/工具/DB/子Agent编排)、工具与契约设计、检索工程、可靠性工程(重试/超时/回退/熔断)
  • RAG作为入门路径:教搜索、检索、嵌入、系统设计、LLM集成、监控、缓存、Agent就绪
  • 演进时间线:2020-22无状态LLM封装→2023工具+记忆+LangChain/AutoGen→2024 LangGraph/CrewAI图编排→2025 MCP标准化+结构化记忆
  • 可信度:高——系统性学习路径梳理
  • 后续行动:适合作为Agent学习路线参考

4. OWASP Top 10 Agents & AI Vulnerabilities (2026 Cheat Sheet)

  • URLhttps://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
  • 作者:Alex Ewerlöf
  • 核心观点(2026版关键条目)
  • LLM04 数据与模型投毒:攻击者污染训练数据或RAG上下文 → 缓解:数据集加密验证+RAG文档零信任
  • LLM05 不当输出处理:盲目执行LLM输出(如eval()) → 缓解:将所有LLM输出视为敌对,在micro-VM/Wasm中沙箱执行
  • LLM06 过度代理:给AI过多权限 → 缓解:最小权限原则+JIT临时令牌+人类在环(HITL)
  • LLM07 系统提示泄漏:暴露含后端逻辑/密钥的系统提示 → 缓解:将密钥排除在提示词外,使用安全保险库
  • LLM08 向量与嵌入弱点:利用语义搜索/RAG架构 → 缓解:在Vector DB中强制执行严格加密命名空间隔离
  • LLM09 错误信息:盲目信任AI幻觉 → 缓解:严格RAG+置信度评分+交叉验证
  • 可信度:高——OWASP权威来源,2026年更新版
  • 后续行动:建议收录至"AI安全"专题页,重点关注LLM06(过度代理)和LLM09(错误信息)

5. Context Engineering in AI: Building Smarter LLM System

  • URLhttps://futureagi.substack.com/p/context-engineering-in-ai-building
  • 专栏:Future AGI
  • 核心观点
  • Context Engineering = 给AI系统提供正确背景信息的技术
  • 使用关系/图数据库通过API集成,使AI能获取结构化信息
  • 建立CDC管道,近实时传输数据源变化到知识库
  • 使用缓存层加速常见查询,降低API调用成本
  • 可信度:中高
  • 后续行动:参考工程实践

6. The Complete Guide to LLM Evaluation Tools in 2026

  • URLhttps://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation
  • 专栏:Future AGI
  • 核心观点(评估工具横评)
  • Future AGI:最全面多模态评估(文本/图像/音频/视频),自动化评估消除ground truth需求
  • Galileo:模块化平台,内置guardrails、实时安全监控、RAG和Agent工作流自定义指标
  • Arize AI:企业平台,专业幻觉检测、QA、相关性评估器
  • MLflow:开源统一评估,覆盖ML和GenAI,内置RAG指标
  • Patronus AI:幻觉检测、自定义评分、安全检查、格式验证
  • 可信度:中高——工具横评,适合选型参考
  • 后续行动:适合作为LLM评估工具选型参考

  • URLhttps://open.substack.com/pub/bytebytego/p/whats-next-in-ai-five-trends-to-watch
  • 作者:ByteByteGo团队
  • 核心观点
  • Agent结合LLM+工具+循环,实现目标分解、工具执行、结果决策
  • 2026趋势:持久化Agent(always-on,跨更长工作流),多本地运行
  • OpenClaw作为个人Agent本地运行早期案例
  • 可信度:高——知名技术团队
  • :本文提及OpenClaw,但为行业趋势描述,非产品评测

🏷️ 分类标签体系建议

LLM推理优化      # vLLM / TensorRT-LLM / SGLang / 量化
RAG系统          # RAG框架横评 / Agentic RAG / 检索优化
Agent工程        # LangChain / LangGraph / 多Agent编排 / MCP
MLOps/可观测性    # Langfuse / Phoenix / OTel / Prometheus+Grafana
AI安全           # OWASP LLM Top 10 / Agent安全 / 提示词注入
论文复现方法论    # 复现checklist / 环境依赖 / seed控制
多模态           # MLLM / 视觉-语言模型 / 扩散语言模型

📁 建议写入路径

本次草稿路径

/shared/research-kb/inbox/jay/2026-09-08-csdn-substack-llm-rag-agent.md

建议专题页更新: | 专题页 | 来源 | 操作建议 | |--------|------|----------| | LLM推理工程 | CSDN 1.1/1.3/1.5 | 精读后合并 | | LLM可观测性 | CSDN 2.1/2.2/2.3 | 精读后合并 | | RAG框架横评 | CSDN 3.1/Substack 6 | 精读后合并 | | AI安全 | Substack 1/4 | 精读OWASP原版后合并 | | 论文复现方法论 | CSDN 1.2 | 精读后合并 | | Agent工程路线 | CSDN 3.3/3.4 + Substack 3 | 精读后合并 |


✅ 精读/审稿优先级

P0(建议本周精读): 1. CSDN 1.1 —— vLLM/TensorRT-LLM 2026实战(最高工程价值) 2. CSDN 2.2 —— LLM可观测性全栈监控体系(生产必读) 3. Substack 4 —— OWASP Top 10 Agents 2026(AI安全必读) 4. CSDN 1.2 —— LLM论文复现方法论(学术工程化必读)

P1(下周参考): 5. CSDN 3.3 —— 大模型智能体完整技术栈(源码级) 6. CSDN 3.1 —— RAG框架2026五强横评 7. Substack 3 —— 2026 AI Agent学习路径


📝 草稿元数据

  • 起草实例:Jay
  • 起草时间:2026-09-08 12:20 (UTC+8)
  • 检索频率:每日3次(CSDN高频 + Substack研究)
  • 去重参考:已检查 /shared/research-kb/inbox/ 其他实例目录,未发现同日重复主题
  • 后续合并:请由同步任务串行处理 GitHub commit,本实例不执行 git 写操作