📋 Jay 知识库草稿 · 2026-09-08
任务概述
- 执行实例:Jay
- 时间:2026-09-08 12:20 (UTC+8)
- 主题:LLM/RAG/Agent 工程化 · CSDN 高价值检索 + Substack 精选
- 检索范围:CSDN 原创/实战类文章、Substack AI Engineering/RAG/Agent 专栏
🔬 CSDN 高价值条目(精选)
1. 【高价值 · 源码/复现类】
1.1 AI 大模型推理优化2026实战:vLLM/TensorRT-LLM 部署与性能调优
- URL:
https://blog.csdn.net/qq_31142761/article/details/162176601 - 标签:
LLM推理vLLMTensorRT-LLMSGLang2026框架横评 - 工程价值:⭐⭐⭐⭐⭐
- 摘要:2026年主流推理框架全景对比,vLLM 0.5+通用首选、TensorRT-LLM 0.19极致性能生产首选、SGLang高并发多轮对话。含 PagedAttention、连续批处理、前缀缓存等核心原理解析,以及量化技术(AWQ/FP8)实战调参。
- 版本信息:vLLM 0.5+、TensorRT-LLM 0.19、SGLang(2026年最新)
- 复现价值:高——含具体命令、参数调优建议、生产级部署流程
- 可信度:高——系统化整理,含框架对比数据
- 后续行动:建议精读,对比 benchmark 数据来源
1.2 如何复现一篇LLM论文:环境、数据、权重、seed 和日志
- URL:
https://blog.csdn.net/weixin_44369324/article/details/163312410 - 标签:
论文复现方法论环境复现实验可复现性 - 工程价值:⭐⭐⭐⭐⭐
- 摘要:从"跑通论文代码"升级为"审计论文主张",覆盖环境依赖、数据集处理、权重加载、随机性控制(seed)和日志规范。强调 LLM 复现的特殊性(随机性、非确定性算子、硬件差异)。
- 复现价值:极高——提供复现checklist,适合学术工程化实践者
- 可信度:高——系统性方法论
- 后续行动:建议收录至"复现方法论"专题页
1.3 vLLM原理解析与实战指南:解锁大模型推理的极致性能
- URL:
https://blog.csdn.net/qq_43664407/article/details/148649915 - 标签:
vLLMPagedAttention源码解析KV Cache - 工程价值:⭐⭐⭐⭐
- 摘要:深入解析 PagedAttention 注意力算法和内存管理优化,伯克利开源项目。含从零部署实战演示。
- 版本:vLLM(具体版本需原文确认,建议以最新稳定版为准)
- 复现价值:中高——原理+实战结合
1.4 Local RAG源码解析:深入理解Streamlit+RAG架构
- URL:
https://blog.csdn.net/gitblog_00008/article/details/153996698 - 标签:
RAG源码解析StreamlitLocal RAG - 工程价值:⭐⭐⭐
- 摘要:基于Streamlit构建的本地化RAG应用解析,结合用户友好界面与本地LLM处理能力。
- 复现价值:中——适合入门级RAG架构理解
1.5 vLLM & Ray 分布式推理模型部署
- URL:
https://blog.csdn.net/weixin_39403185/article/details/147230227 - 标签:
vLLMRay分布式部署GPU集群 - 工程价值:⭐⭐⭐⭐
- 摘要:结合vLLM和Ray构建高性能、可扩展的分布式LLM推理方案,含环境搭建、模型加载、服务构建和性能优化关键环节。
- 复现价值:高——分布式场景
1.6 【第四十周】论文复现记录03
- URL:
https://blog.csdn.net/weixin_57124268/article/details/160080629 - 标签:
论文复现多模态Token Sequence Compression - 工程价值:⭐⭐⭐
- 摘要:论文模型复现过程记录,对《Token Sequence Compression for Efficient Multimodal Computing》复现过程中遇到的问题进行记录。
- 复现价值:高——真实排障经验记录
2. 【高价值 · 可观测性/MLOps 类】
2.1 LLM应用可观测性:为什么你的AI服务出了问题你不知道
- URL:
https://blog.csdn.net/wthfeng/article/details/161265574 - 标签:
LLM可观测性PhoenixLangfuse生产监控 - 工程价值:⭐⭐⭐⭐⭐
- 摘要:AI可观测性新范式,Phoenix全方位监控LLM应用性能与质量。2025年超40%自主智能体项目因不可控风险失败,可观测性成关键。
- 可信度:高——结合真实生产事故
2.2 LLM可观测性实战:从语义质量到成本效率的全栈监控体系
- URL:
https://bbs.csdn.net/weixin_29046611/article/details/100165146 - 标签:
可观测性OTelPrometheusGrafana全链路监控 - 工程价值:⭐⭐⭐⭐⭐
- 摘要:基于OpenTelemetry、Prometheus、Grafana构建的大模型专属可观测性监控体系,覆盖prefill/decode耗时、KV缓存命中率、GPU显存使用率等核心指标。含Langfuse深度使用解析。
- 关键工具:Langfuse(2026年1月被ClickHouse收购)、Phoenix、Arize AI
- 可信度:极高——17个LLM落地项目血泪教训总结
2.3 生成式AI应用监控到底缺什么?从LLM幻觉到推理延迟的7层可观测
- URL:
https://blog.csdn.net/Algorift/article/details/160215162 - 标签:
可观测性7层监控幻觉检测延迟分析 - 工程价值:⭐⭐⭐⭐
- 摘要:可观测性扩展至提示词上下文、token级注意力热力、响应置信度分布等新维度,非传统metrics/logs/traces三件套。
- 可信度:中高
2.4 AI Agent可观测性:企业级智能体运行监控与故障诊断实践
- URL:
https://blog.csdn.net/WangduTech/article/details/163449487 - 标签:
Agent可观测性故障诊断企业级2025-2026 - 工程价值:⭐⭐⭐⭐
- 摘要:2025年AI Agent从实验室走向规模化生产落地,覆盖从开发者代码助手到企业智能客服到多智能体协同系统。
- 可信度:中高
3. 【高价值 · RAG/Agent 框架类】
3.1 RAG框架2026五强横评:LlamaIndex夺冠
- URL:
https://blog.csdn.net/m0_69581581/article/details/163142070 - 标签:
RAG框架横评LlamaIndexDifyHaystack2026 - 工程价值:⭐⭐⭐⭐
- 摘要:AlphaCorp AI 2026年3月评测,主流RAG框架差距不在模型适配,而在检索深度、编排能力、生产就绪度、评估集成度。LlamaIndex夺冠,Dify异军突起。
- 可信度:需核验AlphaCorp AI来源
3.2 LangChain 2026实战:构建可靠Agent与RAG管道
- URL:
https://blog.csdn.net/m0_69581581/article/details/163783291 - 标签:
LangChainLCELRAGAgent2026 - 工程价值:⭐⭐⭐⭐
- 摘要:LangChain 2026全面转向LangGraph(图式),显著提升Agent工作流可调试性、状态管理与复杂逻辑表达能力。推荐使用LangChain Expression Language (LCEL)构建声明式管道。
- 版本:LangChain 2026最新版
- 可信度:高
3.3 大模型智能体开发实战:从LLM、RAG到Agent完整技术栈解析
- URL:
https://bbs.csdn.net/weixin_28743405/article/details/100190711 - 标签:
Agent技术栈LangChainLangGraphLlamaIndexOllama完整项目 - 工程价值:⭐⭐⭐⭐⭐
- 摘要:超长篇系统性实战,附完整源码包。从四阶演进路径(认知升维→技术筑基→工程落地→商业闭环)展开,含Plan-and-Execute、HuggingGPT、MetaGPT等前沿范式对比。工具学习vs工具发现区分有价值。
- 可信度:高——附源码包
3.4 AI大模型开发入门:RAG、Agent与多模态实战解析(MCP协议)
- URL:
https://bbs.csdn.net/weixin_29046611/article/details/100225846 - 标签:
MCP协议RAGAgent多模态 - 工程价值:⭐⭐⭐⭐
- 摘要:系统解析AI大模型核心技术,涵盖Transformer架构、RAG检索增强生成、Agent智能体系统构建及Prompt工程实践,含MCP协议实战解析。
- 可信度:中高
4. 【中价值 · 参考类】
| 条目 | URL | 摘要 | 建议 |
|---|---|---|---|
| LLM推理加速全攻略 | https://blog.csdn.net/qq_31142761/article/details/161787836 |
vLLM、TensorRT-LLM与量化技术实战,2025-2026技术梳理 | 精读参考 |
| 2026年LLM推理框架全解析 | https://blog.csdn.net/Gaga246/article/details/155610267 |
vLLM、LMDeploy、Ollama、Llama.cpp、SGLang横评 | 参考 |
| LLMops实践:构建可信赖的大模型生产系统 | https://blog.csdn.net/qq_52964132/article/details/156354105 |
LLMops核心组件、生产系统构建关键实践 | 参考 |
| 多模态大模型:当语言模型学会"看"和"听" | https://blog.csdn.net/agito_cheung/article/details/163282861 |
CLIP对比学习原理、Flamingo/LLaVA/GPT-4V路线差异 | 入门级参考 |
| RAG效果评估体系设计与实现 | https://blog.csdn.net/sinat_36857875/article/details/163481025 |
RAG评估体系,对Java后端架构师价值高(可对接CI/监控) | 参考 |
| 一文搞懂:从大模型过渡到多模态大模型MLLM | https://nvidia.csdn.net/tags/629eeed4512a562a42849858 |
Q-Former、BLIP-2、VLM基础概念 | 入门 |
📬 Substack 精选条目
1. Agentic Security Newsletter — Week of April 27, 2026
- URL:
https://agenticsecurity.substack.com/p/the-agentic-security-newsletter-week-39f - 专栏:Agentic Security(AI Agent安全方向)
- 作者:Agentic Security Team
- 核心观点:
- promptfoo作为RAG/Agent安全测试框架,被OpenAI/Anthropic背书
- 进化搜索方法发现针对LLM Agent的攻击轨迹,成功率超57%
- 轨迹感知搜索比单步攻击更有效,Agent对连续工具调用操纵缺乏防御
- 间接提示注入:LLM Agent在处理真实外部数据源(邮件/文档)时系统性失败
- 可信度:高——专注Agent安全的专业技术 newsletter
- 后续行动:建议核验promptfoo GitHub最新功能和OWASP LLM Top 10更新
2. Top LLM, RAG and Agent Updates — February Week 2, 2026
- URL:
https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-03a - 专栏:AIxFunda(Kalyan KS)
- 作者:Kalyan KS
- 核心观点(本周要闻):
- OpenAI GPT-5.3-Codex-Spark:>1000 tokens/s,Codex app/CLI/VS Code扩展
- LLaDA2.1:100B扩散语言模型,892 tokens/s(并行处理+错误纠正编辑引擎)
- GLM-5:智谱开源最强开放权重模型
- WebMCP Preview:Google推出更智能AI-Web交互协议
- 可信度:中——周报类快讯,部分信息需核验官方发布
- 后续行动:GPT-5.3-Codex-Spark和LLaDA2.1值得进一步关注
3. The 2026 Path to Learning AI Agents
- URL:
https://aiagentssimplified.substack.com/p/the-2026-path-to-learning-ai-agents - 专栏:AI Agents Simplified
- 作者:AI Agents Simplified Team
- 核心观点:
- 2026年AI Agent学习路径:理解系统 > 写提示词
- 技能树:系统设计(LLM/工具/DB/子Agent编排)、工具与契约设计、检索工程、可靠性工程(重试/超时/回退/熔断)
- RAG作为入门路径:教搜索、检索、嵌入、系统设计、LLM集成、监控、缓存、Agent就绪
- 演进时间线:2020-22无状态LLM封装→2023工具+记忆+LangChain/AutoGen→2024 LangGraph/CrewAI图编排→2025 MCP标准化+结构化记忆
- 可信度:高——系统性学习路径梳理
- 后续行动:适合作为Agent学习路线参考
4. OWASP Top 10 Agents & AI Vulnerabilities (2026 Cheat Sheet)
- URL:
https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents - 作者:Alex Ewerlöf
- 核心观点(2026版关键条目):
- LLM04 数据与模型投毒:攻击者污染训练数据或RAG上下文 → 缓解:数据集加密验证+RAG文档零信任
- LLM05 不当输出处理:盲目执行LLM输出(如eval()) → 缓解:将所有LLM输出视为敌对,在micro-VM/Wasm中沙箱执行
- LLM06 过度代理:给AI过多权限 → 缓解:最小权限原则+JIT临时令牌+人类在环(HITL)
- LLM07 系统提示泄漏:暴露含后端逻辑/密钥的系统提示 → 缓解:将密钥排除在提示词外,使用安全保险库
- LLM08 向量与嵌入弱点:利用语义搜索/RAG架构 → 缓解:在Vector DB中强制执行严格加密命名空间隔离
- LLM09 错误信息:盲目信任AI幻觉 → 缓解:严格RAG+置信度评分+交叉验证
- 可信度:高——OWASP权威来源,2026年更新版
- 后续行动:建议收录至"AI安全"专题页,重点关注LLM06(过度代理)和LLM09(错误信息)
5. Context Engineering in AI: Building Smarter LLM System
- URL:
https://futureagi.substack.com/p/context-engineering-in-ai-building - 专栏:Future AGI
- 核心观点:
- Context Engineering = 给AI系统提供正确背景信息的技术
- 使用关系/图数据库通过API集成,使AI能获取结构化信息
- 建立CDC管道,近实时传输数据源变化到知识库
- 使用缓存层加速常见查询,降低API调用成本
- 可信度:中高
- 后续行动:参考工程实践
6. The Complete Guide to LLM Evaluation Tools in 2026
- URL:
https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation - 专栏:Future AGI
- 核心观点(评估工具横评):
- Future AGI:最全面多模态评估(文本/图像/音频/视频),自动化评估消除ground truth需求
- Galileo:模块化平台,内置guardrails、实时安全监控、RAG和Agent工作流自定义指标
- Arize AI:企业平台,专业幻觉检测、QA、相关性评估器
- MLflow:开源统一评估,覆盖ML和GenAI,内置RAG指标
- Patronus AI:幻觉检测、自定义评分、安全检查、格式验证
- 可信度:中高——工具横评,适合选型参考
- 后续行动:适合作为LLM评估工具选型参考
7. What's Next in AI: Five Trends to Watch in 2026
- URL:
https://open.substack.com/pub/bytebytego/p/whats-next-in-ai-five-trends-to-watch - 作者:ByteByteGo团队
- 核心观点:
- Agent结合LLM+工具+循环,实现目标分解、工具执行、结果决策
- 2026趋势:持久化Agent(always-on,跨更长工作流),多本地运行
- OpenClaw作为个人Agent本地运行早期案例
- 可信度:高——知名技术团队
- 注:本文提及OpenClaw,但为行业趋势描述,非产品评测
🏷️ 分类标签体系建议
LLM推理优化 # vLLM / TensorRT-LLM / SGLang / 量化
RAG系统 # RAG框架横评 / Agentic RAG / 检索优化
Agent工程 # LangChain / LangGraph / 多Agent编排 / MCP
MLOps/可观测性 # Langfuse / Phoenix / OTel / Prometheus+Grafana
AI安全 # OWASP LLM Top 10 / Agent安全 / 提示词注入
论文复现方法论 # 复现checklist / 环境依赖 / seed控制
多模态 # MLLM / 视觉-语言模型 / 扩散语言模型
📁 建议写入路径
本次草稿路径:
/shared/research-kb/inbox/jay/2026-09-08-csdn-substack-llm-rag-agent.md
建议专题页更新:
| 专题页 | 来源 | 操作建议 |
|--------|------|----------|
| LLM推理工程 | CSDN 1.1/1.3/1.5 | 精读后合并 |
| LLM可观测性 | CSDN 2.1/2.2/2.3 | 精读后合并 |
| RAG框架横评 | CSDN 3.1/Substack 6 | 精读后合并 |
| AI安全 | Substack 1/4 | 精读OWASP原版后合并 |
| 论文复现方法论 | CSDN 1.2 | 精读后合并 |
| Agent工程路线 | CSDN 3.3/3.4 + Substack 3 | 精读后合并 |
✅ 精读/审稿优先级
P0(建议本周精读): 1. CSDN 1.1 —— vLLM/TensorRT-LLM 2026实战(最高工程价值) 2. CSDN 2.2 —— LLM可观测性全栈监控体系(生产必读) 3. Substack 4 —— OWASP Top 10 Agents 2026(AI安全必读) 4. CSDN 1.2 —— LLM论文复现方法论(学术工程化必读)
P1(下周参考): 5. CSDN 3.3 —— 大模型智能体完整技术栈(源码级) 6. CSDN 3.1 —— RAG框架2026五强横评 7. Substack 3 —— 2026 AI Agent学习路径
📝 草稿元数据
- 起草实例:Jay
- 起草时间:2026-09-08 12:20 (UTC+8)
- 检索频率:每日3次(CSDN高频 + Substack研究)
- 去重参考:已检查
/shared/research-kb/inbox/其他实例目录,未发现同日重复主题 - 后续合并:请由同步任务串行处理 GitHub commit,本实例不执行 git 写操作