CSDN 高频检索草稿 · 2026-08-18

主题:LLM Agent / RAG 工程实践 + 多模态 AI 系统 + 推理引擎 检索范围:CSDN (site:csdn.net) + Substack AI 研究通讯 检索时间:2026-08-18 08:20 (Asia/Shanghai)


一、CSDN 高价值条目

1. RAG 实战指南 Day 2:RAG开发环境搭建与工具选择

来源:CSDN 博客 · qq_qingtian · 2025-07-02 URLhttps://blog.csdn.net/qq_qingtian/article/details/149075444 标签RAG 环境搭建 LangChain Chroma Pinecone llama-index 评分:⭐⭐⭐⭐ (高价值 · 工程实践型)

摘要: 系列第2篇,提供完整 RAG 开发环境配置流程: - conda 创建 Python 3.10 隔离环境 - pip install:langchain、llama-index、pypdf、torch(GPU版)、sentence-transformers、chromadb - 向量数据库双方案:本地轻量 Chroma vs 云端高性能 Pinecone - 完整验证脚本(rag_env_test.py):PDF加载→分块→嵌入→向量检索→QA链,含 assert 断言

conda create -n rag python=3.10
pip install langchain llama-index pypdf chromadb sentence-transformers
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

评价:实操性强,含完整可运行验证代码,适合快速 PoC 搭建。国内镜像源注意替换 torch index-url。


2. Deep Searcher(Zilliz)RAG Agent 实现逻辑解析

来源:CSDN 博客 · kakazhui · 2025 URLhttps://blog.csdn.net/kakazhui/article/details/149489730 标签RAG-Agent Deep-Searcher Zilliz Agentic-RAG 代码解析 评分:⭐⭐⭐⭐ (高价值 · 源码级分析)

摘要: Zilliz 团队开源的 Agentic RAG 系统。核心特性: - 多模态检索:支持文本、图像等多种模态的检索 - Agent 工作流:融合 LLM + 工具调用 + 迭代检索 - 插件机制:可插拔扩展 - 项目地址:https://github.com/zilliztech/deep-searcher

评价:代码级解析,含实现逻辑拆解,适合想理解 Agentic RAG 内部机制的中高级工程师。


3. vLLM 框架解析:大模型推理引擎的核心技术与优化实践

来源:CSDN · weixin_29032337 · 2025 URLhttps://bbs.csdn.net/weixin_29032337/article/details/100230081 标签vLLM PagedAttention Continuous-Batching Chunked-Prefill KV-Cache 评分:⭐⭐⭐⭐⭐ (极高价值 · 实测数据 + 排障指南)

摘要: 深度解析 vLLM 核心技术及实测调优数据:

核心技术: - PagedAttention(基于《Efficient Memory Management for Large Language Model Serving》):类 OS 分页机制管理 KV Cache - Continuous Batching:动态批处理,请求级别调度 - Chunked Prefill:分块预填充,降低首 token 延迟峰值

实测 Benchmark 数据(Qwen-72B @ DGX A100): | Batch Size | 吞吐量 | 延迟(P99) | 显存使用 | |---|---|---|---| | 8 | 32 req/s | 110ms | 24GB | | 16 | 47 req/s | 89ms | 32GB | | 32 | 51 req/s | 142ms | OOM |

排障指南: - CUDA OOM → 调 gpu_memory_utilizationmax_num_seqsmax_model_lenenable_chunked_prefill - 吞吐量低 → 检查 tensor_parallel_sizeenforce_eager=False - 长序列不稳定 → 调 block_size

源码入口engine/llm_engine.pyworker/model_runner.pyattention/ops.py

评价:有实测数据、有排障命令参数,2026年 vLLM 已是推理事实标准引擎,此文工程价值极高。


4. 开源大模型云原生部署生态深度解析:vLLM + Ollama

来源:CSDN · a13662080711 · 2026 URLhttps://blog.csdn.net/a13662080711/article/details/161727501 标签vLLM Ollama 云原生 LLM部署 2026 评分:⭐⭐⭐⭐ (高价值 · 2026年视角)

摘要: 2026 年 LLM 推理事实标准引擎(vLLM)+ 轻量本地部署方案(Ollama)对比: - vLLM:高性能推理,优化显存使用,适合生产环境高并发 - Ollama:一键安装,模型库丰富,适合快速原型


5. 向量数据库全景解析:Pinecone / Chroma / Weaviate / Qdrant / Milvus

来源:CSDN · 2401_84204207 · 2025-12-08 URLhttps://blog.csdn.net/2401_84204207/article/details/155705252 标签向量数据库 RAG Pinecone Chroma Qdrant Milvus 选型 评分:⭐⭐⭐⭐⭐ (极高价值 · 决策框架完整)

摘要: 2025-12 月更新的企业级向量数据库选型指南,附决策框架:

规模选型: | 向量规模 | 推荐方案 | 理由 | |---|---|---| | <10M | PgVector / Chroma / Qdrant | 成本低、维护简单 | | 10M–200M | Qdrant / Weaviate | 性能+功能平衡 | | 200M–10B | Milvus / Pinecone | 分布式架构、海量处理 |

国内 RAG/Agent/ITSM 推荐组合: - 快速上线 → Qdrant(开源 + 性能好 + Apache 2.0) - 超大规模 → Milvus(Zilliz Cloud 托管) - 省心托管 → Pinecone(成本高但零运维) - 原型验证 → Chroma(轻量、LangChain 友好) - 已有 PG 栈 → PgVector(无需引入新组件) - 极低延迟 → Redis Vector Search

评价:附多租户能力、RBAC、可观测性、成本监控等企业级考量,是最完整的 2025 年底向量数据库选型参考。


6. 【DeepSeek R1 构建本地 RAG 知识库】向量库选型对比

来源:CSDN · qq359605040 · 2025-02-18 URLhttps://blog.csdn.net/qq359605040/article/details/145699715 标签DeepSeek-R1 RAG 向量数据库 选型对比 Pinecone Milvus Chroma 评分:⭐⭐⭐⭐ (高价值 · 对比维度全)

摘要: 以 DeepSeek R1 为 LLM 基座,对比 6 种向量数据库的选型决策树: - Pinecone:云托管,零运维,适合快速验证 - Milvus:超大规模,Zilliz 维护,开源+云服务 - Chroma:轻量本地,LangChain 生态友好 - Weaviate:多模态支持 + Schema-first - Faiss:Meta 开源库,非完整 DB,适合底层集成 - Qdrant:Rust 实现,高性能,支持混合过滤


7. 多模态大模型技术演进全解析(2026)

来源:CSDN · damodev.csdn.net · 2026 URLhttps://damodev.csdn.net/699fbc7954b52172bc5db645.html 标签多模态 MLLM Qwen3-Omni LLaVA 架构演进 2026 评分:⭐⭐⭐⭐ (高价值 · 2026年架构全景)

摘要: 2026 年多模态大模型(MLLM)技术全景,核心维度:

三代架构演进: 1. 拼接式(Two-stage):冻结 LLM + 视觉编码器 + 投影层 2. 指令微调式(Instruction Tuning):端到端 SFT 3. 原生统一(Natively Multimodal)⭐:从设计之初融合多模态

Qwen3-Omni 亮点: - 语言骨干从设计之初考虑多模态协同 - 原生全模态模型代表

参数规模影响: - 70B > 13B > 7B 在复杂推理和生成质量上 - 但成本随规模指数增长,量化/蒸馏技术是落地关键

微调适配:词嵌入空间扩展、注意力机制调整、位置编码扩展


8. vLLM 与 SGLang 大模型推理框架对比与选型指南

来源:CSDN · weixin_32306957 · 2025 URLhttps://bbs.csdn.net/weixin_32306957/article/details/100237981 标签vLLM SGLang 推理框架 选型 Continuous-Batching Tool-Calling 评分:⭐⭐⭐⭐ (高价值 · 框架对比 + 架构哲学)

摘要: 实测对比 vLLM vs SGLang 在不同场景下的表现:

高并发生产环境(Atlas 300T Pro @ 7B): | 指标 | vLLM | SGLang | |---|---|---| | QPS | 1420 | 980 | | 延迟 P99 | 85ms | 120ms | | 显存利用率 | 92% | 78% |

复杂推理(Tool Calling):SGLang 脚本化执行引擎更灵活

选型建议: - 高并发、低延迟生产 → vLLM(Continuous Batching 优势明显) - 复杂逻辑、多步推理 → SGLang(原生 Python 脚本支持) - 混合场景 → vLLM(前)+ SGLang(后)串联

架构哲学:vLLM = 精心调校的流水线;SGLang = 灵活的实验室装置


9. 大模型本地部署指南:工具选型与实战优化

来源:CSDN · bbs.csdn.net · weixin_33525298 · 2025 URLhttps://bbs.csdn.net/weixin_33525298/article/details/100215843 标签LLM部署 Ollama vLLM LM-Studio 本地部署 量化 评分:⭐⭐⭐⭐ (高价值 · 工具对比表 + 硬件配置)

摘要: | 工具 | 适用场景 | 硬件要求 | 优势 | 局限 | |---|---|---|---|---| | Ollama | 快速原型 | 16GB RAM | 一键安装,模型库丰富 | 自定义能力有限 | | LM Studio | Windows 桌面 | CUDA GPU | 图形化界面友好 | 仅部分开源模型 | | vLLM | 生产高并发 | 多 GPU 服务器 | 高性能推理,优化显存 | 配置复杂度高 | | Text-generation-webui | 研究者/小团队 | 8GB RAM 可运行 | 多量化版本 | 需 Python 环境 | | Docker 部署 | 企业容器化 | 视模型大小 | 环境隔离,易迁移 | 需掌握 Docker |

硬件参考: - RTX 3060 12GB → 7B 模型 - RTX 3090 24GB → 13B 模型 - A100 40GB → 30B 模型


10. LLM — 从 LLM 到 RAG、Agent、MCP 的一体化工程实践

来源:CSDN · yangshangwei · 2025 URLhttps://blog.csdn.net/yangshangwei/article/details/155892912 标签LLM RAG Agent MCP 企业架构 一体化 评分:⭐⭐⭐⭐ (高价值 · 企业架构全景)

摘要: 一体化企业 AI 架构设计指南,聚焦 LLM + RAG + Agent + MCP 组合:

典型落地场景:企业内部知识助手 / Copilot(咨询、互联网、制造、金融)

常见选型栈: - 主力大模型(云端通用 + 本地/私有模型) - 向量数据库或检索引擎 - 面向知识的 RAG 服务 - Agent 编排框架(LangChain / LangGraph) - MCP 兼容工具层

MCP + RAG 协同:MCP 控制器根据问题类型路由到不同 RAG 管线,多知识源聚合为统一检索入口


二、Substack 高价值条目

1. The Neural Maze · Building the AI Roadmap for 2026

来源:Miguel Otero Pedrido · theneuralmaze.substack.com URLhttps://theneuralmaze.substack.com/p/building-the-ai-roadmap-for-2026 标签MLOps LLMOps 生产系统 2026路线图 评分:⭐⭐⭐⭐ (高价值 · 工程路线图)

核心观点: - 2026 年重点从"L LM hype"回归"ML Engineering"——生产级推荐系统、欺诈检测、需求预测 - 核心工具链:Docker、FastAPI、Feature Stores、Model Registries、Vector DB、MLOps、LLMOps、RAG - 推荐系统:cohort-based 学习路径,覆盖完整系统 - 强调Bridge between theory and production

可信度:高 · 工程实践导向作者,有实际项目经验


2. jamwithai · The 2026 Roadmap: Production AI/ML Systems

来源:jamwithai.substack.com URLhttps://jamwithai.substack.com/p/the-2026-roadmap-production-aiml 标签RAG Graph-RAG ColPali VLM RAGAS LLM-as-judge 评分:⭐⭐⭐⭐ (高价值 · RAG 迭代路径)

核心观点: RAG 系统迭代路径:Build basic RAG → Measure it → Add relationship → Handle multimodal - RAGAS + LLM-as-judge 评估( faithfulness、relevance、quality) - Graph RAG with Neo4j(多跳查询,如"谁在 Google 之后创立了公司") - ColPali/VLM(视觉文档检索)

可信度:高 · 系统化工程方法论


3. AIxFunda · Top LLM, RAG and Agent Updates (April Week 1, 2026)

来源:Kalyan KS · aixfunda.substack.com URLhttps://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-0d2 标签LLM更新 Qwen3.5-Omni llama.cpp LiquidAI GLM-5V 2026-04 评分:⭐⭐⭐ (中 · 每周快讯)

关键更新摘要: - Qwen3.6-Plus(Alibaba):原生多模态理解、1M token 上下文、113 语言支持 - llama.cpp:GitHub 100k stars,开源本地推理引擎里程碑 - LiquidAI LFM2.5-350M:专注 Agentic loops、数据提取、工具调用 - GLM-5V-Turbo(Z.ai):视觉编码模型

可信度:中 · 快讯性质,需核验具体性能数据


4. AI Agents Simplified · 2026's Q1 AI Updates

来源:aiagentssimplified.substack.com URLhttps://aiagentssimplified.substack.com/p/2026s-q1-ai-updates 标签AI-Agent Qwen3.5 GLM-5.1 Agentic-workflow 评分:⭐⭐⭐⭐ (高价值 · Q1 2026 汇总)

核心观点: - GLM-5.1(Z.ai):支持 8 小时长时自主任务,专注 coding + agentic workflows - Qwen3.5-397B-A17B:在 28/44 视觉基准上超越 GPT-5.2、Claude 4.5 Opus - Qwen3.5-9B:在多项语言任务上超越 10x 规模的 gpt-oss-120B - AI 正在 contrib to its own improvement——反馈循环正在重塑整个领域

可信度:高 · 有具体 benchmark 数据


5. Hugobowne · AgentOps: Lessons from 1,400+ Production Deployments

来源:hugobowne.substack.com URLhttps://hugobowne.substack.com/p/agentops-lessons-from-over-1400-production 标签AgentOps 生产部署 AI-Agent 经验总结 评分:⭐⭐⭐⭐⭐ (极高价值 · 大规模生产经验)

核心观点: - 2026 年是"AI Agent 的十年"——从 RAG 转向自主系统 - 模型选型分化:快速、针对 Agent 优化的模型 vs 超大通用模型 - 生产部署关键:可观测性、错误处理、多 Agent 协调

可信度:极高 · 来自 1,400+ 实际部署的经验总结


三、分类标签汇总

标签 条目数 代表文章
RAG 6 RAG实战指南 Day2、Deep Searcher解析
vLLM 4 vLLM框架解析、vLLM vs SGLang
向量数据库 4 向量数据库全景解析、选型对比
LLM-Agent 3 MCP+RAG+Agent一体化、Deep Searcher
多模态 3 MLLM技术演进2026、Qwen3.5-Omni
MLOps/LLMOps 3 Neural Maze 2026路线图、AgentOps
本地部署 2 Ollama/vLLM部署指南、硬件配置
SGLang 1 vLLM vs SGLang对比

四、建议写入路径

/shared/research-kb/inbox/jay/2026-08-18T0820-jay-csdn-multimodal-rag-inference-substack-highfreq.md

五、后续行动建议

优先级 行动 原因
🔴 高 精读 vLLM 框架解析(含 benchmark + 排障参数) 工程落地价值最高
🔴 高 关注 Qwen3.5-Omni / GLM-5.1 的 agentic workflow 能力 2026 Q1 新模型
🟡 中 Graph RAG with Neo4j 实测(jamwithai 路线图) RAG 迭代方向
🟡 中 向量数据库选型框架更新(2026版) 需与已有决策树合并
🟢 低 AgentOps 1,400+ 部署经验完整核验 高可信度经验总结

本条目由 Jay(CSDN 高频检索任务 · 每日 3 次 · 2026-08-18 08:20)产出