CSDN 高频检索草稿 · 2026-08-18
主题:LLM Agent / RAG 工程实践 + 多模态 AI 系统 + 推理引擎 检索范围:CSDN (site:csdn.net) + Substack AI 研究通讯 检索时间:2026-08-18 08:20 (Asia/Shanghai)
一、CSDN 高价值条目
1. RAG 实战指南 Day 2:RAG开发环境搭建与工具选择
来源:CSDN 博客 · qq_qingtian · 2025-07-02
URL:https://blog.csdn.net/qq_qingtian/article/details/149075444
标签:RAG 环境搭建 LangChain Chroma Pinecone llama-index
评分:⭐⭐⭐⭐ (高价值 · 工程实践型)
摘要: 系列第2篇,提供完整 RAG 开发环境配置流程: - conda 创建 Python 3.10 隔离环境 - pip install:langchain、llama-index、pypdf、torch(GPU版)、sentence-transformers、chromadb - 向量数据库双方案:本地轻量 Chroma vs 云端高性能 Pinecone - 完整验证脚本(rag_env_test.py):PDF加载→分块→嵌入→向量检索→QA链,含 assert 断言
conda create -n rag python=3.10
pip install langchain llama-index pypdf chromadb sentence-transformers
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
评价:实操性强,含完整可运行验证代码,适合快速 PoC 搭建。国内镜像源注意替换 torch index-url。
2. Deep Searcher(Zilliz)RAG Agent 实现逻辑解析
来源:CSDN 博客 · kakazhui · 2025
URL:https://blog.csdn.net/kakazhui/article/details/149489730
标签:RAG-Agent Deep-Searcher Zilliz Agentic-RAG 代码解析
评分:⭐⭐⭐⭐ (高价值 · 源码级分析)
摘要:
Zilliz 团队开源的 Agentic RAG 系统。核心特性:
- 多模态检索:支持文本、图像等多种模态的检索
- Agent 工作流:融合 LLM + 工具调用 + 迭代检索
- 插件机制:可插拔扩展
- 项目地址:https://github.com/zilliztech/deep-searcher
评价:代码级解析,含实现逻辑拆解,适合想理解 Agentic RAG 内部机制的中高级工程师。
3. vLLM 框架解析:大模型推理引擎的核心技术与优化实践
来源:CSDN · weixin_29032337 · 2025
URL:https://bbs.csdn.net/weixin_29032337/article/details/100230081
标签:vLLM PagedAttention Continuous-Batching Chunked-Prefill KV-Cache
评分:⭐⭐⭐⭐⭐ (极高价值 · 实测数据 + 排障指南)
摘要: 深度解析 vLLM 核心技术及实测调优数据:
核心技术: - PagedAttention(基于《Efficient Memory Management for Large Language Model Serving》):类 OS 分页机制管理 KV Cache - Continuous Batching:动态批处理,请求级别调度 - Chunked Prefill:分块预填充,降低首 token 延迟峰值
实测 Benchmark 数据(Qwen-72B @ DGX A100): | Batch Size | 吞吐量 | 延迟(P99) | 显存使用 | |---|---|---|---| | 8 | 32 req/s | 110ms | 24GB | | 16 | 47 req/s | 89ms | 32GB | | 32 | 51 req/s | 142ms | OOM |
排障指南:
- CUDA OOM → 调 gpu_memory_utilization、max_num_seqs、max_model_len、enable_chunked_prefill
- 吞吐量低 → 检查 tensor_parallel_size、enforce_eager=False
- 长序列不稳定 → 调 block_size
源码入口:engine/llm_engine.py、worker/model_runner.py、attention/ops.py
评价:有实测数据、有排障命令参数,2026年 vLLM 已是推理事实标准引擎,此文工程价值极高。
4. 开源大模型云原生部署生态深度解析:vLLM + Ollama
来源:CSDN · a13662080711 · 2026
URL:https://blog.csdn.net/a13662080711/article/details/161727501
标签:vLLM Ollama 云原生 LLM部署 2026
评分:⭐⭐⭐⭐ (高价值 · 2026年视角)
摘要: 2026 年 LLM 推理事实标准引擎(vLLM)+ 轻量本地部署方案(Ollama)对比: - vLLM:高性能推理,优化显存使用,适合生产环境高并发 - Ollama:一键安装,模型库丰富,适合快速原型
5. 向量数据库全景解析:Pinecone / Chroma / Weaviate / Qdrant / Milvus
来源:CSDN · 2401_84204207 · 2025-12-08
URL:https://blog.csdn.net/2401_84204207/article/details/155705252
标签:向量数据库 RAG Pinecone Chroma Qdrant Milvus 选型
评分:⭐⭐⭐⭐⭐ (极高价值 · 决策框架完整)
摘要: 2025-12 月更新的企业级向量数据库选型指南,附决策框架:
规模选型: | 向量规模 | 推荐方案 | 理由 | |---|---|---| | <10M | PgVector / Chroma / Qdrant | 成本低、维护简单 | | 10M–200M | Qdrant / Weaviate | 性能+功能平衡 | | 200M–10B | Milvus / Pinecone | 分布式架构、海量处理 |
国内 RAG/Agent/ITSM 推荐组合: - 快速上线 → Qdrant(开源 + 性能好 + Apache 2.0) - 超大规模 → Milvus(Zilliz Cloud 托管) - 省心托管 → Pinecone(成本高但零运维) - 原型验证 → Chroma(轻量、LangChain 友好) - 已有 PG 栈 → PgVector(无需引入新组件) - 极低延迟 → Redis Vector Search
评价:附多租户能力、RBAC、可观测性、成本监控等企业级考量,是最完整的 2025 年底向量数据库选型参考。
6. 【DeepSeek R1 构建本地 RAG 知识库】向量库选型对比
来源:CSDN · qq359605040 · 2025-02-18
URL:https://blog.csdn.net/qq359605040/article/details/145699715
标签:DeepSeek-R1 RAG 向量数据库 选型对比 Pinecone Milvus Chroma
评分:⭐⭐⭐⭐ (高价值 · 对比维度全)
摘要: 以 DeepSeek R1 为 LLM 基座,对比 6 种向量数据库的选型决策树: - Pinecone:云托管,零运维,适合快速验证 - Milvus:超大规模,Zilliz 维护,开源+云服务 - Chroma:轻量本地,LangChain 生态友好 - Weaviate:多模态支持 + Schema-first - Faiss:Meta 开源库,非完整 DB,适合底层集成 - Qdrant:Rust 实现,高性能,支持混合过滤
7. 多模态大模型技术演进全解析(2026)
来源:CSDN · damodev.csdn.net · 2026
URL:https://damodev.csdn.net/699fbc7954b52172bc5db645.html
标签:多模态 MLLM Qwen3-Omni LLaVA 架构演进 2026
评分:⭐⭐⭐⭐ (高价值 · 2026年架构全景)
摘要: 2026 年多模态大模型(MLLM)技术全景,核心维度:
三代架构演进: 1. 拼接式(Two-stage):冻结 LLM + 视觉编码器 + 投影层 2. 指令微调式(Instruction Tuning):端到端 SFT 3. 原生统一(Natively Multimodal)⭐:从设计之初融合多模态
Qwen3-Omni 亮点: - 语言骨干从设计之初考虑多模态协同 - 原生全模态模型代表
参数规模影响: - 70B > 13B > 7B 在复杂推理和生成质量上 - 但成本随规模指数增长,量化/蒸馏技术是落地关键
微调适配:词嵌入空间扩展、注意力机制调整、位置编码扩展
8. vLLM 与 SGLang 大模型推理框架对比与选型指南
来源:CSDN · weixin_32306957 · 2025
URL:https://bbs.csdn.net/weixin_32306957/article/details/100237981
标签:vLLM SGLang 推理框架 选型 Continuous-Batching Tool-Calling
评分:⭐⭐⭐⭐ (高价值 · 框架对比 + 架构哲学)
摘要: 实测对比 vLLM vs SGLang 在不同场景下的表现:
高并发生产环境(Atlas 300T Pro @ 7B): | 指标 | vLLM | SGLang | |---|---|---| | QPS | 1420 | 980 | | 延迟 P99 | 85ms | 120ms | | 显存利用率 | 92% | 78% |
复杂推理(Tool Calling):SGLang 脚本化执行引擎更灵活
选型建议: - 高并发、低延迟生产 → vLLM(Continuous Batching 优势明显) - 复杂逻辑、多步推理 → SGLang(原生 Python 脚本支持) - 混合场景 → vLLM(前)+ SGLang(后)串联
架构哲学:vLLM = 精心调校的流水线;SGLang = 灵活的实验室装置
9. 大模型本地部署指南:工具选型与实战优化
来源:CSDN · bbs.csdn.net · weixin_33525298 · 2025
URL:https://bbs.csdn.net/weixin_33525298/article/details/100215843
标签:LLM部署 Ollama vLLM LM-Studio 本地部署 量化
评分:⭐⭐⭐⭐ (高价值 · 工具对比表 + 硬件配置)
摘要: | 工具 | 适用场景 | 硬件要求 | 优势 | 局限 | |---|---|---|---|---| | Ollama | 快速原型 | 16GB RAM | 一键安装,模型库丰富 | 自定义能力有限 | | LM Studio | Windows 桌面 | CUDA GPU | 图形化界面友好 | 仅部分开源模型 | | vLLM | 生产高并发 | 多 GPU 服务器 | 高性能推理,优化显存 | 配置复杂度高 | | Text-generation-webui | 研究者/小团队 | 8GB RAM 可运行 | 多量化版本 | 需 Python 环境 | | Docker 部署 | 企业容器化 | 视模型大小 | 环境隔离,易迁移 | 需掌握 Docker |
硬件参考: - RTX 3060 12GB → 7B 模型 - RTX 3090 24GB → 13B 模型 - A100 40GB → 30B 模型
10. LLM — 从 LLM 到 RAG、Agent、MCP 的一体化工程实践
来源:CSDN · yangshangwei · 2025
URL:https://blog.csdn.net/yangshangwei/article/details/155892912
标签:LLM RAG Agent MCP 企业架构 一体化
评分:⭐⭐⭐⭐ (高价值 · 企业架构全景)
摘要: 一体化企业 AI 架构设计指南,聚焦 LLM + RAG + Agent + MCP 组合:
典型落地场景:企业内部知识助手 / Copilot(咨询、互联网、制造、金融)
常见选型栈: - 主力大模型(云端通用 + 本地/私有模型) - 向量数据库或检索引擎 - 面向知识的 RAG 服务 - Agent 编排框架(LangChain / LangGraph) - MCP 兼容工具层
MCP + RAG 协同:MCP 控制器根据问题类型路由到不同 RAG 管线,多知识源聚合为统一检索入口
二、Substack 高价值条目
1. The Neural Maze · Building the AI Roadmap for 2026
来源:Miguel Otero Pedrido · theneuralmaze.substack.com
URL:https://theneuralmaze.substack.com/p/building-the-ai-roadmap-for-2026
标签:MLOps LLMOps 生产系统 2026路线图
评分:⭐⭐⭐⭐ (高价值 · 工程路线图)
核心观点: - 2026 年重点从"L LM hype"回归"ML Engineering"——生产级推荐系统、欺诈检测、需求预测 - 核心工具链:Docker、FastAPI、Feature Stores、Model Registries、Vector DB、MLOps、LLMOps、RAG - 推荐系统:cohort-based 学习路径,覆盖完整系统 - 强调Bridge between theory and production
可信度:高 · 工程实践导向作者,有实际项目经验
2. jamwithai · The 2026 Roadmap: Production AI/ML Systems
来源:jamwithai.substack.com
URL:https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml
标签:RAG Graph-RAG ColPali VLM RAGAS LLM-as-judge
评分:⭐⭐⭐⭐ (高价值 · RAG 迭代路径)
核心观点: RAG 系统迭代路径:Build basic RAG → Measure it → Add relationship → Handle multimodal - RAGAS + LLM-as-judge 评估( faithfulness、relevance、quality) - Graph RAG with Neo4j(多跳查询,如"谁在 Google 之后创立了公司") - ColPali/VLM(视觉文档检索)
可信度:高 · 系统化工程方法论
3. AIxFunda · Top LLM, RAG and Agent Updates (April Week 1, 2026)
来源:Kalyan KS · aixfunda.substack.com
URL:https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-0d2
标签:LLM更新 Qwen3.5-Omni llama.cpp LiquidAI GLM-5V 2026-04
评分:⭐⭐⭐ (中 · 每周快讯)
关键更新摘要: - Qwen3.6-Plus(Alibaba):原生多模态理解、1M token 上下文、113 语言支持 - llama.cpp:GitHub 100k stars,开源本地推理引擎里程碑 - LiquidAI LFM2.5-350M:专注 Agentic loops、数据提取、工具调用 - GLM-5V-Turbo(Z.ai):视觉编码模型
可信度:中 · 快讯性质,需核验具体性能数据
4. AI Agents Simplified · 2026's Q1 AI Updates
来源:aiagentssimplified.substack.com
URL:https://aiagentssimplified.substack.com/p/2026s-q1-ai-updates
标签:AI-Agent Qwen3.5 GLM-5.1 Agentic-workflow
评分:⭐⭐⭐⭐ (高价值 · Q1 2026 汇总)
核心观点: - GLM-5.1(Z.ai):支持 8 小时长时自主任务,专注 coding + agentic workflows - Qwen3.5-397B-A17B:在 28/44 视觉基准上超越 GPT-5.2、Claude 4.5 Opus - Qwen3.5-9B:在多项语言任务上超越 10x 规模的 gpt-oss-120B - AI 正在 contrib to its own improvement——反馈循环正在重塑整个领域
可信度:高 · 有具体 benchmark 数据
5. Hugobowne · AgentOps: Lessons from 1,400+ Production Deployments
来源:hugobowne.substack.com
URL:https://hugobowne.substack.com/p/agentops-lessons-from-over-1400-production
标签:AgentOps 生产部署 AI-Agent 经验总结
评分:⭐⭐⭐⭐⭐ (极高价值 · 大规模生产经验)
核心观点: - 2026 年是"AI Agent 的十年"——从 RAG 转向自主系统 - 模型选型分化:快速、针对 Agent 优化的模型 vs 超大通用模型 - 生产部署关键:可观测性、错误处理、多 Agent 协调
可信度:极高 · 来自 1,400+ 实际部署的经验总结
三、分类标签汇总
| 标签 | 条目数 | 代表文章 |
|---|---|---|
| RAG | 6 | RAG实战指南 Day2、Deep Searcher解析 |
| vLLM | 4 | vLLM框架解析、vLLM vs SGLang |
| 向量数据库 | 4 | 向量数据库全景解析、选型对比 |
| LLM-Agent | 3 | MCP+RAG+Agent一体化、Deep Searcher |
| 多模态 | 3 | MLLM技术演进2026、Qwen3.5-Omni |
| MLOps/LLMOps | 3 | Neural Maze 2026路线图、AgentOps |
| 本地部署 | 2 | Ollama/vLLM部署指南、硬件配置 |
| SGLang | 1 | vLLM vs SGLang对比 |
四、建议写入路径
/shared/research-kb/inbox/jay/2026-08-18T0820-jay-csdn-multimodal-rag-inference-substack-highfreq.md
五、后续行动建议
| 优先级 | 行动 | 原因 |
|---|---|---|
| 🔴 高 | 精读 vLLM 框架解析(含 benchmark + 排障参数) | 工程落地价值最高 |
| 🔴 高 | 关注 Qwen3.5-Omni / GLM-5.1 的 agentic workflow 能力 | 2026 Q1 新模型 |
| 🟡 中 | Graph RAG with Neo4j 实测(jamwithai 路线图) | RAG 迭代方向 |
| 🟡 中 | 向量数据库选型框架更新(2026版) | 需与已有决策树合并 |
| 🟢 低 | AgentOps 1,400+ 部署经验完整核验 | 高可信度经验总结 |
本条目由 Jay(CSDN 高频检索任务 · 每日 3 次 · 2026-08-18 08:20)产出