CSDN 高价值技术检索 · 2026-09-29 早间
检索范围:CSDN 博客 + 腾讯云/阿里云/知乎同步专栏
主题:RAG · LLM推理部署 · 多模态 · 微调训练 · 向量检索 · vLLM/Ollama
时间:2026-09-29 08:20 (Asia/Shanghai)
高价值条目 · Tier 1(可直接复用)
1. 基于openGauss构建企业级RAG知识库(源码+版本+命令全)
- URL:https://blog.csdn.net/m0_68089732/article/details/155428896
- 来源:CSDN博客 · 火山引擎ADG社区收录
- 时间:2025-11-30
- 复现价值:⭐⭐⭐⭐⭐
- 涉及版本:openGauss 4.0.0(企业版,CentOS 7 x86_64)
- 核心技术点:
- 向量类型内置支持:
VECTOR(768),CREATE INDEX ... USING GIN
- SQL建表语句:
rag_knowledge 表含 content TEXT, embedding VECTOR(768), create_time
- Python数据插入:
execute_batch 批量插入,每批10条
- 向量检索SQL:
embedding <=> %s AS similarity(余弦距离)
- 环境命令:gs_ctl start/stop/restart/status,
gsql 连接命令
- 防火墙关闭:
systemctl stop firewalld,SELinux设为disabled
- Python依赖:
sentence-transformers, psycopg2-binary, BeautifulSoup
- Embedding模型:
all-MiniLM-L6-v2(生成768维向量)
- LangChain+Ollama生成层:
from langchain.llms import Ollama; llm = Ollama(model="llama3:8b")
- 工程评价:少见的完整可复现企业级RAG+国产数据库实操指南,SQL Schema + Python代码 + 环境命令 + 验证输出均有覆盖,数据插入验证结果明确。适合作为"RAG+PG/PGVector类国产替代"的参考标杆。
- 可信度:高(B稿有完整命令输出验证,含预期输出示例)
- 建议分类:
RAG / 向量数据库 / openGauss / 国产数据库 / 可复现
- 后续行动:可对比
pgvector 方案与 openGauss vector 方案优劣,写入RAG数据库选型主题页
2. MiniCPM-V高效推理方案:llama.cpp、vLLM、Ollama部署详解
- URL:https://blog.csdn.net/gitblog_01002/article/details/154892380
- 来源:CSDN博客 · 火山引擎ADG社区收录
- 时间:2025-11-16(最新推荐 2026-01-06)
- 复现价值:⭐⭐⭐⭐⭐
- 涉及版本/模型:MiniCPM-V 4.5 / MiniCPM-V 4_5-q4_0.gguf(GGUF格式)
- 核心技术点:
- llama.cpp部署:
./bin/llava-cli -m minicpm-v-4_5-q4_0.gguf --mmproj models/minicpm-v-4_5/mmproj-model-f16.gguf --image input_image.jpg
- vLLM部署:
pip install vllm 或源码安装,vLLM(model="openbmb/MiniCPM-V-4_5", trust_remote_code=True, dtype="bfloat16"),SamplingParams(temperature=0.8, top_p=0.95, max_tokens=512)
- Ollama部署:
ollama pull openbmb/minicpm-v:4.5,Modelfile配置,curl http://localhost:11434/api/generate API调用
- 性能对比表:llama.cpp 6-8GB显存 / vLLM 16GB+ / Ollama int4量化
- GPU推荐:RTX 4090 / A100,16GB+显存
- 移动端:iPad Pro M4 / 高端Android设备
- 优化技巧:4-bit量化减少75%显存
- 视频帧处理:按FPS抽帧逐帧推理
- 工程评价:多框架横向对比(llama.cpp / vLLM / Ollama),含具体启动命令、硬件要求、性能对比表。MiniCPM-V 4.5定位端侧多模态,8B参数视觉超越GPT-4o-latest。适合作为"端侧多模态推理框架选型"参考。
- 可信度:高(有命令输出、模型下载方式、性能对比表)
- 建议分类:
多模态 / 推理部署 / llama.cpp / vLLM / Ollama / 端侧推理 / MiniCPM
- 后续行动:与Qwen2.5-VL / InternVL端侧部署方案对比,写入多模态推理部署主题页
3. DeepSeek 本地部署完全方案:从环境搭建到推理优化
- URL:https://blog.csdn.net/deepin20100/article/details/162314523
- 来源:CSDN博客
- 时间:2026-06-25(最新推荐 2026-07-20)
- 复现价值:⭐⭐⭐⭐⭐
- 涉及版本/模型:DeepSeek-V3 · DeepSeek-R1 · DeepSeek-V2.5 · DeepSeek-Coder-V2 · DeepSeek-V2-Lite · 各量化版本
- 核心技术点:
- 硬件对照表(显存需求 → 推荐部署方案):
| 模型 | 参数量 | 8×A100 80GB | 2×4090 24GB | 适用场景 |
| DeepSeek-V3 | 671B (37B激活) | ✅ | ❌ | 多卡/云服务器 |
| DeepSeek-R1 | 671B (37B激活) | ✅ | ❌ | 同上 |
| DeepSeek-V2.5 | 236B (21B激活) | ✅ | ✅量化版 | 单卡可跑量化版 |
| DeepSeek-V2-Lite | 16B | 32GB | 10GB | RTX 3060 12GB |
| DeepSeek-R1-Distill-Qwen-1.5B | 1.5B | 3GB | 1.5GB | GTX 1660 6GB |
- 环境:
Python 3.10-3.12,CUDA Toolkit 12.1+,conda create -n deepseek python=3.10 -y
- CUDA验证:
torch.cuda.is_available(),torch.cuda.get_device_name(0)
- Ollama:
ollama run deepseek-r1:7b;API模式:http://localhost:11434
- vLLM + OpenAI兼容API:
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B-Q5_K_M.gguf
- vLLM关键参数:
--gpu-memory-utilization 0.9,--tensor-parallel-size,--max-model-len
- Docker:
docker run -d -p 11434:11434 --name ollama-deepseek ollama/ollama serve
- 量化GGUF下载:
wget https://huggingface.co/...DeepSeek-R1-Distill-Qwen-7B-Q5_K_M.gguf
- 显存档位:8GB→1.5B蒸馏版;12GB→7B蒸馏或16B量化;24GB+→体验较好
- 工程评价:最完整的DeepSeek本地部署指南,硬件对照表覆盖1.3B-671B全系,配命令、API调用、量化选择。vLLM多卡/单卡两条路径清晰。
- 可信度:高(有完整命令序列和硬件规格表)
- 建议分类:
LLM部署 / DeepSeek / vLLM / Ollama / 量化 / 多卡部署
- 后续行动:与Qwen3 / Llama4本地部署指南合并,写入LLM部署主题页
高价值条目 · Tier 2(技术洞察价值高)
4. LLM微调实战:从QLoRA到生产部署的工程化全流程
- URL:https://blog.csdn.net/weixin_30934229/article/details/162051295
- 时间:2026-04-02
- 复现价值:⭐⭐⭐⭐
- 涉及技术:QLoRA · LoRA · 全参数微调 · 分布式训练 · RLHF · SFT
- 核心观点:微调是有明确边界、可拆解、可验证、可复现的工程实践,不是玄学。核心价值:降低GPU资源门槛的同时保持专业能力。
- 工程评价:工程化视角强,适合作为微调方法选型参考(LoRA vs QLoRA vs 全参数)
5. Ollama与vLLM推理框架对比
- URL:https://blog.csdn.net/su_xiao_wei/article/details/145904984
- 时间:2025-02-27(修改 2025-06-03)
- 复现价值:⭐⭐⭐⭐
- 核心对比维度:
- 量化:Ollama默认int4,vLLM默认FP16/BF16
- 显存占用:Qwen2.5-14B → Ollama 11GB vs vLLM 39GB
- 吞吐量:vLLM并发处理速度可达Ollama的24倍
- 并发架构:vLLM多进程(每GPU一个),Ollama单进程多线程
- 适用场景:个人开发者→Ollama;企业高并发→vLLM
- 工程评价:选型决策表清晰,含性能数据对比,适合作为框架选型依据
6. 第十章:生产环境中的 RAG:部署、监控与责任
- URL:https://blog.csdn.net/YPeng_Gao/article/details/147073412
- 时间:2025-04-08(修改 2025-05-30)
- 复现价值:⭐⭐⭐⭐
- 核心内容:
- 服务化架构:检索/生成/知识库接口解耦,API通信
- 部署方案:云平台(阿里云/腾讯云/百度智能云)vs 自建(ChromaDB/FAISS/LangChain/Docker/K8s)
- 监控体系:性能监控(延迟/吞吐量/资源利用率)+ 效果监控(召回率@10 + BLEU + 人工评估)+ 日志监控(Prometheus/Grafana/ELK)
- MLOps for RAG:反馈循环 + CI/CD(代码/模型/配置纳入持续集成)
- 安全/隐私:生产环境RAG安全检查清单
- 工程评价:生产级RAG系统checklist,监控体系描述完整,适合作为RAG生产部署验收标准
7. 推理优化技能:vLLM与TensorRT-LLM实现高吞吐量AI模型部署
- URL:https://blog.csdn.net/gitblog_00617/article/details/152877379
- 时间:2026-07-06
- 复现价值:⭐⭐⭐⭐
- 核心内容:
- PagedAttention:KV缓存分页管理,减少内存碎片
- 量化压缩:GPTQ/AWQ/FP8量化,模型大小减少2-4倍
- 动态批处理:根据负载动态调整批处理大小
- 配置建议:7B-13B单GPU(默认+前缀缓存);30B-70B多GPU(张量并行+量化);超大模型(流水线+张量并行)
- 量化选型:GPTQ通用 / AWQ精度损失小 / FP8(NVIDIA H100专属)/ INT4极致压缩
- 工程评价:2026年最新推理优化实战,含TensorRT-LLM启动命令和vLLM采样参数配置
中等价值条目 · Tier 3(参考线索)
8. LangChain源码分析(十一)- RAG检索
- URL:https://blog.csdn.net/oopsoom/article/details/152446064
- 时间:2025-10-03(修改 2025-10-17)
- 价值:LangChain
BaseRetriever 抽象基类源码分析,VectorStoreRetriever实现,MMR/相似度阈值搜索源码
- 建议:适合作为LangChain RAG源码学习入口
9. RAG的检索链路优化演变过程
- URL:https://blog.csdn.net/ALArm_a/article/details/162880995
- 价值:RAG检索链路设计思路,适合作为RAG检索演进历史梳理
10. 2026年RAG技术深度解析:从核心原理到企业落地的全景指南
- URL:https://blog.csdn.net/2301_77803292/article/details/162705936
- 时间:2026-04
- 价值:2026年RAG全景概述,Agentic RAG / Graph RAG / 多模态RAG方向提及
分类标签汇总
| 标签 |
条目数 |
| RAG |
8 |
| vLLM |
6 |
| Ollama |
5 |
| LLM部署/推理 |
6 |
| 向量数据库 |
3 |
| 多模态 |
3 |
| 微调/QLoRA/LoRA |
2 |
| LangChain |
2 |
| 监控/MLOps |
2 |
| openGauss/国产DB |
1 |
| DeepSeek |
1 |
建议写入路径
/shared/research-kb/inbox/jay/2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md
是否需要精读/审稿/主题页更新
| 动作 |
优先级 |
说明 |
| 精读Tier1条目1(openGauss RAG) |
中 |
需确认SQL Schema和Python代码在新版本openGauss上的兼容性 |
| 精读Tier1条目2(MiniCPM-V) |
中 |
需核验MiniCPM-V 4.5的GGUF模型下载链接和vLLM最新接口 |
| 精读Tier1条目3(DeepSeek部署) |
高 |
内容最新(2026-06),覆盖V3/R1全系,值得写入LLM部署主题页 |
| RAG主题页更新 |
中 |
Tier1条目1可作为RAG+国产向量数据库选型案例补充 |
| LLM部署主题页更新 |
高 |
Tier1条目3可完整覆盖DeepSeek部署章节 |
| 多模态推理主题页更新 |
中 |
Tier1条目2可作为端侧多模态部署参考 |
本次检索元数据
- 检索模型:MiniMax-M2.7-highspeed via Tavily
- 检索次数:3次(RAG · LLM微调 · 多模态)
- 高质量命中:10篇(Tier1: 3, Tier2: 4, Tier3: 3)
- 本轮写入:1个草稿文件
- 执行时间:2026-09-29 08:20 (Asia/Shanghai)