CSDN 高价值技术条目 · 下午场 · 2026-08-12
主题: CSDN 精选下午场 · 微调 / K8s部署 / 向量数据库选型 / RAG工程闭环 检索范围: CSDN 博客 · 近3个月 · 命令/YAML/源码/实测/排障类文章 去重参考: jay/inbox/ 2026-08-12 上午场(vLLM参数、Ollama对比、MCP协议) 本次检索覆盖: 微调工程闭环、K8s+LLM生产部署、向量数据库代码实战 筛选者: Jay · 2026-08-12 12:20 CST
一、微调工程闭环 · QLoRA/LLaMA-Factory 实战
精筛 A 级
A1:QLoRA、LlamaFactory、DeepEval 与 llama.cpp 工程闭环指南
- 链接: https://blog.csdn.net/weixin_32629853/article/details/162255203
- 作者: 老白Walt(码龄8年,633原创,3.6k点赞)
- 发布日期: 2026年(文章ID对应)
- 可信度: ★★★★
- 工程价值: 端到端工程闭环,从量化→微调→评估→部署全链路
- 核心内容:
- QLoRA 四层精度坍塌链路:FP16 → INT8 → INT4 → NF4
- llamafactory-cli webui 命令(
llamafactory-cli webui,12秒启动,浏览器自动弹出) - DeepEval 评估集成(LLM微调效果量化验证)
- llama.cpp 量化部署闭环(Q5_K_M 等量化格式生产选型)
- LLaMA 3 微调的特殊挑战(官方未提供训练脚本,需自行搭建 pipeline)
- Jay 评注: 作者是老牌技术博主,工程视角清晰;QLoRA精度链路描述有技术深度;与上午场vLLM参数指南形成"训练→推理"互补。
- 复现价值: ★★★★☆
- 与上午场互补: 上午场#1覆盖推理框架对比,本文覆盖训练到部署闭环,形成完整工程链路
二、K8s + LLM 生产部署 · GPU调度/模型热加载
精筛 A 级
A2:SITS 2026 官方认证 · K8s for AI 部署清单(含GPU调度/LLM推理/模型热加载)
- 链接: https://blog.csdn.net/Algorhythm/article/details/160972750
- 发布日期: 2026年(文章ID对应,SITS = Serverless + Intelligent Technology Summit)
- 可信度: ★★★★☆
- 工程价值: 生产级 YAML 配置,含 GPU 调度、模型热加载、Prometheus/Otel 可观测性
- 核心内容:
- GPU调度配置(K8s 1.28+):
yaml apiVersion: ai.example.com/v1 kind: AIWorkload spec: modelRef: "fraud-bert-v3" minReplicas: 2 autoscaler: targetQPS: 120 gpuMemoryUtilizationThreshold: 75% - vLLM/Triton Serving Sidecar 部署模式
- 模型热加载三阶段流水线: 版本快照 → 内存映射(mmap,<8ms)→ 服务无感切换(原子指针替换,<3ms)
- 混合调度策略:
- 训练任务(PyTorch DDP)→ KubeBatch + 拓扑感知 + RDMA亲和
- 在线推理(vLLM)→ Volcano + GPU显存碎片率<15%
- Prometheus 指标示例:
python lora_latency = Histogram('lora_inference_latency_seconds', 'LoRA inference latency', ['adapter_name']) - GitOps 模型发布流水线: Git Commit → Argo CD → A/B测试 → Flagger + Istio 灰度 → 全量切流
- 统一可观测性栈: Prometheus Exporter + OpenTelemetry gRPC Propagation + Fluent Bit 结构化日志
- Jay 评注: ⚠️
ai.example.com/v1是占位符 CRD,需替换为实际 K8s 运营商(如 Kinvolk Loft、Seldon Core);文章内容来自 SITS 2026 白皮书,有厂商无关的通用价值。 - 复现价值: ★★★★★(YAML 配置直接可用于生产参考)
三、向量数据库 · 代码实战 & 选型决策
精筛 A 级
A3:向量数据库选型指南 · PGVector/Qdrant/Milvus 代码实战(2026版)
- 链接: https://blog.csdn.net/2502_92311356/article/details/159793329
- 发布日期: 2026年(文章ID对应)
- 可信度: ★★★★
- 工程价值: 代码可直接复现,含 PGVector 初始化、Qdrant HNSW 索引配置、Milvus Schema 设计
- 核心代码摘要:
- PGVector 初始化:
python from langchain.vectorstores import PGVector vectorstore = PGVector( collection_name="my_knowledge_base", connection_string=CONNECTION_STRING, embedding_function=embeddings, ) - Qdrant HNSW 索引配置(生产核心):
python index_params.add_index( field_name="vector", index_type="HNSW", metric_type="COSINE", params={"M": 16, "ef_construction": 200} # 生产级参数 ) index_params.add_index( field_name="category", index_type="INVERTED" # 过滤查询加速 ) - 2026年选型结论:
- 已有PostgreSQL → pgvector(省基础设施)
- 新项目/中等规模RAG → Qdrant(最省心)
- 亿级数据 → Milvus(唯一稳妥选项)
- 多模态/GraphQL生态 → Weaviate
- Jay 评注: Qdrant HNSW 参数
M=16, ef_construction=200是生产级参考值;注意 PGVector 的connection_string需替换为实际 Postgres 连接串(包含密码)。 - 复现价值: ★★★★★(代码片段可直接嵌入 RAG 项目)
四、RAG 工程闭环 · GraphRAG 源码 & 2.0 演进
精筛 B 级(有源码,工程参考价值高)
B1:RAG 2.0 落地实战:从「检索增强」到「知识推理」的工程跃迁
- 链接: https://blog.csdn.net/m0_59235245/article/details/161494834
- 作者: 智泊AI(码龄5年,2503原创,3万+点赞)
- 发布日期: 2026年(文章ID对应)
- 可信度: ★★★★(高可信度作者)
- 工程价值: 有完整 GraphRAG 源码(Neo4j),含实体抽取、图查询、多跳推理代码
- 核心内容:
- GraphRAG 源码(Neo4j):
python # Neo4j 图数据库存储 session.run(""" MERGE (a:Entity {name: $head, type: $head_type}) MERGE (b:Entity {name: $tail, type: $tail_type}) MERGE (a)-[:$relation {source: $doc_id}]->(b) """) - 多跳查询流程: 用户问题 → LLM转Cypher查询 → 图数据库执行 → 路径送入LLM生成
- 记忆整合模块: 碎片记忆 → 衰减排序 → 高层抽象整合(JSON输出)
- RAG 2.0 核心洞察:从"像不像"到"对不对",从"模块"到"循环"
- Jay 评注: Neo4j 代码段可直接复现;作者为高质量技术博主(非标题党);"从模块到循环"是RAG 2.0的核心工程转变,有实战洞察。
- 复现价值: ★★★★(源码可直接参考)
- 建议: 可与上午场 RAG 演进文章互补归档
B2:向量数据库性能对比 · Milvus/Chroma/Qdrant(2026年)
- 链接: https://blog.csdn.net/2301_78285120/article/details/144808260
- 发布日期: 2026年7月(最新文章)
- 可信度: ★★★★
- 核心内容:
- 2026年企业RAG向量数据库使用率:Milvus(28%)、pgvector(22%)、Qdrant(15%)、Weaviate(12%)、Chroma(8%)
- Qdrant 的 Rust 实现带来显著写入优势
- 选型决策树:
- 已有PostgreSQL → pgvector
- 中等规模新项目 → Qdrant
- 亿级数据 → Milvus
- 多模态/GraphQL → Weaviate
- Jay 评注: 使用率数据适合作为选型参考背景;具体benchmark数据需核实。
- 降级理由: 无一手benchmark数据,作为选型背景参考价值高
五、综合评价
| 精筛等级 | 条目 | 核心价值 | 工程直接可用性 |
|---|---|---|---|
| A1(★★★★★) | QLoRA工程闭环 | 训练→推理完整链路 | 直接可参考微调流程 |
| A2(★★★★★) | K8s for AI 部署清单 | YAML+Prometheus+GitOps | 直接可用于生产K8s配置 |
| A3(★★★★★) | 向量数据库代码实战 | PGVector+Qdrant+Milvus代码 | 直接可嵌入RAG项目 |
| B1(★★★★) | RAG 2.0 GraphRAG源码 | Neo4j多跳查询代码 | 参考架构和源码 |
| B2(★★★) | 向量数据库选型对比 | 使用率数据+选型树 | 选型背景参考 |
标签归档
#QLoRA工程闭环 #LLaMA-Factory #llamafactory-cli #DeepEval #llama.cpp量化
#K8s-LLM部署 #GPU调度 #Volcano #KubeBatch #模型热加载 #mmap
#vLLM-Sidecar #ArgoCD #Flagger #Istio #Prometheus #OpenTelemetry
#向量数据库选型 #PGVector #Qdrant #Milvus #HNSW索引
#GraphRAG #Neo4j #Cypher #多跳查询 #RAG2.0
#CSDN精选 #精筛A档
建议写入路径
/shared/research-kb/inbox/jay/2026-08-12T1220-jay-csdn-finetuning-k8s-vecdb-afternoon.md
与上午场互补分析
| 维度 | 上午场覆盖 | 本次下午场覆盖 | 形成闭环 |
|---|---|---|---|
| 微调 | ❌(无) | QLoRA+LLaMA-Factory | ✅ 训练→推理完整链路 |
| 推理框架 | vLLM参数/实测 | K8s Sidecar部署vLLM | ✅ 单机→集群扩展 |
| 向量数据库 | ❌(无) | PGVector/Qdrant/Milvus代码 | ✅ 存储层选型+代码 |
| RAG工程 | Agentic RAG概念 | GraphRAG源码+Neo4j | ✅ 概念→源码落地 |
| 可观测性 | vLLM参数 | Prometheus+OTel+GitOps | ✅ 全链路可观测 |
后续行动建议
- 精读(A2): K8s for AI YAML配置 → 对照实际 K8s 运营商(Seldon Core / KServe / Kinvolk)官方文档核实 CRD 字段
- 核验(A3): Qdrant HNSW 参数
M=16, ef_construction=200→ 查阅 Qdrant 官方性能调优文档确认生产推荐值 - 主题页更新建议: - 微调工程页补充 A1 工程闭环链路 - K8s+AI 部署页补充 A2 YAML 和 Prometheus 配置 - RAG 工程页补充 A3 向量数据库代码 + B1 GraphRAG Neo4j 源码
- 审稿: 建议对 A2 的 GitOps 流程(Flagger + Istio 部分)进行工程同事复核
六、补充发现 · 推理框架部署 & RAG评测(本次新增)
精筛 A 级
A4:SGLang + vLLM + Qwen3.5 企业级部署案例实操
- 链接: https://blog.csdn.net/starzhou/article/details/158290747
- 发布日期: 最新推荐 2026-08-09(文章原始发布 2026-02)
- 可信度: ★★★★
- 工程价值: SGLang + vLLM 联合部署实战,企业级案例
- 核心内容: SGLang+VLLM双框架协同部署Qwen3.5,提供完整企业级部署方案
- Jay 评注: 与上午场vLLM参数指南互补;注意原文章发布于2月,需确认Qwen3.5版本兼容性。
- 复现价值: ★★★★
A5:推理框架横评 · vLLM / TGI / TensorRT-LLM / SGLang(含SGLang部署命令)
- 链接: https://blog.csdn.net/weixin_37647148/article/details/161914538
- 发布日期: 最新推荐 2026-08-06(文章原始发布 2026-06-13)
- 可信度: ★★★★
- 工程价值: 四框架横向对比,含SGLang完整部署命令和JSON输出处理
- 核心内容:
- SGLang 部署命令:
bash python -m sglang.launch_server \ --model-path Qwen/Qwen3-32B-Instruct \ --tp 4 \ --port 30000 \ --enable-radix-cache \ --enable-flashinfer - JSON输出保证100%合法(优于vLLM + outlines)
- 框架对比:vLLM / TGI / TensorRT-LLM / SGLang 四框架适用场景
- Jay 评注: SGLang 命令中的
--enable-flashinfer是关键性能参数,需确认硬件兼容性(H100/H200);JSON保证率对比有实测价值。 - 复现价值: ★★★★★
精筛 B 级
B3:DeepEval 企业级 LLM 评估框架完整实战指南
- 链接: https://blog.csdn.net/gitblog_01012/article/details/162XXX(ID不完整,内容为DeepEval评估框架)
- 发布日期: 2026-06-18
- 可信度: ★★★
- 核心内容:
- DeepEval 提供40+开箱即用评估指标
- 覆盖场景:RAG系统、多轮对话
- 幻觉检测(Hallucination)、答案相关性(Answer Relevancy)、忠实性(Faithfulness)
- 与RAGAS四大指标对应
- Jay 评注: DeepEval是RAG评测的重要工具;文章内容与上午场微调闭环(A1)中的DeepEval集成形成呼应,建议交叉参考。
- 复现价值: ★★★★
B4:RAG系统幻觉检测实战 · 方法与优化策略
- 链接: https://blog.csdn.net/weixin_42514540/article/details/160453563
- 发布日期: 2026年(文章ID对应)
- 可信度: ★★★
- 核心内容:
- RAG幻觉检测技术解析
- 忠实性(Faithfulness)vs 事实性(Factuality)区分
- 三层验证框架:事实一致性、逻辑自洽性、引用准确性
- Jay 评注: 分层验证框架有工程方法论价值;可与DeepEval(B3)联动使用。
- 复现价值: ★★★
七、精选汇总与标签
| 精筛等级 | 条目 | 核心价值 | 工程直接可用性 |
|---|---|---|---|
| A1(★★★★★) | QLoRA工程闭环 | 训练→推理完整链路 | 直接可参考微调流程 |
| A2(★★★★★) | K8s for AI 部署清单 | YAML+Prometheus+GitOps | 直接可用于生产K8s配置 |
| A3(★★★★★) | 向量数据库代码实战 | PGVector+Qdrant+Milvus代码 | 直接可嵌入RAG项目 |
| A4(★★★★) | SGLang+vLLM+Qwen3.5部署 | 企业级双框架协同 | 选型参考 |
| A5(★★★★★) | 四框架横评+SGLang命令 | 完整SGLang部署命令 | 直接可用于SGLang部署 |
| B1(★★★★) | RAG 2.0 GraphRAG源码 | Neo4j多跳查询代码 | 参考架构和源码 |
| B2(★★★) | 向量数据库选型对比 | 使用率数据+选型树 | 选型背景参考 |
| B3(★★★) | DeepEval评估框架 | 40+指标+RAG评测 | 与微调闭环形成互补 |
| B4(★★★) | RAG幻觉检测 | 分层验证框架 | 工程方法论参考 |
完整标签归档
#QLoRA工程闭环 #LLaMA-Factory #llamafactory-cli #DeepEval #llama.cpp量化
#K8s-LLM部署 #GPU调度 #Volcano #KubeBatch #模型热加载 #mmap
#vLLM-Sidecar #ArgoCD #Flagger #Istio #Prometheus #OpenTelemetry
#向量数据库选型 #PGVector #Qdrant #Milvus #HNSW索引 #ef_construction
#GraphRAG #Neo4j #Cypher #多跳查询 #RAG2.0
#SGLang部署命令 #推理框架横评 #TensorRT-LLM #TGI
#DeepEval #RAGAS #幻觉检测 #Faithfulness #Factuality
#Qwen3.5部署 #SGLang-vLLM协同 #CSDN精选 #精筛A档
Jay 实例 · 2026-08-12 12:20 CST · 下午场筛选完成 · 产出9条目(A级5条,B级4条)