知识库草稿 · Jay CSDN 高频检索 · 2026-07-31

本次主题

CSDN/腾讯云/火山引擎 高价值 AI 工程化文章 · vLLM 推理优化 · 企业级 RAG · DeepSeek/Qwen 部署


候选条目(按工程价值排序)

1. 腾讯云开发者社区 · 《基于 vLLM 的大模型推理服务部署与性能调优实战》

  • 来源:cloud.tencent.com · CSDN 同步发布
  • 时间:2026-01-13
  • 阅读量:3.2K(社区专栏)
  • 类型:部署实操 + 配置参数详解
  • 核心内容
  • gpu_memory_utilization(0.85-0.95 推荐)
  • swap_space(CPU 交换空间,显存不足时降级)
  • max_model_lenmax_num_seqsmax_num_batched_tokens
  • block_size(PagedAttention 块大小 8/16/32)
  • enable_prefix_caching 启用前缀缓存
  • enforce_eager 禁用 CUDA Graph
  • 调度策略 fcfs / priority
  • 分布式部署参数
  • 评价:⭐⭐⭐⭐ 有明确参数表和数值建议,工程可直接参考,适合做 vLLM 部署 Check List
  • 可信度:高(腾讯云官方社区,工程师署名)
  • 复现价值:高
  • 标签#vLLM #推理服务 #PagedAttention #部署调优

2. CSDN 七月火 · 《一文通透vLLM与其核心技术PagedAttention》

  • 来源:blog.csdn.net/v_JULY_v
  • 时间:首次发布 2024-12-03 · 修改 2026-06-14
  • 阅读量:1.2w
  • 类型:原理图解 + 内存管理分析
  • 核心内容
  • PagedAttention 与操作系统虚拟内存/分页的类比
  • KV Cache 碎片化问题(60-80% 显存浪费根源)
  • Block-wise attention 计算公式
  • 物理块 / 逻辑块 / Block Table 映射机制
  • Copy-on-write 在并行采样和 Beam Search 中的应用
  • 评价:⭐⭐⭐⭐⭐ 图解丰富、类比清晰,是目前中文网络最系统的 PagedAttention 入门到进阶文章
  • 可信度:高(July 图灵奖系列作者,学术工程背景)
  • 精读价值:高,适合加入「LLM 推理优化」主题页
  • 标签#vLLM #PagedAttention #KVCache #原理图解

3. 阿里云文档 · 《一键微调 DeepSeek-R1 蒸馏模型》

  • 来源:help.aliyun.com · 官方文档
  • 时间:更新至 2026-03-26
  • 类型:PAI Model Gallery 操作指南
  • 核心内容
  • 6 个蒸馏模型(Qwen 1.5B/7B/14B/32B、Llama 8B/70B)的最低算力配置表
  • LoRA SFT 数据格式要求(含思维链数据准备说明)
  • 过拟合排查:学习率 5e-6 调优经验
  • DLC 计费说明和常见训练失败排查
  • 评价:⭐⭐⭐⭐ 官方文档,配置确实可执行,有明确硬件门槛
  • 可信度:高(阿里云官方)
  • 标签#DeepSeek-R1 #LoRA #微调 #PAI #Qwen

4. 腾讯云/火山引擎 · 《RAG 系统实现进阶:向量检索、Embedding 与召回优化》

  • 来源:blog.csdn.net(高阅读量 CSDN 专栏)
  • 时间:近期(2026 年内)
  • 类型:RAG 架构深度优化
  • 核心内容
  • 混合检索(向量 + BM25 + RRF 融合)
  • Re-ranking 两阶段流程
  • HyDE(假设文档嵌入)技巧
  • PageIndex 非向量检索新方法
  • GraphRAG + 知识图谱结合路径
  • 企业 RAG 三大挑战:历史数据过时 / 分块破坏上下文 / 向量检索局限
  • 评价:⭐⭐⭐⭐ 覆盖面广,包含 2026 年新趋势(PageIndex、GraphRAG)
  • 可信度:中高(CSDN 高赞技术专栏)
  • 标签#RAG #混合检索 #Re-ranking #GraphRAG #Embedding

5. Datawhale self-llm · DeepSeek-R1-Distill-Qwen-7B vLLM 部署调用

  • 来源:github.com/datawhalechina/self-llm
  • 类型:Step-by-step 部署指南
  • 核心内容
  • ModelScope 模型下载脚本
  • vLLM OpenAI-compatible API 启动命令
  • curl / OpenAI SDK 调用示例
  • 流式输出和非流式输出代码
  • 评价:⭐⭐⭐⭐ 完整可复现,适合初学者跑通 DeepSeek 推理
  • 可信度:高(Datawhale 开源项目)
  • 标签#DeepSeek-R1 #vLLM #Qwen #部署 #Datawhale

6. 鲲鹏社区 · DeepSeek-R1-Distill-Qwen-7B 昇腾 NPU 部署

  • 来源:hikunpengrag 文档
  • 类型:Ascend NPU + 昇腾 310P 驱动安装 + MindIE 推理服务
  • 核心内容
  • Docker exec 进入容器
  • CANN 驱动安装与校验
  • mindieservice_daemon 启动命令
  • config.json 修改路径
  • curl 接口测试
  • 评价:⭐⭐⭐ 国产硬件特定路径,非通用场景,但对华为昇腾用户有唯一参考价值
  • 可信度:中(鲲鹏官方文档)
  • 标签#DeepSeek-R1 #昇腾 #NPU #MindIE #国产化

分类标签汇总

#vLLM #PagedAttention #KVCache #RAG #混合检索 #Re-ranking
#GraphRAG #DeepSeek-R1 #Qwen #LoRA #微调 #推理服务
#部署调优 #Embedding #企业级RAG #昇腾 #NPU #PAI

高价值条目(建议写入知识库)

条目 写入优先级 建议分类
July_v · vLLM/PagedAttention 图解 ★★★★★ 高 LLM 推理优化 · 原理
腾讯云 · vLLM 部署性能调优实战 ★★★★☆ 高 LLM 推理服务 · 工程实践
阿里云 PAI · DeepSeek-R1 微调 ★★★★☆ 中高 模型微调 · 运维手册
腾讯云 · RAG 进阶优化 ★★★★☆ 中高 RAG 系统 · 架构设计
Datawhale self-llm · DeepSeek vLLM 部署 ★★★★☆ 中 部署指南 · Step-by-step

建议写入路径

/shared/research-kb/inbox/jay/2026-07-31-csdn-weekly.md

后续行动建议

  1. 精读:July_v 的 PagedAttention 图解文章 → 建议纳入「LLM 推理优化」主题页核心参考文献
  2. 审稿:腾讯云 vLLM 部署文章的配置参数表 → 可提炼为 vLLM 部署 Check List
  3. 跨平台核验:DeepSeek-R1 微调数据格式要求 → 建议对照官方 GitHub 和 ModelScope 文档交叉验证
  4. 主题页更新:「LLM 推理优化」页可新增 PageIndex 和 CAG(Cache-Augmented Generation)两条 2026 新兴技术路径

本条检索完成时间:2026-07-31 08:20 UTC | 检索范围:CSDN/腾讯云/火山引擎/阿里云/鲲鹏/知乎 | 不含 Substack 本轮