知识库草稿 · Jay CSDN 高频检索 · 2026-07-31
本次主题
CSDN/腾讯云/火山引擎 高价值 AI 工程化文章 · vLLM 推理优化 · 企业级 RAG · DeepSeek/Qwen 部署
候选条目(按工程价值排序)
1. 腾讯云开发者社区 · 《基于 vLLM 的大模型推理服务部署与性能调优实战》
- 来源:cloud.tencent.com · CSDN 同步发布
- 时间:2026-01-13
- 阅读量:3.2K(社区专栏)
- 类型:部署实操 + 配置参数详解
- 核心内容:
gpu_memory_utilization(0.85-0.95 推荐)swap_space(CPU 交换空间,显存不足时降级)max_model_len、max_num_seqs、max_num_batched_tokensblock_size(PagedAttention 块大小 8/16/32)enable_prefix_caching启用前缀缓存enforce_eager禁用 CUDA Graph- 调度策略
fcfs/priority - 分布式部署参数
- 评价:⭐⭐⭐⭐ 有明确参数表和数值建议,工程可直接参考,适合做 vLLM 部署 Check List
- 可信度:高(腾讯云官方社区,工程师署名)
- 复现价值:高
- 标签:
#vLLM#推理服务#PagedAttention#部署调优
2. CSDN 七月火 · 《一文通透vLLM与其核心技术PagedAttention》
- 来源:blog.csdn.net/v_JULY_v
- 时间:首次发布 2024-12-03 · 修改 2026-06-14
- 阅读量:1.2w
- 类型:原理图解 + 内存管理分析
- 核心内容:
- PagedAttention 与操作系统虚拟内存/分页的类比
- KV Cache 碎片化问题(60-80% 显存浪费根源)
- Block-wise attention 计算公式
- 物理块 / 逻辑块 / Block Table 映射机制
- Copy-on-write 在并行采样和 Beam Search 中的应用
- 评价:⭐⭐⭐⭐⭐ 图解丰富、类比清晰,是目前中文网络最系统的 PagedAttention 入门到进阶文章
- 可信度:高(July 图灵奖系列作者,学术工程背景)
- 精读价值:高,适合加入「LLM 推理优化」主题页
- 标签:
#vLLM#PagedAttention#KVCache#原理图解
3. 阿里云文档 · 《一键微调 DeepSeek-R1 蒸馏模型》
- 来源:help.aliyun.com · 官方文档
- 时间:更新至 2026-03-26
- 类型:PAI Model Gallery 操作指南
- 核心内容:
- 6 个蒸馏模型(Qwen 1.5B/7B/14B/32B、Llama 8B/70B)的最低算力配置表
- LoRA SFT 数据格式要求(含思维链数据准备说明)
- 过拟合排查:学习率 5e-6 调优经验
- DLC 计费说明和常见训练失败排查
- 评价:⭐⭐⭐⭐ 官方文档,配置确实可执行,有明确硬件门槛
- 可信度:高(阿里云官方)
- 标签:
#DeepSeek-R1#LoRA#微调#PAI#Qwen
4. 腾讯云/火山引擎 · 《RAG 系统实现进阶:向量检索、Embedding 与召回优化》
- 来源:blog.csdn.net(高阅读量 CSDN 专栏)
- 时间:近期(2026 年内)
- 类型:RAG 架构深度优化
- 核心内容:
- 混合检索(向量 + BM25 + RRF 融合)
- Re-ranking 两阶段流程
- HyDE(假设文档嵌入)技巧
- PageIndex 非向量检索新方法
- GraphRAG + 知识图谱结合路径
- 企业 RAG 三大挑战:历史数据过时 / 分块破坏上下文 / 向量检索局限
- 评价:⭐⭐⭐⭐ 覆盖面广,包含 2026 年新趋势(PageIndex、GraphRAG)
- 可信度:中高(CSDN 高赞技术专栏)
- 标签:
#RAG#混合检索#Re-ranking#GraphRAG#Embedding
5. Datawhale self-llm · DeepSeek-R1-Distill-Qwen-7B vLLM 部署调用
- 来源:github.com/datawhalechina/self-llm
- 类型:Step-by-step 部署指南
- 核心内容:
- ModelScope 模型下载脚本
- vLLM OpenAI-compatible API 启动命令
- curl / OpenAI SDK 调用示例
- 流式输出和非流式输出代码
- 评价:⭐⭐⭐⭐ 完整可复现,适合初学者跑通 DeepSeek 推理
- 可信度:高(Datawhale 开源项目)
- 标签:
#DeepSeek-R1#vLLM#Qwen#部署#Datawhale
6. 鲲鹏社区 · DeepSeek-R1-Distill-Qwen-7B 昇腾 NPU 部署
- 来源:hikunpengrag 文档
- 类型:Ascend NPU + 昇腾 310P 驱动安装 + MindIE 推理服务
- 核心内容:
- Docker exec 进入容器
- CANN 驱动安装与校验
mindieservice_daemon启动命令- config.json 修改路径
- curl 接口测试
- 评价:⭐⭐⭐ 国产硬件特定路径,非通用场景,但对华为昇腾用户有唯一参考价值
- 可信度:中(鲲鹏官方文档)
- 标签:
#DeepSeek-R1#昇腾#NPU#MindIE#国产化
分类标签汇总
#vLLM #PagedAttention #KVCache #RAG #混合检索 #Re-ranking
#GraphRAG #DeepSeek-R1 #Qwen #LoRA #微调 #推理服务
#部署调优 #Embedding #企业级RAG #昇腾 #NPU #PAI
高价值条目(建议写入知识库)
| 条目 | 写入优先级 | 建议分类 |
|---|---|---|
| July_v · vLLM/PagedAttention 图解 | ★★★★★ 高 | LLM 推理优化 · 原理 |
| 腾讯云 · vLLM 部署性能调优实战 | ★★★★☆ 高 | LLM 推理服务 · 工程实践 |
| 阿里云 PAI · DeepSeek-R1 微调 | ★★★★☆ 中高 | 模型微调 · 运维手册 |
| 腾讯云 · RAG 进阶优化 | ★★★★☆ 中高 | RAG 系统 · 架构设计 |
| Datawhale self-llm · DeepSeek vLLM 部署 | ★★★★☆ 中 | 部署指南 · Step-by-step |
建议写入路径
/shared/research-kb/inbox/jay/2026-07-31-csdn-weekly.md
后续行动建议
- 精读:July_v 的 PagedAttention 图解文章 → 建议纳入「LLM 推理优化」主题页核心参考文献
- 审稿:腾讯云 vLLM 部署文章的配置参数表 → 可提炼为 vLLM 部署 Check List
- 跨平台核验:DeepSeek-R1 微调数据格式要求 → 建议对照官方 GitHub 和 ModelScope 文档交叉验证
- 主题页更新:「LLM 推理优化」页可新增 PageIndex 和 CAG(Cache-Augmented Generation)两条 2026 新兴技术路径
本条检索完成时间:2026-07-31 08:20 UTC | 检索范围:CSDN/腾讯云/火山引擎/阿里云/鲲鹏/知乎 | 不含 Substack 本轮