知识库草稿 · Jay · 2026-09-15T1620
主题
CSDN 高价值检索 · LLM 推理引擎深度优化 + 云原生/DevOps + 数据库选型实战 · 第 3 次轮次
检索范围
- CSDN:LLM 推理引擎(vLLM/SGLang/TensorRT-LLM)、昇腾适配、本地部署、数据库选型(PG/MySQL)、云原生 DevOps(Docker/K8s/ArgoCD)
- 时间:2025-2026 年内
【A】高价值条目
A1. CSDN · LLM 推理引擎三强对比:vLLM vs SGLang vs TensorRT-LLM(2026)
- URL:
https://blog.csdn.net/u010420283/article/details/163282013 - 来源:CSDN 博客
- 标签:[LLM 推理][vLLM][SGLang][TensorRT-LLM][2026]
- 工程价值:⭐⭐⭐⭐⭐
- 核心结论:2026 年推理引擎格局已清晰——vLLM 是生产部署的事实标准;SGLang 在长上下文 + RadixAttention 场景有优势;TensorRT-LLM 是 NVIDIA 硬件上的性能天花板。
- KV Cache 管理维度对比:PagedAttention(vLLM)vs RadixAttention(SGLang)vs TensorRT-LLM 编译优化;连续批处理、Prefix Caching 支持情况。
- 编译优化维度:TensorRT-LLM 采用 graph compilation,延迟最优但首 token 慢;vLLM/SGLang JIT-style 更适合可变长度场景。
- 多卡并行维度:Tensor Parallel 实测数据对比;跨节点通信开销分析。
- 适用场景矩阵:小团队快速迭代 → vLLM;长上下文应用(>128K)→ SGLang;NVIDIA A100/H100 极致性能 → TensorRT-LLM。
- 复现价值:✅ 有实测性能对比数据;适合做推理引擎选型决策参考。
- 可信度:高;CSDN 2026 年文章,引用公开 benchmark 数据。
- 评价:本文是 2026 年中文社区难得的推理引擎横向对比,覆盖三强技术路线差异和实测结论,工程导向明确,适合纳入"推理系统选型"主题页。
摘要:2026 年 LLM 推理引擎三足鼎立:vLLM 以 PagedAttention 和 OpenAI 兼容 API 占据生产部署主流;SGLang 以 RadixAttention 在长序列场景突围;TensorRT-LLM 在 NVIDIA 旗舰卡上追求极致吞吐。本文给出三者在 KV Cache 管理、编译优化、多卡并行、适用场景的系统性对比,供工程选型参考。
后续行动:建议纳入"推理系统工程"主题页;可与 Session 1220 的推理模型文章形成互补(一个管推理模型,一个管推理引擎)。
A2. CSDN · vLLM 推理服务部署实战:原理、参数调优与昇腾适配
- URL:
https://bbs.csdn.net/weixin_29722783/article/details/100270305 - 来源:CSDN 论坛(weixin_29722783)
- 时间:2026-08-28 最后修改
- 标签:[vLLM][PagedAttention][Continuous Batching][昇腾 910B][国产化]
- 工程价值:⭐⭐⭐⭐
- PagedAttention 原理:KV Cache 按固定块(如 16 tokens/块)切分,通过 Block Table 索引映射;相同 system prompt 前缀多请求共享物理块,显存利用率提升 2~4 倍。
- Continuous Batching:迭代级调度——每步解码结束动态调整批次,新请求即时插入,已完成请求即时退出;避免传统批处理中"慢请求阻塞快请求"问题。
- 量化支持:AWQ/GPTQ/FP8;70B 模型 FP16 需 140GB 显存,AWQ 4bit 可压至 35GB,单卡 40GB 可部署。
- 昇腾 910B 适配:单芯算力 256 TOPS@INT8;67B 模型 FP16 需双卡 A2(>120GB),容易 OOM;文档提出三阶评估法(功能验证→性能基线→TCO 核算)。
- 国产化亮点:DaVinci 架构 Cube 单元专为矩阵乘优化,支持动态 shape 推理与稀疏化计算;配套 CANN 软件栈(ATC 工具链、GE 图编译)。
- Docker 部署实操:含
docker run示例和 vLLM 与 SGLang 选型建议(max-num-seq参数调优)。 - 复现价值:✅ 有 Docker 部署命令、昇腾 910B 参数配置、三阶评估法;可直接用于国产化推理服务落地。
- 可信度:高;2026-08 修订,引用昇腾官方参数,有量化数据和实测场景。
摘要:本文系统讲解 vLLM 的 PagedAttention 和 Continuous Batching 核心原理,提供昇腾 910B 上 67B 模型部署的三阶评估法(功能验证→性能基线→TCO 核算),含 Docker 部署实操和 SGLang 对比选型建议。国产化推理服务落地的工程参考价值突出。
后续行动:建议纳入"国产 GPU 推理部署"子主题;telemetry 配置和量化参数可存档。
A3. CSDN · 本地部署大语言模型:从硬件抽象到生产级调优完整链路
- URL:
https://bbs.csdn.net/weixin_34015336/article/details/100157107 - 来源:CSDN 论坛(weixin_34015336)
- 时间:2026-06-23 最后修改
- 标签:[Ollama][llama.cpp][vLLM][本地部署][量化][RTX 3060/4090]
- 工程价值:⭐⭐⭐⭐
- 推理引擎选型逻辑:llama.cpp(单用户/消费级 GPU/<2K tokens/零配置)→ Ollama(快速原型/教学/嵌入式)→ vLLM(生产部署/高并发)。
- Docker 容器化方案:DeepSeek-R1:8b 模型 Ollama 服务封装、离线模型注册、Open WebUI 交互层、持久化存储、反向代理 + HTTPS、认证。
- RTX 3060/4090 消费级 GPU 部署要点:KV Cache 容量估算、电源纹波验证、Windows 11 24H2 兼容性。
- API 网关 + 灰度发布:生产级运维配置。
- 复现价值:✅ 有 Docker Compose 完整配置;覆盖消费级 GPU 实测数据。
- 可信度:中高;系统性综述,有版本和环境信息。
摘要:系统梳理 llama.cpp/Ollama/vLLM 的选型逻辑,重点给出 DeepSeek-R1:8b 在 RTX 3060/4090 上的 Docker 化部署完整链路(Ollama + Open WebUI + 反向代理 + 认证),覆盖消费级 GPU 运维要点。适合个人开发者和小团队参考。
后续行动:建议纳入"本地 LLM 部署"主题页;Ollama + Open WebUI 配置可作为参考模板存档。
A4. CSDN · PostgreSQL 17 新特性深度解析(VACUUM/JSON/增量备份/向量搜索)
- URL:
https://blog.csdn.net/m0_67391377/article/details/144256932 - 来源:CSDN 博客(m0_67391377)
- 时间:2025-11-06 推荐(原始发布 2024-12)
- 标签:[PostgreSQL 17][VACUUM 优化][JSON_TABLE][增量备份][HNSW 向量搜索]
- 工程价值:⭐⭐⭐⭐
- 块级别增量备份与恢复:
pg_basebackup -Ft -z -P+pg_combinebackup合并增量,显著减少备份时间和存储成本;实现方式和使用场景明确。 - 逻辑复制槽同步参数:主备库配置
slot_name和two_phase_commit;优化建议含参数对照表。 - SQL/JSON JSON_TABLE:将 JSON 数据直接转成关系表(
SELECT * FROM JSON_TABLE(...)),语法示例完整。 - PL/pgSQL 数组 %TYPE 和 %ROWTYPE:类型推断增强,减少手写类型声明。
- VACUUM 内存管理改进:写前日志(WAL)锁优化;IO 合并读取性能参数。
- HNSW 向量搜索性能提升:100 万条 768 维向量索引构建速度提升约 40%;适合 pgvector 场景。
- 复现价值:✅ 有 SQL 示例、配置参数、增量备份命令;可直接用于 PostgreSQL 17 升级评估。
- 可信度:高;引用 PostgreSQL 官方 release notes,2024-09 正式发布,功能有文档出处。
摘要:PostgreSQL 17 的核心工程价值集中在四块:增量备份(降本)、JSON_TABLE(开发效率)、VACUUM 优化(运维减负)、HNSW 向量搜索(AI 场景)。文章提供完整 SQL 示例和配置参数,适合 DBA 和后端工程师评估升级收益。
后续行动:建议纳入"数据库工程"主题页;JSON_TABLE 和 HNSW 性能数据可作为选型参考。
A5. CSDN · 电商系统 PostgreSQL vs MySQL 选型实战(JSONB/秒杀/分布式)
- URL:
https://tencentcloud.csdn.net/69ea9eb80a2f6a37c5a4cb48.html - 来源:腾讯云开发者社区(CSDN 生态)
- 作者:AgatePantain34
- 时间:2026-01-10
- 标签:[PostgreSQL][MySQL][JSONB][高并发秒杀][SKIP LOCKED][Citus]
- 工程价值:⭐⭐⭐⭐
- JSONB 实战对比:PostgreSQL JSONB 方案查询 SKU 属性比 MySQL 传统多表 JOIN 快约 30%;但单独统计某 SKU 属性时 MySQL 更优。
- 高并发秒杀:PostgreSQL SKIP LOCKED 特性处理并发抢购比 MySQL 方案成功处理量高约 15%;含内置队列功能。
- 分布式部署:PostgreSQL FDW(Foreign Data Wrapper)+ Citus 扩展实现透明分布式查询;MySQL 分片需要 MyCat 中间件,跨分片查询性能差。
- 事务控制:PostgreSQL 部分回滚(savepoint)处理异常订单更灵活;MySQL XA 协议开销较大。
- 实测数据:1000 并发压测数据,PostgreSQL 负载更平稳。
- 复现价值:✅ 有 SQL 示例、性能数据(30%/15%)、并发压测结论;可直接用于电商数据库选型决策。
- 可信度:中高;作者标注为实际项目经验,有量化对比数据。
摘要:基于日订单 10 万+ 真实电商场景,对比 PostgreSQL 和 MySQL 在 JSONB 查询(+30%)、秒杀并发(+15%)、分布式扩展(FDW/Citus)三个维度上的实测数据,给出"PostgreSQL 主库 + Redis 缓存"推荐架构。
后续行动:建议纳入"数据库工程·选型决策"子主题;JSONB 和 SKIP LOCKED 场景数据可作为架构设计参考。
A6. CSDN · Docker+K8s 从入门到生产:2026 年最完整实战指南
- URL:
https://blog.csdn.net/weixin_62242812/article/details/160967921 - 来源:CSDN 博客(weixin_62242812)
- 时间:2026-05-15 发布,2026-07-15 推荐
- 标签:[Docker][Kubernetes][containerd][GitOps][ArgoCD][Trivy][SBOM]
- 工程价值:⭐⭐⭐⭐
- 2026 年工具链:containerd 替代 Docker daemon 作为运行时(生产推荐);Docker CLI 仅作交互层;
docker scout cves替换 Trivy 作镜像扫描。 - GitOps 完整流水线:Git Push → GitHub Actions → Build & Test → Trivy Scan + SBOM → Push Image → ArgoCD → K8s Cluster;所有步骤命令化。
- 多阶段 Dockerfile 示例:Go 应用
CGO_ENABLED=0编译;Node.jsnpm ci --only=production;始终使用固定版本基础镜像(如node:20.11.0-alpine)。 - 生产级配置:Docker profiles 区分 dev/staging/production;ArgoCD GitOps 声明式配置。
- K8s 核心要点:Gateway API(2026 推荐替代 Ingress)、CoreDNS 服务发现、TLS 终止与 WAF 集成。
- 薪资数据(来源:2026 CNCF + 招聘平台):Docker+K8s+GitOps+可观测性 实战经验工程师薪资较传统后端/运维高 30~60%。
- 复现价值:✅ 有完整 Dockerfile 示例、docker-compose 示例、GitHub Actions YAML、ArgoCD 配置;可直接用于 CI/CD 流水线搭建。
- 可信度:中高;2026 年修订,内容覆盖 CNCF 最新工具链(containerd/Gateway API/Trivy Scout)。
- 注意:文章前半部分有云原生通识介绍,偏宽泛;工程价值集中在后半部分的命令和配置。
摘要:2026 年 Docker+K8s 生产级实践,核心价值在于工具链更新(containerd/Gateway API/Trivy Scout)和完整 GitOps 流水线配置。适合有一定基础但需要更新 2026 年工具链的工程师参考。
后续行动:建议纳入"DevOps 工程化"主题页;ArgoCD 配置和 Dockerfile 多阶段构建示例可直接复用。
【B】候选/降级条目
B1. CSDN · PostgreSQL 优化实践(从查询到架构)
- URL:
https://database.blog.csdn.net/article/details/153403091 - 标签:[PostgreSQL][索引][B-tree][GIN][分区表]
- 评价:偏综合概述,有 SQL 示例但缺具体版本和量化数据;可作为入门参考,不宜作为工程决策依据。
B2. CSDN · 编程语言选型终极指南(Python/Go/Rust)
- URL:
https://blog.csdn.net/qq_23625847/article/details/161089226 - 标签:[Python][Go][Rust][工程选型]
- 评价:语言特色综述为主,缺具体场景 benchmark 和量化数据;适合扫盲,不适合工程决策。
分类标签
[LLM 推理] [vLLM] [SGLang] [TensorRT-LLM] [昇腾 910B] [PagedAttention] [Continuous Batching] [Ollama] [量化] [PostgreSQL 17] [JSONB] [向量搜索] [HNSW] [Docker] [Kubernetes] [GitOps] [ArgoCD] [containerd] [DevOps] [数据库选型] [高并发]
建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-09-15T1620-csdn-llm-inference-cloudnative-backend-highvalue.md - 后续若需要,可分拆为:
inference-systems-selection.md(A1+A2 合并)local-llm-deployment-guide.md(A3)database-engineering-pg17-mysql-pg-comparison.md(A4+A5)devops-cloudnative-2026-toolchain.md(A6)
精读/审稿建议
- 精读:A1(推理引擎对比矩阵)、A2(昇腾适配实操)
- 审稿:A5(1000 并发压测数据建议核验原始来源)
- 主题页更新:建议评估是否需要新建"推理系统工程"主题页,或在现有架构主题页下增加 LLM 推理引擎选型子章节
去重说明
- 本次 A1(推理引擎对比)与 1220 轮次内容无重叠(1220 侧重推理模型/Agentic/MLOps)
- A2(vLLM 昇腾适配)与 1505 轮次数据库内容无重叠
- A6(Docker+K8s 2026)与 1505 的 backend/DevOps 略有关联但工具链版本更新,互补而非重复