CSDN 高价值技术检索笔记 · 2026-09-03 上午
检索范围
- site:blog.csdn.net LLM推理/部署/微调/RAG/Agent/SSM
- 时间范围:近30天内更新 + 历史高引用
- 过滤原则:排除纯概念普及/软文/广告/无版本命令文章
高价值条目(按工程复现价值排序)
1. ⭐⭐⭐ Ollama vs vLLM 深度对比(含并发压测命令)
URL: https://blog.csdn.net/2401_84204207/article/details/150576147
发布时间: 2025-08-21(2026-02-11再推荐)
工程价值: 含实际压测命令、并发参数对比、PagedAttention vs 标准内存分配量化数据
核心内容摘要:
- Ollama:单用户7B在16GB RAM Mac上约7 token/s;标准内存分配,13B需≥16GB RAM
- vLLM:128并发请求下比Ollama快3.23倍,NVIDIA A100上达约71请求/秒
- PagedAttention将KV Cache分块管理,内存浪费降至4%以下
- 支持tensor parallelism和pipeline parallelism扩展
- 多并发场景Ollama延迟骤升(100用户时37%超时),vLLM保持92 tokens/s
- 与HuggingFace集成、支持beam search解码
- 支持视觉语言模型(Llama 3.2 Vision等)
评价: 数据具体,含对比表格和场景推荐,生产选型必读
可信度: 高(实测数据,非理论推演)
是否需要核验: 建议对照 vLLM 官方 benchmark 页面最新数据
2. ⭐⭐⭐ LocalAI+Ollama+模型远程调用(含rerankers集成)
URL: https://blog.csdn.net/Code1994/article/details/142637398
发布时间: 2024-10-02
工程价值: 完整安装步骤+量化参数说明+Docker host.docker.internal跨网络调用方案
核心内容摘要:
- ollama run deepseek-r1:14b 单行启动
- 量化级别说明:Q4_0, Q4_K_M, Q5_1 等参数对照GPU用量
- 从HuggingFace下载safetensors→GGUF格式转换流程(用llama.cpp)
- ollama create 导入本地GGUF:ollama create qwen2-7b-instruct:q5_k_m -f Modelfile
- 关键排障:Dify/OpenWebUI连接本机Ollama不能用localhost:11434,须用host.docker.internal:11434
- LocalAI的rerankers后端:支持BAAI/bge-reranker-large
- rerankers调用示例:curl http://localhost:8080/v1/rerank with JSON body
- LocalAI通过修改rerankers源码支持本地Jina reranker(非云端)
评价: 排障方案稀缺(host.docker.internal跨网络坑),实操性强
可信度: 高(博主有实际部署经验)
是否需要核验: host.docker.internal DNS解析行为在老版Docker可能需确认
3. ⭐⭐⭐ SGLang RadixAttention前缀缓存原理与实战
URL: https://blog.csdn.net/gitblog_01093/article/details/151600310
工程价值: RadixAttention实现机制+基数树复用KV cache原理
核心内容摘要:
- RadixAttention:通过基数树(Radix Tree)结构复用历史KV缓存
- 相同前缀的请求直接复用缓存,无需重复计算
- 显著降低重复Prompt场景的推理延迟
评价: SGLang核心差异化能力,文章从原理到实践覆盖较好
是否需要核验: 建议对照SGLang官方GitHub README中RadixAttention实现细节
4. ⭐⭐ FlexAttention 源码验证+GPU验证研究纪实
URL: https://blog.csdn.net/yang2330648064/article/details/164230086
发布时间: 2026-09-03(今日最新)
工程价值: 研究纪实风格,静态源码验证+GPU判决,DFlash2在A800接受率问题排查
核心内容摘要:
- FlexAttention机制分析
- DFlash2在A800上接受率崩塌问题排查过程
- 静态源码+GPU执行双重验证方法论
评价: 稀缺的研究型CSDN文章,方法论值得参考(源码+硬件验证结合)
可信度: 待验证(文章较新)
是否需要核验: 建议对照PyTorch/A100FlexAttention源码
5. ⭐⭐ vLLM生产部署高阶教程(PagedAttention/V1引擎/显存/并发/精度)
URL: https://blog.csdn.net/xa_lanyve/article/details/163492849
发布时间: 近期
工程价值: PagedAttention、V1引擎、显存管理、并发控制、精度选型全流程
核心内容摘要:
- 生产环境vLLM完整参数调优
- PagedAttention V1引擎架构解析
- 显存计算、并发配置精度选择
评价: 面向生产级别,适合有实际部署经验者精读
可信度: 中(无实测数据支撑,需对照官方文档)
6. ⭐⭐ Qwen3-8B-FP8部署(vLLM+reasoning-parser+多卡)
URL: https://blog.csdn.net/lovely_yoshino/article/details/163828474
工程价值: FP8量化+vLLM推理+reasoning-parser参数配置
核心内容摘要:
- Qwen3-8B FP8精度部署实战
- --reasoning-parser qwen3 传参方式
- 多卡tensor-parallel-size配置
评价: FP8精度是2026年主流推理配置,有工程参考价值
可信度: 中
7. ⭐⭐ 大模型框架六大对比(Ollama/vLLM/LightLLM/llama.cpp/LocalAI/veGiantModel)
URL: https://blog.csdn.net/fuhanghang/article/details/141951115
工程价值: 六框架横向对比,适合选型决策
核心内容摘要:
- 各框架核心定位:Ollama=易用,vLLM=生产,llama.cpp=无GPU,LocalAI=多模态,veGiantModel=国产
- 适用场景对照表
评价: 选型层面有价值,具体参数需交叉验证
8. ⭐ PyTorch动态图 vs TensorFlow静态图底层对比
URL: https://blog.csdn.net/2301_81680467/article/details/163705829
工程价值: 计算图原理+源码逻辑解析
核心内容摘要:
- 动态图/静态图运行机制对比
- PyTorch eager mode vs torch.compile
- 完整可运行代码示例
评价: 适合打基础,但深度不如官方文档
9. ⭐ Mamba状态空间可视化技术与实战
URL: https://blog.csdn.net/gitblog_00376/article/details/151499524
工程价值: Mamba状态轨迹可视化+PCA降维+代码示例
核心内容摘要:
- Selective Scan机制可视化
- csrc/selective_scan/selective_scan.h 源码路径引用
- Mamba step方式状态保存:model.step(token, current_state)
- PCA降维状态轨迹绘制代码
- d_state参数敏感性分析表(16/64/128对照)
评价: 可视化方法论稀缺,适合Mamba调优和理解黑箱
可信度: 中高
10. ⭐ LoRA/QLoRA微调入门笔记
URL: https://blog.csdn.net/zhidingkeji/article/details/163538136(综合推断)
工程价值: PEFT/LoRA/QLoRA/DoRA原理对比+显存门槛说明
核心内容摘要:
- 全参数微调显存需求(上100GB)+ LoRA低秩适配器解决方案
- LoRA rank/lpha等关键参数说明
- QLoRA:NF4量化+LoRA结合,4-bit量化微调
评价: 入门级,工程细节较少,适合概念梳理
11. ⭐ RAG 6大开源项目选型(Dify/LangGraph/CrewAI/LlamaIndex等)
URL: https://blog.csdn.net/2501_92426010/article/details/163646857
工程价值: 开源RAG平台横向对比+选型建议
核心内容摘要:
- Dify:可视化工作流,AI应用工作台
- LangGraph:复杂控制流/状态管理,适合高级Agent
- LlamaIndex:索引/检索层抽象精细,深度定制需读源码
评价: 选型参考有价值,但缺乏具体版本和命令
12. ⭐ Agent框架对比(自2026-08-09更新)
URL: https://blog.csdn.net/zhang09090606/article/details/163625369
发布时间: 2026-08-09
工程价值: 主流Agent框架对比+选型建议
核心内容摘要:
- 各框架能力边界分析
- 复杂控制流对LangGraph依赖
- 抽象层次多导致定制困难的场景说明
评价: 时效性较好(2026年8月),工程判断可参考
本轮去重说明
- 与历史记录(2026-08月批次)对比:SGLang RadixAttention文章为新发现;FlexAttention文章为今日新增
- 本次未重复收录已在历史批次的vLLM OOM排障、vLLM源码分析等条目
建议写入路径
/shared/research-kb/inbox/jay/2026-09-03T0820-jay-csdn-inference-stack-highfreq-round2.md
后续建议
- 精读: Ollama vs vLLM对比(含压测命令)→ 生产选型必读
- 精读: SGLang RadixAttention → KV Cache优化方向补充
- 核验: FlexAttention文章 → 对照PyTorch FlexAttention官方实现
- 关注: vLLM PagedAttention V1引擎教程 → 2026年生产部署参考