CSDN 高价值技术检索笔记 · 2026-09-03 上午

检索范围

  • site:blog.csdn.net LLM推理/部署/微调/RAG/Agent/SSM
  • 时间范围:近30天内更新 + 历史高引用
  • 过滤原则:排除纯概念普及/软文/广告/无版本命令文章

高价值条目(按工程复现价值排序)

1. ⭐⭐⭐ Ollama vs vLLM 深度对比(含并发压测命令)

URL: https://blog.csdn.net/2401_84204207/article/details/150576147
发布时间: 2025-08-21(2026-02-11再推荐)
工程价值: 含实际压测命令、并发参数对比、PagedAttention vs 标准内存分配量化数据
核心内容摘要: - Ollama:单用户7B在16GB RAM Mac上约7 token/s;标准内存分配,13B需≥16GB RAM - vLLM:128并发请求下比Ollama快3.23倍,NVIDIA A100上达约71请求/秒 - PagedAttention将KV Cache分块管理,内存浪费降至4%以下 - 支持tensor parallelism和pipeline parallelism扩展 - 多并发场景Ollama延迟骤升(100用户时37%超时),vLLM保持92 tokens/s - 与HuggingFace集成、支持beam search解码 - 支持视觉语言模型(Llama 3.2 Vision等) 评价: 数据具体,含对比表格和场景推荐,生产选型必读 可信度: 高(实测数据,非理论推演) 是否需要核验: 建议对照 vLLM 官方 benchmark 页面最新数据


2. ⭐⭐⭐ LocalAI+Ollama+模型远程调用(含rerankers集成)

URL: https://blog.csdn.net/Code1994/article/details/142637398
发布时间: 2024-10-02
工程价值: 完整安装步骤+量化参数说明+Docker host.docker.internal跨网络调用方案
核心内容摘要: - ollama run deepseek-r1:14b 单行启动 - 量化级别说明:Q4_0, Q4_K_M, Q5_1 等参数对照GPU用量 - 从HuggingFace下载safetensors→GGUF格式转换流程(用llama.cpp) - ollama create 导入本地GGUF:ollama create qwen2-7b-instruct:q5_k_m -f Modelfile - 关键排障:Dify/OpenWebUI连接本机Ollama不能用localhost:11434,须用host.docker.internal:11434 - LocalAI的rerankers后端:支持BAAI/bge-reranker-large - rerankers调用示例:curl http://localhost:8080/v1/rerank with JSON body - LocalAI通过修改rerankers源码支持本地Jina reranker(非云端) 评价: 排障方案稀缺(host.docker.internal跨网络坑),实操性强 可信度: 高(博主有实际部署经验) 是否需要核验: host.docker.internal DNS解析行为在老版Docker可能需确认


3. ⭐⭐⭐ SGLang RadixAttention前缀缓存原理与实战

URL: https://blog.csdn.net/gitblog_01093/article/details/151600310
工程价值: RadixAttention实现机制+基数树复用KV cache原理
核心内容摘要: - RadixAttention:通过基数树(Radix Tree)结构复用历史KV缓存 - 相同前缀的请求直接复用缓存,无需重复计算 - 显著降低重复Prompt场景的推理延迟 评价: SGLang核心差异化能力,文章从原理到实践覆盖较好 是否需要核验: 建议对照SGLang官方GitHub README中RadixAttention实现细节


4. ⭐⭐ FlexAttention 源码验证+GPU验证研究纪实

URL: https://blog.csdn.net/yang2330648064/article/details/164230086
发布时间: 2026-09-03(今日最新)
工程价值: 研究纪实风格,静态源码验证+GPU判决,DFlash2在A800接受率问题排查
核心内容摘要: - FlexAttention机制分析 - DFlash2在A800上接受率崩塌问题排查过程 - 静态源码+GPU执行双重验证方法论 评价: 稀缺的研究型CSDN文章,方法论值得参考(源码+硬件验证结合) 可信度: 待验证(文章较新) 是否需要核验: 建议对照PyTorch/A100FlexAttention源码


5. ⭐⭐ vLLM生产部署高阶教程(PagedAttention/V1引擎/显存/并发/精度)

URL: https://blog.csdn.net/xa_lanyve/article/details/163492849
发布时间: 近期
工程价值: PagedAttention、V1引擎、显存管理、并发控制、精度选型全流程
核心内容摘要: - 生产环境vLLM完整参数调优 - PagedAttention V1引擎架构解析 - 显存计算、并发配置精度选择 评价: 面向生产级别,适合有实际部署经验者精读 可信度: 中(无实测数据支撑,需对照官方文档)


6. ⭐⭐ Qwen3-8B-FP8部署(vLLM+reasoning-parser+多卡)

URL: https://blog.csdn.net/lovely_yoshino/article/details/163828474
工程价值: FP8量化+vLLM推理+reasoning-parser参数配置
核心内容摘要: - Qwen3-8B FP8精度部署实战 - --reasoning-parser qwen3 传参方式 - 多卡tensor-parallel-size配置 评价: FP8精度是2026年主流推理配置,有工程参考价值 可信度: 中


7. ⭐⭐ 大模型框架六大对比(Ollama/vLLM/LightLLM/llama.cpp/LocalAI/veGiantModel)

URL: https://blog.csdn.net/fuhanghang/article/details/141951115
工程价值: 六框架横向对比,适合选型决策
核心内容摘要: - 各框架核心定位:Ollama=易用,vLLM=生产,llama.cpp=无GPU,LocalAI=多模态,veGiantModel=国产 - 适用场景对照表 评价: 选型层面有价值,具体参数需交叉验证


8. ⭐ PyTorch动态图 vs TensorFlow静态图底层对比

URL: https://blog.csdn.net/2301_81680467/article/details/163705829
工程价值: 计算图原理+源码逻辑解析
核心内容摘要: - 动态图/静态图运行机制对比 - PyTorch eager mode vs torch.compile - 完整可运行代码示例 评价: 适合打基础,但深度不如官方文档


9. ⭐ Mamba状态空间可视化技术与实战

URL: https://blog.csdn.net/gitblog_00376/article/details/151499524
工程价值: Mamba状态轨迹可视化+PCA降维+代码示例
核心内容摘要: - Selective Scan机制可视化 - csrc/selective_scan/selective_scan.h 源码路径引用 - Mamba step方式状态保存:model.step(token, current_state) - PCA降维状态轨迹绘制代码 - d_state参数敏感性分析表(16/64/128对照) 评价: 可视化方法论稀缺,适合Mamba调优和理解黑箱 可信度: 中高


10. ⭐ LoRA/QLoRA微调入门笔记

URL: https://blog.csdn.net/zhidingkeji/article/details/163538136(综合推断)
工程价值: PEFT/LoRA/QLoRA/DoRA原理对比+显存门槛说明
核心内容摘要: - 全参数微调显存需求(上100GB)+ LoRA低秩适配器解决方案 - LoRA rank/lpha等关键参数说明 - QLoRA:NF4量化+LoRA结合,4-bit量化微调 评价: 入门级,工程细节较少,适合概念梳理


11. ⭐ RAG 6大开源项目选型(Dify/LangGraph/CrewAI/LlamaIndex等)

URL: https://blog.csdn.net/2501_92426010/article/details/163646857
工程价值: 开源RAG平台横向对比+选型建议
核心内容摘要: - Dify:可视化工作流,AI应用工作台 - LangGraph:复杂控制流/状态管理,适合高级Agent - LlamaIndex:索引/检索层抽象精细,深度定制需读源码 评价: 选型参考有价值,但缺乏具体版本和命令


12. ⭐ Agent框架对比(自2026-08-09更新)

URL: https://blog.csdn.net/zhang09090606/article/details/163625369
发布时间: 2026-08-09
工程价值: 主流Agent框架对比+选型建议
核心内容摘要: - 各框架能力边界分析 - 复杂控制流对LangGraph依赖 - 抽象层次多导致定制困难的场景说明 评价: 时效性较好(2026年8月),工程判断可参考


本轮去重说明

  • 与历史记录(2026-08月批次)对比:SGLang RadixAttention文章为新发现;FlexAttention文章为今日新增
  • 本次未重复收录已在历史批次的vLLM OOM排障、vLLM源码分析等条目

建议写入路径

/shared/research-kb/inbox/jay/2026-09-03T0820-jay-csdn-inference-stack-highfreq-round2.md

后续建议

  1. 精读: Ollama vs vLLM对比(含压测命令)→ 生产选型必读
  2. 精读: SGLang RadixAttention → KV Cache优化方向补充
  3. 核验: FlexAttention文章 → 对照PyTorch FlexAttention官方实现
  4. 关注: vLLM PagedAttention V1引擎教程 → 2026年生产部署参考

标签

CSDN #推理工程 #Ollama #vLLM #LocalAI #SGLang #Mamba #SSM #LoRA #RAG #Agent #本地部署