知识库草稿 · Jay · 2026-07-21 08:20

主题

CSDN 高价值 · LLM 推理框架工程化 / vLLM vs SGLang 实战 / Substack AI Agent Stack 2026

检索范围

  • CSDN: LLM 部署、推理框架对比、RAG 工程化、Ollama/vLLM/SGLang 命令
  • Substack: AI agents stack 2026, OWASP agents, LLM evaluation tools

一、CSDN 高价值条目

✅ 高价值 1:大模型运行 ollama、vllm、huggingface、modelscope(Docker 命令实测)

链接: https://blog.csdn.net/qq_41359817/article/details/143786327 作者: qq_41359817(未确认是否为原创首发) 日期: 2025 年(具体日期待确认,snippet 推断) 可信度: 中高(有实际 docker 命令和环境配置) 工程价值: ⭐⭐⭐⭐⭐

摘要与评价: 本文提供完整的 Docker 启动命令和 API 验证步骤,可直接复现:

# Ollama Docker 启动
docker run -d --restart=always --gpus=all \
  -v /home/docker/ollama:/root/.ollama -p 11434:11434 \
  --name ollama ollama/ollama

# API 验证
curl http://ip:11434/api/tags          # 列出已下载模型
curl http://ip:11434/api/version      # 获取 Ollama 版本

# Ollama 0.3.0+ 多并发配置
curl http://ip:11434/api/generate -d '{"model":"qwen2:7b","keep_alive": -1}'

# Open WebUI 启动
docker run -d -p 8080:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

还包含 ModelScope 加载 vLLM 的 Docker 方式。适合作为本地 LLM 部署 SOP 文档参考。

建议分类: deployment docker ollama vllm 建议行动: 纳入部署命令库;需验证 Ollama 版本与 Open WebUI 兼容性


✅ 高价值 2:从微调到部署一条龙:LLaMA + LoRA + vLLM

链接: https://blog.csdn.net/xx_nm98/article/details/161399673 作者: xx_nm98 日期: 2026 年(根据 ID 推算) 可信度: 中 工程价值: ⭐⭐⭐⭐

摘要与评价: 覆盖从 LoRA 微调到 vLLM 推理部署的完整流水线。包含: - LoRA 微调参数配置(LoraConfig: r=8, lora_alpha=32, target_modules=["q_proj","k_proj"...], dropout=0.1) - 梯度检查点开启 enable_input_require_grads() - 断点续训逻辑 trainer.train(resume_from_checkpoint=last_checkpoint) - vLLM 部署配置

复现要点:

config = LoraConfig(
    task_type=TaskType.CAUSAL_LM,
    target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
    inference_mode=False,
    r=8, lora_alpha=32, lora_dropout=0.1
)

建议分类: finetuning lora vllm pipeline 建议行动: 提取 LoRA 关键参数;注意断点续训路径逻辑需根据 output_dir 动态定位


✅ 高价值 3:深度解析 Transformes、vLLM、Ollama 等 6 大主流部署框架

链接: https://blog.csdn.net/2401_85373396/article/details/159159650 作者: 2401_85373396 日期: 2026 年(snippet 确认) 可信度: 中 工程价值: ⭐⭐⭐⭐

摘要与评价: 对比 transformers、ModelScope、vLLM、Llama.cpp、Ollama、TGI 六种部署方式的适用场景。提供了框架选型决策树: - transformers: 灵活但慢,适合实验 - vLLM: PagedAttention + Continuous Batching,高吞吐 - Ollama: 轻量本地,一键运行 - Llama.cpp: CPU/苹果 Metal 推理,无 GPU 首选 - TGI: Hugging Face 官方,稳定可靠 - SGLang: 结构化生成 + RadixAttention,多轮对话优

建议分类: deployment framework-comparison vllm ollama 建议行动: 适合作为团队框架选型手册的补充


✅ 高价值 4:最受欢迎的开源大模型推理框架 vLLM、SGLang 是如何炼成的?

链接: https://blog.csdn.net/dqcfkyqdxym3f8rb0/article/details/152054356 作者: dqcfkyqdxym3f8rb0 日期: 2025 年(snippet 推断) 可信度: 中高 工程价值: ⭐⭐⭐⭐⭐

摘要与评价: vLLM 与 SGLang 的工程史与技术架构解析,高信息密度

关键史实: - vLLM 2023.06 由 UC Berkeley 天空计算实验室发布,PagedAttention 借鉴 OS 分页缓存管理 - SGLang 2024.01 首个版本,RadixAttention 实现 KV Cache 高效复用 - 两项目创始人均来自伯克利师从 Ion Stoica(Spark/Ray 之父) - 194 名开发者在两个项目中均提交过代码 - vLLM 社区 Issue 响应 12h–3 天;SGLang 3–5 天

技术脉络: - Continuous Batching 由 Orca 论文提出,vLLM/TGI/SGLang 均采纳 - PagedAttention 后 TGI/DeepSpeed-Inference 也加入分页缓存 - vLLM v0.6.0(2024.09):CPU 调度优化实现 ~2.7x 性能提升,5x 延迟下降 - vLLM v1(2024.12 重构):伴随 DeepSeek V3/R1 发布迎来第二轮爆发

建议分类: inference-engineering vllm sglang history 建议行动: 高置信度工程史,适合纳入架构决策参考


✅ 高价值 5:SGLang 与 vLLM 深度对比及集群部署实战指南

链接: https://blog.csdn.net/weixin_44369324/article/details/160417275 日期: 2026 年 可信度: 中高 工程价值: ⭐⭐⭐⭐⭐

摘要与评价: vLLM 与 SGLang 的工程化实战对比: - vLLM PagedAttention 3–5x 显存优化,通用对话场景优 - SGLang RadixAttention + 声明式编程,复杂提示工程快 2–5x - 集群部署四大陷阱:分布式通信、故障恢复雪崩、拓扑感知调度、故障隔离 - 分级故障处理、拓扑感知调度方案 - 选型建议:简单场景选 vLLM,复杂多轮/结构化输出选 SGLang

建议分类: inference vllm sglang production 建议行动: 建议纳入生产部署选型 checklist


✅ 高价值 6:性能揭秘 LMDeploy vs vLLM vs SGLang 深度解析

链接: https://blog.csdn.net/qq_40999403/article/details/151405198 日期: 2025.09(2026.07 有更新推荐) 可信度: 中 工程价值: ⭐⭐⭐⭐

摘要与评价: 实测性能数据对比: - LMDeploy TurboMind 引擎 + 动态批处理 + 4-bit 量化:RTX 4090 上比传统方案快 1.8x,显存降 60% - vLLM PagedAttention + Continuous Batching - SGLang 结构化生成范式,多轮对话/程序生成场景 3–5x 效率提升 - 多 GPU:LMDeploy 4 卡 85% 扩展效率,vLLM Tensor Parallelism + RDMA 通信开销 <5% - KV Cache 配置关键参数: vLLM block_size 长文本建议从 64 增至 128;LMDeploy cache_max_entry_count=0.5 比默认 0.3 提升 23% 吞吐量

建议分类: inference benchmark vllm sglang lmdeploy 建议行动: KV Cache 参数建议可直接写入生产配置模板


二、Substack 高价值条目

✅ Substack 高价值 1:The AI Agents Stack (2026 Edition)

来源: theaiengineer.substack.com 链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 作者: The AI Engineer(行业垂直 newsletter) 日期: 2026 年 可信度: 中高(工程师社区权威来源) 工程价值: ⭐⭐⭐⭐⭐

核心观点: - 2026 年 Agent Stack 已演化为六层架构(2024 年 Letta 原始图只有四层) - 核心定义:think-act-observe 循环 = 推理→工具调用→记忆→循环 - Agent Stack ≠ LLM Stack:推理引擎层以下是独立的系统工程问题 - 新增层次(2025–2026):Memory 层、Orchestration/Agent Runtime 层、Tool Ecosystem 层 - 工程难点:14 节点状态图 + Redis checkpointer + 失败重试逻辑

建议行动: 纳入 Agent 系统架构设计参考;六层模型可用于团队技术对齐 建议分类: agent architecture engineering


✅ Substack 高价值 2:OWASP Top 10 Agents & AI Vulnerabilities (2026 Cheat Sheet)

来源: alexewerlof.substack.com 链接: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents 作者: Alex Ewerlöf(OWASP 贡献者) 日期: 2026 年 可信度: 高(OWASP 标准) 工程价值: ⭐⭐⭐⭐⭐

核心观点: - LLM01–LLM10(OWASP Top 10 LLM)+ ASI01–ASI10(OWASP Top 10 Agents) - Agent 循环执行 = 更大攻击面:循环中每次工具调用都是潜在攻击向量 - 语义防火墙(Semantic Firewall):用隔离的、受限的二次模型评估输入/输出 - 最小权限原则(Principle of Least Privilege)应用于 Agent 工具权限 - Prompt Injection 与 Agent 循环结合可造成金融级灾难

建议行动: 纳入安全 review checklist;建议对照 ASI01–ASI10 自查生产 Agent 系统 建议分类: security agent owasp


✅ Substack 高价值 3:The Complete Guide to LLM Evaluation Tools in 2026

来源: futureagi.substack.com 链接: https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation 日期: 2026 年 可信度: 中 工程价值: ⭐⭐⭐⭐

核心观点: 五大平台对比:FutureAGI、Galileo、Arize、MLflow、Patronus AI - RAG evaluation 已成为标配功能 - LLM-as-Judge 方法广泛采用 - 2026 年趋势:实时监控 + 大规模数据流处理 - 选型建议:生产系统优先考虑 FutureAGI(研究背书)或 Galileo(Guardrails 内置)

建议分类: evaluation llmops rag


三、总体建议

建议写入路径: /shared/research-kb/inbox/jay/2026-07-21-csdn-inference-stack-vllm-sglang-substack.md

是否需要精读: - ⭐⭐ vLLM vs SGLang 史实文(CSDN)→ 可精读,架构演进信息密度高 - ⭐⭐ OWASP Agents 2026 Cheat Sheet → 建议精读,安全 review 必备 - ⭐⭐ The AI Agents Stack 2026 Edition → 建议精读,团队对齐用

主题页更新建议: - 新增/更新 inference-engineering 主题页:纳入 vLLM/SGLang/LMDeploy 2026 对比表 - 新增 agent-security 主题页:纳入 OWASP ASI Top 10

分类标签汇总: inference vllm sglang lmdeploy ollama deployment finetuning lora agent security owasp evaluation rag benchmark


草稿生成时间: 2026-07-21 08:20 CST | 实例: Jay | 本次检索: CSDN LLM部署推理框架 + Substack AI agents