研究知识库草稿 · Jay · 2026-07-31(第3次/天)
任务摘要
- 主题:CSDN 高价值技术分享 · SGLang/vLLM 横向评测 · LLM 评测体系 · Agent Eval 生产实践
- 检索范围:SGLang 部署实测 / vLLM vs SGLang benchmark / LLM Evaluation / AI Agent Eval / PEFT/微调前沿
- 来源:CSDN Blog / AtomGit / 腾讯云开发者社区 / Substack 高质量工程博客
- 本次定位:第三次检索 · 聚焦评测与推理框架横向实测
一、高价值 CSDN 条目(工程价值 / 复现价值)
条目 1|NVIDIA DGX Spark 部署 Qwen3.5-35B-A3B-FP8 完整教程 + 性能分析
| 属性 |
内容 |
| 标题 |
【实测】NVIDIA DGX Spark 本地部署 Qwen3.5-35B-A3B-FP8 完整教程 + 性能分析 |
| 来源 |
Blog CSDN(u010026928) |
| URL |
https://blog.csdn.net/u010026928/article/details/158582591 |
| 发布 |
2026(根据文章内 Qwen3.5 推断为 2026-07 最新) |
| 工程价值 |
⭐⭐⭐⭐⭐ 含完整 Docker 启动命令 + 完整性能实测脚本 |
| 复现价值 |
高:含所有关键 Docker 参数表(seccomp/privileged/trust-remote-code/ipc/host)、实测耗时/Token 速度计算脚本 |
| 涉及版本 |
Qwen3.5-35B-A3B-FP8、Docker、SGLang(最新) |
| 核心提炼 |
① Docker 安全参数踩坑全记录:--security-opt seccomp=unconfined(允许 Triton JIT)、--privileged(允许 GPU 驱动加载自定义内核);② FP8 量化模型不需要再加 --kv-cache-dtype fp8(会导致 block_size 冲突);③ 性能实测:curl 完整示例 + Token 速度计算脚本;④ --enable-prefix-caching 多轮对话显著加速;⑤ Qwen3 专用工具解析器 --tool-call-parser qwen3_coder |
| 建议分类 |
LLM推理 / SGLang / Qwen3.5 / Docker部署 / FP8量化 / DGX-Spark |
| 可信度 |
高——有完整命令截图、踩坑记录、Docker 参数表,可直接参考 |
| 后续行动 |
结合 Qwen3.5 官方文档核验 Docker 安全参数是否在生产环境有替代方案 |
条目 2|LLM 推理引擎深度对比:SGLang vs vLLM(吞吐量/延迟/内存全面测评)
| 属性 |
内容 |
| 标题 |
LLM 推理引擎深度对比:SGLang vs vLLM,吞吐量、延迟、内存全面测评与生产选型 |
| 来源 |
Blog CSDN(cmzznet) |
| URL |
https://blog.csdn.net/u013701860/article/details/148295809 |
| 发布 |
2026-05-31 |
| 阅读量 |
1,017 |
| 工程价值 |
⭐⭐⭐⭐⭐ 含 bench_serving 实测数据、Mooncake 分布式 KVCache 集成案例 |
| 复现价值 |
高:含 benchmark 工具名(bench_serving)、具体指标数值(TTFT/P99 ITL/Throughput) |
| 涉及版本 |
SGLang、vLLM(具体版本待确认) |
| 核心提炼 |
① 两者核心差异:vLLM 擅长高吞吐/API 场景;SGLang 擅长多轮对话/结构化输出;② Mooncake + SGLang 集成:分布式 KVCache 显存节省 + 吞吐提升;③ 实测数字:1M input / 131K output 场景下 TTFT P99=17752ms;④ SGLang 在流量尖峰时性能更可预测;⑤ 附详细 benchmark 工具和测试方法论 |
| 建议分类 |
LLM推理 / vLLM / SGLang / Benchmark / Mooncake / 性能对比 |
| 可信度 |
高——有具体数字,有测试方法论,有场景分析 |
| 后续行动 |
对照 SGLang/vLLM 官方 benchmark 页面核验最新数字;核验 Mooncake GitHub 最新 release |
条目 3|2026 年 LLM 推理框架选型指南(vLLM / SGLang / TensorRT-LLM / LMDeploy)
| 属性 |
内容 |
| 标题 |
大模型推理框架选型指南:vLLM、SGLang、TensorRT-LLM 怎么选? |
| 来源 |
Blog CSDN(xx_nm98) |
| URL |
https://blog.csdn.net/xx_nm98/article/details/158851692 |
| 发布 |
2026-03-09(最新推荐 2026-07-27) |
| 阅读量 |
590 |
| 工程价值 |
⭐⭐⭐⭐ 综合横向对比,各框架明确工程定位 |
| 核心提炼 |
① vLLM:生态最完整全能首选;② SGLang:高并发+结构化生成独树一帜;③ LMDeploy:国产生态最佳搭档;④ TensorRT-LLM:吞吐量性能天花板,部署成本最高;⑤ 框架能力分化加剧:有的擅长大规模分布式,有的针对国产 GPU 深度优化;⑥ 选型建议:以 vLLM 为默认起点,根据具体瓶颈(延迟/吞吐/量化/国产 GPU)针对性切换 |
| 建议分类 |
LLM推理 / 框架选型 / vLLM / SGLang / TensorRT-LLM / LMDeploy |
| 可信度 |
中高——综述性质,各框架优劣势清晰,需按方向核验官方文档 |
| 后续行动 |
作为选型决策参考,核验 TensorRT-LLM 2026 最新国产 GPU 兼容性 |
条目 4|Agent Eval 最佳实践:从 Benchmark 到生产监控的完整落地指南
| 属性 |
内容 |
| 标题 |
Agent Eval 最佳实践:从 Benchmark 到生产监控的完整落地指南 |
| 来源 |
Blog CSDN(warm3snow) |
| URL |
https://blog.csdn.net/warm3snow/article/details/161662750 |
| 发布 |
2026(最新文章,近期活跃) |
| 工程价值 |
⭐⭐⭐⭐ 含 @observe(type="reasoning") 链路追踪装饰器代码、LangSmith/DeepEval 集成方案 |
| 复现价值 |
高:含生产监控代码示例、评估管线设计 |
| 涉及版本 |
LangSmith、DeepEval(Confident AI)2026-05 更新 |
| 核心提炼 |
① EDD(评估驱动开发):每次代码提交验证 Agent 性能不退化;② LLM-as-a-Judge 自动化评估机制;③ @observe 装饰器追踪 Agent Chain-of-Thought 和工具调用;④ Benchmark:AgentBench、DeepEval;⑤ 引用:Anthropic《Demystifying evals for AI agents》(2026-01);⑥ "全局把控+局部深挖"双层测试保障 |
| 建议分类 |
AI Agent / Eval / 可观测性 / LLM评测 / LangSmith / DeepEval / 生产工程 |
| 可信度 |
高——有代码示例,引用 Anthropic 官方博客,参考列表完整 |
| 后续行动 |
核验 DeepEval 最新 2026 API;结合 Anthropic Engineering Blog 补充最佳实践 |
条目 5|SGLang 部署 Qwen3-3.2B 本地大模型实战教程
| 属性 |
内容 |
| 标题 |
地表最强 SGLang 部署本地 Qwen3-32B 大模型——实战教程 |
| 来源 |
Blog CSDN(weixin_42234168) |
| URL |
https://blog.csdn.net/weixin_42234168/article/details/148282338 |
| 发布 |
2026-06-27(评论时间) |
| 阅读量 |
2,695 |
| 工程价值 |
⭐⭐⭐⭐ 含硬件要求(224GB 显存)、ModelScope 下载、Docker 启动、SGLang 三种调用方式(Python/HTTP/客户端) |
| 复现价值 |
高:Docker 参数详解(共享内存/GPU 配置)、8001 端口调用示例 |
| 涉及版本 |
SGLang、Qwen3-32B、ModelScope |
| 核心提炼 |
① 硬件门槛:至少 224GB 显存;② ModelScope 或 HuggingFace 下载模型;③ Docker 启动关键参数:共享内存 + GPU 配置;④ 三种调用方式完整示例;⑤ 满足企业数据安全需求的本地部署全流程 |
| 建议分类 |
LLM推理 / SGLang / Qwen3 / Docker部署 / 本地部署 |
| 可信度 |
高——含完整步骤,可直接复现 |
| 后续行动 |
结合 SGLang 官方文档确认 2026 最新 API 是否变化 |
条目 6|2026 AI Agent 趋势全景图 + 可观测性与 EDD 实践
| 属性 |
内容 |
| 标题 |
收藏这篇就够了!2026年AI Agent趋势全景图:从技术到商业,一篇讲透! |
| 来源 |
Blog CSDN(xx_nm98) |
| URL |
https://blog.csdn.net/xx_nm98/article/details/156149727 |
| 发布 |
2026 |
| 工程价值 |
⭐⭐⭐⭐ 含可观测性数据(89% 组织已实施,62% 可追踪 Agent 完整过程)和商业分布图 |
| 核心提炼 |
① 89% 的组织已实施可观测性系统;② OpenTelemetry + LangSmith 链路追踪技术;③ EDD(评估驱动开发)理念:拥抱自动化评估;④ 商业价值分布:客户服务 36.9% / 内部生产力 26.4% / 研究与数据分析 24.4%;⑤ 大型企业优先内部可控环境再扩展外部;⑥ 新三大挑战:推理成本下降后,可观测性 / Agent 稳定性 / 安全合规成为核心 |
| 建议分类 |
AI Agent / 可观测性 / 2026趋势 / EDD / OpenTelemetry |
| 可信度 |
中高——综述性,有数据支撑(89%/62%),来源待核 |
| 后续行动 |
核验 89% / 62% 数据来源(可能来自某行业报告) |
条目 7|RAG vs 微调 vs 长上下文:2026 终极选型指南
| 属性 |
内容 |
| 标题 |
别再纠结了!2026年终极指南:RAG、微调与长上下文,到底该选谁? |
| 来源 |
腾讯云开发者社区(cloud.tencent.com) |
| URL |
https://cloud.tencent.com/developer/article/2658674 |
| 发布 |
2026 |
| 工程价值 |
⭐⭐⭐⭐ 直观对比表(知识更新/成本/幻觉控制/上下文理解四维),含场景实战举例 |
| 核心提炼 |
① RAG:知识实时更新首选(★★★★★),低成本(★★★★☆);② 微调:风格/格式/输出模式(改变权重),知识固化不适合频繁更新;③ 长上下文:O(n²) 复杂度导致显存/延迟指数增长,1M 上下文成本极高;④ 未来趋势:不是取代关系,而是 RAG+微调组合(法律助手场景);⑤ 最优路径:Prompt → RAG → Fine-tune → Distill |
| 建议分类 |
RAG / 微调 / 长上下文 / LLM选型 / 2026技术动态 |
| 可信度 |
中高——综合梳理,有维度评分,需按场景核验 |
| 后续行动 |
可作为知识库专题页「RAG vs Fine-tune 选型决策树」素材 |
条目 8|彻底搞懂 LangChain 与 Langfuse 关系 · LLM 应用可观测落地完整实战
| 属性 |
内容 |
| 标题 |
彻底搞懂LangChain与Langfuse关系|LLM应用可观测落地+自托管完整实战教程(建议收藏!) |
| 来源 |
Blog CSDN(具体作者,待确认 URL) |
| 发布 |
2026-07 |
| 工程价值 |
⭐⭐⭐⭐⭐ 自托管 Langfuse 完整教程、LangChain + Langfuse 集成代码示例 |
| 复现价值 |
高:含完整配置和集成代码,可直接落地 |
| 涉及版本 |
LangChain(最新版)、Langfuse(自托管) |
| 核心提炼 |
① Langfuse = LLM 可观测性平台(Tracing/Evaluation/Dashboard);② LangChain 内置 Langfuse 回调集成;③ 自托管优势:数据主权/GDPR 合规/成本控制;④ 完整部署步骤(Docker/docker-compose) |
| 建议分类 |
AI可观测性 / LangChain / Langfuse / MLOps / 自托管 |
| 可信度 |
高——有完整教程,Langfuse 官方文档支持 |
| 后续行动 |
核验 Langfuse 最新 2026 自托管部署方式是否变化 |
二、高价值 Substack 条目(研究线索)
条目 S1|vLLM vs SGLang vs TensorRT-LLM:H100 Benchmark 2026 全解析
| 属性 |
内容 |
| 作者/专栏 |
Spheron Blog |
| URL |
https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks |
| 发布日期 |
2026 |
| 核心观点 |
① TensorRT-LLM 在所有并发级别领先(H100 场景比 vLLM 快 8-13%);② vLLM 和 SGLang 在 80GB H100 上显存占用相近(71-74GB);③ SGLang KV Cache 管理最优(峰值显存最低);④ SGLang RadixAttention 在有共享前缀时效果显著;⑤ Modular MAX(Mojo)成为第 5 候选者,在密集模型高并发场景超越 vLLM |
| 可信度 |
高——有具体 H100 benchmark 数字,方法论清晰 |
| 后续行动 |
作为框架选型量化参考;关注 Modular MAX 进展 |
| 建议分类 |
LLM推理 / Benchmark / H100 / vLLM / SGLang / TensorRT-LLM |
条目 S2|Fine-tuning LLMs in 2026: When RAG Isn't Enough (and When It Still Is)
| 属性 |
内容 |
| 作者/专栏 |
Big Data Boutique |
| URL |
https://bigdataboutique.com/blog/fine-tuning-llms-when-rag-isnt-enough |
| 发布日期 |
2026 |
| 核心观点 |
① Fine-tune 用于 form(格式/风格/结构化输出/拒答模式),不用于 facts(每周更新的知识);② 2026 最优路径:Prompt → RAG → Fine-tune → Distill;③ DoRA(Decomposed Weight-Update)相比 LoRA 质量更好;④ LoRAX(LoRA eXchange):多 Adapter 共享 GPU + JIT 动态加载;⑤ 高 ROI 微调 = Strong Base Model + Thin LoRA Adapter + Retrieval(不替换检索,而是互补) |
| 可信度 |
高——有清晰的技术路径分析和成本分析 |
| 后续行动 |
与条目 7 交叉验证;核验 DoRA 2026 最新版本 |
| 建议分类 |
微调 / LoRA / QLoRA / DoRA / RAG / PEFT |
条目 S3|What 1,000+ Job Descriptions Reveal About AI Engineer Role in 2026
| 属性 |
内容 |
| 作者/专栏 |
Alex Ewerlof / alexeyondata.substack.com |
| URL |
https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal |
| 发布日期 |
2026 |
| 核心观点 |
① RAG 是最强 GenAI 技能信号(35.9%),远高于 Prompt 工程(29.1%);② Agent(14.4%):多步骤工作流、工具调用、编排框架;③ Fine-tuning(8.5%)明显次要;④ AI 工程核心是让基础模型成为可靠、可观测的生产特性 |
| 可信度 |
高——1000+ JD 统计样本 |
| 后续行动 |
可作为 AI 工程学习路径优先级参考 |
| 建议分类 |
AI工程 / 职业趋势 / RAG / Agent |
三、分类标签汇总(去重合并)
LLM推理 / vLLM / SGLang / TensorRT-LLM / LMDeploy / Benchmark / H100 / Qwen3 / Qwen3.5 / Docker部署 / FP8量化 / DGX-Spark / Mooncake / AI Agent / Eval / LLM评测 / AI可观测性 / LangSmith / Langfuse / DeepEval / OpenTelemetry / RAG / 微调 / LoRA / QLoRA / DoRA / PEFT / 2026趋势 / EDD / 框架选型
四、建议写入路径
/shared/research-kb/inbox/jay/
└── 2026-07-31T1620-jay-csdn-sglang-bench-eval.md ✅(本次草稿)
五、精读 / 审稿 / 主题页更新建议
| 优先级 |
行动 |
| 🔴 高 |
条目 1(DGX Spark + Qwen3.5 Docker 部署)+ 条目 5(SGLang Qwen3-32B)合并为「Qwen3 系列 SGLang/vLLM 部署实战手册」专题页 |
| 🔴 高 |
条目 2(SGLang vs vLLM 横向测评)+ 条目 3(框架选型指南)+ S1(Spheron H100 benchmark)合并为「2026 LLM 推理框架 Benchmark 专辑」 |
| 🟡 中 |
条目 4(Agent Eval)+ 条目 6(可观测性)+ 条目 8(Langfuse)合并为「AI Agent 生产可观测性与评测体系」主题页 |
| 🟡 中 |
条目 7(RAG vs Fine-tune)+ S2(Fine-tune 2026 路径)合并为「RAG+微调组合决策树」素材 |
| 🟢 低 |
S3(AI 工程 JD 趋势)纳入年度 AI 工程职业趋势盘点 |
六、本次未写入文件原因
本次所有条目均写入草稿,未直接写入 /shared/research-kb/review/ 或 /shared/research-kb/published/。
Jay · 2026-07-31 16:20 CST · 第 3 次/天 · CSDN 高频检索专项