研究知识库草稿 · Jay · 2026-07-31(第3次/天)

任务摘要

  • 主题:CSDN 高价值技术分享 · SGLang/vLLM 横向评测 · LLM 评测体系 · Agent Eval 生产实践
  • 检索范围:SGLang 部署实测 / vLLM vs SGLang benchmark / LLM Evaluation / AI Agent Eval / PEFT/微调前沿
  • 来源:CSDN Blog / AtomGit / 腾讯云开发者社区 / Substack 高质量工程博客
  • 本次定位:第三次检索 · 聚焦评测与推理框架横向实测

一、高价值 CSDN 条目(工程价值 / 复现价值)

条目 1|NVIDIA DGX Spark 部署 Qwen3.5-35B-A3B-FP8 完整教程 + 性能分析

属性 内容
标题 【实测】NVIDIA DGX Spark 本地部署 Qwen3.5-35B-A3B-FP8 完整教程 + 性能分析
来源 Blog CSDN(u010026928)
URL https://blog.csdn.net/u010026928/article/details/158582591
发布 2026(根据文章内 Qwen3.5 推断为 2026-07 最新)
工程价值 ⭐⭐⭐⭐⭐ 含完整 Docker 启动命令 + 完整性能实测脚本
复现价值 高:含所有关键 Docker 参数表(seccomp/privileged/trust-remote-code/ipc/host)、实测耗时/Token 速度计算脚本
涉及版本 Qwen3.5-35B-A3B-FP8、Docker、SGLang(最新)
核心提炼 ① Docker 安全参数踩坑全记录:--security-opt seccomp=unconfined(允许 Triton JIT)、--privileged(允许 GPU 驱动加载自定义内核);② FP8 量化模型不需要再加 --kv-cache-dtype fp8(会导致 block_size 冲突);③ 性能实测:curl 完整示例 + Token 速度计算脚本;④ --enable-prefix-caching 多轮对话显著加速;⑤ Qwen3 专用工具解析器 --tool-call-parser qwen3_coder
建议分类 LLM推理 / SGLang / Qwen3.5 / Docker部署 / FP8量化 / DGX-Spark
可信度 高——有完整命令截图、踩坑记录、Docker 参数表,可直接参考
后续行动 结合 Qwen3.5 官方文档核验 Docker 安全参数是否在生产环境有替代方案

条目 2|LLM 推理引擎深度对比:SGLang vs vLLM(吞吐量/延迟/内存全面测评)

属性 内容
标题 LLM 推理引擎深度对比:SGLang vs vLLM,吞吐量、延迟、内存全面测评与生产选型
来源 Blog CSDN(cmzznet)
URL https://blog.csdn.net/u013701860/article/details/148295809
发布 2026-05-31
阅读量 1,017
工程价值 ⭐⭐⭐⭐⭐ 含 bench_serving 实测数据、Mooncake 分布式 KVCache 集成案例
复现价值 高:含 benchmark 工具名(bench_serving)、具体指标数值(TTFT/P99 ITL/Throughput)
涉及版本 SGLang、vLLM(具体版本待确认)
核心提炼 ① 两者核心差异:vLLM 擅长高吞吐/API 场景;SGLang 擅长多轮对话/结构化输出;② Mooncake + SGLang 集成:分布式 KVCache 显存节省 + 吞吐提升;③ 实测数字:1M input / 131K output 场景下 TTFT P99=17752ms;④ SGLang 在流量尖峰时性能更可预测;⑤ 附详细 benchmark 工具和测试方法论
建议分类 LLM推理 / vLLM / SGLang / Benchmark / Mooncake / 性能对比
可信度 高——有具体数字,有测试方法论,有场景分析
后续行动 对照 SGLang/vLLM 官方 benchmark 页面核验最新数字;核验 Mooncake GitHub 最新 release

条目 3|2026 年 LLM 推理框架选型指南(vLLM / SGLang / TensorRT-LLM / LMDeploy)

属性 内容
标题 大模型推理框架选型指南:vLLM、SGLang、TensorRT-LLM 怎么选?
来源 Blog CSDN(xx_nm98)
URL https://blog.csdn.net/xx_nm98/article/details/158851692
发布 2026-03-09(最新推荐 2026-07-27)
阅读量 590
工程价值 ⭐⭐⭐⭐ 综合横向对比,各框架明确工程定位
核心提炼 ① vLLM:生态最完整全能首选;② SGLang:高并发+结构化生成独树一帜;③ LMDeploy:国产生态最佳搭档;④ TensorRT-LLM:吞吐量性能天花板,部署成本最高;⑤ 框架能力分化加剧:有的擅长大规模分布式,有的针对国产 GPU 深度优化;⑥ 选型建议:以 vLLM 为默认起点,根据具体瓶颈(延迟/吞吐/量化/国产 GPU)针对性切换
建议分类 LLM推理 / 框架选型 / vLLM / SGLang / TensorRT-LLM / LMDeploy
可信度 中高——综述性质,各框架优劣势清晰,需按方向核验官方文档
后续行动 作为选型决策参考,核验 TensorRT-LLM 2026 最新国产 GPU 兼容性

条目 4|Agent Eval 最佳实践:从 Benchmark 到生产监控的完整落地指南

属性 内容
标题 Agent Eval 最佳实践:从 Benchmark 到生产监控的完整落地指南
来源 Blog CSDN(warm3snow)
URL https://blog.csdn.net/warm3snow/article/details/161662750
发布 2026(最新文章,近期活跃)
工程价值 ⭐⭐⭐⭐ 含 @observe(type="reasoning") 链路追踪装饰器代码、LangSmith/DeepEval 集成方案
复现价值 高:含生产监控代码示例、评估管线设计
涉及版本 LangSmith、DeepEval(Confident AI)2026-05 更新
核心提炼 ① EDD(评估驱动开发):每次代码提交验证 Agent 性能不退化;② LLM-as-a-Judge 自动化评估机制;③ @observe 装饰器追踪 Agent Chain-of-Thought 和工具调用;④ Benchmark:AgentBench、DeepEval;⑤ 引用:Anthropic《Demystifying evals for AI agents》(2026-01);⑥ "全局把控+局部深挖"双层测试保障
建议分类 AI Agent / Eval / 可观测性 / LLM评测 / LangSmith / DeepEval / 生产工程
可信度 高——有代码示例,引用 Anthropic 官方博客,参考列表完整
后续行动 核验 DeepEval 最新 2026 API;结合 Anthropic Engineering Blog 补充最佳实践

条目 5|SGLang 部署 Qwen3-3.2B 本地大模型实战教程

属性 内容
标题 地表最强 SGLang 部署本地 Qwen3-32B 大模型——实战教程
来源 Blog CSDN(weixin_42234168)
URL https://blog.csdn.net/weixin_42234168/article/details/148282338
发布 2026-06-27(评论时间)
阅读量 2,695
工程价值 ⭐⭐⭐⭐ 含硬件要求(224GB 显存)、ModelScope 下载、Docker 启动、SGLang 三种调用方式(Python/HTTP/客户端)
复现价值 高:Docker 参数详解(共享内存/GPU 配置)、8001 端口调用示例
涉及版本 SGLang、Qwen3-32B、ModelScope
核心提炼 ① 硬件门槛:至少 224GB 显存;② ModelScope 或 HuggingFace 下载模型;③ Docker 启动关键参数:共享内存 + GPU 配置;④ 三种调用方式完整示例;⑤ 满足企业数据安全需求的本地部署全流程
建议分类 LLM推理 / SGLang / Qwen3 / Docker部署 / 本地部署
可信度 高——含完整步骤,可直接复现
后续行动 结合 SGLang 官方文档确认 2026 最新 API 是否变化

条目 6|2026 AI Agent 趋势全景图 + 可观测性与 EDD 实践

属性 内容
标题 收藏这篇就够了!2026年AI Agent趋势全景图:从技术到商业,一篇讲透!
来源 Blog CSDN(xx_nm98)
URL https://blog.csdn.net/xx_nm98/article/details/156149727
发布 2026
工程价值 ⭐⭐⭐⭐ 含可观测性数据(89% 组织已实施,62% 可追踪 Agent 完整过程)和商业分布图
核心提炼 ① 89% 的组织已实施可观测性系统;② OpenTelemetry + LangSmith 链路追踪技术;③ EDD(评估驱动开发)理念:拥抱自动化评估;④ 商业价值分布:客户服务 36.9% / 内部生产力 26.4% / 研究与数据分析 24.4%;⑤ 大型企业优先内部可控环境再扩展外部;⑥ 新三大挑战:推理成本下降后,可观测性 / Agent 稳定性 / 安全合规成为核心
建议分类 AI Agent / 可观测性 / 2026趋势 / EDD / OpenTelemetry
可信度 中高——综述性,有数据支撑(89%/62%),来源待核
后续行动 核验 89% / 62% 数据来源(可能来自某行业报告)

条目 7|RAG vs 微调 vs 长上下文:2026 终极选型指南

属性 内容
标题 别再纠结了!2026年终极指南:RAG、微调与长上下文,到底该选谁?
来源 腾讯云开发者社区(cloud.tencent.com)
URL https://cloud.tencent.com/developer/article/2658674
发布 2026
工程价值 ⭐⭐⭐⭐ 直观对比表(知识更新/成本/幻觉控制/上下文理解四维),含场景实战举例
核心提炼 ① RAG:知识实时更新首选(★★★★★),低成本(★★★★☆);② 微调:风格/格式/输出模式(改变权重),知识固化不适合频繁更新;③ 长上下文:O(n²) 复杂度导致显存/延迟指数增长,1M 上下文成本极高;④ 未来趋势:不是取代关系,而是 RAG+微调组合(法律助手场景);⑤ 最优路径:Prompt → RAG → Fine-tune → Distill
建议分类 RAG / 微调 / 长上下文 / LLM选型 / 2026技术动态
可信度 中高——综合梳理,有维度评分,需按场景核验
后续行动 可作为知识库专题页「RAG vs Fine-tune 选型决策树」素材

条目 8|彻底搞懂 LangChain 与 Langfuse 关系 · LLM 应用可观测落地完整实战

属性 内容
标题 彻底搞懂LangChain与Langfuse关系|LLM应用可观测落地+自托管完整实战教程(建议收藏!)
来源 Blog CSDN(具体作者,待确认 URL)
发布 2026-07
工程价值 ⭐⭐⭐⭐⭐ 自托管 Langfuse 完整教程、LangChain + Langfuse 集成代码示例
复现价值 高:含完整配置和集成代码,可直接落地
涉及版本 LangChain(最新版)、Langfuse(自托管)
核心提炼 ① Langfuse = LLM 可观测性平台(Tracing/Evaluation/Dashboard);② LangChain 内置 Langfuse 回调集成;③ 自托管优势:数据主权/GDPR 合规/成本控制;④ 完整部署步骤(Docker/docker-compose)
建议分类 AI可观测性 / LangChain / Langfuse / MLOps / 自托管
可信度 高——有完整教程,Langfuse 官方文档支持
后续行动 核验 Langfuse 最新 2026 自托管部署方式是否变化

二、高价值 Substack 条目(研究线索)

条目 S1|vLLM vs SGLang vs TensorRT-LLM:H100 Benchmark 2026 全解析

属性 内容
作者/专栏 Spheron Blog
URL https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
发布日期 2026
核心观点 ① TensorRT-LLM 在所有并发级别领先(H100 场景比 vLLM 快 8-13%);② vLLM 和 SGLang 在 80GB H100 上显存占用相近(71-74GB);③ SGLang KV Cache 管理最优(峰值显存最低);④ SGLang RadixAttention 在有共享前缀时效果显著;⑤ Modular MAX(Mojo)成为第 5 候选者,在密集模型高并发场景超越 vLLM
可信度 高——有具体 H100 benchmark 数字,方法论清晰
后续行动 作为框架选型量化参考;关注 Modular MAX 进展
建议分类 LLM推理 / Benchmark / H100 / vLLM / SGLang / TensorRT-LLM

条目 S2|Fine-tuning LLMs in 2026: When RAG Isn't Enough (and When It Still Is)

属性 内容
作者/专栏 Big Data Boutique
URL https://bigdataboutique.com/blog/fine-tuning-llms-when-rag-isnt-enough
发布日期 2026
核心观点 ① Fine-tune 用于 form(格式/风格/结构化输出/拒答模式),不用于 facts(每周更新的知识);② 2026 最优路径:Prompt → RAG → Fine-tune → Distill;③ DoRA(Decomposed Weight-Update)相比 LoRA 质量更好;④ LoRAX(LoRA eXchange):多 Adapter 共享 GPU + JIT 动态加载;⑤ 高 ROI 微调 = Strong Base Model + Thin LoRA Adapter + Retrieval(不替换检索,而是互补)
可信度 高——有清晰的技术路径分析和成本分析
后续行动 与条目 7 交叉验证;核验 DoRA 2026 最新版本
建议分类 微调 / LoRA / QLoRA / DoRA / RAG / PEFT

条目 S3|What 1,000+ Job Descriptions Reveal About AI Engineer Role in 2026

属性 内容
作者/专栏 Alex Ewerlof / alexeyondata.substack.com
URL https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
发布日期 2026
核心观点 ① RAG 是最强 GenAI 技能信号(35.9%),远高于 Prompt 工程(29.1%);② Agent(14.4%):多步骤工作流、工具调用、编排框架;③ Fine-tuning(8.5%)明显次要;④ AI 工程核心是让基础模型成为可靠、可观测的生产特性
可信度 高——1000+ JD 统计样本
后续行动 可作为 AI 工程学习路径优先级参考
建议分类 AI工程 / 职业趋势 / RAG / Agent

三、分类标签汇总(去重合并)

LLM推理 / vLLM / SGLang / TensorRT-LLM / LMDeploy / Benchmark / H100 / Qwen3 / Qwen3.5 / Docker部署 / FP8量化 / DGX-Spark / Mooncake / AI Agent / Eval / LLM评测 / AI可观测性 / LangSmith / Langfuse / DeepEval / OpenTelemetry / RAG / 微调 / LoRA / QLoRA / DoRA / PEFT / 2026趋势 / EDD / 框架选型


四、建议写入路径

/shared/research-kb/inbox/jay/
└── 2026-07-31T1620-jay-csdn-sglang-bench-eval.md   ✅(本次草稿)

五、精读 / 审稿 / 主题页更新建议

优先级 行动
🔴 高 条目 1(DGX Spark + Qwen3.5 Docker 部署)+ 条目 5(SGLang Qwen3-32B)合并为「Qwen3 系列 SGLang/vLLM 部署实战手册」专题页
🔴 高 条目 2(SGLang vs vLLM 横向测评)+ 条目 3(框架选型指南)+ S1(Spheron H100 benchmark)合并为「2026 LLM 推理框架 Benchmark 专辑」
🟡 中 条目 4(Agent Eval)+ 条目 6(可观测性)+ 条目 8(Langfuse)合并为「AI Agent 生产可观测性与评测体系」主题页
🟡 中 条目 7(RAG vs Fine-tune)+ S2(Fine-tune 2026 路径)合并为「RAG+微调组合决策树」素材
🟢 低 S3(AI 工程 JD 趋势)纳入年度 AI 工程职业趋势盘点

六、本次未写入文件原因

本次所有条目均写入草稿,未直接写入 /shared/research-kb/review//shared/research-kb/published/


Jay · 2026-07-31 16:20 CST · 第 3 次/天 · CSDN 高频检索专项