Jay · CSDN 高价值技术检索 + Substack 研究线索

日期: 2026-10-11 检索范围: CSDN(LLM/RAG/Agent/vLLM/SGLang)+ Substack(inference engineering / agentic RAG / MoE systems) 本轮执行时间: 2026-10-11 12:20 UTC


一、CSDN 高价值条目

🔴 高价值(源码/命令/版本/复现/排障)

1. SGLang vs vLLM vs TGI 2026 双模型实测

  • 标题: 【推理引擎2026年中版】SGLang vs vLLM:Qwen3与GLM-5.1双模型实测对比与选型指南
  • 链接: https://blog.csdn.net/gedonshen/article/details/164287845
  • 工程价值:
  • 实测 Qwen3-27B + GLM-5.1 两个主流模型的推理框架对比
  • 包含启动命令:python -m sglang.launch_server --model-path Qwen/Qwen3-6-27B
  • 关键经验:CUDA_DSL_ARCH=sm_121 环境变量不加性能直接腰斩但无报错,易误判为模型问题
  • SGLang 适合工具调用解析场景,vLLM 追求计算效率,TGI 适合快速上线
  • 版本信息: SGLang + kt-kernel(源码构建路径依赖 torch==2.9.1 固定版本)
  • 可信度: ⭐⭐⭐⭐⭐ 自测数据,有明确硬件环境和命令
  • 建议分类: inference-engineering sglang vllm benchmark
  • 后续行动: 可纳入推理引擎选型对比参考,建议精读命令和实测数据部分

2. SGLang 2026 部署踩坑实录 + NCCL 物理映射问题

  • 标题: 五大主流大模型推理引擎深度解析:llama.cpp、vLLM、SGLang、DeepSpeed和Unsloth终极选择指南
  • 链接: https://blog.csdn.net/qq_40999403/article/details/148424108
  • 工程价值:
  • 多节点 SLURM 集群上 SGLang 部署工具链(Dockerfile/Makefile/run.sbatch/bench.sh)
  • EFA/NCCL/GDRCopy 镜像构建,TP/DP/PP/EP 并行策略
  • 关键排障经验:NCCL 环境变量和 CUDA_VISIBLE_DEVICES 物理映射关系
  • 可信度: ⭐⭐⭐⭐ 工具链完整,踩坑经验有工程价值
  • 建议分类: inference-engineering sglang production nvidia
  • 后续行动: 可纳入 SGLang 生产部署 runbook 参考

3. vLLM 生态集成:PagedAttention 原理到 Ollama/SGLang 部署选型

  • 链接: https://blog.csdn.net/weixin_31062533/article/details/166041904
  • 发布时间: 2026-09-19(最新推荐)
  • 工程价值: 从 PagedAttention 源码层面讲解 vLLM 架构,对比 Ollama 和 SGLang 生态差异
  • 可信度: ⭐⭐⭐⭐ 原创文章,版本 2026-09
  • 建议分类: inference-engineering vllm pagedattention
  • 后续行动: 精读 PagedAttention 原理部分,适合作为推理引擎架构理解材料

4. SGLang vs vLLM vs TGI 框架横评(含代码对比表)

  • 标题: SGLang vs vLLM vs Text Generation Inference:2026年大模型推理框架横评
  • 链接: https://blog.csdn.net/weixin_52208686/article/details/163067235
  • 工程价值:
  • 含 Docker 启动命令(TGI 最简配置 bitsandbytes 量化)
  • 特性对比表:Beam Search / Python SDK / prefix caching / continuous batching
  • 结论:追求稳定选 vLLM;追求高并发+prefix复用选 SGLang;追求简单上线选 TGI
  • 可信度: ⭐⭐⭐⭐ 对比维度全面,含实测结论
  • 建议分类: inference-engineering vllm sglang tgi benchmark
  • 后续行动: 可作为推理框架选型决策参考

5. vLLM 源码编译完整攻略

  • 标题: 解锁vLLM源码编译的终极秘籍:从零构建高性能AI推理引擎
  • 链接: https://blog.csdn.net/gitblog_01200/article/details/155806102
  • 工程价值: CMake 3.26+ / PyTorch 1.10+ / Python 3.8+ 编译依赖说明,源码构建步骤
  • 可信度: ⭐⭐⭐ 基础但完整,适合从零编译场景
  • 建议分类: inference-engineering vllm build-from-source
  • 后续行动: 备用参考(非优先级,官方文档可能更新)

🟡 中等价值(综述/趋势/学习路线,非源码级)

6. 2026年LLM应用落地四大阶段 + LangChain vs LlamaIndex 对比

  • 链接: https://blog.csdn.net/m0_69581581/article/details/163542988
  • 工程价值: LangChain 0.3.14 vs LlamaIndex 0.12.0 对比;退化处理机制讨论;企业知识库 RAG 完整 pipeline;Agentic RAG 局限性分析
  • 可信度: ⭐⭐⭐⭐ 多个项目踩坑经验,有实用建议
  • 建议分类: rag agentic-rag langchain llamaindex
  • 后续行动: 精读退化处理机制部分

7. AI Agent 学习路线:ReAct 智能体纯原生实现

  • 链接: https://blog.csdn.net/llwszx/article/details/163446336
  • 工程价值: 不依赖 LangChain,仅用 requests + pydantic 实现标准 ReAct 智能体;分层设计(配置层/LLM客户端层/工具抽象层/Agent核心模块)
  • 可信度: ⭐⭐⭐ 纯工程实践,有架构参考价值
  • 建议分类: agent react langchain-alternative

二、Substack 研究线索

🔴 值得追踪的高价值作者/专栏

1. Physics & Engineering of Frontier LLM Inference (2026版)

  • 专栏: kenhuang (Ken Huang) / Substack
  • 链接: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
  • 核心观点:
  • 10章系列:MoE架构(DeepSeek-V4-Pro 1.6T总参数/49B激活参数,256路由专家+1共享专家)、分布式服务挑战
  • 2026生产架构栈:API Gateway → Semantic Router → Prefix Caching Cluster → Disaggregated P/D Nodes → HW Monitoring
  • Edge SLM:MLX/Metal、骁龙X Elite NPU、WebGPU/ONNX Runtime 部署小模型
  • 来源:DeepSeek/Moonshot AI/Zhipu AI/Alibaba/NVIDIA/Google DeepMind
  • 可信度: ⭐⭐⭐⭐ 综合性工程分析,引用前沿研究和生产蓝图
  • 后续行动: 列入周度追踪列表;核验 MoE 专家路由具体数字

2. LLM Inference at Scale: Batching/Caching/Routing/Cost Control

  • 专栏: System Design Nuggets (Arslan Ahmad) / Substack
  • 链接: https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
  • 核心观点:
  • continuous batching 机制:请求完成即退出,新请求立即补位,保持硬件满载
  • 详细解释 decode 阶段内存带宽瓶颈(memory bandwidth bottleneck)
  • 面向 2026 年生产级 AI 系统工程师
  • 可信度: ⭐⭐⭐⭐ 付费内容,但标题和摘要质量高,系统设计角度清晰
  • 后续行动: 订阅全文;适合作为推理成本控制参考

3. What is inference engineering? (Pragmatic Engineer / Gergely Orosz)

  • 链接: https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
  • 核心观点:
  • 2026年推理工程正在普及,因开源模型崛起(Cursor 基于 Kimi 2.5 构建 Composer 2.0)
  • decode 阶段是内存带宽瓶颈,低到中等 batch size 下计算资源闲置
  • 闭源模型推理工程只服务于几千名AI工程师;开源模型让更多公司能定制优化
  • 可信度: ⭐⭐⭐⭐ Pragmatic Engineer 是知名技术博客,工程视角严谨
  • 后续行动: 全文核验后纳入 inference engineering 定义参考

4. LLM Inference Curriculum (Dennis Kennetz)

  • 链接: https://dkennetz.substack.com/p/llm-inference-curriculum
  • 核心观点:
  • 多节点推理:topology + RDMA + placement + tail latency + storage
  • 核心思维转变:不是"学习LLM推理",而是"学习规模化下瓶颈如何迁移"
  • Build small, throw it away, build the next thing
  • 可信度: ⭐⭐⭐⭐ 课程体系化视角,RDMA/拓扑内容稀缺
  • 后续行动: 纳入多节点推理研究线索

5. Architecting LLM Inference Part 1 (Pawan K Jha)

  • 链接: https://pawankjha.substack.com/p/architecting-llm-inference-part-1
  • 核心观点:
  • 从用户 prompt 到最终 token 输出的端到端架构完整心智模型
  • Token 生成、内存管理、GPU 执行、生产架构
  • 可信度: ⭐⭐⭐ 付费内容,系列文章需订阅
  • 后续行动: 列入队列,核验与社区已有知识库的重复度

三、本轮分类标签汇总

标签 条目数 主要来源
inference-engineering 7 CSDN + Substack
vllm 4 CSDN
sglang 3 CSDN
rag 2 CSDN
agentic-rag 2 CSDN + Substack
moe 1 Substack
multimodal-mlops 2 CSDN
agent 2 CSDN
benchmark 2 CSDN
production 2 CSDN + Substack
edge-inference 1 Substack

四、建议写入路径

实际写入路径: /shared/research-kb/inbox/jay/2026-10-11-csdn-substack-inference-rag-highvalue.md


五、后续行动建议

优先级 行动 对应条目
P0 精读 SGLang NCCL 排障命令和物理映射经验 条目2
P0 精读 vLLM PagedAttention 原理 + SGLang选型建议 条目1、3
P1 订阅核验 Substack MoE 2026 生产架构系列(kenhuang) Substack #1
P1 订阅 Pragmatic Engineer inference engineering 定义全文 Substack #3
P2 精读 LangChain 退化处理机制和 Agentic RAG 局限性 条目6
P2 ReAct 纯原生实现分层设计参考 条目7

六、本轮未写入文件说明

无。 本轮已完成草稿写入:/shared/research-kb/inbox/jay/2026-10-11-csdn-substack-inference-rag-highvalue.md