Jay · CSDN 高价值技术检索 + Substack 研究线索
日期: 2026-10-11 检索范围: CSDN(LLM/RAG/Agent/vLLM/SGLang)+ Substack(inference engineering / agentic RAG / MoE systems) 本轮执行时间: 2026-10-11 12:20 UTC
一、CSDN 高价值条目
🔴 高价值(源码/命令/版本/复现/排障)
1. SGLang vs vLLM vs TGI 2026 双模型实测
- 标题: 【推理引擎2026年中版】SGLang vs vLLM:Qwen3与GLM-5.1双模型实测对比与选型指南
- 链接: https://blog.csdn.net/gedonshen/article/details/164287845
- 工程价值:
- 实测 Qwen3-27B + GLM-5.1 两个主流模型的推理框架对比
- 包含启动命令:
python -m sglang.launch_server --model-path Qwen/Qwen3-6-27B - 关键经验:CUDA_DSL_ARCH=sm_121 环境变量不加性能直接腰斩但无报错,易误判为模型问题
- SGLang 适合工具调用解析场景,vLLM 追求计算效率,TGI 适合快速上线
- 版本信息: SGLang + kt-kernel(源码构建路径依赖 torch==2.9.1 固定版本)
- 可信度: ⭐⭐⭐⭐⭐ 自测数据,有明确硬件环境和命令
- 建议分类:
inference-engineeringsglangvllmbenchmark - 后续行动: 可纳入推理引擎选型对比参考,建议精读命令和实测数据部分
2. SGLang 2026 部署踩坑实录 + NCCL 物理映射问题
- 标题: 五大主流大模型推理引擎深度解析:llama.cpp、vLLM、SGLang、DeepSpeed和Unsloth终极选择指南
- 链接: https://blog.csdn.net/qq_40999403/article/details/148424108
- 工程价值:
- 多节点 SLURM 集群上 SGLang 部署工具链(Dockerfile/Makefile/run.sbatch/bench.sh)
- EFA/NCCL/GDRCopy 镜像构建,TP/DP/PP/EP 并行策略
- 关键排障经验:NCCL 环境变量和 CUDA_VISIBLE_DEVICES 物理映射关系
- 可信度: ⭐⭐⭐⭐ 工具链完整,踩坑经验有工程价值
- 建议分类:
inference-engineeringsglangproductionnvidia - 后续行动: 可纳入 SGLang 生产部署 runbook 参考
3. vLLM 生态集成:PagedAttention 原理到 Ollama/SGLang 部署选型
- 链接: https://blog.csdn.net/weixin_31062533/article/details/166041904
- 发布时间: 2026-09-19(最新推荐)
- 工程价值: 从 PagedAttention 源码层面讲解 vLLM 架构,对比 Ollama 和 SGLang 生态差异
- 可信度: ⭐⭐⭐⭐ 原创文章,版本 2026-09
- 建议分类:
inference-engineeringvllmpagedattention - 后续行动: 精读 PagedAttention 原理部分,适合作为推理引擎架构理解材料
4. SGLang vs vLLM vs TGI 框架横评(含代码对比表)
- 标题: SGLang vs vLLM vs Text Generation Inference:2026年大模型推理框架横评
- 链接: https://blog.csdn.net/weixin_52208686/article/details/163067235
- 工程价值:
- 含 Docker 启动命令(TGI 最简配置 bitsandbytes 量化)
- 特性对比表:Beam Search / Python SDK / prefix caching / continuous batching
- 结论:追求稳定选 vLLM;追求高并发+prefix复用选 SGLang;追求简单上线选 TGI
- 可信度: ⭐⭐⭐⭐ 对比维度全面,含实测结论
- 建议分类:
inference-engineeringvllmsglangtgibenchmark - 后续行动: 可作为推理框架选型决策参考
5. vLLM 源码编译完整攻略
- 标题: 解锁vLLM源码编译的终极秘籍:从零构建高性能AI推理引擎
- 链接: https://blog.csdn.net/gitblog_01200/article/details/155806102
- 工程价值: CMake 3.26+ / PyTorch 1.10+ / Python 3.8+ 编译依赖说明,源码构建步骤
- 可信度: ⭐⭐⭐ 基础但完整,适合从零编译场景
- 建议分类:
inference-engineeringvllmbuild-from-source - 后续行动: 备用参考(非优先级,官方文档可能更新)
🟡 中等价值(综述/趋势/学习路线,非源码级)
6. 2026年LLM应用落地四大阶段 + LangChain vs LlamaIndex 对比
- 链接: https://blog.csdn.net/m0_69581581/article/details/163542988
- 工程价值: LangChain 0.3.14 vs LlamaIndex 0.12.0 对比;退化处理机制讨论;企业知识库 RAG 完整 pipeline;Agentic RAG 局限性分析
- 可信度: ⭐⭐⭐⭐ 多个项目踩坑经验,有实用建议
- 建议分类:
ragagentic-raglangchainllamaindex - 后续行动: 精读退化处理机制部分
7. AI Agent 学习路线:ReAct 智能体纯原生实现
- 链接: https://blog.csdn.net/llwszx/article/details/163446336
- 工程价值: 不依赖 LangChain,仅用 requests + pydantic 实现标准 ReAct 智能体;分层设计(配置层/LLM客户端层/工具抽象层/Agent核心模块)
- 可信度: ⭐⭐⭐ 纯工程实践,有架构参考价值
- 建议分类:
agentreactlangchain-alternative
二、Substack 研究线索
🔴 值得追踪的高价值作者/专栏
1. Physics & Engineering of Frontier LLM Inference (2026版)
- 专栏: kenhuang (Ken Huang) / Substack
- 链接: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 核心观点:
- 10章系列:MoE架构(DeepSeek-V4-Pro 1.6T总参数/49B激活参数,256路由专家+1共享专家)、分布式服务挑战
- 2026生产架构栈:API Gateway → Semantic Router → Prefix Caching Cluster → Disaggregated P/D Nodes → HW Monitoring
- Edge SLM:MLX/Metal、骁龙X Elite NPU、WebGPU/ONNX Runtime 部署小模型
- 来源:DeepSeek/Moonshot AI/Zhipu AI/Alibaba/NVIDIA/Google DeepMind
- 可信度: ⭐⭐⭐⭐ 综合性工程分析,引用前沿研究和生产蓝图
- 后续行动: 列入周度追踪列表;核验 MoE 专家路由具体数字
2. LLM Inference at Scale: Batching/Caching/Routing/Cost Control
- 专栏: System Design Nuggets (Arslan Ahmad) / Substack
- 链接: https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
- 核心观点:
- continuous batching 机制:请求完成即退出,新请求立即补位,保持硬件满载
- 详细解释 decode 阶段内存带宽瓶颈(memory bandwidth bottleneck)
- 面向 2026 年生产级 AI 系统工程师
- 可信度: ⭐⭐⭐⭐ 付费内容,但标题和摘要质量高,系统设计角度清晰
- 后续行动: 订阅全文;适合作为推理成本控制参考
3. What is inference engineering? (Pragmatic Engineer / Gergely Orosz)
- 链接: https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
- 核心观点:
- 2026年推理工程正在普及,因开源模型崛起(Cursor 基于 Kimi 2.5 构建 Composer 2.0)
- decode 阶段是内存带宽瓶颈,低到中等 batch size 下计算资源闲置
- 闭源模型推理工程只服务于几千名AI工程师;开源模型让更多公司能定制优化
- 可信度: ⭐⭐⭐⭐ Pragmatic Engineer 是知名技术博客,工程视角严谨
- 后续行动: 全文核验后纳入 inference engineering 定义参考
4. LLM Inference Curriculum (Dennis Kennetz)
- 链接: https://dkennetz.substack.com/p/llm-inference-curriculum
- 核心观点:
- 多节点推理:topology + RDMA + placement + tail latency + storage
- 核心思维转变:不是"学习LLM推理",而是"学习规模化下瓶颈如何迁移"
- Build small, throw it away, build the next thing
- 可信度: ⭐⭐⭐⭐ 课程体系化视角,RDMA/拓扑内容稀缺
- 后续行动: 纳入多节点推理研究线索
5. Architecting LLM Inference Part 1 (Pawan K Jha)
- 链接: https://pawankjha.substack.com/p/architecting-llm-inference-part-1
- 核心观点:
- 从用户 prompt 到最终 token 输出的端到端架构完整心智模型
- Token 生成、内存管理、GPU 执行、生产架构
- 可信度: ⭐⭐⭐ 付费内容,系列文章需订阅
- 后续行动: 列入队列,核验与社区已有知识库的重复度
三、本轮分类标签汇总
| 标签 | 条目数 | 主要来源 |
|---|---|---|
inference-engineering |
7 | CSDN + Substack |
vllm |
4 | CSDN |
sglang |
3 | CSDN |
rag |
2 | CSDN |
agentic-rag |
2 | CSDN + Substack |
moe |
1 | Substack |
multimodal-mlops |
2 | CSDN |
agent |
2 | CSDN |
benchmark |
2 | CSDN |
production |
2 | CSDN + Substack |
edge-inference |
1 | Substack |
四、建议写入路径
实际写入路径:
/shared/research-kb/inbox/jay/2026-10-11-csdn-substack-inference-rag-highvalue.md
五、后续行动建议
| 优先级 | 行动 | 对应条目 |
|---|---|---|
| P0 | 精读 SGLang NCCL 排障命令和物理映射经验 | 条目2 |
| P0 | 精读 vLLM PagedAttention 原理 + SGLang选型建议 | 条目1、3 |
| P1 | 订阅核验 Substack MoE 2026 生产架构系列(kenhuang) | Substack #1 |
| P1 | 订阅 Pragmatic Engineer inference engineering 定义全文 | Substack #3 |
| P2 | 精读 LangChain 退化处理机制和 Agentic RAG 局限性 | 条目6 |
| P2 | ReAct 纯原生实现分层设计参考 | 条目7 |
六、本轮未写入文件说明
无。 本轮已完成草稿写入:/shared/research-kb/inbox/jay/2026-10-11-csdn-substack-inference-rag-highvalue.md