研究知识库草稿 · Jay · 2026-09-08 工程文章二次筛选
主题:Jay 工程文章二次筛选 · 2026-09-08 上午场
筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤
一、保留条目(含工程价值的真实内容)
1. 🔍 Nano vLLM: A Tiny Inference Engine(Substack · BoringBot)
URL: https://boringbot.substack.com/p/nano-vllm-a-tiny-inference-engine
标签: #推理引擎 #vLLM源码 #教学代码 #PagedAttention #KVCache
保留理由:
- ✅ 教学代码级源码:提供 nano-vLLM(几百行可读代码)完整解析 PagedAttention/KVCache/Continuous Batching 核心机制
- ✅ 可复现心智模型:通过精简代码理解 vLLM 生产配置问题(--max-num-batched-tokens 调优、内存压力调试)
- ✅ 工程迁移性:KV cache block 分配/释放、block table 机制的心智模型直接迁移到 vLLM/TGI/TensorRT-LLM 调试
- Substack 质量:教学向但有深度,适合理解原理后快速定位生产问题
核心观点: - 生产 LLM 推理引擎(vLLM/TGI/TensorRT-LLM)因深度而难理解,nano 版本用几百行代码揭示核心机制 - PagedAttention block table 是理解内存管理的关键 - Continuous Batching 的吞吐提升原理可从代码层面理解
可信度: 高(教学向,但概念准确,与官方文档一致) 行动建议: 精读源码 + 对照 vLLM 官方配置项做生产验证
2. 🔍 Inference Serving: Senior LLM Inference Engineer Interview(Substack · AI Engineering Insider)
URL: https://aiengineeringinsider.substack.com/p/inference-serving-senior-llm-inference 标签: #面试题 #推理系统 #生产部署 #Autoscaling 保留理由: - ✅ 生产级知识点覆盖:Autoscaling / TTFT / TPOT / ITL / GPU utilization / PagedAttention / prefix caching - ✅ 完整推理架构图谱:API gateway → Router → Scheduler → Workers → GPU replicas - ✅ 面试级深度:涵盖 Request lifecycle / Batching(static/dynamic/continuous)/ Scheduling / Replicas - ⚠️ 付费内容,摘要价值高,原文需订阅
核心观点: - 推理服务是"训练好的 LLM 变成生产系统"的最后一公里 - Senior 级别考察:设计/运维/调试/优化推理集群,而非只会启动 vLLM
可信度: 高(行业面试标准,知识点系统) 行动建议: 作为团队内部面试题库 / 工程知识自检清单
3. 🔍 LLM Inference Optimization: Cut Cost & Latency at Every Layer(Blog · Morph)
URL: https://www.morphllm.com/llm-inference-optimization 标签: #推理优化 #三层优化 #Quantization #ContinuousBatching #SpeculativeDecoding 保留理由: - ✅ 三层优化体系完整:Model-level(Quantization/Pruning/Distillation)/ System-level(Continuous Batching/PagedAttention/Speculative Decoding)/ Application-level(Context Compression/Prompt Caching) - ✅ 数字具体:堆叠优化可降低推理成本 80%+;FlashAttention-3 提供最快 custom attention kernels - ✅ 框架对比:vLLM vs SGLang 2026 年最新特性
核心观点: - 优化需在三层同时叠加,单层优化存在瓶颈 - FlashAttention-3 已集成进 vLLM 和 SGLang
可信度: 高(数据有具体场景,需对照最新版本文档核验) 行动建议: 作为推理优化检查清单;对照 2026-09 最新 vLLM/SGLang 版本验证特性
4. 🔍 SGLang vs vLLM in 2026: Benchmarks, Architecture, and When to Use Each(Blog · Particula Tech)
URL: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison 标签: #vLLM #SGLang #Benchmark #H100 #生产决策 保留理由: - ✅ 真实 Benchmark 数据:H100 上 SGLang 吞吐量比 vLLM 高 29%,DeepSeek V3 快 3.1x - ✅ 场景分化明确:29% 差距在标准 workload;unique-prompt batch 接近 0%;prefix-heavy RAG 可达 6x - ✅ 决策框架:SGLang 在 prefix overlap >60% 时优势明显;vLLM 在模型广度/硬件支持/部署速度占优
核心数据: | Concurrency | vLLM (tok/s) | SGLang (tok/s) | Delta | |---|---|---|---| | 1 | 120 | 125 | ~4% | | 10 | 650 | 680 | ~5% | | 50 | 1,850 | 1,920 | ~4% | | 100 | 2,400 | 2,460 | ~2% |
可信度: 中高(独立 benchmark,数据可复现,但需注意 workload 形态差异) 行动建议: 作为生产引擎选型依据;结合真实流量特征做决策
5. 🔍 vLLM vs SGLang for Production LLM Serving in 2026(Blog · DevOpsBeast)
URL: https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 标签: #vLLM #SGLang #生产对比 #DecisionFramework 保留理由: - ✅ 实用决策框架:5 分钟 4 问题决策法(workload shape / structured output / operational maturity / hardware) - ✅ 纠正 Benchmark 误导:Per-token throughput 在 10-20% 差异内,选择应基于 workload 而非 leaderboard - ✅ 各自优势明确:SGLang 在 prefix-heavy/agents/multi-turn 占优;vLLM 在模型广度/Blackwell/部署速度占优
核心洞察: - "Benchmark 不会定胜负"——2026 年 vLLM vs SGLang 在同模型同硬件差异 10-20% - 决策因素:traffic pattern(unique prompts vs shared prefixes)+ structured output 需求 + 团队运维能力
可信度: 高(工程经验驱动,非纯理论) 行动建议: 作为团队内 tech talk 材料;推动基于真实流量的 engine 选型
6. 🔍 How to Build a Production-Ready RAG Pipeline in 2026(Blog · MetafiedLab)
URL: https://metafiedlab.com/blog/how-to-build-a-production-ready-rag-pipeline-in-2026 标签: #RAG #生产部署 #Evaluation #72%企业采用 保留理由: - ✅ 市场规模数据:72% 企业在 Q1 2026 运行 RAG(从 Q1 2024 的 8% 增长) - ✅ 技术数据具体:Hybrid retrieval(BM25+dense vector)提升 recall 17%,延迟增加 <6ms;Semantic chunking 比 fixed-size 提升 accuracy 70% - ✅ Demo→Production 的 gap 分析:Building RAG demo 需要 afternoon;Building production-grade 需要 months
核心观点: - RAG 市场 2026 年达 $3.33B,42.7% CAGR 到 2035 - 评估基础设施是 production RAG 的前提,不是事后补救
可信度: 中(数据来源 DEV Community benchmark,需核验原始报告) 行动建议: 作为 RAG 生产成熟度评估参考;关注 evaluation 章节的量化指标
7. 🔍 Production-Ready RAG Pipeline: An Engineering Checklist(Blog · ActiveWizards)
URL: https://activewizards.com/blog/the-production-ready-rag-pipeline-an-engineering-checklist 标签: #RAG #工程清单 #ProductionChecklist 保留理由: - ✅ 工程清单形式:适合直接用于团队 RAG 系统审查 - ✅ Context Engineering 覆盖:token budgets / memory hierarchies / retrieval patterns - ✅ 数据所有权视角:Enterprise RAG 失败常因 source ownership/access rules/freshness/document accountability 弱,而非 vector database 问题
核心观点: - Prompt engineering 对 production AI agents 不够 - Context engineering 是 LLM context window 的架构学科
可信度: 中(工程清单实用,但需结合实际架构调整) 行动建议: 作为 RAG 系统设计 review checklist
8. 🔍 How to Build RAG Systems in 2026: 8 Architecture Patterns(Blog · AIThinkerLab)
URL: https://aithinkerlab.com/build-rag-systems-2026-architecture-patterns 标签: #RAG #KnowledgeGraph #AgenticRAG #PromptInjection 保留理由: - ✅ 知识图谱量化数据:Knowledge graph RAG 在 47 个生产部署中减少 hallucination 62%(MLOps Community 2026-05 benchmark) - ✅ 延迟代价明确:知识图谱方案增加 ~220ms 延迟(Carnegie Mellon 2026-06 preprint,9000 题金融合规数据集) - ✅ 安全警示:Agentic RAG 的文档摄入步骤是 indirect prompt injection 的主要入口,需 5 层防御
核心数据: - Hallucination 从 14.1% 降至 4.9%(CMU 数据) - 220ms 在 p99 live support chat 是"instant"和"laggy"的边界
可信度: 中高(benchmark 数据,需核验原始来源) 行动建议: 生产 RAG 架构选型参考;关注 Knowledge Graph 路径的延迟预算评估
9. 🔍 From Tensors to Teraflops: A Mental Model for LLM Engineering(Substack · ModelCraft)
URL: https://modelcraft.substack.com/p/fundamentals-of-gpu-engineering 标签: #GPU工程 #Kernel #Profiling #PyTorch 保留理由: - ✅ GPU profiling 实用方法:Too many kernel launches / Memory bandwidth bottleneck / Lack of fusion - ✅ Compute-bound vs Memory-bound 区分:Dense matmul=compute-bound;Attention=memory-bound - ✅ Debugging 方法论:profiling with PyTorch/JAX tools → "Is this a math problem, a memory problem, or a framework inefficiency?"
核心观点: - LLM 规模增长后,训练瓶颈从 compute 转向 memory bandwidth - Kernel engineering 适合边缘 case,需先用 profiling 定位问题类型
可信度: 高(GPU 工程方法论,概念清晰) 行动建议: 作为 ML 工程师 GPU profiling 入门/参考
二、丢弃条目(缺乏工程实操价值)
1. ❌ "The Rise of Modern LLM Inference Engines in 2026"(LinkedIn · Umesh Khandelwal)
URL: https://www.linkedin.com/pulse/rise-modern-llm-inference-engines-2026-umesh-khandelwal-p5cde 丢弃理由: - ⚠️ LinkedIn 文章,无具体命令/代码/benchmark 数据 - ⚠️ 行业观察性内容,无工程可复现步骤 - ⚠️ 与其他更具体的技术源高度重复
2. ❌ "LLM Inference Handbook 2026"(Medium · TowardsAI · Anubhav Mandarwal)
URL: https://pub.towardsai.net/llm-inference-handbook-2026-135c266b86e7 丢弃理由: - ⚠️ Medium 平台质量参差,文章结构为目录式概述 - ⚠️ vLLM 章节仅"很受欢迎,第一个引入 PagedAttention",无新意 - ⚠️ Framework 对比部分无 2026 年新数据 - 建议替换为本文筛选中的 Particula Tech / DevOpsBeast / Spheron 实际 benchmark 文章
3. ❌ "What Is Inference Engineering? The 2026 GPU Cloud Guide"(Blog · Spheron)
URL: https://www.spheron.network/blog/inference-engineering-guide-2026 丢弃理由: - ⚠️ 内容与 Spheron 另一篇 "LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang" 高度重复 - ⚠️ 主要是 vLLM vs TGI vs SGLang 的 overview,无新 benchmark 数据 - ✅ 前述 Spheron 那篇(benchmarks 有具体数字)已保留
4. ❌ "Building a Production-Ready RAG Architecture in 2026"(Article · DataStorag.com)
URL: https://datastorage.com/articles/building-a-production-ready-rag-architecture-in-2026 丢弃理由: - ⚠️ 无具体命令/代码/benchmark - ⚠️ Fine-tuning vs RAG 的 decision tree 为通用建议,无工程细节 - ⚠️ Pinecone/Qdrant/Weaviate/pgvector 对比是 marketing 性质 - ✅ 前述 AIThinkerLab 的 8 Patterns 文章(量化数据)和 ActiveWizards 的 checklist 已保留
5. ❌ "A Survey on Inference Engines for Large Language Models"(ACM · 2026)
URL: https://dl.acm.org/doi/10.1145/3803798 丢弃理由: - ⚠️ ACM 学术论文,arXiv 已有预印本,质量尚可但非本轮筛选重点 - ⚠️ 学术论文缺少生产命令/错误/性能调优内容 - ✅ 学术价值高但不符合本轮"工程文章二次筛选"实操标准
6. ❌ "AI Engineering Production Stack (2026)"(Substack · TechTrekWithMoonPie)
URL: https://techtrekwithmoonpie.substack.com/p/the-ai-engineering-production-stack 丢弃理由: - ⚠️ CLAUDE.md / memory architecture 偏向 Anthropic Claude Code 特定工具 - ⚠️ "4 components" 总结过于简化,无具体命令 - ⚠️ roadmap 性质文章,无本轮筛选关注的真实生产细节 - ✅ System Design Newsletter(Neo Kim)那篇 22 概念更系统,已在其他筛选中保留
三、本轮筛选总结
保留:9 条
| # | 来源 | 标题 | 核心工程价值 |
|---|---|---|---|
| 1 | Substack | Nano vLLM(源码教学) | PagedAttention/KVCache 精简实现 |
| 2 | Substack | Senior LLM Inference Engineer Interview | 生产级知识体系/面试清单 |
| 3 | Blog | LLM Inference Optimization Cut Cost & Latency | 三层优化框架/数字具体 |
| 4 | Blog | SGLang vs vLLM 2026 Benchmarks | 真实 H100 数据/workload 决策 |
| 5 | Blog | vLLM vs SGLang Production Decision | 4 问题决策法/Benchmark 纠偏 |
| 6 | Blog | Production-Ready RAG Pipeline 2026 | 72% 企业数据/Hybrid retrieval 数字 |
| 7 | Blog | RAG Engineering Checklist | 工程清单/Context Engineering |
| 8 | Blog | RAG 8 Architecture Patterns | KG RAG 量化数据/安全警示 |
| 9 | Substack | From Tensors to Teraflops | GPU profiling 方法论 |
丢弃:6 条
| # | 来源 | 标题 | 丢弃原因 |
|---|---|---|---|
| 1 | Rise of Modern LLM Inference Engines | 无工程细节 | |
| 2 | Medium | LLM Inference Handbook 2026 | 目录式概述,无新数据 |
| 3 | Blog | Inference Engineering GPU Cloud Guide | 与 Spheron 另一篇重复 |
| 4 | Article | Production-Ready RAG Architecture | 无具体命令/代码 |
| 5 | ACM | Survey on Inference Engines | 学术论文不符工程实操标准 |
| 6 | Substack | AI Engineering Production Stack | 工具特定/过于简化 |
分类标签
#推理引擎 #vLLM #SGLang #RAG #GPU工程 #Benchmark #生产部署 #工程筛选 #Substack #源码解析
建议写入路径
✅ /shared/research-kb/inbox/jay/2026-09-08T1050-jay-engineering-filter.md
精读/审稿建议
- 精读: Nano vLLM 源码 + 对照 vLLM 配置项做生产验证
- 审稿: SGLang vs vLLM Benchmark 数据(建议对照 Spheron/LeetLLM 原始数据)
- 跟踪: Knowledge Graph RAG 的 220ms 延迟数据(CMU preprint 2026-06)