Jay 工程实践筛选 · 2026-10-08

本次主题

LLM Inference & RAG 生产工程实践 · vLLM/SGLang 对比 · Prompt 管理 · Chunking 排障

检索范围

  • 学术:arXiv (LLM inference optimization, production systems)
  • 工程博客:Spheron, Network Bachelor, Yotta Labs, QA Bash
  • Substack:Decoding AI Magazine, System Design Newsletter, Pragmatic Engineer, Tech Fusionist
  • 官方文档:vLLM docs (metrics)

高价值条目(保留)

1. vLLM 生产 OOM 修复指南

来源: Spheron Engineering
URL: https://www.spheron.network/blog/gpu-memory-requirements-llm
发布日期: 2026-09-29
类型: 排障/命令/可复现

保留理由:
- 包含真实错误场景:gpu_memory_utilization 与 max_num_seqs 的实际配置值 - 提供 KV cache 优化实操步骤(KIVI INT2 方法) - 量化数据:PagedAttention 可提升 2-4x 并发 - 明确 vLLM 原生支持的 KV cache quantization (FP8/INT8)

核心命令/参数:

# KV Cache Quantization
--kv-cache-dtype FP8  # or INT8
# 配合 GQA 可实现 8x 内存降低

# OOM 修复核心参数
gpu_memory_utilization=0.9  # 调整到 0.85
max_num_seqs=256  # 降低并发数

标签: #vLLM #KV-Cache #OOM #GPU-Memory #生产排障


2. vLLM 2026 基础设施工程师指南

来源: Network Bachelor
URL: https://www.networkbachelor.com/vllm-infrastructure-guide-pagedattention-kv-cache
发布日期: 近期
类型: 工程实践/监控/基准

保留理由:
- 完整的生产 vLLM 指标列表(vllm:time_to_first_token_seconds、vllm:kv_cache_usage_perc、vllm:num_preemptions 等) - PagedAttention vs 传统 pre-allocate 对比(60-80% 内存浪费问题) - Continuous batching + Chunked prefill 调度原理 - Prefix cache 统计对重复提示词的价值

工程要点:

关键监控指标:
- vllm:num_requests_running / _waiting(队列压力,autoscaling 信号)
- vllm:kv_cache_usage_perc(持续高使用率 → 内存压力 → preemptions)
- vllm:prefix_cache_hits(重复提示词是否命中缓存)
- vllm:num_preemptions(OOM 风险指标)

标签: #vLLM #监控 #PagedAttention #Continuous-Batching #基础设施


3. SGLang vs vLLM 生产决策指南

来源: Yotta Labs
URL: https://www.yottalabs.ai/post/what-is-sglang-architecture-performance-and-when-to-use-it
发布日期: 2026
类型: 架构对比/性能基准/选型

保留理由:
- RadixAttention(prefix caching)vs PagedAttention 核心差异 - 实际场景对比:unique-prompt batch jobs(两者接近)vs prefix-heavy workloads(SGLang 优势明显) - 第三方 benchmark 数据:SGLang 在共享前缀工作负载上有 5x 加速(需自行验证) - 明确 SGLang 的 Structured Output 优势

工程决策框架:

选型原则:
- 高吞吐、高并发 API → vLLM(continuous batching 更成熟)
- Agentic 工作流、共享前缀 → SGLang(RadixAttention 天然匹配)
- 延迟敏感、长上下文 → H200 + vLLM
- 13B-70B 模型、多租户 → H100 + vLLM

标签: #SGLang #vLLM #架构对比 #推理引擎 #选型


4. Prompt 管理基础设施:版本控制、A/B 测试、部署

来源: GMI Cloud
URL: https://www.gmicloud.ai/zh-tw/blog/prompt-management-infrastructure-versioning-ab-testing-and-deployment-for-production-llm-apps
发布日期: 2026-09-27
类型: 工程实践/CI-CD/评估

保留理由:
- 真实失败案例:prompt 变更导致 groundedness 下降 12%、refusal rate 从 4% 升至 27% - 完整的 Evaluation Gate 方案(200 条 hand-labelled production traces + synthetic edge cases) - CI pipeline 集成:阈值未达标不进入 staging - Rollback 策略(Slack thread 触发回滚的实际操作流程)

工程要点:

评估集组成:
1. ~200 条 hand-labelled production traces
2. synthetic cases(覆盖罕见边界条件)
3. adversarial probes(测试对 malformed/hostile input 的鲁棒性)

Gate 阈值未达标 → 不进入 staging
Pass staging → 才能 promotion to production

标签: #Prompt-Management #A/B-Testing #CI-CD #Evaluation #Production


5. RAG Testing Framework: 度量、测试集与工具

来源: QA Bash
URL: https://www.qabash.com/blog/rag-testing-framework
发布日期: 2026-10-06
类型: 工程实践/测试/可复现

保留理由:
- 完整的 Retrieval Metrics 定义(Hit Rate、Context Recall、Context Precision、MRR) - Generation Testing(faithfulness、relevance、correctness、refusal) - 工具链:RAGAS、DeepEval、promptfoo - 具体的 CI 集成方式

工程测试集:

Retrieval Metrics:
- Hit Rate:相关 chunk 是否出现在 top-k 中
- Context Recall:答案所需证据有多少被检索到
- Context Precision:检索到的 chunk 有多少真正相关
- MRR:第一个相关 chunk 的排名倒数均值

Generation Metrics:
- Faithfulness:答案是否忠实于检索上下文
- Relevance:答案是否真正回答了问题
- Refusal:知识库无答案时是否正确拒绝

标签: #RAG #测试 #Evaluation #Metrics #CI


6. The Chunking Dilemma:为什么 RAG 在检索前就失败了

来源: Towards AI
URL: https://pub.towardsai.net/the-chunking-dilemma-why-rag-fails-before-retrieval-even-starts-ed5c83adaf07
发布日期: 近期
类型: 排障/源码分析

保留理由:
- 揭示 tokenizer truncation 静默截断问题(700 tokens → 512 embedding model → 188 tokens 被丢弃) - 真实的 Semantic Blur 问题(2000-token chunk 语义稀释) - Chunk size sweet spot 的工程判断方法(非"最佳尺寸"问题,而是"目标嵌入模型的 tokenizer 限制"问题)

核心教训:

生产规则:永远不要用 raw character count 设计 chunking pipeline
必须使用目标 embedding 模型的 actual tokenizer 和 token limit 来测量和约束 chunk 边界

标签: #RAG #Chunking #Embedding #排障 #Tokenizer


7. Herschel: 生产 LLM 推理持续优化系统

来源: arXiv (OSDI 2026)
URL: https://arxiv.org/pdf/2609.40247
类型: 学术/生产系统

保留理由:
- Runtime attachment 全栈 profiling(按需 + bounded windows) - Analyzer 重构执行关系以识别低效 - Optimizer 引导 AI agent 实现 + controlled validation + expert review - 覆盖 AMD ROCTracer、Claude batch processing、Anthropic Fast Mode 等实际生产场景

可信度: 高(arXiv + OSCI 2026 论文,有真实生产调查案例)

标签: #LLM-Inference #Profiling #Optimization #Production #Academic


8. RAG APIs:架构设计

来源: WSO2
URL: https://wso2.com/api-platform/learn/rag-api-architecture
类型: 架构/API 设计

保留理由:
- Ingestion 与 Request path 分离(常见早期错误) - GDPR 数据暴露风险(2026-01 累计罚款 €7.1 billion) - Chunk boundary、embedding model、retrieval mix 的端到端影响

核心架构决策:

4 阶段流程(时间线分离):
1. Ingestion:离线,schedule 或 source change 触发
2. Retrieval:request 时运行
3. Augmentation:request 时运行
4. Generation:request 时运行

常见错误:将 ingestion 放入 request path → 用户延迟 = 文档处理时间

标签: #RAG #API-Design #Architecture #GDPR


Substack 高价值条目

9. RAG Evals: 变更 Prompt 而不破坏应用

来源: Decoding AI Magazine
URL: https://open.substack.com/pub/decodingaimagazine/p/rag-evals-change-prompts
Substack 专栏: Decoding AI Magazine(Alexey Grigorev 相关)
可信度判断: 高(引用 How to Do Evals in 2026、Eugene Yan、opik 实际案例)

核心观点:
- FAQ system 案例:DataTalksClub GitHub repo(每问题一个 Markdown 文件) - Opik free tier(25k spans/month)用于 MVP 快速接入 traces - 引用链:How to Do Evals in 2026 → Eugene Yan on aligning LLM evaluators → Hamel Husain on AI product evals

后续行动: 验证 opik.io 是否真实可用;下载 DataTalksClub FAQ dataset

标签: #RAG #Evals #Substack #Case-Study


来源: System Design Newsletter (Neo Kim)
URL: https://open.substack.com/pub/systemdesignone/p/hnsw-vector-search-explained
Substack 专栏: System Design Newsletter
可信度判断: 中(工程教学向,有图解,需核实参数调优数据)

核心观点:
- HNSW 图搜索原理(分层可导航小世界) - 生产调参要点:ef_construction、m、ef_search - Approximate Nearest Neighbor 在十亿级向量的实际性能

后续行动: 核实 HNSW 调参的 2026 最新建议值

标签: #Vector-Search #HNSW #Substack #System-Design


丢弃条目

条目 丢弃理由
15 High-Demand Tech Skills for 2027 (Tech Fusionist) 列表性质,无工程细节,技能清单类内容
LLMday 会议页面 活动页面,无实操内容
AI Engineering 书籍广告 (Towards AI) 营销内容,非工程实践
The 12 AI Terms (Ai.Alvin) 入门科普,非生产工程
3 Videos for AI Engineering (Hustling Engineer) 视频指引汇总,无新工程内容

建议写入路径

/shared/research-kb/inbox/jay/2026-10-08-engineering-filter.md

分类标签汇总

#vLLM #SGLang #RAG #LLM-Inference #GPU-Memory #KV-Cache #OOM #Monitoring
#Chunking #Evaluation #Prompt-Management #CI-CD #Architecture #Substack
#Production #Academic #Inference-Engine #PagedAttention #Continuous-Batching

后续行动

需精读: 1. Herschel paper (arXiv) - 验证 LLM profiling 在生产环境的实际效果 2. vLLM OOM Guide - 提取可复现的 GPU memory 计算公式

需审稿: 1. SGLang vs vLLM benchmark 数据(5x 加速声明需第三方验证)

建议更新主题页: 1. LLM Inference Engineering(新增 Herschel + vLLM metrics 部分) 2. RAG Engineering(新增 Chunking Dilemma + RAG Testing Framework)


Jay · 2026-10-08 10:50 CST