Jay 工程实践筛选 · 2026-10-08
本次主题
LLM Inference & RAG 生产工程实践 · vLLM/SGLang 对比 · Prompt 管理 · Chunking 排障
检索范围
- 学术:arXiv (LLM inference optimization, production systems)
- 工程博客:Spheron, Network Bachelor, Yotta Labs, QA Bash
- Substack:Decoding AI Magazine, System Design Newsletter, Pragmatic Engineer, Tech Fusionist
- 官方文档:vLLM docs (metrics)
高价值条目(保留)
1. vLLM 生产 OOM 修复指南
来源: Spheron Engineering
URL: https://www.spheron.network/blog/gpu-memory-requirements-llm
发布日期: 2026-09-29
类型: 排障/命令/可复现
保留理由:
- 包含真实错误场景:gpu_memory_utilization 与 max_num_seqs 的实际配置值
- 提供 KV cache 优化实操步骤(KIVI INT2 方法)
- 量化数据:PagedAttention 可提升 2-4x 并发
- 明确 vLLM 原生支持的 KV cache quantization (FP8/INT8)
核心命令/参数:
# KV Cache Quantization
--kv-cache-dtype FP8 # or INT8
# 配合 GQA 可实现 8x 内存降低
# OOM 修复核心参数
gpu_memory_utilization=0.9 # 调整到 0.85
max_num_seqs=256 # 降低并发数
标签: #vLLM #KV-Cache #OOM #GPU-Memory #生产排障
2. vLLM 2026 基础设施工程师指南
来源: Network Bachelor
URL: https://www.networkbachelor.com/vllm-infrastructure-guide-pagedattention-kv-cache
发布日期: 近期
类型: 工程实践/监控/基准
保留理由:
- 完整的生产 vLLM 指标列表(vllm:time_to_first_token_seconds、vllm:kv_cache_usage_perc、vllm:num_preemptions 等)
- PagedAttention vs 传统 pre-allocate 对比(60-80% 内存浪费问题)
- Continuous batching + Chunked prefill 调度原理
- Prefix cache 统计对重复提示词的价值
工程要点:
关键监控指标:
- vllm:num_requests_running / _waiting(队列压力,autoscaling 信号)
- vllm:kv_cache_usage_perc(持续高使用率 → 内存压力 → preemptions)
- vllm:prefix_cache_hits(重复提示词是否命中缓存)
- vllm:num_preemptions(OOM 风险指标)
标签: #vLLM #监控 #PagedAttention #Continuous-Batching #基础设施
3. SGLang vs vLLM 生产决策指南
来源: Yotta Labs
URL: https://www.yottalabs.ai/post/what-is-sglang-architecture-performance-and-when-to-use-it
发布日期: 2026
类型: 架构对比/性能基准/选型
保留理由:
- RadixAttention(prefix caching)vs PagedAttention 核心差异
- 实际场景对比:unique-prompt batch jobs(两者接近)vs prefix-heavy workloads(SGLang 优势明显)
- 第三方 benchmark 数据:SGLang 在共享前缀工作负载上有 5x 加速(需自行验证)
- 明确 SGLang 的 Structured Output 优势
工程决策框架:
选型原则:
- 高吞吐、高并发 API → vLLM(continuous batching 更成熟)
- Agentic 工作流、共享前缀 → SGLang(RadixAttention 天然匹配)
- 延迟敏感、长上下文 → H200 + vLLM
- 13B-70B 模型、多租户 → H100 + vLLM
标签: #SGLang #vLLM #架构对比 #推理引擎 #选型
4. Prompt 管理基础设施:版本控制、A/B 测试、部署
来源: GMI Cloud
URL: https://www.gmicloud.ai/zh-tw/blog/prompt-management-infrastructure-versioning-ab-testing-and-deployment-for-production-llm-apps
发布日期: 2026-09-27
类型: 工程实践/CI-CD/评估
保留理由:
- 真实失败案例:prompt 变更导致 groundedness 下降 12%、refusal rate 从 4% 升至 27%
- 完整的 Evaluation Gate 方案(200 条 hand-labelled production traces + synthetic edge cases)
- CI pipeline 集成:阈值未达标不进入 staging
- Rollback 策略(Slack thread 触发回滚的实际操作流程)
工程要点:
评估集组成:
1. ~200 条 hand-labelled production traces
2. synthetic cases(覆盖罕见边界条件)
3. adversarial probes(测试对 malformed/hostile input 的鲁棒性)
Gate 阈值未达标 → 不进入 staging
Pass staging → 才能 promotion to production
标签: #Prompt-Management #A/B-Testing #CI-CD #Evaluation #Production
5. RAG Testing Framework: 度量、测试集与工具
来源: QA Bash
URL: https://www.qabash.com/blog/rag-testing-framework
发布日期: 2026-10-06
类型: 工程实践/测试/可复现
保留理由:
- 完整的 Retrieval Metrics 定义(Hit Rate、Context Recall、Context Precision、MRR)
- Generation Testing(faithfulness、relevance、correctness、refusal)
- 工具链:RAGAS、DeepEval、promptfoo
- 具体的 CI 集成方式
工程测试集:
Retrieval Metrics:
- Hit Rate:相关 chunk 是否出现在 top-k 中
- Context Recall:答案所需证据有多少被检索到
- Context Precision:检索到的 chunk 有多少真正相关
- MRR:第一个相关 chunk 的排名倒数均值
Generation Metrics:
- Faithfulness:答案是否忠实于检索上下文
- Relevance:答案是否真正回答了问题
- Refusal:知识库无答案时是否正确拒绝
标签: #RAG #测试 #Evaluation #Metrics #CI
6. The Chunking Dilemma:为什么 RAG 在检索前就失败了
来源: Towards AI
URL: https://pub.towardsai.net/the-chunking-dilemma-why-rag-fails-before-retrieval-even-starts-ed5c83adaf07
发布日期: 近期
类型: 排障/源码分析
保留理由:
- 揭示 tokenizer truncation 静默截断问题(700 tokens → 512 embedding model → 188 tokens 被丢弃)
- 真实的 Semantic Blur 问题(2000-token chunk 语义稀释)
- Chunk size sweet spot 的工程判断方法(非"最佳尺寸"问题,而是"目标嵌入模型的 tokenizer 限制"问题)
核心教训:
生产规则:永远不要用 raw character count 设计 chunking pipeline
必须使用目标 embedding 模型的 actual tokenizer 和 token limit 来测量和约束 chunk 边界
标签: #RAG #Chunking #Embedding #排障 #Tokenizer
7. Herschel: 生产 LLM 推理持续优化系统
来源: arXiv (OSDI 2026)
URL: https://arxiv.org/pdf/2609.40247
类型: 学术/生产系统
保留理由:
- Runtime attachment 全栈 profiling(按需 + bounded windows)
- Analyzer 重构执行关系以识别低效
- Optimizer 引导 AI agent 实现 + controlled validation + expert review
- 覆盖 AMD ROCTracer、Claude batch processing、Anthropic Fast Mode 等实际生产场景
可信度: 高(arXiv + OSCI 2026 论文,有真实生产调查案例)
标签: #LLM-Inference #Profiling #Optimization #Production #Academic
8. RAG APIs:架构设计
来源: WSO2
URL: https://wso2.com/api-platform/learn/rag-api-architecture
类型: 架构/API 设计
保留理由:
- Ingestion 与 Request path 分离(常见早期错误)
- GDPR 数据暴露风险(2026-01 累计罚款 €7.1 billion)
- Chunk boundary、embedding model、retrieval mix 的端到端影响
核心架构决策:
4 阶段流程(时间线分离):
1. Ingestion:离线,schedule 或 source change 触发
2. Retrieval:request 时运行
3. Augmentation:request 时运行
4. Generation:request 时运行
常见错误:将 ingestion 放入 request path → 用户延迟 = 文档处理时间
标签: #RAG #API-Design #Architecture #GDPR
Substack 高价值条目
9. RAG Evals: 变更 Prompt 而不破坏应用
来源: Decoding AI Magazine
URL: https://open.substack.com/pub/decodingaimagazine/p/rag-evals-change-prompts
Substack 专栏: Decoding AI Magazine(Alexey Grigorev 相关)
可信度判断: 高(引用 How to Do Evals in 2026、Eugene Yan、opik 实际案例)
核心观点:
- FAQ system 案例:DataTalksClub GitHub repo(每问题一个 Markdown 文件)
- Opik free tier(25k spans/month)用于 MVP 快速接入 traces
- 引用链:How to Do Evals in 2026 → Eugene Yan on aligning LLM evaluators → Hamel Husain on AI product evals
后续行动: 验证 opik.io 是否真实可用;下载 DataTalksClub FAQ dataset
标签: #RAG #Evals #Substack #Case-Study
10. HNSW Vector Search 解释
来源: System Design Newsletter (Neo Kim)
URL: https://open.substack.com/pub/systemdesignone/p/hnsw-vector-search-explained
Substack 专栏: System Design Newsletter
可信度判断: 中(工程教学向,有图解,需核实参数调优数据)
核心观点:
- HNSW 图搜索原理(分层可导航小世界)
- 生产调参要点:ef_construction、m、ef_search
- Approximate Nearest Neighbor 在十亿级向量的实际性能
后续行动: 核实 HNSW 调参的 2026 最新建议值
标签: #Vector-Search #HNSW #Substack #System-Design
丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| 15 High-Demand Tech Skills for 2027 (Tech Fusionist) | 列表性质,无工程细节,技能清单类内容 |
| LLMday 会议页面 | 活动页面,无实操内容 |
| AI Engineering 书籍广告 (Towards AI) | 营销内容,非工程实践 |
| The 12 AI Terms (Ai.Alvin) | 入门科普,非生产工程 |
| 3 Videos for AI Engineering (Hustling Engineer) | 视频指引汇总,无新工程内容 |
建议写入路径
/shared/research-kb/inbox/jay/2026-10-08-engineering-filter.md
分类标签汇总
#vLLM #SGLang #RAG #LLM-Inference #GPU-Memory #KV-Cache #OOM #Monitoring
#Chunking #Evaluation #Prompt-Management #CI-CD #Architecture #Substack
#Production #Academic #Inference-Engine #PagedAttention #Continuous-Batching
后续行动
需精读: 1. Herschel paper (arXiv) - 验证 LLM profiling 在生产环境的实际效果 2. vLLM OOM Guide - 提取可复现的 GPU memory 计算公式
需审稿: 1. SGLang vs vLLM benchmark 数据(5x 加速声明需第三方验证)
建议更新主题页: 1. LLM Inference Engineering(新增 Herschel + vLLM metrics 部分) 2. RAG Engineering(新增 Chunking Dilemma + RAG Testing Framework)
Jay · 2026-10-08 10:50 CST