Jay 工程文章筛选 · 2026-08-29 上午场二次过滤

实例: Jay · 时间: 2026-08-29 11:20 (Asia/Shanghai) 任务: 上午 RSS/Substack 覆盖后的工程增量筛选 筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤


一、保留条目(Keep)

✅ K1 · SGLang OOM 场景化命令参考

  • 来源: inference.net — SGLang: The Complete Guide to High-Performance LLM Inference
  • URL: https://inference.net/content/sglang-complete-guide
  • 为什么保留: 按 OOM 阶段分门别类,附真实命令行参数
  • Prefill OOM → --chunked-prefill-size 4096
  • Decode OOM → --max-running-requests 128
  • 通用 OOM → --mem-fraction-static 0.8
  • CUDA_HOME 未设 → export CUDA_HOME=/usr/local/cuda
  • Kernel 编译错误 → --attention-backend triton
  • 复现可行性: 高(命令块可直接复制进启动脚本)
  • 版本信息: SGLang v0.5.8(2026-01)
  • 分类: 推理部署 SGLang OOM排障 生产命令
  • 建议路径: /shared/research-kb/inbox/jay/inference/sglang-oom-runbook-2026.md

✅ K2 · vLLM OOM 根因诊断完整清单

  • 来源: Sector88 — How to fix vLLM OOM: the complete 2026 checklist
  • URL: https://www.sector88.co/blog/how-to-fix-vllm-oom
  • 为什么保留: 揭示 vLLM 预分配机制(gpu_memory_utilization 静态预留),给出"Do not"清单
  • "不要设 gpu_memory_utilization=1.0"
  • "不要在同一 GPU 同时跑 vLLM 和其他 CUDA 负载"
  • "不要把 max_model_len 设在模型上限——会为每个请求全额付费"
  • 复现可行性: 高(工程师直接可用的 Checklist)
  • 分类: 推理部署 vLLM OOM排障 显存管理
  • 建议路径: /shared/research-kb/inbox/jay/inference/vllm-oom-checklist-2026.md

✅ K3 · vLLM OOM 四类根因 + 对应 Fix

  • 来源: ParallelIQ — vLLM OOM Errors: Root Cause Diagnosis Guide(2026-05)
  • URL: https://www.paralleliq.ai/blog/vllm-oom-errors-root-cause-diagnosis
  • 为什么保留: 明确划分四类根因并给出诊断路径 1. KV Cache Overflow → 调 max_model_len / gpu_memory_utilization 2. Batch Size Misconfiguration → 切 continuous batching 3. Memory Fragmentation → 动态分页 4. Startup OOM → 连续 batching 问题
  • 复现可行性: 高(分类清晰,Fix 可直接验证)
  • 分类: 推理部署 vLLM OOM诊断 根因分析
  • 建议路径: /shared/research-kb/inbox/jay/inference/vllm-oom-4patterns-2026.md

✅ K4 · LangChain/LangGraph 版本迁移路线图(AgentExecutor 截止 2026-12)

  • 来源: uvik.net — LangChain vs LangGraph: 2026 Decision Guide
  • URL: https://uvik.net/blog/langchain-vs-langgraph
  • 为什么保留: 精确版本号 + AgentExecutor 停更截止日 + 迁移路径量化
  • langchain-core → 1.4.x,LangGraph → 1.2.6
  • create_agent(4 行)vs StateGraph(17 行)量化对比
  • AgentExecutor 2026-12 停更,须迁往 create_agentStateGraph
  • 生产环境 Checkpointer:从 in-memory → Postgres 或 Redis(持久化必须)
  • 复现可行性: 中高(版本号可核验,迁移路径有代码片段)
  • 分类: Agent LangGraph LangChain 版本迁移 生产
  • 建议路径: /shared/research-kb/inbox/jay/agent/langgraph-migration-2026.md

✅ K5 · Cloudflare MCP 2026-07-28 无状态规范深度解读

  • 来源: Cloudflare Blog — The next generation of MCP
  • URL: https://blog.cloudflare.com/mcp-v2
  • 为什么保留: 工程细节丰富
  • SDK v2:包体积缩小 83%,速度提升 25%(client-server split)
  • MCP → 无状态架构(无需有状态基础设施)
  • Python/TypeScript/Go/C# SDK 同步更新
  • 引用来自 Google Cloud Manufact 的生产验证
  • 复现可行性: 中(规范变更,非命令复现;但有 SDK 升级具体数字)
  • 分类: MCP 协议 无状态架构 SDK 生产
  • 建议路径: /shared/research-kb/inbox/jay/mcp/mcp-v2-stateless-cloudflare-2026.md

二、丢弃条目(Drop)

编号 来源 丢弃理由
D1 DevOpsBeast — vLLM vs SGLang 生产对比 性能数据(10-20%差距)无硬件/模型/命令上下文;无错误处理;无源码;对比性描述为主
D2 ByteByteGo EP223 — Ollama vs vLLM vs SGLang 浅层三分法,RSS摘要已捕获;无新命令或错误信息;工程深度不足
D3 ByteByteGo — 如何窃取AI模型的私密思考 安全研究方向,MATRS/ MPI / ELLIS联合研究可信,但无命令/错误/性能数据;仅作线索
D4 HuggingFace Trending — Awesome-LLM-Inference-Engine 清单 论文引用型 survey,无原创命令或错误经验;是导航资源而非工程实践
D5 theaiengineer.substack — vLLM vs Ollama vs SGLang vs TensorRT-LLM 图表式对比,OOM 错误引用有("OOM error they haven't hit yet"),但无实际命令块;工程细节浅
D6 Pragmatic Engineer — AI 工程团队建设 团队结构指南(10-50人配置比例),非工程实践;不符合本轮筛选"命令/错误/性能"标准
D7 LangChain.com — State of AI Agents 调查数据(~97M MCP月下载 / 41%生产),无技术细节;适合趋势判断,不适合工程知识库
D8 Emerging AI — LLM Inference Engineering 可视化指南 via 转发,来源待核;图表质量未核实;工程价值"待验证"(已在昨日后续行动中)

三、待核实条目(Verify)

编号 来源 待核实项
V1 GitHub sgl-project/sglang#8902 — VLM cuda memory leak Issue 8902 是否为 2026-08-28 前新回复;20MB/2-5请求内存增长是否在v0.5.8中已修复
V2 arXiv:2506.09713v2 — A First Look at Bugs in LLM Inference Engines 精确数据:vLLM#8952 crash with response_format/guided_json;59%服务中断;研究方法是否来自真实生产bug库

四、arXiv 2026-08-29 Cool Papers 快速扫过

ID 标题 判断
2608.27455 CritICL:弱到强泛化(推理时) 生产价值待核;属于 Eval/Harness 范畴
2608.27448 TTPO:测试时策略优化 测试时 RL,新;需核实与现有 RLVR 条目是否有重叠
2608.27420 RLVR 弱模型引导探索 训练方法论;工程实践价值待核
2608.27409 跨领域 RLVR 融合 同上;建议由专门 RL/训练管线处理
2608.27428 转导语言模型随机估计 偏理论;工程价值低

arXiv 建议: V2 TTPO 可入后续 RL 训练管线关注列表;其余本次不深度处理。


五、本次分类标签汇总

标签 保留条目
推理部署 K1(SGLang OOM命令)/ K2(vLLM OOM checklist)/ K3(vLLM 四类根因)
OOM排障 K1 / K2 / K3
Agent K4(LangGraph 迁移)
MCP K5(MCP v2 无状态)
LangGraph K4
版本迁移 K4

六、建议写入路径

草稿 优先级
inference/sglang-oom-runbook-2026.md P1
inference/vllm-oom-checklist-2026.md P1
inference/vllm-oom-4patterns-2026.md P1
agent/langgraph-migration-2026.md P2
mcp/mcp-v2-stateless-cloudflare-2026.md P2

Jay · 2026-08-29 11:20 CST · 工程二次筛选 · inbox/jay/ · 零 git/零越界/零密钥泄漏