Jay 工程文章筛选 · 2026-08-29 上午场二次过滤
实例: Jay · 时间: 2026-08-29 11:20 (Asia/Shanghai)
任务: 上午 RSS/Substack 覆盖后的工程增量筛选
筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤
一、保留条目(Keep)
✅ K1 · SGLang OOM 场景化命令参考
- 来源: inference.net — SGLang: The Complete Guide to High-Performance LLM Inference
- URL: https://inference.net/content/sglang-complete-guide
- 为什么保留: 按 OOM 阶段分门别类,附真实命令行参数
- Prefill OOM →
--chunked-prefill-size 4096
- Decode OOM →
--max-running-requests 128
- 通用 OOM →
--mem-fraction-static 0.8
- CUDA_HOME 未设 →
export CUDA_HOME=/usr/local/cuda
- Kernel 编译错误 →
--attention-backend triton
- 复现可行性: 高(命令块可直接复制进启动脚本)
- 版本信息: SGLang v0.5.8(2026-01)
- 分类:
推理部署 SGLang OOM排障 生产命令
- 建议路径:
/shared/research-kb/inbox/jay/inference/sglang-oom-runbook-2026.md
✅ K2 · vLLM OOM 根因诊断完整清单
- 来源: Sector88 — How to fix vLLM OOM: the complete 2026 checklist
- URL: https://www.sector88.co/blog/how-to-fix-vllm-oom
- 为什么保留: 揭示 vLLM 预分配机制(gpu_memory_utilization 静态预留),给出"Do not"清单
- "不要设 gpu_memory_utilization=1.0"
- "不要在同一 GPU 同时跑 vLLM 和其他 CUDA 负载"
- "不要把 max_model_len 设在模型上限——会为每个请求全额付费"
- 复现可行性: 高(工程师直接可用的 Checklist)
- 分类:
推理部署 vLLM OOM排障 显存管理
- 建议路径:
/shared/research-kb/inbox/jay/inference/vllm-oom-checklist-2026.md
✅ K3 · vLLM OOM 四类根因 + 对应 Fix
- 来源: ParallelIQ — vLLM OOM Errors: Root Cause Diagnosis Guide(2026-05)
- URL: https://www.paralleliq.ai/blog/vllm-oom-errors-root-cause-diagnosis
- 为什么保留: 明确划分四类根因并给出诊断路径
1. KV Cache Overflow → 调 max_model_len / gpu_memory_utilization
2. Batch Size Misconfiguration → 切 continuous batching
3. Memory Fragmentation → 动态分页
4. Startup OOM → 连续 batching 问题
- 复现可行性: 高(分类清晰,Fix 可直接验证)
- 分类:
推理部署 vLLM OOM诊断 根因分析
- 建议路径:
/shared/research-kb/inbox/jay/inference/vllm-oom-4patterns-2026.md
✅ K4 · LangChain/LangGraph 版本迁移路线图(AgentExecutor 截止 2026-12)
- 来源: uvik.net — LangChain vs LangGraph: 2026 Decision Guide
- URL: https://uvik.net/blog/langchain-vs-langgraph
- 为什么保留: 精确版本号 + AgentExecutor 停更截止日 + 迁移路径量化
- langchain-core → 1.4.x,LangGraph → 1.2.6
create_agent(4 行)vs StateGraph(17 行)量化对比
- AgentExecutor 2026-12 停更,须迁往
create_agent 或 StateGraph
- 生产环境 Checkpointer:从 in-memory → Postgres 或 Redis(持久化必须)
- 复现可行性: 中高(版本号可核验,迁移路径有代码片段)
- 分类:
Agent LangGraph LangChain 版本迁移 生产
- 建议路径:
/shared/research-kb/inbox/jay/agent/langgraph-migration-2026.md
✅ K5 · Cloudflare MCP 2026-07-28 无状态规范深度解读
- 来源: Cloudflare Blog — The next generation of MCP
- URL: https://blog.cloudflare.com/mcp-v2
- 为什么保留: 工程细节丰富
- SDK v2:包体积缩小 83%,速度提升 25%(client-server split)
- MCP → 无状态架构(无需有状态基础设施)
- Python/TypeScript/Go/C# SDK 同步更新
- 引用来自 Google Cloud Manufact 的生产验证
- 复现可行性: 中(规范变更,非命令复现;但有 SDK 升级具体数字)
- 分类:
MCP 协议 无状态架构 SDK 生产
- 建议路径:
/shared/research-kb/inbox/jay/mcp/mcp-v2-stateless-cloudflare-2026.md
二、丢弃条目(Drop)
| 编号 |
来源 |
丢弃理由 |
| D1 |
DevOpsBeast — vLLM vs SGLang 生产对比 |
性能数据(10-20%差距)无硬件/模型/命令上下文;无错误处理;无源码;对比性描述为主 |
| D2 |
ByteByteGo EP223 — Ollama vs vLLM vs SGLang |
浅层三分法,RSS摘要已捕获;无新命令或错误信息;工程深度不足 |
| D3 |
ByteByteGo — 如何窃取AI模型的私密思考 |
安全研究方向,MATRS/ MPI / ELLIS联合研究可信,但无命令/错误/性能数据;仅作线索 |
| D4 |
HuggingFace Trending — Awesome-LLM-Inference-Engine 清单 |
论文引用型 survey,无原创命令或错误经验;是导航资源而非工程实践 |
| D5 |
theaiengineer.substack — vLLM vs Ollama vs SGLang vs TensorRT-LLM |
图表式对比,OOM 错误引用有("OOM error they haven't hit yet"),但无实际命令块;工程细节浅 |
| D6 |
Pragmatic Engineer — AI 工程团队建设 |
团队结构指南(10-50人配置比例),非工程实践;不符合本轮筛选"命令/错误/性能"标准 |
| D7 |
LangChain.com — State of AI Agents |
调查数据(~97M MCP月下载 / 41%生产),无技术细节;适合趋势判断,不适合工程知识库 |
| D8 |
Emerging AI — LLM Inference Engineering 可视化指南 |
via 转发,来源待核;图表质量未核实;工程价值"待验证"(已在昨日后续行动中) |
三、待核实条目(Verify)
| 编号 |
来源 |
待核实项 |
| V1 |
GitHub sgl-project/sglang#8902 — VLM cuda memory leak |
Issue 8902 是否为 2026-08-28 前新回复;20MB/2-5请求内存增长是否在v0.5.8中已修复 |
| V2 |
arXiv:2506.09713v2 — A First Look at Bugs in LLM Inference Engines |
精确数据:vLLM#8952 crash with response_format/guided_json;59%服务中断;研究方法是否来自真实生产bug库 |
四、arXiv 2026-08-29 Cool Papers 快速扫过
| ID |
标题 |
判断 |
| 2608.27455 |
CritICL:弱到强泛化(推理时) |
生产价值待核;属于 Eval/Harness 范畴 |
| 2608.27448 |
TTPO:测试时策略优化 |
测试时 RL,新;需核实与现有 RLVR 条目是否有重叠 |
| 2608.27420 |
RLVR 弱模型引导探索 |
训练方法论;工程实践价值待核 |
| 2608.27409 |
跨领域 RLVR 融合 |
同上;建议由专门 RL/训练管线处理 |
| 2608.27428 |
转导语言模型随机估计 |
偏理论;工程价值低 |
arXiv 建议: V2 TTPO 可入后续 RL 训练管线关注列表;其余本次不深度处理。
五、本次分类标签汇总
| 标签 |
保留条目 |
推理部署 |
K1(SGLang OOM命令)/ K2(vLLM OOM checklist)/ K3(vLLM 四类根因) |
OOM排障 |
K1 / K2 / K3 |
Agent |
K4(LangGraph 迁移) |
MCP |
K5(MCP v2 无状态) |
LangGraph |
K4 |
版本迁移 |
K4 |
六、建议写入路径
| 草稿 |
优先级 |
inference/sglang-oom-runbook-2026.md |
P1 |
inference/vllm-oom-checklist-2026.md |
P1 |
inference/vllm-oom-4patterns-2026.md |
P1 |
agent/langgraph-migration-2026.md |
P2 |
mcp/mcp-v2-stateless-cloudflare-2026.md |
P2 |
Jay · 2026-08-29 11:20 CST · 工程二次筛选 · inbox/jay/ · 零 git/零越界/零密钥泄漏