Jay 工程实践筛选 · 2026-10-01 上午场
筛选角色:Jay · 二次筛选(工程价值复核) 筛选标准:真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 不输出:API Key、Cookie、Token、私有链接
一、推理引擎 Benchmark(vLLM vs SGLang vs LMDeploy · 2026 Q3-Q4)
候选条目
✅ 保留 1:vLLM vs SGLang · H100 80GB · Llama 3.3 70B FP8 · 并发基准
| 来源 | 类型 | 工程价值 |
|---|---|---|
| Spheron Blog | 第三方 benchmark | 性能数字具体,含 TTFT/TPOT 分解 |
保留理由: - 有具体数字:SGLang + LMDeploy ≈ 16,200 tok/s,vLLM ≈ 12,500 tok/s(+29% 差距) - H100 单卡配置明确(80GB,FP8) - 并发 50 请求场景:Qwen3.8-27B 上 SGLang 1725 vs vLLM 1610 tok/s - 涵盖 TensorRT-LLM 冷启动 penalty(compiled path) - 含"vLLM 冷启动约 62 秒"的生产指标
丢弃项目: - 宣称"最快"的标题党成分;不同模型差异巨大,Qwen3.8-27B 上两者几乎打平(-0.4%),故保留具体数字,丢弃绝对化结论
工程启示: - 选择 SGLang:多轮对话、共享 system prompt、前缀复用场景 - 选择 vLLM:首次部署、多架构兼容、单轮交互 - 两者均支持 XGrammar 结构化输出、Automatic Prefix Caching
✅ 保留 2:Winder.ai · vLLM vs Ollama vs SGLang · 多引擎对比
保留理由: - 实测 Qwen3.8-27B(2026年8月发布):vLLM 和 SGLang 各自需要修改一个默认参数才能 scale with load - 社区 SGLang build 用于 Blackwell RTX PRO 6000(对比 vLLM FP8 packed path 无法加载该卡) - 50 并发时 vLLM 1,610 vs SGLang 1,725 tok/s(差异仅 7%) - Ollama 在该测试中仅 33 tok/s(可忽略) - 真实硬件 + 真实模型 + 具体命令输出
工程启示: Blackwell 新卡上 SGLang 社区版先行适配,vLLM 跟进中;生产选型需确认具体 GPU 型号。
✅ 保留 3:DeployBase · LLM Inference Engines 对比 · 含启动命令
保留理由: - 包含真实命令: ```bash # vLLM 启动 python -m vllm.entrypoints.openai.api_server \ --model meta-llama/Llama-2-70b-hf \ --tensor-parallel-size 2 \ --dtype float16 \ --gpu-memory-utilization 0.90 \ --port 8000
# SGLang 启动
python -m sglang.launch_server \
--model-path meta-llama/Llama-2-70b-hf \
--port 30000
- 含 llama.cpp GPU offload 命令:bash
./main -m model.gguf -ngl 80 -p "Your prompt"
./main -m model.gguf -t 16 -p "Your prompt"
```
- TTFT 实测:SGLang 80ms,vLLM/TRT-LLM 150ms,TGI 250ms
- 吞吐排名:vLLM 3500 > SGLang 2800 > TGI 2500 > baseline 1800 > llama.cpp 20(CPU)
工程价值:命令可直接复现;H100 实测数据; llama.cpp 作为低端基线对比。
✅ 保留 4:InferenceEngineering.tech · vLLM vs SGLang vs TRT-LLM
保留理由: - 明确三个引擎共同具备的功能集(PagedAttention、continuous batching 等) - TRT-LLM 最成熟(Baseten 等大规模部署) - 决策树清晰:bursty 流量 → vLLM;前缀复用 → SGLang;固定单模型 + 极致性能 → TRT-LLM
二、KV Cache 系统工程
✅ 保留 5:HotInfra 2026 · Memory-Centric KV Cache Servers · CXL vs GPU HBM
| 设备 | Total Memory | Aggregate BW | Throughput | CapEx | OpEx |
|---|---|---|---|---|---|
| 19× H100 SXM5 | 1,520 GB | 63.7 TB/s | 679 tok/s | $570,000 | $59.23/hr |
| 23× 64GB PIM-DIMMs (CXL) | 1,472 GB | 150.7 TB/s (2.4×↑) | 1,607 tok/s (2.4×↑) | $27,664 | $3.53/hr |
保留理由: - 具体硬件配置:H100 SXM5、CXL switch、PIM-DIMMs 型号均有 - DeepSeek-V3.2 → V4-Pro:100K token KV cache 从 9GB 压缩到 1GB(2026年数据) - CapEx 差距 20.6×,OpEx 差距 16.8×;CXL 方案 OpEx 仅 $3.53/hr - 对应架构图(Prefill GPU / Decode GPU / CXL 互联)
工程启示:RAG 和 multi-turn 场景(高 KV reuse)最适合 CXL 扩展方案;decode-heavy 推理用 HBM 更合适。
✅ 保留 6:arXiv 2608.01526 · Internet for KV Cache
保留理由: - KV Cache 作为全局可复用基础设施的概念论证 - DeepSeek-V4-Pro KV cache 压缩数据(9GB → 1GB / 100K tokens)具体可信 - 引用 Mooncake 架构,属于已知高价值系统论文
✅ 保留 7:LMCache · arXiv 2510.09665 · 工业级 KV Cache 层
保留理由: - 企业级 KV cache 中间件,支持 vLLM/SGLang 提取和存储 KV - LMCache 被多个生产系统引用(Yihua Cheng et al.,USENIX OSDI 2026) - 配合 Hierarchical KV Caching (HiCache) 使用
三、AI Agent 生产与评测
✅ 保留 8:LangChain · State of AI Agents · June 2026
核心数字: - 69% 组织已有 agent 生产部署(2025 年为 51%) - 10k+ 员工:内部生产力(26.8%)、客服(24.7%)、研究数据分析(22.2%) - 已有 agent 生产经验的组织:94% 有某种可观测性,71.5% 有完整 tracing
保留理由: - 调查数据而非厂商宣传;增长趋势具体(+18pp) - 可观测性数据对工程团队有直接参考价值
✅ 保留 9:RAG 评测工具对比 2026(Maximize AI / Braintrust / Medium)
保留理由: - 工具矩阵完整:Ragas(开源指标)、Maxim AI(端到端)、Arize Phoenix(检索可观测)、LangSmith(LangChain 原生)、DeepEval(pytest 风格) - Braintrust 连接生产 trace → eval 数据闭环,可直接用于 CI/CD - 强调检索层评测优先("context precision/recall")而非只看最终答案
工程启示: - 生产 RAG 评测首选 Ragas(开源、灵活)+ Phoenix(检索诊断)+ Braintrust(生产监控) - 失败场景模拟(tool API 失败、空 context、vector DB 慢)应纳入评测设计
四、GitHub / Hugging Face 热门工程仓库
✅ 保留 10:NousResearch / Hermes Agent(221K ⭐)
保留理由: - 自增长 agent(learns from interactions) - 完整 stars 22.1 万,生产影响力大 - NousResearch 背书,有真实工程用户
✅ 保留 11:affaan-m / ECC · Agent Harness Performance Optimization(233K ⭐)
保留理由: - 描述具体:skills、instincts、memory、security、research 全链路 - Stars 23.3 万,社区关注度高
✅ 保留 12:HuggingFace / ml-intern(8.1K ⭐,2026年5月新)
保留理由: - 自动完成 ML 研究全流程(读论文→找数据集→微调→上传 HF dataset) - 300 iterations agentic loop,含 approval gates - 代表 ML 工作流自动化方向
五、Substack 高价值条目
✅ 保留 13:The AI Engineer · The AI Agents Stack: LLM to Production (2026 Edition)
保留理由: - 分 6 层系统梳理 agent stack(含评估框架) - 关键洞察:agent guardrails ≠ LLM guardrails(2026 年新分野) - 涵盖 state management complexity、vendor lock-in risk、demo-to-production gap 三个评估维度
可信度:The AI Engineer(专业 newsletter),非营销内容
✅ 保留 14:Ken Huang / Physics & Engineering of Frontier LLM Inference(10章系列 2026版)
保留理由: - DeepSeek、Moonshot、Zhipu、Alibaba、NVIDIA、Google DeepMind 系统级分析 - EAGLE-1/2 提速数据:2.5×-3.8× real-world speedup on reasoning benchmarks - Medusa Multi-Head Drafting vs Zhipu IndexShare 详细对比 - 目标受众是有生产部署经验的工程师,非科普
⚠️ 有条件保留 15:Miguel Otero Pedrido / The hands-on guide to LLM inference with vLLM(substack · 部分免费)
保留理由: - Azure AKS + vLLM 部署实战;含 Unlimited OCR VLM pipeline 案例 - 付费订阅墙,仅可记录方向(需继续跟踪完整免费版本)
六、总结与写入建议
| 类别 | 保留数 | 高价值 | 需精读 |
|---|---|---|---|
| 推理引擎 benchmark | 4 | 4 | 保留 2、3(命令层) |
| KV Cache 系统 | 3 | 3 | 保留 5(数字具体) |
| Agent 评测生产 | 2 | 2 | 保留 9(RAG 评测矩阵) |
| GitHub/HF 仓库 | 3 | 3 | 保留 12(ml-intern 新方向) |
| Substack | 3 | 3 | 保留 14(系统级深度) |
建议写入路径:/shared/research-kb/inbox/jay/2026-10-01T1050-jay-engineering-filter.md(本文)
后续行动建议: 1. 精读 HotInfra 2026 CXL KV Cache paper(CapEx/OpEx 数据具体) 2. 跟进 Blackwell RTX PRO 6000 上 SGLang 社区版适配进展 3. 评估 Hermes Agent / ECC 在 agent harness 场景的实际表现 4. Substack 14(Physics & Engineering of LLM Inference)10章系列逐一跟踪
筛选时间:2026-10-01 10:50 CST · Jay · 不执行任何 GitHub 写入