Jay 工程实践筛选 · 2026-10-01 上午场

筛选角色:Jay · 二次筛选(工程价值复核) 筛选标准:真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 不输出:API Key、Cookie、Token、私有链接


一、推理引擎 Benchmark(vLLM vs SGLang vs LMDeploy · 2026 Q3-Q4)

候选条目

✅ 保留 1:vLLM vs SGLang · H100 80GB · Llama 3.3 70B FP8 · 并发基准

来源 类型 工程价值
Spheron Blog 第三方 benchmark 性能数字具体,含 TTFT/TPOT 分解

保留理由: - 有具体数字:SGLang + LMDeploy ≈ 16,200 tok/s,vLLM ≈ 12,500 tok/s(+29% 差距) - H100 单卡配置明确(80GB,FP8) - 并发 50 请求场景:Qwen3.8-27B 上 SGLang 1725 vs vLLM 1610 tok/s - 涵盖 TensorRT-LLM 冷启动 penalty(compiled path) - 含"vLLM 冷启动约 62 秒"的生产指标

丢弃项目: - 宣称"最快"的标题党成分;不同模型差异巨大,Qwen3.8-27B 上两者几乎打平(-0.4%),故保留具体数字,丢弃绝对化结论

工程启示: - 选择 SGLang:多轮对话、共享 system prompt、前缀复用场景 - 选择 vLLM:首次部署、多架构兼容、单轮交互 - 两者均支持 XGrammar 结构化输出、Automatic Prefix Caching


✅ 保留 2:Winder.ai · vLLM vs Ollama vs SGLang · 多引擎对比

保留理由: - 实测 Qwen3.8-27B(2026年8月发布):vLLM 和 SGLang 各自需要修改一个默认参数才能 scale with load - 社区 SGLang build 用于 Blackwell RTX PRO 6000(对比 vLLM FP8 packed path 无法加载该卡) - 50 并发时 vLLM 1,610 vs SGLang 1,725 tok/s(差异仅 7%) - Ollama 在该测试中仅 33 tok/s(可忽略) - 真实硬件 + 真实模型 + 具体命令输出

工程启示: Blackwell 新卡上 SGLang 社区版先行适配,vLLM 跟进中;生产选型需确认具体 GPU 型号。


✅ 保留 3:DeployBase · LLM Inference Engines 对比 · 含启动命令

保留理由: - 包含真实命令: ```bash # vLLM 启动 python -m vllm.entrypoints.openai.api_server \ --model meta-llama/Llama-2-70b-hf \ --tensor-parallel-size 2 \ --dtype float16 \ --gpu-memory-utilization 0.90 \ --port 8000

# SGLang 启动 python -m sglang.launch_server \ --model-path meta-llama/Llama-2-70b-hf \ --port 30000 - 含 llama.cpp GPU offload 命令:bash ./main -m model.gguf -ngl 80 -p "Your prompt" ./main -m model.gguf -t 16 -p "Your prompt" ``` - TTFT 实测:SGLang 80ms,vLLM/TRT-LLM 150ms,TGI 250ms - 吞吐排名:vLLM 3500 > SGLang 2800 > TGI 2500 > baseline 1800 > llama.cpp 20(CPU)

工程价值:命令可直接复现;H100 实测数据; llama.cpp 作为低端基线对比。


✅ 保留 4:InferenceEngineering.tech · vLLM vs SGLang vs TRT-LLM

保留理由: - 明确三个引擎共同具备的功能集(PagedAttention、continuous batching 等) - TRT-LLM 最成熟(Baseten 等大规模部署) - 决策树清晰:bursty 流量 → vLLM;前缀复用 → SGLang;固定单模型 + 极致性能 → TRT-LLM


二、KV Cache 系统工程

✅ 保留 5:HotInfra 2026 · Memory-Centric KV Cache Servers · CXL vs GPU HBM

设备 Total Memory Aggregate BW Throughput CapEx OpEx
19× H100 SXM5 1,520 GB 63.7 TB/s 679 tok/s $570,000 $59.23/hr
23× 64GB PIM-DIMMs (CXL) 1,472 GB 150.7 TB/s (2.4×↑) 1,607 tok/s (2.4×↑) $27,664 $3.53/hr

保留理由: - 具体硬件配置:H100 SXM5、CXL switch、PIM-DIMMs 型号均有 - DeepSeek-V3.2 → V4-Pro:100K token KV cache 从 9GB 压缩到 1GB(2026年数据) - CapEx 差距 20.6×,OpEx 差距 16.8×;CXL 方案 OpEx 仅 $3.53/hr - 对应架构图(Prefill GPU / Decode GPU / CXL 互联)

工程启示:RAG 和 multi-turn 场景(高 KV reuse)最适合 CXL 扩展方案;decode-heavy 推理用 HBM 更合适。


✅ 保留 6:arXiv 2608.01526 · Internet for KV Cache

保留理由: - KV Cache 作为全局可复用基础设施的概念论证 - DeepSeek-V4-Pro KV cache 压缩数据(9GB → 1GB / 100K tokens)具体可信 - 引用 Mooncake 架构,属于已知高价值系统论文


✅ 保留 7:LMCache · arXiv 2510.09665 · 工业级 KV Cache 层

保留理由: - 企业级 KV cache 中间件,支持 vLLM/SGLang 提取和存储 KV - LMCache 被多个生产系统引用(Yihua Cheng et al.,USENIX OSDI 2026) - 配合 Hierarchical KV Caching (HiCache) 使用


三、AI Agent 生产与评测

✅ 保留 8:LangChain · State of AI Agents · June 2026

核心数字: - 69% 组织已有 agent 生产部署(2025 年为 51%) - 10k+ 员工:内部生产力(26.8%)、客服(24.7%)、研究数据分析(22.2%) - 已有 agent 生产经验的组织:94% 有某种可观测性,71.5% 有完整 tracing

保留理由: - 调查数据而非厂商宣传;增长趋势具体(+18pp) - 可观测性数据对工程团队有直接参考价值


✅ 保留 9:RAG 评测工具对比 2026(Maximize AI / Braintrust / Medium)

保留理由: - 工具矩阵完整:Ragas(开源指标)、Maxim AI(端到端)、Arize Phoenix(检索可观测)、LangSmith(LangChain 原生)、DeepEval(pytest 风格) - Braintrust 连接生产 trace → eval 数据闭环,可直接用于 CI/CD - 强调检索层评测优先("context precision/recall")而非只看最终答案

工程启示: - 生产 RAG 评测首选 Ragas(开源、灵活)+ Phoenix(检索诊断)+ Braintrust(生产监控) - 失败场景模拟(tool API 失败、空 context、vector DB 慢)应纳入评测设计


四、GitHub / Hugging Face 热门工程仓库

✅ 保留 10:NousResearch / Hermes Agent(221K ⭐)

保留理由: - 自增长 agent(learns from interactions) - 完整 stars 22.1 万,生产影响力大 - NousResearch 背书,有真实工程用户


✅ 保留 11:affaan-m / ECC · Agent Harness Performance Optimization(233K ⭐)

保留理由: - 描述具体:skills、instincts、memory、security、research 全链路 - Stars 23.3 万,社区关注度高


✅ 保留 12:HuggingFace / ml-intern(8.1K ⭐,2026年5月新)

保留理由: - 自动完成 ML 研究全流程(读论文→找数据集→微调→上传 HF dataset) - 300 iterations agentic loop,含 approval gates - 代表 ML 工作流自动化方向


五、Substack 高价值条目

✅ 保留 13:The AI Engineer · The AI Agents Stack: LLM to Production (2026 Edition)

保留理由: - 分 6 层系统梳理 agent stack(含评估框架) - 关键洞察:agent guardrails ≠ LLM guardrails(2026 年新分野) - 涵盖 state management complexity、vendor lock-in risk、demo-to-production gap 三个评估维度

可信度:The AI Engineer(专业 newsletter),非营销内容


✅ 保留 14:Ken Huang / Physics & Engineering of Frontier LLM Inference(10章系列 2026版)

保留理由: - DeepSeek、Moonshot、Zhipu、Alibaba、NVIDIA、Google DeepMind 系统级分析 - EAGLE-1/2 提速数据:2.5×-3.8× real-world speedup on reasoning benchmarks - Medusa Multi-Head Drafting vs Zhipu IndexShare 详细对比 - 目标受众是有生产部署经验的工程师,非科普


⚠️ 有条件保留 15:Miguel Otero Pedrido / The hands-on guide to LLM inference with vLLM(substack · 部分免费)

保留理由: - Azure AKS + vLLM 部署实战;含 Unlimited OCR VLM pipeline 案例 - 付费订阅墙,仅可记录方向(需继续跟踪完整免费版本)


六、总结与写入建议

类别 保留数 高价值 需精读
推理引擎 benchmark 4 4 保留 2、3(命令层)
KV Cache 系统 3 3 保留 5(数字具体)
Agent 评测生产 2 2 保留 9(RAG 评测矩阵)
GitHub/HF 仓库 3 3 保留 12(ml-intern 新方向)
Substack 3 3 保留 14(系统级深度)

建议写入路径:/shared/research-kb/inbox/jay/2026-10-01T1050-jay-engineering-filter.md(本文)

后续行动建议: 1. 精读 HotInfra 2026 CXL KV Cache paper(CapEx/OpEx 数据具体) 2. 跟进 Blackwell RTX PRO 6000 上 SGLang 社区版适配进展 3. 评估 Hermes Agent / ECC 在 agent harness 场景的实际表现 4. Substack 14(Physics & Engineering of LLM Inference)10章系列逐一跟踪


筛选时间:2026-10-01 10:50 CST · Jay · 不执行任何 GitHub 写入