Jay 学术研究知识库 · 傍晚档 · 2026-07-24
时间:14:50 (UTC+8) 主题:推理引擎工程对比精筛 · Colibri 纯 C 744B MoE 本地推理 · Jarvis Labs 实测命令集
今日主题
本档为工程实践二次筛选档,聚焦有真实量化数据、命令、源码或可复现步骤的推理工程内容。排除纯概念/路线图类条目,保留有工程参数的 benchmark 对比和新兴推理工具。
分类标签
LLM-Inference vLLM SGLang TensorRT-LLM Benchmark Colibri MoE Local-LLM Engineering-Practice 2026
⭐ 高价值条目(工程实践筛选)
🔴 保留 · 实测 benchmark + 工程参数
1. SGLang vs vLLM vs TensorRT-LLM:2026 推理引擎完整 benchmark 对比
来源: - iotdigitaltwinplm.com(2026-07) - particula.tech(2026-07) - spheron.network(2026-03) - Jarvis Labs(2026)
可信度:高——多方交叉 benchmark,测试场景可复现
保留理由:有完整实测数据、具体参数名和量化对比,区别于纯概念类文章
核心工程数据(Llama 3.3 70B FP8 / 4× H100):
| 引擎 | 并发64吞吐量 | H100×4 成本/h | 每百万输出 token 成本 |
|---|---|---|---|
| TensorRT-LLM | 3,520 tok/s | $14.00 | $1.10 |
| SGLang | 3,650 tok/s | $14.00 | $1.07 |
| vLLM v2 | 3,380 tok/s | $14.00 | $1.15 |
关键调参发现(iotdigitaltwinplm 独家披露):
"vLLM v2 吞吐量可因
max-num-batched-tokens、enable-chunked-prefill、gpu-memory-utilization三参数从默认变调优后波动 35%。SGLang 的--mem-fraction-static和 TRT-LLM 的 batch scheduler 参数同理。默认配置下会丢失 20-30% 理论吞吐量。"
| 引擎 | 指标 | SGLang | vLLM | Delta |
|---|---|---|---|---|
| particula | 总吞吐量 | ~16,200 tok/s | ~12,500 tok/s | SGLang +29% |
| particula | 输出 token 吞吐 | 894 tok/s | 413 tok/s | SGLang +117% |
| particula | TTFT | 79 ms | 103 ms | SGLang 快 23% |
| particula | ITL | 6.0 ms | 7.1 ms | SGLang 快 15% |
引擎特性选择指南: - vLLM:硬件覆盖最广(NVIDIA/AMD/Intel/Google TPUs/AWS Trainium/IBM Spyre/华为 Ascend);batch 密集型负载;OpenAI 兼容 API 最完善 - SGLang:多轮对话共享 KV cache prefix(RraxAttention);结构化输出(constrained decoding);RAG prefix-heavy 场景;TTFT 要求严苛的交互式应用 - TensorRT-LLM:NVIDIA 专用;单节点最高吞吐量;延迟敏感场景(量化交易、实时语音);编译开销大,配置复杂
Structured Outputs 专项发现: - vLLM guided decoding 在 batch size ≥8 时有显著吞吐量衰减 - SGLang 将 mask 生成与 GPU 推理步骤 overlap,overhead 极小 - XGrammar 和 LLGuidance 是两引擎共用的 grammar backends
观测性差异: - vLLM:metrics 最丰富(per-request、queue depth、prefix cache hit rate) - SGLang:独有 radix-tree statistics - TRT-LLM:默认 metrics 最精简,但跨版本最稳定
链接: - iotdigitaltwinplm benchmark:https://iotdigitaltwinplm.com/sglang-vs-vllm-vs-tensorrt-llm-benchmark-2026 - particula.tech:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison - spheron benchmark:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - Jarvis Labs(含命令):https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
评价:目前最完整的 2026 推理引擎工程对比,有量化数字和调参路径,不是泛泛而谈的"哪个更好"
🟠 保留 · 新兴工具 · 工程突破
2. Colibri —— 纯 C 744B MoE 消费级推理引擎
来源:Analytics Vidhya July 2026 Trending · GitHub(JustVugg/colibri,~14.7K stars)
可信度:高——GitHub 开源,有完整 technical 说明
保留理由:纯 C 实现、无依赖、能在 ~25GB RAM 消费级机器上流式运行 744B 参数 MoE 模型(GLM-5.2),是 2026 本地推理工程的重要突破
核心技术: - 纯 C inference engine,零外部依赖 - MoE expert disk streaming:expert 按需从磁盘 streaming,避免全量加载 - 适合场景:隐私敏感、本地优先、边缘部署、算力受限环境
与 llama.cpp 的差异化定位: - llama.cpp 主打 dense 模型量化推理 - Colibri 专攻 MoE expert streaming,绕过消费级硬件的内存墙
链接:GitHub:https://github.com/JustVugg/colibri
评价:MoE 模型的本地推理是 2026 年的工程前沿,Colibri 的 disk-streaming MoE 路径值得关注
🟡 保留 · 实测命令(工程参考)
3. Jarvis Labs:vLLM / SGLang / TensorRT-LLM 实测命令集
来源:Jarvis Labs Blog · GitHub benchmark
可信度:高——实测驱动,有具体命令和参数
保留理由:少数包含实际 benchmark 命令和输出格式的工程参考
代表性命令片段:
SGLang 启动:
python3 -m sglang.launch_server \
--model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
SGLang benchmark:
python3 -m sglang.bench_serving \
--backend sglang \
--num-prompt 10 \
--host 127.0.0.1 \
--port 30000
vLLM 启动后 benchmark(通过克隆 vllm repo 脚本 + ShareGPT 数据集)
TRT-LLM build:
trtllm-build \
--checkpoint_dir ./qwen3_30b_checkpoint \
--output_dir ./qwen3_30b_trt_engine \
--gemm_plugin bfloat16 \
--gpt_attention_plugin bfloat16 \
--max_batch_size 128 \
--max_input_len 4096 \
--max_seq_len 8192
TRT-LLM serve:
trtllm-serve serve ./qwen3_30b_trt_engine \
--backend tensorrt \
--tokenizer /home/Qwen/Qwen3-30B-A3B \
--max_batch_size 128 \
--max_input_len 4096 \
--max_seq_len 8192 \
--host 0.0.0.0 \
--port 8000 \
--tp_size 2
注意:SGLang 使用 --base-url 而非 --host/port,--max-concurrency 可调 120~600
链接:https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison
🔵 丢弃条目及理由
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| LLM Gateway Architecture 2026 | digitalapplied.com | 偏概念介绍,LiteLLM 配置信息不足以复现,无实测数字 |
| AI/ML System Design 2026 Guide | designgurus.substack.com | 付费 Substack,内容不可验证;仅为路线图性质 |
| Production AI Engineering 课程 | aiamastery.substack.com | 付费课程营销,内容仅展示大纲,无工程细节 |
| AI Engineer 学习路线图 1000+ JD 分析 | alexeyondata.substack.com | 职位分析,非工程实践;无命令/代码/数据 |
| The AI Agents Stack 2026 | theaiengineer.substack.com | 已在 13:35 档完整覆盖,避免重复 |
| ISO-Bench arXiv 论文 | arxiv.org | 已在 13:35 档提及(作为 SGLang 工程背景引用) |
| Inference Engineering 站点章节 | inferenceengineering.tech | 内容框架完整但snippet 缺乏具体参数,无新鲜实测数据 |
| 各类 2026 LLM System Design 泛指南 | 多源 | 概念梳理,无新工程数据 |
🟢 值得关注(轻记录)
| 条目 | 来源 | 备注 |
|---|---|---|
| Strix | AI 渗透测试 agent,找到并验证真实漏洞 | 与 HF 安全事件呼应,AI 自主安全测试工具成熟度信号 |
| OfficeCLI | AI agent 读写 Word/Excel/PPT,无需 Office | MCP 协议落地案例 |
| OmniRoute | 统一 API 网关路由 200+ AI provider | LLM Gateway 工程实现方向参考 |
📋 汇总 & 行动建议
| 优先级 | 条目 | 类型 | 建议操作 |
|---|---|---|---|
| 🔴 精读 | 推理引擎 benchmark 完整对比(含调参路径) | 推理工程 | 更新 Inference 主题页;提炼关键参数配置表 |
| 🟠 关注 | Colibri MoE disk-streaming C engine | 本地推理 | 跟进;评估 MoE 本地推理工程路径 |
| 🟡 参考 | Jarvis Labs 实测命令集 | 复现参考 | 作为 benchmark SOP 草稿基础 |
| 🟢 关注 | Strix AI pentest agent | 安全工程 | 与 HF 安全事件关联追踪 |
| 🟢 关注 | OfficeCLI MCP 工具 | Agent 工程 | 关注 MCP 工具生态扩展 |
📁 建议写入路径
本次草稿:/shared/research-kb/inbox/jay/2026-07-24-1450-evening-inference-benchmark-colibri-engineering-jul2026.md
精读/主题更新建议:
- Inference-Engine-Benchmark-2026 → 更新 Inference 主题页,包含调参参数表(max-num-batched-tokens、enable-chunked-prefill、gpu-memory-utilization、--mem-fraction-static)
- Colibri-MoE-Local-Inference → 可在 Local-LLM 主题页新增条目
🔍 去重说明
本档与今日 13:35 档完全不重叠: - 13:35 档:HF 安全事件 / Grok Build / SGLang GB300 / HotInfra CXL / Agent Stack 2026 - 本档:推理引擎实测 benchmark / Colibri / Jarvis Labs 实测命令
Jay · 2026-07-24 14:50 UTC+8