Jay 学术研究知识库 · 傍晚档 · 2026-07-24

时间:14:50 (UTC+8) 主题:推理引擎工程对比精筛 · Colibri 纯 C 744B MoE 本地推理 · Jarvis Labs 实测命令集


今日主题

本档为工程实践二次筛选档,聚焦有真实量化数据、命令、源码或可复现步骤的推理工程内容。排除纯概念/路线图类条目,保留有工程参数的 benchmark 对比和新兴推理工具。


分类标签

LLM-Inference vLLM SGLang TensorRT-LLM Benchmark Colibri MoE Local-LLM Engineering-Practice 2026


⭐ 高价值条目(工程实践筛选)

🔴 保留 · 实测 benchmark + 工程参数

1. SGLang vs vLLM vs TensorRT-LLM:2026 推理引擎完整 benchmark 对比

来源: - iotdigitaltwinplm.com(2026-07) - particula.tech(2026-07) - spheron.network(2026-03) - Jarvis Labs(2026)

可信度:高——多方交叉 benchmark,测试场景可复现

保留理由:有完整实测数据、具体参数名和量化对比,区别于纯概念类文章

核心工程数据(Llama 3.3 70B FP8 / 4× H100):

引擎 并发64吞吐量 H100×4 成本/h 每百万输出 token 成本
TensorRT-LLM 3,520 tok/s $14.00 $1.10
SGLang 3,650 tok/s $14.00 $1.07
vLLM v2 3,380 tok/s $14.00 $1.15

关键调参发现(iotdigitaltwinplm 独家披露):

"vLLM v2 吞吐量可因 max-num-batched-tokensenable-chunked-prefillgpu-memory-utilization 三参数从默认变调优后波动 35%。SGLang 的 --mem-fraction-static 和 TRT-LLM 的 batch scheduler 参数同理。默认配置下会丢失 20-30% 理论吞吐量。"

引擎 指标 SGLang vLLM Delta
particula 总吞吐量 ~16,200 tok/s ~12,500 tok/s SGLang +29%
particula 输出 token 吞吐 894 tok/s 413 tok/s SGLang +117%
particula TTFT 79 ms 103 ms SGLang 快 23%
particula ITL 6.0 ms 7.1 ms SGLang 快 15%

引擎特性选择指南: - vLLM:硬件覆盖最广(NVIDIA/AMD/Intel/Google TPUs/AWS Trainium/IBM Spyre/华为 Ascend);batch 密集型负载;OpenAI 兼容 API 最完善 - SGLang:多轮对话共享 KV cache prefix(RraxAttention);结构化输出(constrained decoding);RAG prefix-heavy 场景;TTFT 要求严苛的交互式应用 - TensorRT-LLM:NVIDIA 专用;单节点最高吞吐量;延迟敏感场景(量化交易、实时语音);编译开销大,配置复杂

Structured Outputs 专项发现: - vLLM guided decoding 在 batch size ≥8 时有显著吞吐量衰减 - SGLang 将 mask 生成与 GPU 推理步骤 overlap,overhead 极小 - XGrammar 和 LLGuidance 是两引擎共用的 grammar backends

观测性差异: - vLLM:metrics 最丰富(per-request、queue depth、prefix cache hit rate) - SGLang:独有 radix-tree statistics - TRT-LLM:默认 metrics 最精简,但跨版本最稳定

链接: - iotdigitaltwinplm benchmark:https://iotdigitaltwinplm.com/sglang-vs-vllm-vs-tensorrt-llm-benchmark-2026 - particula.tech:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison - spheron benchmark:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - Jarvis Labs(含命令):https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison

评价:目前最完整的 2026 推理引擎工程对比,有量化数字和调参路径,不是泛泛而谈的"哪个更好"


🟠 保留 · 新兴工具 · 工程突破

2. Colibri —— 纯 C 744B MoE 消费级推理引擎

来源:Analytics Vidhya July 2026 Trending · GitHub(JustVugg/colibri,~14.7K stars)

可信度:高——GitHub 开源,有完整 technical 说明

保留理由:纯 C 实现、无依赖、能在 ~25GB RAM 消费级机器上流式运行 744B 参数 MoE 模型(GLM-5.2),是 2026 本地推理工程的重要突破

核心技术: - 纯 C inference engine,零外部依赖 - MoE expert disk streaming:expert 按需从磁盘 streaming,避免全量加载 - 适合场景:隐私敏感、本地优先、边缘部署、算力受限环境

与 llama.cpp 的差异化定位: - llama.cpp 主打 dense 模型量化推理 - Colibri 专攻 MoE expert streaming,绕过消费级硬件的内存墙

链接:GitHub:https://github.com/JustVugg/colibri

评价:MoE 模型的本地推理是 2026 年的工程前沿,Colibri 的 disk-streaming MoE 路径值得关注


🟡 保留 · 实测命令(工程参考)

3. Jarvis Labs:vLLM / SGLang / TensorRT-LLM 实测命令集

来源:Jarvis Labs Blog · GitHub benchmark

可信度:高——实测驱动,有具体命令和参数

保留理由:少数包含实际 benchmark 命令和输出格式的工程参考

代表性命令片段

SGLang 启动:

python3 -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B

SGLang benchmark:

python3 -m sglang.bench_serving \
  --backend sglang \
  --num-prompt 10 \
  --host 127.0.0.1 \
  --port 30000

vLLM 启动后 benchmark(通过克隆 vllm repo 脚本 + ShareGPT 数据集)

TRT-LLM build:

trtllm-build \
  --checkpoint_dir ./qwen3_30b_checkpoint \
  --output_dir ./qwen3_30b_trt_engine \
  --gemm_plugin bfloat16 \
  --gpt_attention_plugin bfloat16 \
  --max_batch_size 128 \
  --max_input_len 4096 \
  --max_seq_len 8192

TRT-LLM serve:

trtllm-serve serve ./qwen3_30b_trt_engine \
  --backend tensorrt \
  --tokenizer /home/Qwen/Qwen3-30B-A3B \
  --max_batch_size 128 \
  --max_input_len 4096 \
  --max_seq_len 8192 \
  --host 0.0.0.0 \
  --port 8000 \
  --tp_size 2

注意:SGLang 使用 --base-url 而非 --host/port--max-concurrency 可调 120~600

链接:https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison


🔵 丢弃条目及理由

条目 来源 丢弃理由
LLM Gateway Architecture 2026 digitalapplied.com 偏概念介绍,LiteLLM 配置信息不足以复现,无实测数字
AI/ML System Design 2026 Guide designgurus.substack.com 付费 Substack,内容不可验证;仅为路线图性质
Production AI Engineering 课程 aiamastery.substack.com 付费课程营销,内容仅展示大纲,无工程细节
AI Engineer 学习路线图 1000+ JD 分析 alexeyondata.substack.com 职位分析,非工程实践;无命令/代码/数据
The AI Agents Stack 2026 theaiengineer.substack.com 已在 13:35 档完整覆盖,避免重复
ISO-Bench arXiv 论文 arxiv.org 已在 13:35 档提及(作为 SGLang 工程背景引用)
Inference Engineering 站点章节 inferenceengineering.tech 内容框架完整但snippet 缺乏具体参数,无新鲜实测数据
各类 2026 LLM System Design 泛指南 多源 概念梳理,无新工程数据

🟢 值得关注(轻记录)

条目 来源 备注
Strix AI 渗透测试 agent,找到并验证真实漏洞 与 HF 安全事件呼应,AI 自主安全测试工具成熟度信号
OfficeCLI AI agent 读写 Word/Excel/PPT,无需 Office MCP 协议落地案例
OmniRoute 统一 API 网关路由 200+ AI provider LLM Gateway 工程实现方向参考

📋 汇总 & 行动建议

优先级 条目 类型 建议操作
🔴 精读 推理引擎 benchmark 完整对比(含调参路径) 推理工程 更新 Inference 主题页;提炼关键参数配置表
🟠 关注 Colibri MoE disk-streaming C engine 本地推理 跟进;评估 MoE 本地推理工程路径
🟡 参考 Jarvis Labs 实测命令集 复现参考 作为 benchmark SOP 草稿基础
🟢 关注 Strix AI pentest agent 安全工程 与 HF 安全事件关联追踪
🟢 关注 OfficeCLI MCP 工具 Agent 工程 关注 MCP 工具生态扩展

📁 建议写入路径

本次草稿/shared/research-kb/inbox/jay/2026-07-24-1450-evening-inference-benchmark-colibri-engineering-jul2026.md

精读/主题更新建议: - Inference-Engine-Benchmark-2026 → 更新 Inference 主题页,包含调参参数表(max-num-batched-tokensenable-chunked-prefillgpu-memory-utilization--mem-fraction-static) - Colibri-MoE-Local-Inference → 可在 Local-LLM 主题页新增条目


🔍 去重说明

本档与今日 13:35 档完全不重叠: - 13:35 档:HF 安全事件 / Grok Build / SGLang GB300 / HotInfra CXL / Agent Stack 2026 - 本档:推理引擎实测 benchmark / Colibri / Jarvis Labs 实测命令


Jay · 2026-07-24 14:50 UTC+8