superlinked/sie · 上手攻略
- 仓库:superlinked/sie
- 链接:https://github.com/superlinked/sie
- 分类:ai
- 作者:Jay
- 更新:2026-07-12
是什么
SIE(Superlinked Inference Engine)是一个开源推理服务器,在一个统一的 HTTP API 下集成 85+ 预配置模型,覆盖 Embedding 编码、语义重排序、文档转 Markdown(OCR/解析)、结构化信息抽取、内容安全审核和大模型生成五大任务。它替代了过去"每个任务配一个模型服务器"的碎片化架构,让 Agent 开发者只需维护一个集群,从本地 macOS 到 Kubernetes 均可部署,许可证为 Apache 2.0。
官方将其定位为 Agent 的推理后端——一切需要模型能力的环节(检索、文档解析、实体抽取、结构化输出、Agent 循环)均由 SIE 统一承载。
解决什么问题
部署 Agent 时,常见的痛苦包括:
- 多模型碎片化:Embedding 服务器、重排服务、OCR 引擎、生成服务各自独立,配置复杂、运维成本高。
- 供应商锁定:依赖多个第三方 API 引入延迟、成本和数据合规问题。
- 版本管理混乱:每个模型有各自依赖(PyTorch、MLX、CUDA 版本),环境冲突频发。
- 本地部署门槛高:在 Apple Silicon Mac 或私有云上跑一整套推理栈需要大量调优。
SIE 用"一个集群、一个 API、一套 SDK"来解决这些问题。85+ 模型均已预配置,质量在 MTEB 基准的 CI 中验证,开发者无需手动调参。
快速安装
服务器端(任选其一)
# Linux CPU(模拟 x86,macOS Intel 也可用)
docker run --platform linux/amd64 \
-p 8080:8080 \
-v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cpu-default
# Linux NVIDIA GPU(推荐生产环境)
docker run --gpus all \
-p 8080:8080 \
-v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cuda12-default
# Apple Silicon macOS(原生 Metal,非模拟)
pip install "sie-server[local]"
sie-server serve
注意:生成任务(Qwen3 等大模型)需要 GPU,只能用
latest-cuda12-sglang镜像,不能在 CPU 上运行。
启动后确认健康状态:
curl http://localhost:8080/readyz
# 期望输出:ok
客户端 SDK
pip install sie-sdk # Python
pnpm add @superlinked/sie-sdk # TypeScript
核心用法
所有模型共享同一个 SIEClient,只需换模型 ID:
from sie_sdk import SIEClient
from sie_sdk.types import Item
client = SIEClient("http://localhost:8080")
# 1. Embedding(稠密向量)
result = client.encode(
"sentence-transformers/all-MiniLM-L6-v2",
Item(text="Hello world")
)
print(result["dense"].shape) # (384,)
# 2. 语义重排(Cross-Encoder)
scores = client.score(
"cross-encoder/ms-marco-MiniLM-L-6-v2",
Item(text="What is machine learning?"),
[Item(text="ML learns from data."), Item(text="The weather is sunny.")]
)
# scores["scores"] 返回带 rank 的排序结果
# 3. 零样本实体抽取(GLiNER,无需微调)
result = client.extract(
"urchade/gliner_multi-v2.1",
Item(text="Tim Cook is the CEO of Apple."),
labels=["person", "organization"]
)
# result["entities"] → [{'text':'Tim Cook','label':'person','score':0.991}, ...]
# 4. 文本生成(需要 GPU + sglang 镜像)
result = client.generate(
"Qwen/Qwen3-0.6B",
"Reply with a single word: the capital of France.",
max_new_tokens=16,
)
print(result["text"]) # Paris
五大任务对应的模型示例(直接替换 HuggingFace ID 即可):
| 任务 | 推荐模型 | 模型 ID(示例) |
|---|---|---|
| 搜索 Embedding | BGE-M3 / SPLADE-v3 / ColBERTv2 | BAAI/bge-m3 |
| 文档重排 | Qwen3-Reranker | Qwen/Qwen3-Reranker |
| 文档→Markdown | GLM-OCR / MinerU / Docling | 参见官方模型目录 |
| 结构化抽取 | GLiNER2 / Nuner-Zero / Qwen3.6-27B | urchade/gliner_multi-v2.1 |
| 内容安全 | Granite-Guardian-2B | granite-guardian-2b |
| Agent 循环生成 | Qwen3-0.6B / Qwen3-4B | Qwen/Qwen3-0.6B |
生产部署(Kubernetes)
SIE 官方提供 Helm Chart,支持 GKE / EKS,含 KEDA 自动扩缩容(可缩至零)、负载均衡网关和 Grafana 监控面板:
helm upgrade --install sie-cluster oci://ghcr.io/superlinked/charts/sie-cluster \
--namespace sie --create-namespace \
--set hfToken.create=true \
--set hfToken.value=YOUR_HF_TOKEN \
-f deploy/helm/sie-cluster/values-gke.yaml # 或 values-aws.yaml
注意:HuggingFace 模型下载需要认证 Token,生产部署必须配置
hfToken。
典型适用场景
- RAG Pipeline:Embedding → 检索 → 重排,一条 HTTP 调用链,无需维护多个服务。
- 文档处理 Agent:PDF/Office 文件 → Markdown → 实体抽取 → 结构化输出,全部在私有集群完成。
- 企业级 Agent 平台:多租户、跨模型负载均衡、审计日志,统一基础设施而非各自为政。
- 隐私合规场景:数据不出境,所有推理在自有云上运行,支持离线部署。
- 多框架集成:LangChain、LlamaIndex、Haystack、DSPy、CrewAI 均已官方集成,Drop-in 迁移。
坑与注意
- 生成模型必须 GPU:Qwen3 等生成模型无 CPU 路径,务必使用
latest-cuda12-sglang镜像,并在docker run时加--gpus all。 - 首次调用冷启动:首次请求每个模型时从 HuggingFace 下载权重(小型模型数秒,大型模型更久),后续请求热缓存,延迟在毫秒级。
- Apple Silicon 本地安装依赖 Python 3.12:
sie-server[local]需要 Python 3.12 以上。 - 遥测数据:默认会匿名收集版本、OS、架构、GPU 类型等使用统计,可通过
SIE_TELEMETRY_DISABLED=1关闭。 - 模型 ID 需精确:必须使用 HuggingFace 完整路径(如
sentence-transformers/all-MiniLM-L6-v2),不能只写模型简称。 - 内存需求: Embedding / 重排服务 CPU 可跑,但大型模型(如 Qwen3-4B)需足够显存,建议生产环境 GPU 机型。
与同类对比
| 方案 | 模型覆盖 | 部署复杂度 | 许可证 | 亮点 |
|---|---|---|---|---|
| SIE | 85+(Embedding/重排/OCR/抽取/生成) | ⭐ 低(Docker 一键) | Apache 2.0 | 统一 API,五类任务一站搞定 |
| vLLM | 仅 LLM 生成 | 中 | Apache 2.0 | LLM 吞吐极强,但只有生成 |
| Ollama | 各类模型 | 低 | MIT | 本地轻量,但缺企业级编排 |
| Text Embedding Inference(T.E.I.) | 仅 Embedding | 低 | Apache 2.0 | 专注 Embedding,性能好 |
| Ray Serve | 通用 | 高 | Apache 2.0 | 最灵活,但需要自己搭 |
| LM Studio | 各类模型 | 低 | 专有/部分开源 | 桌面端友好,生产不适用 |
SIE 的核心差异在于五类任务统一推理,而非只解决生成或只解决 Embedding。如果你的 Agent 需要同时处理文档解析、检索、抽取和生成,SIE 能显著减少运维复杂度;如果只需要单一能力(尤其是大模型生成),vLLM 或 Ollama 可能更专注。
一句话推荐结论
SIE 是目前最完整的开源 Agent 推理一体化方案,一个集群搞定 Embedding、检索、文档解析、实体抽取和生成,85+ 模型开箱即用,生产级部署一条 Helm 命令,推荐所有需要本地推理能力的 Agent 开发者试用。