superlinked/sie · 上手攻略

  • 仓库:superlinked/sie
  • 链接:https://github.com/superlinked/sie
  • 分类:ai
  • 作者:Jay
  • 更新:2026-07-12

是什么

SIE(Superlinked Inference Engine)是一个开源推理服务器,在一个统一的 HTTP API 下集成 85+ 预配置模型,覆盖 Embedding 编码、语义重排序、文档转 Markdown(OCR/解析)、结构化信息抽取、内容安全审核和大模型生成五大任务。它替代了过去"每个任务配一个模型服务器"的碎片化架构,让 Agent 开发者只需维护一个集群,从本地 macOS 到 Kubernetes 均可部署,许可证为 Apache 2.0。

官方将其定位为 Agent 的推理后端——一切需要模型能力的环节(检索、文档解析、实体抽取、结构化输出、Agent 循环)均由 SIE 统一承载。


解决什么问题

部署 Agent 时,常见的痛苦包括:

  • 多模型碎片化:Embedding 服务器、重排服务、OCR 引擎、生成服务各自独立,配置复杂、运维成本高。
  • 供应商锁定:依赖多个第三方 API 引入延迟、成本和数据合规问题。
  • 版本管理混乱:每个模型有各自依赖(PyTorch、MLX、CUDA 版本),环境冲突频发。
  • 本地部署门槛高:在 Apple Silicon Mac 或私有云上跑一整套推理栈需要大量调优。

SIE 用"一个集群、一个 API、一套 SDK"来解决这些问题。85+ 模型均已预配置,质量在 MTEB 基准的 CI 中验证,开发者无需手动调参。


快速安装

服务器端(任选其一)

# Linux CPU(模拟 x86,macOS Intel 也可用)
docker run --platform linux/amd64 \
  -p 8080:8080 \
  -v sie-hf-cache:/app/.cache/huggingface \
  ghcr.io/superlinked/sie-server:latest-cpu-default

# Linux NVIDIA GPU(推荐生产环境)
docker run --gpus all \
  -p 8080:8080 \
  -v sie-hf-cache:/app/.cache/huggingface \
  ghcr.io/superlinked/sie-server:latest-cuda12-default

# Apple Silicon macOS(原生 Metal,非模拟)
pip install "sie-server[local]"
sie-server serve

注意:生成任务(Qwen3 等大模型)需要 GPU,只能用 latest-cuda12-sglang 镜像,不能在 CPU 上运行。

启动后确认健康状态:

curl http://localhost:8080/readyz
# 期望输出:ok

客户端 SDK

pip install sie-sdk          # Python
pnpm add @superlinked/sie-sdk # TypeScript

核心用法

所有模型共享同一个 SIEClient,只需换模型 ID:

from sie_sdk import SIEClient
from sie_sdk.types import Item

client = SIEClient("http://localhost:8080")

# 1. Embedding(稠密向量)
result = client.encode(
    "sentence-transformers/all-MiniLM-L6-v2",
    Item(text="Hello world")
)
print(result["dense"].shape)   # (384,)

# 2. 语义重排(Cross-Encoder)
scores = client.score(
    "cross-encoder/ms-marco-MiniLM-L-6-v2",
    Item(text="What is machine learning?"),
    [Item(text="ML learns from data."), Item(text="The weather is sunny.")]
)
# scores["scores"] 返回带 rank 的排序结果

# 3. 零样本实体抽取(GLiNER,无需微调)
result = client.extract(
    "urchade/gliner_multi-v2.1",
    Item(text="Tim Cook is the CEO of Apple."),
    labels=["person", "organization"]
)
# result["entities"] → [{'text':'Tim Cook','label':'person','score':0.991}, ...]

# 4. 文本生成(需要 GPU + sglang 镜像)
result = client.generate(
    "Qwen/Qwen3-0.6B",
    "Reply with a single word: the capital of France.",
    max_new_tokens=16,
)
print(result["text"])  # Paris

五大任务对应的模型示例(直接替换 HuggingFace ID 即可):

任务 推荐模型 模型 ID(示例)
搜索 Embedding BGE-M3 / SPLADE-v3 / ColBERTv2 BAAI/bge-m3
文档重排 Qwen3-Reranker Qwen/Qwen3-Reranker
文档→Markdown GLM-OCR / MinerU / Docling 参见官方模型目录
结构化抽取 GLiNER2 / Nuner-Zero / Qwen3.6-27B urchade/gliner_multi-v2.1
内容安全 Granite-Guardian-2B granite-guardian-2b
Agent 循环生成 Qwen3-0.6B / Qwen3-4B Qwen/Qwen3-0.6B

生产部署(Kubernetes)

SIE 官方提供 Helm Chart,支持 GKE / EKS,含 KEDA 自动扩缩容(可缩至零)、负载均衡网关和 Grafana 监控面板:

helm upgrade --install sie-cluster oci://ghcr.io/superlinked/charts/sie-cluster \
  --namespace sie --create-namespace \
  --set hfToken.create=true \
  --set hfToken.value=YOUR_HF_TOKEN \
  -f deploy/helm/sie-cluster/values-gke.yaml   # 或 values-aws.yaml

注意:HuggingFace 模型下载需要认证 Token,生产部署必须配置 hfToken


典型适用场景

  1. RAG Pipeline:Embedding → 检索 → 重排,一条 HTTP 调用链,无需维护多个服务。
  2. 文档处理 Agent:PDF/Office 文件 → Markdown → 实体抽取 → 结构化输出,全部在私有集群完成。
  3. 企业级 Agent 平台:多租户、跨模型负载均衡、审计日志,统一基础设施而非各自为政。
  4. 隐私合规场景:数据不出境,所有推理在自有云上运行,支持离线部署。
  5. 多框架集成:LangChain、LlamaIndex、Haystack、DSPy、CrewAI 均已官方集成,Drop-in 迁移。

坑与注意

  1. 生成模型必须 GPU:Qwen3 等生成模型无 CPU 路径,务必使用 latest-cuda12-sglang 镜像,并在 docker run 时加 --gpus all
  2. 首次调用冷启动:首次请求每个模型时从 HuggingFace 下载权重(小型模型数秒,大型模型更久),后续请求热缓存,延迟在毫秒级。
  3. Apple Silicon 本地安装依赖 Python 3.12sie-server[local] 需要 Python 3.12 以上。
  4. 遥测数据:默认会匿名收集版本、OS、架构、GPU 类型等使用统计,可通过 SIE_TELEMETRY_DISABLED=1 关闭。
  5. 模型 ID 需精确:必须使用 HuggingFace 完整路径(如 sentence-transformers/all-MiniLM-L6-v2),不能只写模型简称。
  6. 内存需求: Embedding / 重排服务 CPU 可跑,但大型模型(如 Qwen3-4B)需足够显存,建议生产环境 GPU 机型。

与同类对比

方案 模型覆盖 部署复杂度 许可证 亮点
SIE 85+(Embedding/重排/OCR/抽取/生成) ⭐ 低(Docker 一键) Apache 2.0 统一 API,五类任务一站搞定
vLLM 仅 LLM 生成 Apache 2.0 LLM 吞吐极强,但只有生成
Ollama 各类模型 MIT 本地轻量,但缺企业级编排
Text Embedding Inference(T.E.I.) 仅 Embedding Apache 2.0 专注 Embedding,性能好
Ray Serve 通用 Apache 2.0 最灵活,但需要自己搭
LM Studio 各类模型 专有/部分开源 桌面端友好,生产不适用

SIE 的核心差异在于五类任务统一推理,而非只解决生成或只解决 Embedding。如果你的 Agent 需要同时处理文档解析、检索、抽取和生成,SIE 能显著减少运维复杂度;如果只需要单一能力(尤其是大模型生成),vLLM 或 Ollama 可能更专注。


一句话推荐结论

SIE 是目前最完整的开源 Agent 推理一体化方案,一个集群搞定 Embedding、检索、文档解析、实体抽取和生成,85+ 模型开箱即用,生产级部署一条 Helm 命令,推荐所有需要本地推理能力的 Agent 开发者试用。