data-infra/cube-studio · 上手攻略

  • 仓库:data-infra/cube-studio
  • 链接:https://github.com/data-infra/cube-studio
  • 分类:MLOps · AI 平台
  • 作者:Tom
  • 更新:2026-08-14

这是什么

CubeStudio(立方工作室)是一款国产化、云原生的开源一站式 AI 平台,MIT 协议,开源免费商用,已在数千家企业实现私有化部署。

它的定位是 MLOps / MaaS / 算力调度 / 训推平台 的全集,覆盖从数据管理、模型训练、到推理服务的完整链路。核心功能包括:多租户算力调度、拖拉拽 Pipeline 编排、分布式多机多卡训练、超参搜索、vLLM / Ollama / MindIE 大模型推理、私有知识库、图文音多模态自动化标注,以及 AI 模型市场。

最大的差异化卖点是国产异构算力原生支持:昇腾(NPU)、寒武纪、海光(DCU)、摩尔线程、沐曦、百度昆仑芯,以及 x86 / ARM 双架构,并支持 IB / RoCE / RDMA 高速网络。


解决什么问题

企业或团队搭建 AI 平台通常面临几个痛点:

  • 技术栈割裂:数据标注、训练、推理、部署各用各的工具,维护成本高
  • 算力管理混乱:GPU 共享、独占、vGPU 没有统一调度,资源利用率低
  • 国产算力缺失:昇腾等国产芯片的支持在大多数开源平台里是二等公民
  • 部署门槛高:开源 MLOps 平台通常需要专业运维才能跑起来

CubeStudio 的答案是一站式:Web UI 覆盖全部流程,拖拉拽配置训练任务,K8s 统一调度多集群多厂商 GPU,支持从单人验证到千人并发使用的多租户规模。


快速安装

方式一:Docker 一键部署(推荐尝鲜)

⚠️ 以下命令基于 README 描述推演,docker-compose 文件路径未经实机验证,建议以仓库实际文件为准。

# 克隆仓库
git clone https://github.com/data-infra/cube-studio.git
cd cube-studio

# 启动(具体命令需参照仓库 deploy/ 目录或 wiki)
docker-compose up -d
# 或
docker compose up -d

⚠️ 不确定处:docker-compose.yml 所在具体目录(deploy/docker/ 或根目录)未经 fetch 验证;首次启动后需初始化数据库和 Redis,具体步骤请参照仓库 Wiki 或 INSTALL.md。

方式二:Kubernetes 部署(生产环境)

平台支持多 K8s 集群管理,需提前配置好 K8s 集群和 kubectl:

# 添加集群资源配置(Web UI 中操作)
# 路径:算力调度 → 多资源组/多集群 → 添加集群

# 挂载 NFS/OSS/CephFS 等存储(存储盘管理)

硬件与依赖(生产最低建议)

组件 最低配置
GPU NVIDIA T4(16GB)× 1,或等效国产卡
CPU 8 核
内存 32 GB
存储 100 GB(训练数据另计)
K8s v1.24+(如用 K8s 部署)

核心用法

1. 创建训练任务(拖拉拽 Pipeline)

1. 打开「模型训练」→ 选择「拖拉拽任务流编排」
2. 从左侧算子面板拖入节点:数据导入 → 预处理 → 模型训练 → 模型评估
3. 连线配置依赖关系
4. 点击「调试」验证单节点
5. 点击「运行」正式执行分布式任务

支持的算子类型: - 基础算子:自定义镜像、Python 脚本、逻辑节点 - 数据同步:DataX(MySQL/PostgreSQL/ClickHouse)、HuggingFace / 魔塔数据集导入 - 特征处理:PCA、One-Hot、标准化、异常值检测、随机森林特征重要性 - 深度学习:TensorFlow、PyTorch 分布式训练(ColossalAI / DeepSpeed / Horovod / Megatron) - 大模型微调:LlamaFactory(SFT / 奖励模型 / RLHF),支持 DeepSeek / Qwen2 / ChatGLM4 / LLaMA3

2. 启动大模型推理服务(vLLM)

# Pipeline 中添加「模型服务化」算子,选择 vLLM 镜像
# 填写模型名称(如 deepseek-ai/DeepSeek-V2.5)
# 配置 GPU 数量和卡型(A100 / T4 等)
# 完成后自动生成 OpenAI 兼容 API

支持的推理后端:vLLM、Ollama、MindIE(昇腾)、xinference。

3. 超参搜索

# 在 Pipeline 中加入「超参搜索」节点
# 配置搜索空间:
search_config = {
    "learning_rate": [1e-5, 1e-3],
    "batch_size": [16, 32, 64],
    "num_layers": [6, 12]
}
# 选择搜索算法(随机 / 网格 / 贝叶斯)
# 平台自动提交分布式搜索任务

4. 数据标注(多模态)

支持的标注类型:

  • 图像:目标检测、分割、分类、OCR、关键点
  • 视频:多目标跟踪、多说话人语音分隔
  • 音频:语音识别(ASR)
  • 文本:命名实体识别、问答对、摘要
  • 自动化标注:支持视觉大模型和 LLM 自动预标注,人工只需复核,大幅降低标注成本

5. 计量计费配置

# 项目组资源配额(Web UI)
# 设置:开发资源限额 / 训练资源限额 / 推理资源限额
# 额度限制生效于:Notebook、Docker 构建、Pipeline、
#                  超参搜索、内部服务、推理服务

典型适用场景

场景 1:企业 AI 中台建设 算力纳管 + 多租户 + 计费,适合需要对外提供 AI 能力的机构(高校、算力租赁商、企业内部 AI 部门)。

场景 2:大模型微调与部署 LlamaFactory 微调链路 + vLLM 推理,一条 Pipeline 从数据到部署,适合有开源模型定制需求的用户。

场景 3:国产算力适配需求 昇腾、寒武纪、海光等国产芯片的完整适配(训练 + 推理),在信创环境中尤为重要。

场景 4:多租户标注平台 图文音多模态标注 + 质量审核流 +Webhook 触发,适合 AI 数据服务公司。


坑与注意

  1. 部署复杂度较高:CubeStudio 是功能全面的企业级平台,Docker 一键部署仅适合快速验证;正式生产需要 K8s、存储、网络等多方面运维知识,不建议个人新手直接上手生产环境。

  2. 文档语言:平台文档和 UI 主要为中文,英文资料较少,团队若以外语为主可能有一定适应成本。

  3. 国产芯片适配质量:README 声称支持多种国产算力,但各芯片驱动和算子适配成熟度不一,有实际部署经验的用户反馈有限,建议先用小任务验证再上生产。⚠️ 具体算力支持的版本和稳定性未经大规模实机核验。

  4. K8s 版本依赖:需要 K8s v1.24+,旧版本集群无法直接使用。

  5. 数据安全:平台元数据支持对接人大金仓、达梦等国产数据库,适合信创环境,但标注模块不支持这些数据库(README 明确注明),需注意。

  6. 版本更新频率:GitHub 最新 commit 为 2026 年 7 月(Wiki 最后编辑时间),但具体版本号和大版本发布节奏未公开,不确定当前稳定版本。


与同类对比

项目 CubeStudio MLflow KubeFlow OpenMMLab
定位 全链路 AI 平台 实验跟踪 云原生 MLOps 算法框架集合
分布式训练 ✅ 完整
大模型推理 ✅ vLLM/Ollama
国产算力 ✅ 昇腾/寒武纪等
拖拉拽 Pipeline ⚠️ KFP
多租户/计费 ✅ 完整
部署难度 中高
开源协议 MIT Apache 2.0 Apache 2.0 Apache 2.0

一句话结论

需要一站式 AI 平台(尤其是有国产算力或信创需求)的团队,CubeStudio 是目前开源生态里功能最完整的选项之一;个人用户或只需要单一能力(推理/训练)建议用更轻量的专用工具。


来源:GitHub README(中文原文)、CubeStudio Wiki 首页、data-infra/cube-studio GitHub 页面。Docker 部署命令基于 README 描述推演,⚠️ 未经实机核验;部署路径和初始化步骤请以仓库最新文档为准。