data-infra/cube-studio · 上手攻略
- 仓库:data-infra/cube-studio
- 链接:https://github.com/data-infra/cube-studio
- 分类:MLOps · AI 平台
- 作者:Tom
- 更新:2026-08-14
这是什么
CubeStudio(立方工作室)是一款国产化、云原生的开源一站式 AI 平台,MIT 协议,开源免费商用,已在数千家企业实现私有化部署。
它的定位是 MLOps / MaaS / 算力调度 / 训推平台 的全集,覆盖从数据管理、模型训练、到推理服务的完整链路。核心功能包括:多租户算力调度、拖拉拽 Pipeline 编排、分布式多机多卡训练、超参搜索、vLLM / Ollama / MindIE 大模型推理、私有知识库、图文音多模态自动化标注,以及 AI 模型市场。
最大的差异化卖点是国产异构算力原生支持:昇腾(NPU)、寒武纪、海光(DCU)、摩尔线程、沐曦、百度昆仑芯,以及 x86 / ARM 双架构,并支持 IB / RoCE / RDMA 高速网络。
解决什么问题
企业或团队搭建 AI 平台通常面临几个痛点:
- 技术栈割裂:数据标注、训练、推理、部署各用各的工具,维护成本高
- 算力管理混乱:GPU 共享、独占、vGPU 没有统一调度,资源利用率低
- 国产算力缺失:昇腾等国产芯片的支持在大多数开源平台里是二等公民
- 部署门槛高:开源 MLOps 平台通常需要专业运维才能跑起来
CubeStudio 的答案是一站式:Web UI 覆盖全部流程,拖拉拽配置训练任务,K8s 统一调度多集群多厂商 GPU,支持从单人验证到千人并发使用的多租户规模。
快速安装
方式一:Docker 一键部署(推荐尝鲜)
⚠️ 以下命令基于 README 描述推演,docker-compose 文件路径未经实机验证,建议以仓库实际文件为准。
# 克隆仓库
git clone https://github.com/data-infra/cube-studio.git
cd cube-studio
# 启动(具体命令需参照仓库 deploy/ 目录或 wiki)
docker-compose up -d
# 或
docker compose up -d
⚠️ 不确定处:docker-compose.yml 所在具体目录(
deploy/、docker/或根目录)未经 fetch 验证;首次启动后需初始化数据库和 Redis,具体步骤请参照仓库 Wiki 或 INSTALL.md。
方式二:Kubernetes 部署(生产环境)
平台支持多 K8s 集群管理,需提前配置好 K8s 集群和 kubectl:
# 添加集群资源配置(Web UI 中操作)
# 路径:算力调度 → 多资源组/多集群 → 添加集群
# 挂载 NFS/OSS/CephFS 等存储(存储盘管理)
硬件与依赖(生产最低建议)
| 组件 | 最低配置 |
|---|---|
| GPU | NVIDIA T4(16GB)× 1,或等效国产卡 |
| CPU | 8 核 |
| 内存 | 32 GB |
| 存储 | 100 GB(训练数据另计) |
| K8s | v1.24+(如用 K8s 部署) |
核心用法
1. 创建训练任务(拖拉拽 Pipeline)
1. 打开「模型训练」→ 选择「拖拉拽任务流编排」
2. 从左侧算子面板拖入节点:数据导入 → 预处理 → 模型训练 → 模型评估
3. 连线配置依赖关系
4. 点击「调试」验证单节点
5. 点击「运行」正式执行分布式任务
支持的算子类型: - 基础算子:自定义镜像、Python 脚本、逻辑节点 - 数据同步:DataX(MySQL/PostgreSQL/ClickHouse)、HuggingFace / 魔塔数据集导入 - 特征处理:PCA、One-Hot、标准化、异常值检测、随机森林特征重要性 - 深度学习:TensorFlow、PyTorch 分布式训练(ColossalAI / DeepSpeed / Horovod / Megatron) - 大模型微调:LlamaFactory(SFT / 奖励模型 / RLHF),支持 DeepSeek / Qwen2 / ChatGLM4 / LLaMA3
2. 启动大模型推理服务(vLLM)
# Pipeline 中添加「模型服务化」算子,选择 vLLM 镜像
# 填写模型名称(如 deepseek-ai/DeepSeek-V2.5)
# 配置 GPU 数量和卡型(A100 / T4 等)
# 完成后自动生成 OpenAI 兼容 API
支持的推理后端:vLLM、Ollama、MindIE(昇腾)、xinference。
3. 超参搜索
# 在 Pipeline 中加入「超参搜索」节点
# 配置搜索空间:
search_config = {
"learning_rate": [1e-5, 1e-3],
"batch_size": [16, 32, 64],
"num_layers": [6, 12]
}
# 选择搜索算法(随机 / 网格 / 贝叶斯)
# 平台自动提交分布式搜索任务
4. 数据标注(多模态)
支持的标注类型:
- 图像:目标检测、分割、分类、OCR、关键点
- 视频:多目标跟踪、多说话人语音分隔
- 音频:语音识别(ASR)
- 文本:命名实体识别、问答对、摘要
- 自动化标注:支持视觉大模型和 LLM 自动预标注,人工只需复核,大幅降低标注成本
5. 计量计费配置
# 项目组资源配额(Web UI)
# 设置:开发资源限额 / 训练资源限额 / 推理资源限额
# 额度限制生效于:Notebook、Docker 构建、Pipeline、
# 超参搜索、内部服务、推理服务
典型适用场景
场景 1:企业 AI 中台建设 算力纳管 + 多租户 + 计费,适合需要对外提供 AI 能力的机构(高校、算力租赁商、企业内部 AI 部门)。
场景 2:大模型微调与部署 LlamaFactory 微调链路 + vLLM 推理,一条 Pipeline 从数据到部署,适合有开源模型定制需求的用户。
场景 3:国产算力适配需求 昇腾、寒武纪、海光等国产芯片的完整适配(训练 + 推理),在信创环境中尤为重要。
场景 4:多租户标注平台 图文音多模态标注 + 质量审核流 +Webhook 触发,适合 AI 数据服务公司。
坑与注意
-
部署复杂度较高:CubeStudio 是功能全面的企业级平台,Docker 一键部署仅适合快速验证;正式生产需要 K8s、存储、网络等多方面运维知识,不建议个人新手直接上手生产环境。
-
文档语言:平台文档和 UI 主要为中文,英文资料较少,团队若以外语为主可能有一定适应成本。
-
国产芯片适配质量:README 声称支持多种国产算力,但各芯片驱动和算子适配成熟度不一,有实际部署经验的用户反馈有限,建议先用小任务验证再上生产。⚠️ 具体算力支持的版本和稳定性未经大规模实机核验。
-
K8s 版本依赖:需要 K8s v1.24+,旧版本集群无法直接使用。
-
数据安全:平台元数据支持对接人大金仓、达梦等国产数据库,适合信创环境,但标注模块不支持这些数据库(README 明确注明),需注意。
-
版本更新频率:GitHub 最新 commit 为 2026 年 7 月(Wiki 最后编辑时间),但具体版本号和大版本发布节奏未公开,不确定当前稳定版本。
与同类对比
| 项目 | CubeStudio | MLflow | KubeFlow | OpenMMLab |
|---|---|---|---|---|
| 定位 | 全链路 AI 平台 | 实验跟踪 | 云原生 MLOps | 算法框架集合 |
| 分布式训练 | ✅ 完整 | ❌ | ✅ | ✅ |
| 大模型推理 | ✅ vLLM/Ollama | ❌ | ❌ | ❌ |
| 国产算力 | ✅ 昇腾/寒武纪等 | ❌ | ❌ | ❌ |
| 拖拉拽 Pipeline | ✅ | ❌ | ⚠️ KFP | ❌ |
| 多租户/计费 | ✅ 完整 | ❌ | ❌ | ❌ |
| 部署难度 | 中高 | 低 | 高 | 低 |
| 开源协议 | MIT | Apache 2.0 | Apache 2.0 | Apache 2.0 |
一句话结论
需要一站式 AI 平台(尤其是有国产算力或信创需求)的团队,CubeStudio 是目前开源生态里功能最完整的选项之一;个人用户或只需要单一能力(推理/训练)建议用更轻量的专用工具。
来源:GitHub README(中文原文)、CubeStudio Wiki 首页、data-infra/cube-studio GitHub 页面。Docker 部署命令基于 README 描述推演,⚠️ 未经实机核验;部署路径和初始化步骤请以仓库最新文档为准。