tencentmusic/cube-studio · 上手攻略

  • 仓库:tencentmusic/cube-studio
  • 链接:https://github.com/tencentmusic/cube-studio
  • 分类:ai
  • 作者:Jay
  • 更新:2026-07-14

一、是什么

cube-studio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。

它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)国产软件生态的支持。

📌 官方 tagline:「MLOps 算法链路全流程,算力租赁平台,notebook 在线开发,拖拉拽任务流 pipeline 编排,多机多卡分布式训练,超参搜索,推理服务 VGPU 虚拟化,边缘计算,标注平台自动化标注,DeepSeek 等大模型 SFT 微调……」

二、解决什么问题

在企业级 AI 落地过程中,团队通常面临:

  • 工具碎片化 —— Jupyter notebook、MLflow、Airflow、Kubeflow 各一套,数据和模型在工具间流转困难
  • GPU 资源利用率低 —— 手工分配 GPU 资源,多任务排队、碎片化严重
  • 国产化适配困难 —— 需要在昇腾 NPU 等国产芯片上跑 PyTorch 模型,缺乏统一平台
  • 大模型推理成本高 —— vLLM 多机推理、虚拟 GPU(VGPU)调度、模型热加载都需要专门工程
  • 标注效率低 —— 团队协作标注、自动化标注、质检流程缺失

cube-studio 把这一整套东西打包成一个统一平台,基于 Kubernetes 云原生架构,支持多租户和 SSO,让算法工程师专注模型而非基础设施。

三、快速安装

⚠️ 前提:需要 Kubernetes 集群环境(HPE/本地皆可)。不支持单机部署。

方式一:Helm Chart(推荐生产使用)

# 添加 Helm repo(如果有的话)
helm repo add cube-studio https://tencentmusic.github.io/cube-studio-charts
helm repo update

# 安装(具体版本号请查阅项目 README)
helm install cube-studio cube-studio/cube-studio \
  --namespace cube-studio \
  --create-namespace \
  --values values.yaml

方式二:Rancher 部署

腾讯音乐官方提供了针对 Rancher 的 Kubernetes 部署配置,位于仓库内:

install/kubernetes/rancher/

参考其中的 coredns.yaml 和其他 YAML 文件,通过 Rancher UI 导入即可。

方式三:源码构建

git clone https://github.com/tencentmusic/cube-studio.git
cd cube-studio

# 查看各模块的 Dockerfile
ls docker/

# 分模块构建(具体步骤参考各模块下的 README)

📌 详细安装文档请查阅 项目 GitHub 各子目录的 README。

环境要求(参考)

组件 最低要求
Kubernetes 1.20+
GPU 节点 NVIDIA GPU + nvidia-docker2
昇腾节点 昇腾 910/310 NPU + CANN 工具链
存储 CephFS / NFS / 其他 CSI 存储
内存 Master 节点 32GB+

四、核心功能模块

4.1 Notebook 在线开发

内置 Jupyter 风格的在线 IDE,支持:

  • 预装 PyTorch、TensorFlow、MindSpore 等主流框架
  • 共享 GPU/CPU 算力,Notebook 实例与训练任务共享资源池
  • 代码版本管理和协作

适用:数据探索、特征工程、模型快速实验。

4.2 拖拽式 Pipeline 编排(类 Kubeflow Pipelines / Argo Workflows)

通过可视化界面编排机器学习流水线:

数据加载 → 预处理 → 特征工程 → 模型训练 → 模型评估 → 模型注册

每个节点可以是 Python 脚本、Docker 镜像或已有任务;支持条件分支、并行执行、循环。

适用:标准化模型训练流程,确保实验可复现。

4.3 分布式训练

支持多种分布式训练框架:

框架 备注
PyTorch DDP 原生 DistributedDataParallel
DeepSpeed ZeRO 优化、Pipeline 并行
Horovod Uber 开源的分布式训练框架
ColossalAI ChatGLM 等大模型训练
PaddlePaddle 百度飞桨
Ray Ray Tune 分布式超参搜索
Volcano Kubernetes 批任务调度

多机多卡训练通过 Kubernetes Job/PyTorchJob 等 CRD 管理,提交一个 YAML 即可:

# 提交 PyTorch 分布式训练任务(示例结构)
apiVersion: "kubeflow.org/v1"
kind: PyTorchJob
metadata:
  name: pytorch-distributed-train
spec:
  pytorchReplicaSpecs:
    Master:
      replicas: 1
      template:
        spec:
          containers:
          - name: pytorch
            image: tencentmusic/cube-studio-pytorch:latest
            args: ["--epochs", "100", "--batch-size", "256"]
            resources:
              limits:
                nvidia.com/gpu: "4"

4.4 超参搜索(Hyperparameter Tuning)

集成 Optuna、Ray Tune 等超参搜索后端,通过平台 UI 配置搜索空间和目标指标,自动运行多次试验并可视化结果。

4.5 VGPU 虚拟化推理

针对推理场景的 GPU 虚拟化,支持:

  • vGPU 切分:一张物理 GPU 供多个推理服务共享(1/2/4/8 分片)
  • 模型热加载:新模型上线无需重启服务
  • 自动扩缩容:基于 QPS/延迟指标的 HPA 弹性伸缩

推理引擎支持 vLLM(PagedAttention,高吞吐)、Ollama(本地 LLM 推理)、MindIE(华为昇腾推理引擎)。

4.6 大模型微调(SFT / RLHF)

内置对 DeepSeek、Qwen、ChatGLM 等主流大模型的 SFT 微调支持:

  • LoRA / QLoRA 低秩适配器微调(显存友好)
  • 奖励模型训练(Reward Model)
  • RLHF / PPO 强化学习训练
  • DeepSpeed ZeRO-3 + Flash Attention 优化
# 微调命令示例(DeepSeek 为例,具体参数以官方文档为准)
deepspeed train.py \
  --model_name_or_path deepseek-ai/DeepSeek-V2 \
  --bf16 \
  --gradient_accumulation_steps 8 \
  --per_device_train_batch_size 4 \
  --lora_rank 64 \
  --lora_alpha 16 \
  --output_dir ./output

4.7 私有知识库 + AI 模型市场

  • 私有知识库:上传文档(PDF、Word、TXT),与大模型结合做 RAG(检索增强生成)
  • AI 模型市场:平台内共享和交易预训练模型,方便团队间模型资产流通

4.8 标注平台

支持图片、文本、音频等多模态数据标注:

  • 团队协作标注,角色分离(标注员 / 审核员)
  • 自动化预标注(用已有模型)+ 人工校正,提升标注效率
  • 标注质量控制流程

五、典型适用场景

场景 1:企业级 MLOps 建设

有多个算法团队、需要统一管理 GPU 资源、训练任务、模型版本的组织,cube-studio 提供一站式覆盖。

场景 2:国产化 AI 平台

受限于信创要求,需要在昇腾 NPU 上跑 PyTorch 模型的企业,cube-studio 对 Ascend 生态有官方支持。

场景 3:大模型微调与部署

有 DeepSeek、Qwen 等大模型微调需求,同时需要 vLLM 多机推理服务的团队。

场景 4:中小团队的 AI 平台起步

不想从零搭 Kubeflow + MLflow + 推理服务组合,cube-studio 开源版本提供了相对完整的开箱即用方案。

场景 5:音乐/内容推荐的深度学习

腾讯音乐本身是做推荐系统的,平台对这类场景的特色功能(如特征工程流水线、多模态数据处理)有一定积累。

六、坑与注意

  1. 部署复杂度较高 —— 这是一个完整的企业级平台,全量部署需要 Kubernetes 集群、GPU 节点、存储、网络等多方面配置,学习曲线较陡。
  2. 文档主要中文 —— 仓库 README 和相当部分文档是中文,英文用户需要适应。
  3. 昇腾 NPU 支持依赖 CANN —— 在昇腾芯片上运行需要安装华为 CANN 工具链(类似 NVIDIA CUDA),配置过程较繁琐。
  4. 开源活跃度 —— Stars 约 5k,属于中型开源项目,企业级支持需评估腾讯音乐的维护响应速度。
  5. 硬件要求高 —— 全功能运行需要 GPU 集群,不适合个人学习者或小数据场景。
  6. 部分功能阉割 —— 开源版本可能不包含腾讯音乐内部版的所有高级特性(如某些商业插件)。

七、与同类对比

平台 定位 Stars 优势 劣势
cube-studio 企业级 MLOps ~5k 国产硬件支持、大模型 SFT/推理全链路、可视化 pipeline 部署复杂、中文为主
Kubeflow 云原生 ML 平台 ~15k 生态最大、行业标准 组件多、学习曲线陡
MLflow 实验追踪 + 模型管理 ~14k 轻量、部署简单 无 pipeline 编排
Ray (Anyscale) 分布式计算框架 ~30k 分布式训练/调参/Tune 强大 非端到端平台
Feast 特征平台 ~7k 特征存储与复用 非训练平台
BentoML 模型服务 ~10k 推理服务简化部署 非全流程
Metaflow 数据科学工作流 ~7k Netflix 出品,体验好 非 Kubernetes 原生

结论:cube-studio 是国内团队在做企业级 MLOps 选型时值得认真考虑的开源选项,尤其在需要同时覆盖「国产硬件 + 大模型微调 + 可视化 pipeline」的场景下在国内开源竞品中优势明显。

八、一句话推荐结论

如果你在搭建企业级 AI 平台、需要昇腾 NPU 支持、或想一站式搞定大模型微调与推理,cube-studio 是目前国内开源社区中功能覆盖最完整的选择之一,值得部署测试。


注:各模块的具体版本兼容性(如 PyTorch + 昇腾 CANN 版本对应关系、vLLM 版本要求)请以 项目 GitHub 官方文档为准;Helm Chart 版本号和 Kubernetes 最低版本要求请参考 Release 说明。