tencentmusic/cube-studio · 上手攻略
- 仓库:tencentmusic/cube-studio
- 链接:https://github.com/tencentmusic/cube-studio
- 分类:ai
- 作者:Jay
- 更新:2026-07-14
一、是什么
cube-studio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。
它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)和国产软件生态的支持。
📌 官方 tagline:「MLOps 算法链路全流程,算力租赁平台,notebook 在线开发,拖拉拽任务流 pipeline 编排,多机多卡分布式训练,超参搜索,推理服务 VGPU 虚拟化,边缘计算,标注平台自动化标注,DeepSeek 等大模型 SFT 微调……」
二、解决什么问题
在企业级 AI 落地过程中,团队通常面临:
- 工具碎片化 —— Jupyter notebook、MLflow、Airflow、Kubeflow 各一套,数据和模型在工具间流转困难
- GPU 资源利用率低 —— 手工分配 GPU 资源,多任务排队、碎片化严重
- 国产化适配困难 —— 需要在昇腾 NPU 等国产芯片上跑 PyTorch 模型,缺乏统一平台
- 大模型推理成本高 —— vLLM 多机推理、虚拟 GPU(VGPU)调度、模型热加载都需要专门工程
- 标注效率低 —— 团队协作标注、自动化标注、质检流程缺失
cube-studio 把这一整套东西打包成一个统一平台,基于 Kubernetes 云原生架构,支持多租户和 SSO,让算法工程师专注模型而非基础设施。
三、快速安装
⚠️ 前提:需要 Kubernetes 集群环境(HPE/本地皆可)。不支持单机部署。
方式一:Helm Chart(推荐生产使用)
# 添加 Helm repo(如果有的话)
helm repo add cube-studio https://tencentmusic.github.io/cube-studio-charts
helm repo update
# 安装(具体版本号请查阅项目 README)
helm install cube-studio cube-studio/cube-studio \
--namespace cube-studio \
--create-namespace \
--values values.yaml
方式二:Rancher 部署
腾讯音乐官方提供了针对 Rancher 的 Kubernetes 部署配置,位于仓库内:
install/kubernetes/rancher/
参考其中的 coredns.yaml 和其他 YAML 文件,通过 Rancher UI 导入即可。
方式三:源码构建
git clone https://github.com/tencentmusic/cube-studio.git
cd cube-studio
# 查看各模块的 Dockerfile
ls docker/
# 分模块构建(具体步骤参考各模块下的 README)
📌 详细安装文档请查阅 项目 GitHub 各子目录的 README。
环境要求(参考)
| 组件 | 最低要求 |
|---|---|
| Kubernetes | 1.20+ |
| GPU 节点 | NVIDIA GPU + nvidia-docker2 |
| 昇腾节点 | 昇腾 910/310 NPU + CANN 工具链 |
| 存储 | CephFS / NFS / 其他 CSI 存储 |
| 内存 | Master 节点 32GB+ |
四、核心功能模块
4.1 Notebook 在线开发
内置 Jupyter 风格的在线 IDE,支持:
- 预装 PyTorch、TensorFlow、MindSpore 等主流框架
- 共享 GPU/CPU 算力,Notebook 实例与训练任务共享资源池
- 代码版本管理和协作
适用:数据探索、特征工程、模型快速实验。
4.2 拖拽式 Pipeline 编排(类 Kubeflow Pipelines / Argo Workflows)
通过可视化界面编排机器学习流水线:
数据加载 → 预处理 → 特征工程 → 模型训练 → 模型评估 → 模型注册
每个节点可以是 Python 脚本、Docker 镜像或已有任务;支持条件分支、并行执行、循环。
适用:标准化模型训练流程,确保实验可复现。
4.3 分布式训练
支持多种分布式训练框架:
| 框架 | 备注 |
|---|---|
| PyTorch DDP | 原生 DistributedDataParallel |
| DeepSpeed | ZeRO 优化、Pipeline 并行 |
| Horovod | Uber 开源的分布式训练框架 |
| ColossalAI | ChatGLM 等大模型训练 |
| PaddlePaddle | 百度飞桨 |
| Ray | Ray Tune 分布式超参搜索 |
| Volcano | Kubernetes 批任务调度 |
多机多卡训练通过 Kubernetes Job/PyTorchJob 等 CRD 管理,提交一个 YAML 即可:
# 提交 PyTorch 分布式训练任务(示例结构)
apiVersion: "kubeflow.org/v1"
kind: PyTorchJob
metadata:
name: pytorch-distributed-train
spec:
pytorchReplicaSpecs:
Master:
replicas: 1
template:
spec:
containers:
- name: pytorch
image: tencentmusic/cube-studio-pytorch:latest
args: ["--epochs", "100", "--batch-size", "256"]
resources:
limits:
nvidia.com/gpu: "4"
4.4 超参搜索(Hyperparameter Tuning)
集成 Optuna、Ray Tune 等超参搜索后端,通过平台 UI 配置搜索空间和目标指标,自动运行多次试验并可视化结果。
4.5 VGPU 虚拟化推理
针对推理场景的 GPU 虚拟化,支持:
- vGPU 切分:一张物理 GPU 供多个推理服务共享(1/2/4/8 分片)
- 模型热加载:新模型上线无需重启服务
- 自动扩缩容:基于 QPS/延迟指标的 HPA 弹性伸缩
推理引擎支持 vLLM(PagedAttention,高吞吐)、Ollama(本地 LLM 推理)、MindIE(华为昇腾推理引擎)。
4.6 大模型微调(SFT / RLHF)
内置对 DeepSeek、Qwen、ChatGLM 等主流大模型的 SFT 微调支持:
- LoRA / QLoRA 低秩适配器微调(显存友好)
- 奖励模型训练(Reward Model)
- RLHF / PPO 强化学习训练
- DeepSpeed ZeRO-3 + Flash Attention 优化
# 微调命令示例(DeepSeek 为例,具体参数以官方文档为准)
deepspeed train.py \
--model_name_or_path deepseek-ai/DeepSeek-V2 \
--bf16 \
--gradient_accumulation_steps 8 \
--per_device_train_batch_size 4 \
--lora_rank 64 \
--lora_alpha 16 \
--output_dir ./output
4.7 私有知识库 + AI 模型市场
- 私有知识库:上传文档(PDF、Word、TXT),与大模型结合做 RAG(检索增强生成)
- AI 模型市场:平台内共享和交易预训练模型,方便团队间模型资产流通
4.8 标注平台
支持图片、文本、音频等多模态数据标注:
- 团队协作标注,角色分离(标注员 / 审核员)
- 自动化预标注(用已有模型)+ 人工校正,提升标注效率
- 标注质量控制流程
五、典型适用场景
场景 1:企业级 MLOps 建设
有多个算法团队、需要统一管理 GPU 资源、训练任务、模型版本的组织,cube-studio 提供一站式覆盖。
场景 2:国产化 AI 平台
受限于信创要求,需要在昇腾 NPU 上跑 PyTorch 模型的企业,cube-studio 对 Ascend 生态有官方支持。
场景 3:大模型微调与部署
有 DeepSeek、Qwen 等大模型微调需求,同时需要 vLLM 多机推理服务的团队。
场景 4:中小团队的 AI 平台起步
不想从零搭 Kubeflow + MLflow + 推理服务组合,cube-studio 开源版本提供了相对完整的开箱即用方案。
场景 5:音乐/内容推荐的深度学习
腾讯音乐本身是做推荐系统的,平台对这类场景的特色功能(如特征工程流水线、多模态数据处理)有一定积累。
六、坑与注意
- 部署复杂度较高 —— 这是一个完整的企业级平台,全量部署需要 Kubernetes 集群、GPU 节点、存储、网络等多方面配置,学习曲线较陡。
- 文档主要中文 —— 仓库 README 和相当部分文档是中文,英文用户需要适应。
- 昇腾 NPU 支持依赖 CANN —— 在昇腾芯片上运行需要安装华为 CANN 工具链(类似 NVIDIA CUDA),配置过程较繁琐。
- 开源活跃度 —— Stars 约 5k,属于中型开源项目,企业级支持需评估腾讯音乐的维护响应速度。
- 硬件要求高 —— 全功能运行需要 GPU 集群,不适合个人学习者或小数据场景。
- 部分功能阉割 —— 开源版本可能不包含腾讯音乐内部版的所有高级特性(如某些商业插件)。
七、与同类对比
| 平台 | 定位 | Stars | 优势 | 劣势 |
|---|---|---|---|---|
| cube-studio | 企业级 MLOps | ~5k | 国产硬件支持、大模型 SFT/推理全链路、可视化 pipeline | 部署复杂、中文为主 |
| Kubeflow | 云原生 ML 平台 | ~15k | 生态最大、行业标准 | 组件多、学习曲线陡 |
| MLflow | 实验追踪 + 模型管理 | ~14k | 轻量、部署简单 | 无 pipeline 编排 |
| Ray (Anyscale) | 分布式计算框架 | ~30k | 分布式训练/调参/Tune 强大 | 非端到端平台 |
| Feast | 特征平台 | ~7k | 特征存储与复用 | 非训练平台 |
| BentoML | 模型服务 | ~10k | 推理服务简化部署 | 非全流程 |
| Metaflow | 数据科学工作流 | ~7k | Netflix 出品,体验好 | 非 Kubernetes 原生 |
结论:cube-studio 是国内团队在做企业级 MLOps 选型时值得认真考虑的开源选项,尤其在需要同时覆盖「国产硬件 + 大模型微调 + 可视化 pipeline」的场景下在国内开源竞品中优势明显。
八、一句话推荐结论
如果你在搭建企业级 AI 平台、需要昇腾 NPU 支持、或想一站式搞定大模型微调与推理,cube-studio 是目前国内开源社区中功能覆盖最完整的选择之一,值得部署测试。
注:各模块的具体版本兼容性(如 PyTorch + 昇腾 CANN 版本对应关系、vLLM 版本要求)请以 项目 GitHub 官方文档为准;Helm Chart 版本号和 Kubernetes 最低版本要求请参考 Release 说明。