aigc-apps/EasyAnimate · 上手攻略
- 仓库:aigc-apps/EasyAnimate
- 链接:https://github.com/aigc-apps/EasyAnimate
- 分类:AI视频生成 · Diffusion Transformer
- 作者:Tom
- 更新:2026-08-21
这是什么
EasyAnimate 是阿里巴巴 PAI 团队开源的端到端视频生成 Pipeline,基于 Diffusion Transformer(DiT)架构,支持文生视频、图生视频、视频生视频及多种控制条件(姿态/Canny/深度/相机轨迹)。最新版本 V5.1 提供 7B 和 12B 两种规模,支持中英文双语提示词,是目前开源生态中支持控制类型最丰富的视频生成方案之一。
解决的问题:在 Sora/OpenAI 闭源、国内开源视频生成方案稀缺的背景下,EasyAnimate 提供了一条完整的数据预处理→VAE训练→DiT训练→推理生成的 Pipeline,且对中文场景做了深度适配。
快速安装
环境要求
| 组件 | 版本要求 |
|---|---|
| Python | 3.10 / 3.11 |
| PyTorch | 2.2.0 |
| CUDA | 11.8 / 12.1 |
| CUDNN | 8+ |
| 磁盘 | ≥60 GB(仅权重) |
最低显存参考(EasyAnimateV5.1):
| 显存 | 7B 模型 | 12B 模型 |
|---|---|---|
| 16 GB | 🧡 qfloat8 可跑 | ❌ 不支持 |
| 24 GB | ✅ 可跑 | 🧡 qfloat8 可跑 |
| 40 GB | ✅ | ✅ |
| 80 GB | ✅ | ✅ |
方式一:Docker(推荐新手)
# 拉取镜像
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:easyanimate
# 启动容器(需 nvidia-docker)
docker run -it -p 7860:7860 --network host --gpus all \
--security-opt seccomp:unconfined --shm-size 200g \
mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:easyanimate
# 克隆代码
git clone https://github.com/aigc-apps/EasyAnimate.git
cd EasyAnimate
# 创建权重目录
mkdir -p models/Diffusion_Transformer
mkdir -p models/Motion_Module
mkdir -p models/Personalized_Model
方式二:阿里云 PAI-DSW(免费 GPU)
阿里云 PAI 提供免费 GPU 时长,5 分钟内可启动:
- 访问 阿里云 PAI FreeTier 领取免费资源
- 在 PAI-DSW 中创建实例,镜像选择 EasyAnimate 对应版本
- 在 Gallery 中找到 EasyAnimate V5 模板直接加载
下载权重
V5.1 推荐使用 ModelScope 或 HuggingFace:
# HuggingFace(12B 中文版,支持图生视频)
# https://huggingface.co/alibaba-pai/EasyAnimateV5.1-12b-zh-InP
# HuggingFace(12B 纯文生视频)
# https://huggingface.co/alibaba-pai/EasyAnimateV5.1-12b-zh
# ModelScope(国内访问更快)
# https://modelscope.cn/models/PAI/EasyAnimateV5.1-12b-zh-InP
⚠️ 注意:12B 权重约 24 GB,下载前确认网络和磁盘空间。
核心用法
权重目录结构
models/
├── Diffusion_Transformer/
│ └── EasyAnimateV5.1-12b-zh-InP/ # 放入下载的权重
├── Motion_Module/ # 如需自定义运动模块
└── Personalized_Model/ # 自训练 LoRA 权重
文生视频(Text-to-Video)
修改 predict_t2v.py 中的关键参数后运行:
# predict_t2v.py 中修改
prompt = "A beautiful sunset over the ocean, cinematic lighting"
neg_prompt = "blurry, low quality, distorted"
guidance_scale = 7.0
seed = 42
num_frames = 25 # 或 49(6 秒 / 8fps)
# 显存不足时,在文件顶部设置
gpu_memory_mode = "model_cpu_offload" # 可选: model_cpu_offload / model_cpu_offload_and_qfloat8 / sequential_cpu_offload
python predict_t2v.py
# 输出保存在 samples/easyanimate-videos/
图生视频(Image-to-Video)
# predict_i2v.py 中修改
validation_image_start = "path/to/start_image.png" # 起始图
validation_image_end = "path/to/end_image.png" # 结束图(可与起始图相同)
prompt = "The character walks forward confidently"
neg_prompt = "blurry, distorted"
guidance_scale = 7.0
seed = 42
python predict_i2v.py
# 输出保存在 samples/easyanimate-videos_i2v/
控制生视频(Canny/Pose/Depth/轨迹)
# predict_v2v_control.py 中修改
control_video = "path/to/control_video.mp4" # 控制视频(姿态/深度等提取)
validation_image_end = "path/to/first_frame.png" # 参考起始图
prompt = "A woman dancing gracefully"
guidance_scale = 7.0
seed = 42
python predict_v2v_control.py
# 输出保存在 samples/easyanimate-videos_v2v_control/
ComfyUI 图形化操作(推荐)
EasyAnimate 提供完整 ComfyUI 节点,详情见 comfyui/README.md:
cd comfyui
# 按 ComfyUI README 安装节点和模型
WebUI(Gradio)
# 直接运行 app.py 启动 Gradio 界面
python app.py
# 访问 http://localhost:7860
显存节省策略
V5/V5.1 参数规模大(7B/12B),官方提供三级显存节省模式:
| 模式 | 显存节省 | 速度 | 推荐场景 |
|---|---|---|---|
model_cpu_offload |
中等 | 较快 | 24 GB 显卡(推荐) |
model_cpu_offload_and_qfloat8 |
较多 | 中等 | 16 GB 显卡 |
sequential_cpu_offload |
最大 | 慢 | 极限低显存 |
⚠️ 已知限制:2080 Ti 和 V100 等不支持 torch.bfloat16 的显卡,需将 weight_dtype 改为 torch.float16(修改 app.py 和对应 predict 文件)。
A100 80GB 生成时间参考(25 steps,384×672):约 45 秒(1.75 s/it)
典型适用场景
- AI 视频内容创作:广告、短视频、社交媒体内容
- 游戏过场动画:生成游戏内 CG 片段或概念验证
- 数字人/虚拟主播:结合姿态控制生成说话/动作视频
- 电商视频生成:商品展示图生视频化
- 科研实验:Diffusion Transformer 视频生成的学术研究
坑与注意
⚠️ V100 用户必读:V100 不支持 bfloat16,运行时必须切换为 float16,否则报错。
⚠️ 权重路径严格:必须将权重文件放入 models/Diffusion_Transformer/EasyAnimateV5.1-*/ 目录,否则推理脚本报路径错误。
⚠️ shm-size 建议 200g:Docker 运行时默认共享内存偏小,视频帧处理可能爆内存,务必设置 --shm-size 200g。
⚠️ 非最新架构:V5.1(2025.03)已集成 HuggingFace diffusers,但主分支仍是独立 Pipeline,升级前建议查看 diffusers PR 确认兼容性。
⚠️ 视频时长限制:目前最多 49 帧(~6 秒),长视频需自行拼接。
⚠️ 中文字符渲染:部分中文提示词在图生视频场景下效果不稳定,建议以英文为主或使用中文+英文混合。
与同类对比
| 方案 | 参数量 | 中文支持 | 控制类型 | 显存需求 | 许可证 |
|---|---|---|---|---|---|
| EasyAnimate V5.1 | 7B/12B | ✅ 深度 | Canny/Pose/Depth/轨迹/相机 | 16GB+ | Apache 2.0 |
| CogVideoX (05b) | 5B | ✅ | 有限 | 20GB+ | Apache 2.0 |
| ModelScope Tuner | — | ✅ | 有限 | 高 | ModelScope |
| AnimateDiff | ~1.5B | ❌ | 需搭配 ControlNet | 8GB+ | Apache 2.0 |
| Stable Video Diffusion | 1.5B | ❌ | 有限 | 12GB+ | Stability AI |
核心差异:EasyAnimate 是目前开源方案中控制类型最丰富的(支持相机轨迹控制),且有完整的训练 Pipeline;CogVideoX 更轻量适合快速推理;AnimateDiff 适合搭配已有 SD 模型。
一句话推荐结论
适合需要中英双语视频生成、且对姿态/轨迹/相机控制有强需求的用户;12B 大模型对显存要求较高,建议 40GB 以上显卡优先使用,16-24GB 用户可尝试 qfloat8 量化模式。