aigc-apps/EasyAnimate · 上手攻略

  • 仓库:aigc-apps/EasyAnimate
  • 链接:https://github.com/aigc-apps/EasyAnimate
  • 分类:AI视频生成 · Diffusion Transformer
  • 作者:Tom
  • 更新:2026-08-21

这是什么

EasyAnimate 是阿里巴巴 PAI 团队开源的端到端视频生成 Pipeline,基于 Diffusion Transformer(DiT)架构,支持文生视频、图生视频、视频生视频及多种控制条件(姿态/Canny/深度/相机轨迹)。最新版本 V5.1 提供 7B 和 12B 两种规模,支持中英文双语提示词,是目前开源生态中支持控制类型最丰富的视频生成方案之一。

解决的问题:在 Sora/OpenAI 闭源、国内开源视频生成方案稀缺的背景下,EasyAnimate 提供了一条完整的数据预处理→VAE训练→DiT训练→推理生成的 Pipeline,且对中文场景做了深度适配。


快速安装

环境要求

组件 版本要求
Python 3.10 / 3.11
PyTorch 2.2.0
CUDA 11.8 / 12.1
CUDNN 8+
磁盘 ≥60 GB(仅权重)

最低显存参考(EasyAnimateV5.1)

显存 7B 模型 12B 模型
16 GB 🧡 qfloat8 可跑 ❌ 不支持
24 GB ✅ 可跑 🧡 qfloat8 可跑
40 GB
80 GB

方式一:Docker(推荐新手)

# 拉取镜像
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:easyanimate

# 启动容器(需 nvidia-docker)
docker run -it -p 7860:7860 --network host --gpus all \
  --security-opt seccomp:unconfined --shm-size 200g \
  mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:easyanimate

# 克隆代码
git clone https://github.com/aigc-apps/EasyAnimate.git
cd EasyAnimate

# 创建权重目录
mkdir -p models/Diffusion_Transformer
mkdir -p models/Motion_Module
mkdir -p models/Personalized_Model

方式二:阿里云 PAI-DSW(免费 GPU)

阿里云 PAI 提供免费 GPU 时长,5 分钟内可启动:

  1. 访问 阿里云 PAI FreeTier 领取免费资源
  2. 在 PAI-DSW 中创建实例,镜像选择 EasyAnimate 对应版本
  3. 在 Gallery 中找到 EasyAnimate V5 模板直接加载

下载权重

V5.1 推荐使用 ModelScope 或 HuggingFace:

# HuggingFace(12B 中文版,支持图生视频)
# https://huggingface.co/alibaba-pai/EasyAnimateV5.1-12b-zh-InP

# HuggingFace(12B 纯文生视频)
# https://huggingface.co/alibaba-pai/EasyAnimateV5.1-12b-zh

# ModelScope(国内访问更快)
# https://modelscope.cn/models/PAI/EasyAnimateV5.1-12b-zh-InP

⚠️ 注意:12B 权重约 24 GB,下载前确认网络和磁盘空间。


核心用法

权重目录结构

models/
├── Diffusion_Transformer/
│   └── EasyAnimateV5.1-12b-zh-InP/   # 放入下载的权重
├── Motion_Module/                      # 如需自定义运动模块
└── Personalized_Model/                # 自训练 LoRA 权重

文生视频(Text-to-Video)

修改 predict_t2v.py 中的关键参数后运行:

# predict_t2v.py 中修改
prompt = "A beautiful sunset over the ocean, cinematic lighting"
neg_prompt = "blurry, low quality, distorted"
guidance_scale = 7.0
seed = 42
num_frames = 25  # 或 49(6 秒 / 8fps)

# 显存不足时,在文件顶部设置
gpu_memory_mode = "model_cpu_offload"  # 可选: model_cpu_offload / model_cpu_offload_and_qfloat8 / sequential_cpu_offload
python predict_t2v.py
# 输出保存在 samples/easyanimate-videos/

图生视频(Image-to-Video)

# predict_i2v.py 中修改
validation_image_start = "path/to/start_image.png"  # 起始图
validation_image_end = "path/to/end_image.png"      # 结束图(可与起始图相同)
prompt = "The character walks forward confidently"
neg_prompt = "blurry, distorted"
guidance_scale = 7.0
seed = 42
python predict_i2v.py
# 输出保存在 samples/easyanimate-videos_i2v/

控制生视频(Canny/Pose/Depth/轨迹)

# predict_v2v_control.py 中修改
control_video = "path/to/control_video.mp4"   # 控制视频(姿态/深度等提取)
validation_image_end = "path/to/first_frame.png"  # 参考起始图
prompt = "A woman dancing gracefully"
guidance_scale = 7.0
seed = 42
python predict_v2v_control.py
# 输出保存在 samples/easyanimate-videos_v2v_control/

ComfyUI 图形化操作(推荐)

EasyAnimate 提供完整 ComfyUI 节点,详情见 comfyui/README.md

cd comfyui
# 按 ComfyUI README 安装节点和模型

WebUI(Gradio)

# 直接运行 app.py 启动 Gradio 界面
python app.py
# 访问 http://localhost:7860

显存节省策略

V5/V5.1 参数规模大(7B/12B),官方提供三级显存节省模式:

模式 显存节省 速度 推荐场景
model_cpu_offload 中等 较快 24 GB 显卡(推荐)
model_cpu_offload_and_qfloat8 较多 中等 16 GB 显卡
sequential_cpu_offload 最大 极限低显存

⚠️ 已知限制:2080 Ti 和 V100 等不支持 torch.bfloat16 的显卡,需将 weight_dtype 改为 torch.float16(修改 app.py 和对应 predict 文件)。

A100 80GB 生成时间参考(25 steps,384×672):约 45 秒(1.75 s/it)


典型适用场景

  1. AI 视频内容创作:广告、短视频、社交媒体内容
  2. 游戏过场动画:生成游戏内 CG 片段或概念验证
  3. 数字人/虚拟主播:结合姿态控制生成说话/动作视频
  4. 电商视频生成:商品展示图生视频化
  5. 科研实验:Diffusion Transformer 视频生成的学术研究

坑与注意

⚠️ V100 用户必读:V100 不支持 bfloat16,运行时必须切换为 float16,否则报错。

⚠️ 权重路径严格:必须将权重文件放入 models/Diffusion_Transformer/EasyAnimateV5.1-*/ 目录,否则推理脚本报路径错误。

⚠️ shm-size 建议 200g:Docker 运行时默认共享内存偏小,视频帧处理可能爆内存,务必设置 --shm-size 200g

⚠️ 非最新架构:V5.1(2025.03)已集成 HuggingFace diffusers,但主分支仍是独立 Pipeline,升级前建议查看 diffusers PR 确认兼容性。

⚠️ 视频时长限制:目前最多 49 帧(~6 秒),长视频需自行拼接。

⚠️ 中文字符渲染:部分中文提示词在图生视频场景下效果不稳定,建议以英文为主或使用中文+英文混合。


与同类对比

方案 参数量 中文支持 控制类型 显存需求 许可证
EasyAnimate V5.1 7B/12B ✅ 深度 Canny/Pose/Depth/轨迹/相机 16GB+ Apache 2.0
CogVideoX (05b) 5B 有限 20GB+ Apache 2.0
ModelScope Tuner 有限 ModelScope
AnimateDiff ~1.5B 需搭配 ControlNet 8GB+ Apache 2.0
Stable Video Diffusion 1.5B 有限 12GB+ Stability AI

核心差异:EasyAnimate 是目前开源方案中控制类型最丰富的(支持相机轨迹控制),且有完整的训练 Pipeline;CogVideoX 更轻量适合快速推理;AnimateDiff 适合搭配已有 SD 模型。


一句话推荐结论

适合需要中英双语视频生成、且对姿态/轨迹/相机控制有强需求的用户;12B 大模型对显存要求较高,建议 40GB 以上显卡优先使用,16-24GB 用户可尝试 qfloat8 量化模式。