Lightricks/LTX-2 · 上手攻略

  • 仓库:Lightricks/LTX-2
  • 链接:https://github.com/Lightricks/LTX-2
  • 分类:ai
  • 作者:Jay
  • 更新:2026-07-12

是什么

LTX-2 是 Lightricks 开源的视频生成模型(当前版本 LTX-2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型:

  • 同步音视频生成(4K 视频 + 音频,一次扩散过程完成)
  • 原生 4K 50fps 输出
  • 完整开源权重 + 训练代码 + 推理工具,商用免费(年营收 10M USD 以下)

同时支持 ComfyUI 插件(ComfyUI-LTXVideo),以及 HuggingFace 生态。官方提供网页 Playground(console.ltx.video)和 API 接口。

解决什么问题

当前 AI 视频生成的三大痛点:质量天花板(闭源模型效果最好但无法私有部署)、版权不确定性(Sora/Runway 等对商业使用有限制)、硬件门槛过高(通常需要 A100 等高端 GPU)。LTX-2 一次性解决:

  • 质量上对标专业制作水准,4K + 音频开箱即用
  • 许可清晰(Apache 2.0 下的权重 + 完整训练代码),低于 10M ARR 免费商用
  • RTX 4090 或 RTX 5090 等消费级显卡即可运行(需 16GB VRAM,详见坑与注意)

快速安装

前置依赖

  • Python 3.10+
  • NVIDIA GPU(推荐 RTX 4090 / RTX 5090 或 Blackwell 架构 B200 等)
  • CUDA 12+(推荐 CUDA 12.8+)

克隆仓库

git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2

下载模型(通过 HuggingFace CLI)

需要先登录 HuggingFace 并同意模型条款:

pip install huggingface_hub
hf auth login

下载 LTX-2.3 蒸馏版检查点 + 空间超分模型 + Gemma 文本编码器:

hf download Lightricks/LTX-2.3 \
  ltx-2.3-22b-distilled-1.1.safetensors \
  ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
  --local-dir models/ltx-2.3

hf download google/gemma-3-12b-it-qat-q4_0-unquantized \
  --local-dir models/gemma-3-12b

⚠️ 如遇到 401/403 错误,需先在 HuggingFace 页面同意模型协议条款;如果是细粒度 Token,需开启 "Read gated repos" 权限。

核心用法

最快上手:蒸馏管道(推荐首次体验)

蒸馏版推理最快(8 步 stage-1 + 4 步 stage-2):

uv run python -m ltx_pipelines.distilled \
  --distilled-checkpoint-path models/ltx-2.3/ltx-2.3-22b-distilled-1.1.safetensors \
  --spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
  --gemma-root models/gemma-3-12b \
  --seed 42 \
  --output-path output.mp4 \
  --prompt "A medium close-up shot features a Caucasian man with a beard..."

⚠️ 注意:完整质量版本(TwoStagesPipeline)的 GPU 需求比蒸馏版更高,见下方显存说明。

质量优先:两步管道

uv run python -m ltx_pipelines.ti2vid_two_stages \
  --checkpoint-path models/ltx-2.3/ltx-2.3-22b-dev.safetensors \
  --spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
  --gemma-root models/gemma-3-12b \
  --distilled-lora-path models/ltx-2.3/ltx-2.3-22b-distilled-lora-384-1.1.safetensors \
  --prompt "你的完整视频描述(按时间顺序编写,包含动作、表情、镜头角度)" \
  --output-path output.mp4

其他常用管道

管道 用途 备注
TI2VidTwoStagesHQPipeline 高质量两步生成 使用二阶采样器,步数更少质量更高
TI2VidOneStagePipeline 单步快速原型 适合快速预览,无需超分
ICLoraPipeline 图生视频 / 视频生视频 使用蒸馏模型
A2VidPipelineTwoStage 音频驱动视频 输入 .wav/.mp3 生成匹配口型视频
LipDubPipeline 唇配音 / 改词 保持说话人音色 Identity
KeyframeInterpolationPipeline 关键帧插值 两张图之间平滑过渡
HDRICLoraPipeline HDR 视频输出 适合 EXR 格式导出

LoRA 个性化定制

从 HuggingFace 下载 LoRA 文件(如姿态控制、摄像机运动等),配合管道使用:

# 以姿态控制 LoRA 为例
uv run python -m ltx_pipelines.ic_lora \
  --checkpoint-path models/ltx-2.3/ltx-2.3-22b-dev.safetensors \
  --lora-path models/ltx-2.3-22b-IC-LoRA-Pose-Control/xxx.safetensors \
  --input-image-path input.jpg \
  --prompt "你的视频描述" \
  --output-path output.mp4

Python API 调用示例

from ltx_pipelines.distilled import DistilledPipeline

pipeline = DistilledPipeline(
    distilled_checkpoint="models/ltx-2.3/ltx-2.3-22b-distilled-1.1.safetensors",
    spatial_upsampler="models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors",
    gemma_root="models/gemma-3-12b",
)

result = pipeline.generate(
    prompt="A cinematic shot of a chef in a busy kitchen...",
    seed=42,
    output_path="output.mp4",
)

典型适用场景

  1. 短视频 / 广告制作:4K + 音频同步,一次生成可用于社交媒体发布
  2. 影视预览(Pre-vis):导演 / 分镜师快速生成参考镜头,降低沟通成本
  3. 游戏过场动画:LoRA 个性化角色动作和表情
  4. 唇配音本地化:将已有视频的语音替换为其他语言同时保持口型自然
  5. AI 内容工作流:配合 ComfyUI 接入已有图像 / 视频生成管线
  6. 音频驱动视频:音乐节奏视频、播客可视化等

坑与注意

显存需求

官方营销材料写"12GB VRAM 可运行",但这仅针对无音频的 1080p 基础版本音频同步 1080p 实际需要 ~16GB VRAM,4K 生成显存需求更高。实测:

  • 蒸馏版 1080p(无音频):RTX 4090 24GB 可运行
  • 蒸馏版 1080p + 音频同步:需 16GB+(Blackwell 架构更优)
  • 两步高质量 4K:建议 24GB+ VRAM 或多卡

显存优化选项

显存不足时,可使用以下参数(以 CLI 为例):

--quantization fp8-cast          # FP8 动态量化,降低显存占用
--offload cpu                    # 将部分层 offload 到 CPU(速度变慢)
--offload disk                   # offload 到磁盘(更慢,仅测试用)

在 Hopper GPU(如 H100/H200)上,可使用 --quantization fp8-scaled-mm,配合 FP8 检查点效果更好。

提示词技巧

README 明确建议:写提示词应像写分镜头脚本,按时间顺序详细描述动作、表情、镜头角度、环境、灯光,用单个流畅段落呈现。避免过度抽象概括,参考 官方提示词指南

可使用 enhance_prompt=True 参数开启自动提示词增强(由模型内置 GPT 辅助优化)。

Blackwell GPU 额外注意

在数据中心 Blackwell GPU(如 B200)上,如需安装 FlashAttention 4,需指定修订版:

uv pip install 'flash-attn-4==4.0.0b9'

此修订版与 torch 2.9.1+cu128 验证兼容;更新版本在消费级 Blackwell 上存在已知问题。

ComfyUI 支持

如使用 ComfyUI,请参考 ComfyUI-LTXVideo 官方节点,不在本仓库范围内。

与同类对比

维度 LTX-2 Runway Gen-3 Pika 2.0 CogVideoX Sora
开源 ✅ 完全开源 ❌ 闭源 API ❌ 闭源 API ✅ 开源 ❌ 闭源
4K 输出 ✅ 原生 4K 50fps ❌ 最高 1080p ❌ 最高 1080p ❌ 最高 1080p ✅ 4K
音频同步 ✅ 单次扩散生成 ❌ 需后期配音 ❌ 需后期配音
商用许可 ✅ <$10M ARR 免费 ❌ 付费订阅 ❌ 付费订阅 ✅ 开源
本地运行 ✅ RTX 4090 可跑 ❌ 仅 API ❌ 仅 API ⚠️ 需高配 GPU
LoRA 个性化 ✅ 丰富 LoRA 生态

一句话推荐结论

LTX-2 是 2026 年最具诚意的开源视频生成模型——4K + 音频同步一次搞定、完整开源权重可商用、消费级显卡跑得动,是 AI 视频从"玩具"走向"生产工具"的分水岭。如果你在做视频内容、IP 创作或广告制作,且需要私有部署 + 商业授权,LTX-2 是当前最优选择之一。


来源:GitHub README (Lightricks/LTX-2)、HuggingFace LTX-2.3AVB LTX-2 完全指南WaveSpeed BlogNVIDIA CES 2026 博客mlflow.org/releases

不确定处:VRAM 需求数据来自第三方测评(AVB Guide),与官方文档细节可能存在差异,建议以官方 README 最新版本为准;LoRA 个别文件路径需参照 HuggingFace 页面实际文件名。