Lightricks/LTX-2 · 上手攻略
- 仓库:Lightricks/LTX-2
- 链接:https://github.com/Lightricks/LTX-2
- 分类:ai
- 作者:Jay
- 更新:2026-07-12
是什么
LTX-2 是 Lightricks 开源的视频生成模型(当前版本 LTX-2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型:
- 同步音视频生成(4K 视频 + 音频,一次扩散过程完成)
- 原生 4K 50fps 输出
- 完整开源权重 + 训练代码 + 推理工具,商用免费(年营收 10M USD 以下)
同时支持 ComfyUI 插件(ComfyUI-LTXVideo),以及 HuggingFace 生态。官方提供网页 Playground(console.ltx.video)和 API 接口。
解决什么问题
当前 AI 视频生成的三大痛点:质量天花板(闭源模型效果最好但无法私有部署)、版权不确定性(Sora/Runway 等对商业使用有限制)、硬件门槛过高(通常需要 A100 等高端 GPU)。LTX-2 一次性解决:
- 质量上对标专业制作水准,4K + 音频开箱即用
- 许可清晰(Apache 2.0 下的权重 + 完整训练代码),低于 10M ARR 免费商用
- RTX 4090 或 RTX 5090 等消费级显卡即可运行(需 16GB VRAM,详见坑与注意)
快速安装
前置依赖
- Python 3.10+
- NVIDIA GPU(推荐 RTX 4090 / RTX 5090 或 Blackwell 架构 B200 等)
- CUDA 12+(推荐 CUDA 12.8+)
克隆仓库
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
下载模型(通过 HuggingFace CLI)
需要先登录 HuggingFace 并同意模型条款:
pip install huggingface_hub
hf auth login
下载 LTX-2.3 蒸馏版检查点 + 空间超分模型 + Gemma 文本编码器:
hf download Lightricks/LTX-2.3 \
ltx-2.3-22b-distilled-1.1.safetensors \
ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
--local-dir models/ltx-2.3
hf download google/gemma-3-12b-it-qat-q4_0-unquantized \
--local-dir models/gemma-3-12b
⚠️ 如遇到 401/403 错误,需先在 HuggingFace 页面同意模型协议条款;如果是细粒度 Token,需开启 "Read gated repos" 权限。
核心用法
最快上手:蒸馏管道(推荐首次体验)
蒸馏版推理最快(8 步 stage-1 + 4 步 stage-2):
uv run python -m ltx_pipelines.distilled \
--distilled-checkpoint-path models/ltx-2.3/ltx-2.3-22b-distilled-1.1.safetensors \
--spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
--gemma-root models/gemma-3-12b \
--seed 42 \
--output-path output.mp4 \
--prompt "A medium close-up shot features a Caucasian man with a beard..."
⚠️ 注意:完整质量版本(TwoStagesPipeline)的 GPU 需求比蒸馏版更高,见下方显存说明。
质量优先:两步管道
uv run python -m ltx_pipelines.ti2vid_two_stages \
--checkpoint-path models/ltx-2.3/ltx-2.3-22b-dev.safetensors \
--spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
--gemma-root models/gemma-3-12b \
--distilled-lora-path models/ltx-2.3/ltx-2.3-22b-distilled-lora-384-1.1.safetensors \
--prompt "你的完整视频描述(按时间顺序编写,包含动作、表情、镜头角度)" \
--output-path output.mp4
其他常用管道
| 管道 | 用途 | 备注 |
|---|---|---|
TI2VidTwoStagesHQPipeline |
高质量两步生成 | 使用二阶采样器,步数更少质量更高 |
TI2VidOneStagePipeline |
单步快速原型 | 适合快速预览,无需超分 |
ICLoraPipeline |
图生视频 / 视频生视频 | 使用蒸馏模型 |
A2VidPipelineTwoStage |
音频驱动视频 | 输入 .wav/.mp3 生成匹配口型视频 |
LipDubPipeline |
唇配音 / 改词 | 保持说话人音色 Identity |
KeyframeInterpolationPipeline |
关键帧插值 | 两张图之间平滑过渡 |
HDRICLoraPipeline |
HDR 视频输出 | 适合 EXR 格式导出 |
LoRA 个性化定制
从 HuggingFace 下载 LoRA 文件(如姿态控制、摄像机运动等),配合管道使用:
# 以姿态控制 LoRA 为例
uv run python -m ltx_pipelines.ic_lora \
--checkpoint-path models/ltx-2.3/ltx-2.3-22b-dev.safetensors \
--lora-path models/ltx-2.3-22b-IC-LoRA-Pose-Control/xxx.safetensors \
--input-image-path input.jpg \
--prompt "你的视频描述" \
--output-path output.mp4
Python API 调用示例
from ltx_pipelines.distilled import DistilledPipeline
pipeline = DistilledPipeline(
distilled_checkpoint="models/ltx-2.3/ltx-2.3-22b-distilled-1.1.safetensors",
spatial_upsampler="models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors",
gemma_root="models/gemma-3-12b",
)
result = pipeline.generate(
prompt="A cinematic shot of a chef in a busy kitchen...",
seed=42,
output_path="output.mp4",
)
典型适用场景
- 短视频 / 广告制作:4K + 音频同步,一次生成可用于社交媒体发布
- 影视预览(Pre-vis):导演 / 分镜师快速生成参考镜头,降低沟通成本
- 游戏过场动画:LoRA 个性化角色动作和表情
- 唇配音本地化:将已有视频的语音替换为其他语言同时保持口型自然
- AI 内容工作流:配合 ComfyUI 接入已有图像 / 视频生成管线
- 音频驱动视频:音乐节奏视频、播客可视化等
坑与注意
显存需求
官方营销材料写"12GB VRAM 可运行",但这仅针对无音频的 1080p 基础版本。音频同步 1080p 实际需要 ~16GB VRAM,4K 生成显存需求更高。实测:
- 蒸馏版 1080p(无音频):RTX 4090 24GB 可运行
- 蒸馏版 1080p + 音频同步:需 16GB+(Blackwell 架构更优)
- 两步高质量 4K:建议 24GB+ VRAM 或多卡
显存优化选项
显存不足时,可使用以下参数(以 CLI 为例):
--quantization fp8-cast # FP8 动态量化,降低显存占用
--offload cpu # 将部分层 offload 到 CPU(速度变慢)
--offload disk # offload 到磁盘(更慢,仅测试用)
在 Hopper GPU(如 H100/H200)上,可使用 --quantization fp8-scaled-mm,配合 FP8 检查点效果更好。
提示词技巧
README 明确建议:写提示词应像写分镜头脚本,按时间顺序详细描述动作、表情、镜头角度、环境、灯光,用单个流畅段落呈现。避免过度抽象概括,参考 官方提示词指南。
可使用 enhance_prompt=True 参数开启自动提示词增强(由模型内置 GPT 辅助优化)。
Blackwell GPU 额外注意
在数据中心 Blackwell GPU(如 B200)上,如需安装 FlashAttention 4,需指定修订版:
uv pip install 'flash-attn-4==4.0.0b9'
此修订版与 torch 2.9.1+cu128 验证兼容;更新版本在消费级 Blackwell 上存在已知问题。
ComfyUI 支持
如使用 ComfyUI,请参考 ComfyUI-LTXVideo 官方节点,不在本仓库范围内。
与同类对比
| 维度 | LTX-2 | Runway Gen-3 | Pika 2.0 | CogVideoX | Sora |
|---|---|---|---|---|---|
| 开源 | ✅ 完全开源 | ❌ 闭源 API | ❌ 闭源 API | ✅ 开源 | ❌ 闭源 |
| 4K 输出 | ✅ 原生 4K 50fps | ❌ 最高 1080p | ❌ 最高 1080p | ❌ 最高 1080p | ✅ 4K |
| 音频同步 | ✅ 单次扩散生成 | ❌ 需后期配音 | ❌ 需后期配音 | ❌ | ✅ |
| 商用许可 | ✅ <$10M ARR 免费 | ❌ 付费订阅 | ❌ 付费订阅 | ✅ 开源 | ❌ |
| 本地运行 | ✅ RTX 4090 可跑 | ❌ 仅 API | ❌ 仅 API | ⚠️ 需高配 GPU | ❌ |
| LoRA 个性化 | ✅ 丰富 LoRA 生态 | ❌ | ❌ | ✅ | ❌ |
一句话推荐结论
LTX-2 是 2026 年最具诚意的开源视频生成模型——4K + 音频同步一次搞定、完整开源权重可商用、消费级显卡跑得动,是 AI 视频从"玩具"走向"生产工具"的分水岭。如果你在做视频内容、IP 创作或广告制作,且需要私有部署 + 商业授权,LTX-2 是当前最优选择之一。
来源:GitHub README (Lightricks/LTX-2)、HuggingFace LTX-2.3、AVB LTX-2 完全指南、WaveSpeed Blog、NVIDIA CES 2026 博客、mlflow.org/releases
不确定处:VRAM 需求数据来自第三方测评(AVB Guide),与官方文档细节可能存在差异,建议以官方 README 最新版本为准;LoRA 个别文件路径需参照 HuggingFace 页面实际文件名。