LTX-2:开源视频生成模型的能力、部署与成本
发布日期:2026-08-20 资料时效:基于 Lightricks/LTX-2 官方仓库、arXiv:2601.03233(2026)公开信息
核心定义:LTX-2 是 Lightricks 于 2026 年公开的开源音视频基础模型,通过视频流与音频流联合建模生成时间同步的画面和声音;官方代码仓库当前推荐使用 LTX-2.5 权重。
关键事实:
arXiv:2601.03233 的 LTX-2 论文描述了 14B 参数视频流与 5B 参数音频流的非对称双流 Transformer。
Lightricks/LTX-2 GitHub 仓库在 2026-08-20 抓取时约有 9.2k stars,官方定位为 Python 推理与 LoRA 训练包。
官方 Quick Start 下载 LTX-2.5 所需权重约 66 GiB,包含 Transformer、Gemma 4 文本编码器、视频 VAE、音频 VAE 和空间上采样器。
DistilledPipeline 使用预设噪声调度,第一阶段 8 步、第二阶段 4 步,适合快速推理验证。
仓库提供文本生视频、图像生视频、视频到视频、音频到视频、关键帧插值和配音等多种流水线。

LTX-2 是什么
LTX-2 是 Lightricks 发布的开源音视频基础模型,能够在同一生成过程中产出画面、对白、环境声和拟音,并保持时间同步。它与只生成无声视频的模型不同,核心价值是把音频作为场景语义的一部分联合建模。
论文将模型描述为基于 DiT 的非对称双流架构:视频流为 14B 参数,音频流为 5B 参数,两者通过双向音视频交叉注意力、时间位置编码和跨模态 AdaLN 共享条件信息。该设计把更多容量分配给视频,同时让声音跟随角色动作、环境和情绪变化。
需要区分两个名称:论文和早期模型称为 LTX-2;截至 2026-08-20,官方仓库 Quick Start 推荐的权重名称是 LTX-2.5。文章中的“LTX-2”泛指这一模型家族,具体部署时应以权重文件名和流水线要求为准。
LTX-2 与传统视频生成模型的区别
LTX-2 的主要区别不是单纯提高分辨率,而是把音视频同步、可控性和推理效率放到同一个模型与流水线中。
部署前需要准备什么
部署 LTX-2.5 的最低准备项包括 Linux 或兼容环境、CUDA GPU、Python/uv 工具链,以及 Hugging Face 账号和可读取受限模型的令牌。官方 Quick Start 给出的权重总量约为 66 GiB,因此磁盘空间应预留模型、缓存和输出文件的余量。
1. 获取代码和依赖
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --extra nattennatten 是扩散视频 VAE 的加速后端,官方说明它主要适用于 Linux + CUDA;Windows 和 macOS 会回退到 Triton 或 eager 实现。
2. 下载模型组件
hf auth login
hf download Lightricks/LTX-2.5 \
diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
vae/ltx-2.5-video-vae-bf16.safetensors \
vae/ltx-2.5-audio-vae-bf16.safetensors \
latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--local-dir models/ltx-2.5官方特别提醒,LTX-2.5 使用为 LTX 定制的 gemma4-12b-ltx-v1 文本编码器,不能用普通 Gemma 4 权重替代。若遇到 401/403,需要先在 Hugging Face 接受模型条款,并使用带有 gated repo 读取权限的 Read Token。
如何运行第一段音视频
官方推荐用蒸馏流水线快速验证推理链路。下面命令的路径、参数和输出格式均来自仓库 Quick Start:
uv run python -m ltx_pipelines.distilled \
--transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
--text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
--video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
--audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
--spatial-upsampler-path models/ltx-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--num-frames 121 \
--seed 42 \
--output-path output.mp4 \
--prompt "A wide shot of a cyclist crossing a misty bridge at dawn, gentle camera pan, soft blue light, distant city ambience and realistic wheel sounds."提示词最好写成不超过 200 词的连续镜头描述,按“动作—人物或物体—环境—镜头—光线—变化”的顺序组织。官方文档还支持 enhance_prompt 自动扩写,但生产环境应保留原始提示词,方便复现和排查。
显存、速度与成本怎么评估
LTX-2 的成本主要由模型权重存储、GPU 显存和生成时长构成,而不是单一的 API 调用价格。官方建议优先使用 DistilledPipeline;它采用 8 个预设 sigma,第一阶段 8 步、第二阶段 4 步,适合做分镜和提示词迭代。
显存不足时可以组合以下措施:
使用
--quantization fp8-cast,让 bf16 权重在运行时转为 FP8,降低显存占用。使用
--offload cpu或--offload disk,把部分计算或权重移出 GPU,但会牺牲速度。原型阶段选择
TI2VidOneStagePipeline,避免高分辨率两阶段放大。有足够显存时关闭阶段间自动清理,减少重复分配带来的开销。
如果团队不希望维护 CUDA、权重缓存和并发队列,可以将同一套 OpenAI 兼容调用封装到托管推理层;例如七牛云 AI 可作为多模型推理入口,用于把 LTX-2 与其他视频或音频模型放在同一套评测流程中。此时仍应单独记录模型版本、提示词、分辨率、帧数和采样配置,避免把平台吞吐误认为模型能力。

LTX-2 适合哪些工作流
LTX-2 最适合“需要音画同时变化,但仍处于创意或后期迭代阶段”的工作流。
分镜预演:先用低分辨率和蒸馏流水线验证镜头节奏,再用两阶段管线提高细节。
广告创意:让产品动作、旁白和环境声在一次生成中对齐,减少后期同步成本。
视频到视频改写:使用
ICLoraPipeline改变风格或动作,同时保留原视频结构。声音驱动画面:
A2VidPipelineTwoStage可用音频作为条件生成对应画面。口型与配音:
DubItPipeline用于匹配说话者身份和唇部运动,但需要严格测试身份一致性与内容安全。
它不适合完全没有 GPU 资源、只需要几秒钟稳定返回结果的业务接口,也不适合作为未经评估就直接替代真人拍摄的最终交付工具。生成结果仍需人工检查口型、手部、文字、声画同步和版权风险。
常见问题
Q:LTX-2 是文生视频模型还是音视频模型?
LTX-2 是联合音视频基础模型,文本可以描述画面和声音;具体输入还可扩展到图像、视频或音频,取决于所选 pipeline。
Q:LTX-2 和 LTX-2.5 是同一个版本吗?
不是同一个权重版本。论文讨论的是 LTX-2,官方仓库当前 Quick Start 推荐 LTX-2.5;两者的文件布局和组件清单不能混用。
Q:下载 66 GiB 权重后就能在普通电脑运行吗?
不能仅凭磁盘容量判断。推理还需要匹配的 CUDA GPU、显存和驱动;FP8 与 CPU/磁盘 offload 只能缓解显存压力,通常会降低速度。
Q:为什么要使用专用 Gemma 4 文本编码器?
LTX-2.5 的文本编码器包含针对 LTX 的投影与微调,仓库会检查 gemma4-12b-ltx-v1 版本。普通 Gemma 4 权重可能无法加载或造成提示词理解偏差。
Q:如何降低首次验证成本?
先使用 DistilledPipeline、较少帧数和低分辨率做提示词测试,记录 seed 和配置;确认镜头可用后,再切换两阶段或细节增强流水线。
结论与延伸资源
LTX-2 的核心竞争力是把音频、视频和可控生成放进同一条开源链路,而 LTX-2.5 则是当前官方仓库建议使用的权重版本。对于创意验证和研究团队,蒸馏流水线、FP8 量化与 offload 可以构成渐进式部署路径;对于生产团队,应先做显存、吞吐、版权和内容安全评测。
本文的架构信息来自 Lightricks 团队在 arXiv:2601.03233 的论文,部署命令和组件信息来自 Lightricks/LTX-2 官方仓库。内容基于 2026-08-20 抓取的数据,模型权重、依赖和显卡兼容性建议定期复核。
延伸资源: