
2026 年 8 月 11 日(当地时间),LTX 发布了开放权重(open weights)视频生成模型 LTX-2.5。ComfyUI 也宣布在首日即提供官方工作流支持。LTX 将这一系列模型定位为”世界模型(world model)”——不仅学习画面本身,还学习空间与运动行为的基础规律。据官方说明,相较上一代 LTX-2.3,LTX-2.5 的生成管线几乎被完全重写。
最大的卖点在于模型权重可以直接下载,素材与生成内容无需经过外部云服务商,可在自有硬件上运行;同时也支持使用自有数据进行微调(fine-tuning)或使用 LoRA(Low-Rank Adaptation)进行轻量调整。LTX 把”控制权留在本地”作为与封闭式 API 模型的核心差异来强调。
其他新增能力包括:跨镜头不易崩坏的原生多镜头生成(native multi-shot generation)、新的 Diffusion Fidelity Rendering(扩散保真渲染)、根据提示词自动决定时长的 Duration Head 等。官方还提到,LTX 系列累计下载量已超过 3,300 万,是目前使用最广泛的开放世界模型。
主要特性
Diffusion Fidelity Rendering
这是本次的核心渲染方式。首先在时间维度上压缩 8 倍的潜在空间(latent space)中构建动作与构图,同时生成高保真关键帧;关键帧数量会根据场景复杂度与可用算力动态增减,随后由专门的扩散渲染阶段基于结构与关键帧生成最终影像。计算资源会向信息密度更高的镜头倾斜,而非平均分配。
Diffusion Video Decoder
用基于扩散的解码器替代传统 VAE 解码阶段。官方称这能减少压缩过程中容易丢失的面部、纹理与屏幕文字细节,同时降低快速运动带来的残影与伪影,在保持高压缩率的同时减少后期修复工作。
原生多镜头生成(Native Multi-shot Generation)
一次生成可输出多个连续镜头,跨镜头保持角色、环境、灯光、声音与画面风格一致。此前版本一次只能输出单个连续镜头,制作序列时需要把多次生成结果手动拼接。
Gemma 4 12B 文本编码器
LTX-2.5 采用针对该模型定制的 Gemma 4 12B 作为文本编码器。官方表示,即使提示词包含多个主体、动作、灯光与摄像机指令,也不易遗漏中间元素。同时附带一个轻量的提示词增强器(prompt enhancer),可把简短提示词扩展为更详细的影像指令。
自动时长决定(Duration Head)
根据提示词中描述的动作自动估算剪辑长度,在扩散处理开始前确定帧数。结合提示词增强器后,需要手动调节的参数进一步减少。不过 ComfyUI 文档与 Hugging Face 模型卡均将其标注为”小规模实验性模型”或”可选节点”,并非强制启用。
4K HDR 与 ACES 工作流
原生 4K、同步音视频、最高 50fps 等特性从 LTX-2.3 延续下来。LTX-2.5 新增对 16bit 线性 HDR 数据的支持:可通过 EXR 以 ACES 标准直接读取,在保持动态范围的前提下输出,方便直接交给后期调色流程。官方页面也提到了对 RAW 的支持。
蒸馏(distilled)模型经过重新训练,能在固定 8 步、CFG=1 的设置下保留更多完整模型的画质、提示词跟随度与运动一致性。此外还发布了面向微调的 dev 基础检查点,方便用自有数据训练。
使用方法
LTX-2.5 主要通过 Hugging Face 下载权重、ComfyUI 与 LTX API 三种途径使用。也可以先在无需安装的 API Playground 体验。
模型文件构成
LTX-2.5 不是单一文件,而是由多个 safetensors 组件组合发布,文件名以 ltx-2.5-22b-... 开头,可推测为 22B(220 亿参数)规模。主要组件包括:
- Transformer(DiT):distilled / dev 的 bf16 版、ComfyUI 专用 int8 版、面向 Blackwell 的 NVFP4 版
- 文本编码器:gemma4-12b-with-proj(bf16 / ComfyUI 专用 int8)
- 视频 VAE:DiffVAE(高质量但较重)、Conv VAE(高速轻量)
- 音频 VAE + 声码器
- Duration Head
- 潜在上采样器:空间×2 / 时间×2
- 蒸馏 LoRA
注意:文件名带 comfy-int8-convrot 的为 ComfyUI 专用,无法通过 ltx-pipelines 等 PyTorch 路径加载;若用 Python 调用,请选择 bf16 版。
运行环境与限制
使用 Python 的 ltx-pipelines 时,推荐 Python 3.12 以上、CUDA 12.7 以上、PyTorch 2.7 前后版本。针对显存不足的环境,提供 --quantization fp8-cast 动态降精度与 --offload cpu CPU 卸载选项。LTX 与 NVIDIA 合作,针对 GeForce RTX GPU 与 DGX Spark 优化了本地推理,降低了内存需求。

LTX 与主要竞品在开放权重、可微调性、硬件要求及部署方式上的对比。
生成参数有以下限制:
- 帧数必须满足
num_frames % 8 == 1(例如 1、9、17…121…) - 宽与高必须能被 32 整除
- 省略
--num-frames时,Duration Head 会根据提示词自动决定时长
Diffusers 版本另见 Lightricks/LTX-2.5-Diffusers。截至本文撰写时,diffusers 正式版尚未包含 LTX-2.5 支持,需要从 GitHub mAIn 分支安装。
在训练方面,dev 版 Transformer 可用于训练,已公开的 LoRA 与 IC-LoRA 可通过 LTX-2 Trainer 复现。LTX-2.3 上训练的 LoRA 与 IC-LoRA 在 LTX-2.5 上”大部分可不经修改直接运行”,但官方建议在大规模投入生产前进行验证。
ComfyUI 使用
ComfyUI 从发布首日即支持 LTX-2.5。本地环境只需将 ComfyUI 更新到 0.32.0 以上,或使用 Comfy Cloud,即可获得文本到视频(T2V)、图像到视频(I2V)、首尾帧补间(FLF2V)三套官方工作流模板。
注意:Hugging Face 上的 LTX-2.5 模型仓库为 gate 仓库,需要先同意许可条款并等待访问申请通过,否则下载会失败。运行工作流前请提前完成此步骤。
三套工作流所用模型大体相同:I2V 与 T2V 配置一致,FLF2V 则不需要空间上采样器。典型目录结构如下:
ComfyUI/
└── models/
├── diffusion_models/
│ └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
├── text_encoders/
│ ├── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
│ └── gemma4_e2b_it_bf16.safetensors
├── vae/
│ ├── ltx-2.5-video-vae-bf16.safetensors
│ └── ltx-2.5-audio-vae-bf16.safetensors
└── latent_upscale_models/
└── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors
ComfyUI 官方文档给出的提示词建议:
- T2V:把镜头类型、场景、动作、人物、摄像机运动写成一段连续描述;写出需要的音效或台词;短提示词可交给提示词增强器自动扩展。
- I2V:只写输入画面之后发生的动作、运镜与声音,不必重复描述画面中已有的内容;可加上 “Use the provided start image as the first frame” 以固定首帧。
- FLF2V:描述两张帧之间发生的内容,包含运镜与声音;保持两张输入图的长宽比一致,补间会更平滑。
API 使用
如果不想自建环境,可直接使用 LTX API,按生成视频的秒数计费:
- 720p:$0.09 / 秒
- 1080p:$0.15 / 秒
- 2K:$0.19 / 秒
- 4K:$0.37 / 秒
生成速度

官方页面给出的参考数据是:在搭载 2 块 GB200 GPU 的本地环境中,720p 条件下生成 10 秒片段只需 6.8 秒。这一速度已快于实时回放,但需注意这是基于数据中心级双 GPU 的数值。API 版本的 1080p 端到端耗时约为 23.7 秒。
许可协议
LTX-2.5 在 LTX-2.x CommUnity License 下发布,年度经常性收入(ARR)低于 1,000 万美元的组织可免费用于商业与生产环境,且无需标注品牌。
ARR 达到 1,000 万美元以上的组织则需要购买包含完整权重、工程支持、LoRA 与灵活部署形态的商用许可。
对个人与小规模工作室而言门槛接近免费,但条款中有两点容易被忽略:
- 收入按整个组织计算,包括子公司及同一控制下的关联企业。
- 微调后模型的对外转让可能需要商用许可,自用与向外部交付成果的待遇不同。
具有法律约束力的是 LICENSE 原文,建议在业务使用前仔细阅读。模型卡同时列明:该模型不适合需要事实准确性的用途,可能放大既有社会偏见,提示词写法会显著影响跟随度,且可能生成不当内容。


评论留言