全部模型资源
  • 全部模型资源
  • - 交通工具
  • - 动物昆虫
  • - 场景\道具模型
  • - 建筑模型
  • - 植物模型
  • - 武器模型
  • - 独家资源库
  • - 科幻模型
  • - 角色动画库
  • - 角色模型
  • 游戏开发知识博客

LTX 发布开放权重视频生成模型 LTX-2.5:支持原生多镜头生成

LTX-2.5 官方宣传图,中央显示 Ltx 2.5 字样,周围环绕多段 AI 生成的演示视频画面
LTX-2.5 官方宣传

2026 年 8 月 11 日(当地时间),LTX 发布了开放权重(open weights)视频生成模型 LTX-2.5。ComfyUI 也宣布在首日即提供官方工作流支持。LTX 将这一系列模型定位为”世界模型(world model)”——不仅学习画面本身,还学习空间与运动行为的基础规律。据官方说明,相较上一代 LTX-2.3,LTX-2.5 的生成管线几乎被完全重写。

最大的卖点在于模型权重可以直接下载,素材与生成内容无需经过外部云服务商,可在自有硬件上运行;同时也支持使用自有数据进行微调(fine-tuning)或使用 LoRA(Low-Rank Adaptation)进行轻量调整。LTX 把”控制权留在本地”作为与封闭式 API 模型的核心差异来强调。

其他新增能力包括:跨镜头不易崩坏的原生多镜头生成(native multi-shot generation)、新的 Diffusion Fidelity Rendering(扩散保真渲染)、根据提示词自动决定时长的 Duration Head 等。官方还提到,LTX 系列累计下载量已超过 3,300 万,是目前使用最广泛的开放世界模型。

主要特性

Diffusion Fidelity Rendering

这是本次的核心渲染方式。首先在时间维度上压缩 8 倍的潜在空间(latent space)中构建动作与构图,同时生成高保真关键帧;关键帧数量会根据场景复杂度与可用算力动态增减,随后由专门的扩散渲染阶段基于结构与关键帧生成最终影像。计算资源会向信息密度更高的镜头倾斜,而非平均分配。

Diffusion Video Decoder

用基于扩散的解码器替代传统 VAE 解码阶段。官方称这能减少压缩过程中容易丢失的面部、纹理与屏幕文字细节,同时降低快速运动带来的残影与伪影,在保持高压缩率的同时减少后期修复工作。

原生多镜头生成(Native Multi-shot Generation)

一次生成可输出多个连续镜头,跨镜头保持角色、环境、灯光、声音与画面风格一致。此前版本一次只能输出单个连续镜头,制作序列时需要把多次生成结果手动拼接。

Gemma 4 12B 文本编码器

LTX-2.5 采用针对该模型定制的 Gemma 4 12B 作为文本编码器。官方表示,即使提示词包含多个主体、动作、灯光与摄像机指令,也不易遗漏中间元素。同时附带一个轻量的提示词增强器(prompt enhancer),可把简短提示词扩展为更详细的影像指令。

自动时长决定(Duration Head)

根据提示词中描述的动作自动估算剪辑长度,在扩散处理开始前确定帧数。结合提示词增强器后,需要手动调节的参数进一步减少。不过 ComfyUI 文档与 Hugging Face 模型卡均将其标注为”小规模实验性模型”或”可选节点”,并非强制启用。

4K HDR 与 ACES 工作流

原生 4K、同步音视频、最高 50fps 等特性从 LTX-2.3 延续下来。LTX-2.5 新增对 16bit 线性 HDR 数据的支持:可通过 EXR 以 ACES 标准直接读取,在保持动态范围的前提下输出,方便直接交给后期调色流程。官方页面也提到了对 RAW 的支持。

蒸馏模型更新与微调检查点

蒸馏(distilled)模型经过重新训练,能在固定 8 步、CFG=1 的设置下保留更多完整模型的画质、提示词跟随度与运动一致性。此外还发布了面向微调的 dev 基础检查点,方便用自有数据训练。

使用方法

LTX-2.5 主要通过 Hugging Face 下载权重、ComfyUI 与 LTX API 三种途径使用。也可以先在无需安装的 API Playground 体验。

模型文件构成

LTX-2.5 不是单一文件,而是由多个 safetensors 组件组合发布,文件名以 ltx-2.5-22b-... 开头,可推测为 22B(220 亿参数)规模。主要组件包括:

  • Transformer(DiT):distilled / dev 的 bf16 版、ComfyUI 专用 int8 版、面向 Blackwell 的 NVFP4 版
  • 文本编码器:gemma4-12b-with-proj(bf16 / ComfyUI 专用 int8)
  • 视频 VAE:DiffVAE(高质量但较重)、Conv VAE(高速轻量)
  • 音频 VAE + 声码器
  • Duration Head
  • 潜在上采样器:空间×2 / 时间×2
  • 蒸馏 LoRA

注意:文件名带 comfy-int8-convrot 的为 ComfyUI 专用,无法通过 ltx-pipelines 等 PyTorch 路径加载;若用 Python 调用,请选择 bf16 版。

运行环境与限制

使用 Python 的 ltx-pipelines 时,推荐 Python 3.12 以上、CUDA 12.7 以上、PyTorch 2.7 前后版本。针对显存不足的环境,提供 --quantization fp8-cast 动态降精度与 --offload cpu CPU 卸载选项。LTX 与 NVIDIA 合作,针对 GeForce RTX GPU 与 DGX Spark 优化了本地推理,降低了内存需求。

LTX 与 MiniMax H3、Seedance、Kling、Veo、Grok 等视频生成模型在开放权重、微调、GPU 要求、部署方式等方面的对比表

LTX 与主要竞品在开放权重、可微调性、硬件要求及部署方式上的对比。

生成参数有以下限制:

  • 帧数必须满足 num_frames % 8 == 1(例如 1、9、17…121…)
  • 宽与高必须能被 32 整除
  • 省略 --num-frames 时,Duration Head 会根据提示词自动决定时长

Diffusers 版本另见 Lightricks/LTX-2.5-Diffusers。截至本文撰写时,diffusers 正式版尚未包含 LTX-2.5 支持,需要从 GitHub mAIn 分支安装。

在训练方面,dev 版 Transformer 可用于训练,已公开的 LoRA 与 IC-LoRA 可通过 LTX-2 Trainer 复现。LTX-2.3 上训练的 LoRA 与 IC-LoRA 在 LTX-2.5 上”大部分可不经修改直接运行”,但官方建议在大规模投入生产前进行验证。

ComfyUI 使用

ComfyUI 从发布首日即支持 LTX-2.5。本地环境只需将 ComfyUI 更新到 0.32.0 以上,或使用 Comfy Cloud,即可获得文本到视频(T2V)、图像到视频(I2V)、首尾帧补间(FLF2V)三套官方工作流模板。

注意:Hugging Face 上的 LTX-2.5 模型仓库为 gate 仓库,需要先同意许可条款并等待访问申请通过,否则下载会失败。运行工作流前请提前完成此步骤。

三套工作流所用模型大体相同:I2V 与 T2V 配置一致,FLF2V 则不需要空间上采样器。典型目录结构如下:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
    ├── text_encoders/
    │   ├── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
    │   └── gemma4_e2b_it_bf16.safetensors
    ├── vae/
    │   ├── ltx-2.5-video-vae-bf16.safetensors
    │   └── ltx-2.5-audio-vae-bf16.safetensors
    └── latent_upscale_models/
        └── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors

ComfyUI 官方文档给出的提示词建议:

  • T2V:把镜头类型、场景、动作、人物、摄像机运动写成一段连续描述;写出需要的音效或台词;短提示词可交给提示词增强器自动扩展。
  • I2V:只写输入画面之后发生的动作、运镜与声音,不必重复描述画面中已有的内容;可加上 “Use the provided start image as the first frame” 以固定首帧。
  • FLF2V:描述两张帧之间发生的内容,包含运镜与声音;保持两张输入图的长宽比一致,补间会更平滑。

API 使用

如果不想自建环境,可直接使用 LTX API,按生成视频的秒数计费:

  • 720p:$0.09 / 秒
  • 1080p:$0.15 / 秒
  • 2K:$0.19 / 秒
  • 4K:$0.37 / 秒

生成速度

LTX-2.5 与主流视频生成模型的速度与视觉质量对比图,LTX-2.5 在生成速度和缺陷率上均领先
LTX-2.5 与竞品的速度(左)与视觉质量(右)基准对比,数值越低越好。

官方页面给出的参考数据是:在搭载 2 块 GB200 GPU 的本地环境中,720p 条件下生成 10 秒片段只需 6.8 秒。这一速度已快于实时回放,但需注意这是基于数据中心级双 GPU 的数值。API 版本的 1080p 端到端耗时约为 23.7 秒。

许可协议

LTX-2.5 在 LTX-2.x CommUnity License 下发布,年度经常性收入(ARR)低于 1,000 万美元的组织可免费用于商业与生产环境,且无需标注品牌。

ARR 达到 1,000 万美元以上的组织则需要购买包含完整权重、工程支持、LoRA 与灵活部署形态的商用许可。

对个人与小规模工作室而言门槛接近免费,但条款中有两点容易被忽略:

  • 收入按整个组织计算,包括子公司及同一控制下的关联企业。
  • 微调后模型的对外转让可能需要商用许可,自用与向外部交付成果的待遇不同。

具有法律约束力的是 LICENSE 原文,建议在业务使用前仔细阅读。模型卡同时列明:该模型不适合需要事实准确性的用途,可能放大既有社会偏见,提示词写法会显著影响跟随度,且可能生成不当内容。

评论留言