LTX 2.5 正式发布:原生多镜头分镜、DFR 渲染与更强提示词控制

2026/08/13

LTX 2.5 现已全新重磅发布,这不仅是一次常规的模型权重微调更新,更是生成式 AI 视频领域的重大突破。Lightricks 将其定位为面向视频生成的开源世界模型,重点攻克了创作者在生成首帧画面后面临的深层难题:跨镜头连贯度、高速运动中的细节保持、复杂指令的准确执行,以及与专业影视后期工作流的无缝衔接。

本次更新的核心亮点包括:原生多镜头连贯生成扩散保真渲染 (DFR)、全新的扩散视频解码器、微调的 Gemma 4 12B 文本编码器、自动时长预测、原生 4K HDR/RAW 极清工作流,以及画质与效率大幅提升的蒸馏模型。

不想繁琐配置?想立即开启创作? 立即使用文本生成 LTX 2.5 AI 视频 →。无需下载庞大的本地模型,无需配置显卡环境,浏览器打开即用。

LTX 2.5 AI 视频生成

什么是 LTX 2.5?

LTX 2.5 是 Lightricks 最新推出的音视频统一基础大模型。它可以作为文生视频、图生视频、音效生视频、关键帧插帧、视频局部重绘、视频风格转换、HDR 高清输出及专业后期管线的强大引擎。

与封闭的纯网页端商业模型不同,LTX 2.5 以开源权重形式公开发布。开发者与技术团队可以通过 LTX 2.5 官方模型主页LTX-2 GitHub 官方仓库 以及 Hugging Face 模型仓库 下载模型组件并在自建基础设施上部署定制。

对于不想部署复杂本地环境的创作者,本平台在浏览器中直接提供了基于 LTX 2.5 的在线生成工具,涵盖 文生视频图生视频音效生视频

LTX 2.5 vs LTX 2.3:带来了哪些重大改变?

维度LTX 2.3LTX 2.5
镜头结构主要为单镜头生成单次生成原生连贯的多镜头场景切分
细节管线传统的多次超分放大切分DFR 关键帧、空间细节增强与时间轴优化
视频解码卷积 VAE 解码管线全新扩散视频解码器,高画质与轻量卷积可选
提示词理解基于 Gemma 3 的文本架构微调的 Gemma 4 12B 编码器与自定义增强器
时长选择需人工手动选择固定时长可选时长预测头,根据描述智能推荐最佳时长
专业输出高清音视频生成原生 4K HDR 及面向 RAW/EXR 的影视级管线
极速模式蒸馏快速迭代生成更新更优秀的蒸馏模型,兼顾画质与生成速度

实际使用中的关键转变在于:从生成一段仅外观好看的孤立短片,升级为构建可控性极高的连贯镜号序列。LTX 2.5 赋予了导演与创意团队在多镜头间保持创作意图的能力。

1. 原生多镜头分镜生成 (Native Multi-Shot Generation)

多镜头生成是 LTX 2.5 最直观的革新特性。在单次生成中,模型可以自动切分多个关联镜头,同时完美保持角色人设、环境场景、光影风格及配音音色的一致性。

过去拼接独立生成的片段往往会导致连贯性失真:转场后夹克变色、房间布局变动、主光方向偏移或配音音色突变。原生多镜头生成使模型能够站在整段连贯序列的高度去推理,而非将每个镜头拆解为孤立请求。

推荐的提示词写作方式是按时间顺序描述短序列。例如:

夜晚,一名穿着红色雨衣的女子站在霓虹灯招牌下等待。全景建立镜头,大雨倾盆。切至特写镜头,她听到自行车铃声并向左转头。切至过肩镜头,一名骑自行车的人在她身旁停下。在所有镜头中保持她的面部、红色雨衣、蓝紫色灯光、降雨强度和自然都市环境音高度一致。

在提示词中建议根据设定时长安排合理的镜头数量,一般 2~3 个分镜能让每个动作有足够的展现时间。

2. 扩散保真渲染 (Diffusion Fidelity Rendering, DFR)

LTX 2.5 引入了 扩散保真渲染 (DFR) 机制,这是一种根据场景区域复杂度按需分配算力的渲染方法。官方 DFR 管线通过生成关键帧、执行空间细节处理,并结合时间轴放大器进行平滑优化。

LTX 2.5 扩散保真渲染 (DFR)

这意味着算力被用在了最关键的刀刃上:静态背景易于处理,而运动的人物面部、高反光材质、快速运镜或清晰文字则极难保留。DFR 集中算力精雕细琢视觉瑕疵最明显的区域,使动态过程中的细节依然稳健逼真。

3. 全新视频解码器带来的流畅运动

LTX 2.5 的视频 VAE 现已提供全新的扩散解码器。官方仓库显示,该解码器通过消耗适度的解码时间与显存,换取了更高的画质与细节还原度,同时也保留了轻量级的卷积解码器供较低配置使用。

在实际表现中,新解码器有效解决了视频动态中常见的痛点:面部抖动扭曲、纹理爬行、文字变形、材质闪烁及边缘模糊。它的目的不仅仅是让静态单帧更清晰,而是让画质细节能在时间流转中平滑延续。

4. 基于 Gemma 4 的更强提示词理解

LTX 2.5 采用了微调的 Gemma 4 12B 编码器和自定义提示词增强器,显著提升了模型将简洁自然语言转化为有序动作、镜头轨迹、视觉连贯性及音效指令的能力。

撰写提示词时建议采用类似导演指挥的方式:

  1. 先写核心主体与主要动作。
  2. 按时间先后顺序描述动作步骤。
  3. 明确指定构图景别与镜头运镜。
  4. 锁定人设、服装、环境及光影细节。
  5. 添加相关的对话、环境音、音效及背景音乐提示。
  6. 说明跨分镜时哪些元素必须保持一致。

立即尝试提示词生成: 打开 LTX 2.5 文生视频生成器 →,选择 Fast 快速模式碰撞灵感,或选择 Pro 模式追求极佳交付画质。

5. 自动时长预测与高效迭代

内置可选的时长预测头可以根据描述的动作复杂度智能预测最合适的片段长度。简单的表情反应保持短小精悍,而复杂的连贯动作则有足够的画幅时长流畅展示完成。

此外,LTX 2.5 搭载了升级版的蒸馏模型。在需要快速试错或批量碰撞灵感时,蒸馏模型仅需较少的扩散步骤即可快速输出结果,非常适合早期创作。

6. 原生 4K HDR、RAW 与 EXR 影视级工作流

面向专业影视制作管线,LTX 2.5 增加了原生 4K HDR 生成,并支持线性图像数据处理。本地管线支持导入 EXR 序列帧、在 HDR 色彩空间中工作,并导出 EXR 帧及 HDR 母版,便于后期调色与合成。

这些特性对于 VFX 特效与专业调色至关重要,因为它们保留了比普通 SDR 视频丰富得多的光影与色彩信息。

在在线平台体验 LTX 2.5 的三种方式

文生视频 (Text to Video)

使用 LTX 2.5 文生视频,只需输入一段创意文案、剧本切片或产品概念,即可快速测试构图、镜头语言、氛围与动态。

图生视频 (Image to Video)

使用 LTX 2.5 图生视频,上传一张参考图作为起始帧,描述画面动态,还可选择性添加结尾帧来精确控制镜头落点。

音效生视频 (Audio to Video)

使用 LTX 2.5 音效生视频,上传 2–20 秒音频,结合文字描述,让视频画面围绕声音的节奏与情绪自动生成。

本地部署还是在线使用?

  • 本地部署:适合需要深度管线控制、自定义 LoRA 训练、DFR 细调、EXR/HDR 调色交付或私有化部署的技术团队。官方提示完整本地组件约需 66 GiB 存储空间及较高显存配置。
  • 在线平台:适合希望快速将想法转化为视频、无需下载数十 GB 模型权重或配置 CUDA 显卡环境的创作者。

总结

LTX 2.5 解决了 AI 视频创作中最核心的痛点:分镜连贯性、细节持久度、更强的指令响应以及专业级的输出能力。原生多镜头分镜与 DFR 渲染是其最具革新意义的升级,结合 Gemma 4 提示词理解与高效的生成模式,使 LTX 2.5 成为兼具创意探索与实际生产力的强力工具。

开启您的第一个 LTX 2.5 视频创作: 从文本开始生成 → | 让图片动起来 → | 从音频生成画面 →