LTX 2.5 视频重绘指南(Video to Video):API 现状揭秘、ComfyUI 风格迁移工作流与免显卡方案

2026/08/18

如果你在搜索“LTX 2.5 Video to Video”或“LTX 2.5 视频生视频”,你很可能会遇到一个令人困惑的现象:一方面,社交平台上大量创作者展示了利用 LTX 2.5 实现的惊艳真人转动漫、赛博朋克重绘和动作迁移视频;但另一方面,当你打开 fal.ai、Replicate 等主流模型 API 托管平台时,却找不到任何名为“Video-to-Video”的独立接口。

LTX 2.5 到底原生支持视频重绘(Video to Video)吗?普通创作者如何利用 LTX 2.5 把已有视频转换成新风格?如果没有 24GB 显存的高性能显卡,又该如何体验?

本文将全面解答 LTX 2.5 在视频重绘领域的真实技术现状,提供开箱即用的本地 ComfyUI 工作流搭建指南,并为你提供云端免配置替代方案。

不想折腾复杂本地环境? 立即在浏览器中体验 LTX 2.5 极清 AI 视频生成 →。无需下载几十 GB 模型,零门槛生成影视级动态画面。

LTX 2.5 视频风格转换实测

核心真相:LTX 2.5 到底支持 Video to Video 吗?

结论:底层架构完全支持,但云端托管平台暂未开放单一的“一键式” API 端点。

目前不同平台和环境下对 LTX 2.5 视频重绘的支持现状对比如下:

平台 / 环境视频重绘(V2V)支持情况实际运行与实现机制
本地 ComfyUI / Diffusers完全支持通过加载原视频帧,利用 LTX 3D VAE 编码到 Latent 空间,结合提示词通过加噪重采样(Latent Denoise)生成全新风格视频。
云端 API(如 fal.ai、Replicate)无独立 V2V 端点平台目前仅提供标准化程度高的 文生视频(Text-to-Video)图生视频(Image-to-Video)音生视频(Audio-to-Video)
在线 Web 生成工具关键帧/首尾帧替代网页工具主要通过首尾帧过渡(FLF2V)或提示词复刻运镜,而非直接处理原始 MP4 视频流输入。

为什么 fal.ai 等云端平台没有直接提供 V2V 接口?

与图生视频只需处理一张固定比例图片不同,纯粹的视频转视频(Video-to-Video)需要服务端处理不同编码格式、帧率、长宽比的 MP4 视频,涉及耗算力的逐帧 3D VAE 编码及时间轴去噪对齐。此外,降噪强度(Denoise Strength)对不同原片极其敏感,极易产生画面闪烁或偏离预期。

因此,云端托管商优先上线了吞吐量大、确定性强的文生/图生接口;而真正的视频重绘与风格迁移,目前主要由开源社区通过 ComfyUI 节点链来实现。


LTX 2.5 视频重绘的底层技术原理

要在重绘过程中既保留原视频的人物动作与镜头轨迹,又完美切换画面风格,理解其背后的处理机制至关重要:

  1. 3D 时空 VAE 编码:LTX 2.5 采用因果 3D VAE,同时在空间(宽高)和时间(帧序列)两个维度对输入视频进行高倍率特征压缩。
  2. Latent 级加噪与重采样:将编码后的视频潜空间向量施加高斯噪声(由降噪幅度 Denoise 决定)。
  3. DiT 时空去噪:Diffusion Transformer 在文本提示词引导下,逐步去除噪声,在保留底层骨骼动作与相机运镜的同时,将像素材质替换为目标画风。
  4. 扩散解码器细节还原:LTX 2.5 全新的 Diffusion Video Decoder 负责最终帧重建,有效改善传统 VAE 导致的边缘模糊、面部崩坏与时间轴抖动。

本地 ComfyUI 搭建 LTX 2.5 视频重绘工作流

如果你的电脑配备了 12GB 以上显存的 NVIDIA 显卡(如 RTX 3080/4070/4090),可以通过 ComfyUI 轻松搭建专属的视频风格转换工作流。

必备节点与环境准备

请先在 ComfyUI Manager 中安装并更新以下扩展节点:

  • ComfyUI-LTXVideo(Lightricks 官方节点库)
  • ComfyUI-VideoHelperSuite(VHS,用于视频读取、抽帧与重组输出)
  • ComfyUI-GGUF(选装,用于在 8GB/12GB 显存设备上加载量化模型)

推荐节点连接管线

[VHS_LoadVideo (读取原视频 MP4)]


[LTXVideoVAEEncode (3D VAE 编码至 Latent 空间)]


[KSampler / LTXVSampler 采样器] ◄── [LTX 2.5 模型 (FP8 / GGUF)]
  • 降噪幅度 (Denoise): 0.50 - 0.65  ◄── [正向提示词 + Gemma 4 文本编码]
  • 采样步数 (Steps): 25 - 35        ◄── [负向提示词]
  • 引导系数 (CFG): 3.0 - 4.0


[LTXVideoVAEDecode (解码还原视频帧)]


[VHS_VideoCombine (导出风格化新 MP4)]

完整开箱即用 ComfyUI 工作流 JSON 模板

你可以直接复制下方 JSON 代码,保存为 ltx25_video_to_video.json,然后直接拖拽或通过 ComfyUI 右侧菜单的 Load 按钮导入:

{
  "last_node_id": 8,
  "last_link_id": 12,
  "nodes": [
    {
      "id": 1,
      "type": "CheckpointLoaderSimple",
      "pos": [40, 100],
      "size": [320, 100],
      "flags": {},
      "order": 0,
      "mode": 0,
      "inputs": [],
      "outputs": [
        { "name": "MODEL", "type": "MODEL", "links": [1], "slot_index": 0 },
        { "name": "CLIP", "type": "CLIP", "links": [2, 3], "slot_index": 1 },
        { "name": "VAE", "type": "VAE", "links": [4, 5], "slot_index": 2 }
      ],
      "widgets_values": ["ltx-2.5-fp8.safetensors"]
    },
    {
      "id": 2,
      "type": "VHS_LoadVideo",
      "pos": [40, 260],
      "size": [320, 220],
      "flags": {},
      "order": 1,
      "mode": 0,
      "inputs": [],
      "outputs": [
        { "name": "IMAGE", "type": "IMAGE", "links": [6], "slot_index": 0 },
        { "name": "frame_count", "type": "INT", "links": null },
        { "name": "audio", "type": "AUDIO", "links": [7], "slot_index": 2 }
      ],
      "widgets_values": {
        "video": "input_video.mp4",
        "force_rate": 24,
        "custom_width": 768,
        "custom_height": 512,
        "frame_load_cap": 97,
        "skip_first_frames": 0,
        "select_every_nth": 1
      }
    },
    {
      "id": 3,
      "type": "VAEEncode",
      "pos": [400, 300],
      "size": [220, 80],
      "flags": {},
      "order": 2,
      "mode": 0,
      "inputs": [
        { "name": "pixels", "type": "IMAGE", "link": 6 },
        { "name": "vae", "type": "VAE", "link": 4 }
      ],
      "outputs": [
        { "name": "LATENT", "type": "LATENT", "links": [8], "slot_index": 0 }
      ]
    },
    {
      "id": 4,
      "type": "CLIPTextEncode",
      "pos": [400, 80],
      "size": [360, 100],
      "flags": {},
      "order": 3,
      "mode": 0,
      "inputs": [{ "name": "clip", "type": "CLIP", "link": 2 }],
      "outputs": [
        {
          "name": "CONDITIONING",
          "type": "CONDITIONING",
          "links": [9],
          "slot_index": 0
        }
      ],
      "widgets_values": [
        "cinematic cyberpunk aesthetic, neon lights, rainy street, detailed face, keeping original motion"
      ]
    },
    {
      "id": 5,
      "type": "CLIPTextEncode",
      "pos": [400, 200],
      "size": [360, 80],
      "flags": {},
      "order": 4,
      "mode": 0,
      "inputs": [{ "name": "clip", "type": "CLIP", "link": 3 }],
      "outputs": [
        {
          "name": "CONDITIONING",
          "type": "CONDITIONING",
          "links": [10],
          "slot_index": 0
        }
      ],
      "widgets_values": [
        "blurry, deformed, low quality, static, frame jitter, oversaturated"
      ]
    },
    {
      "id": 6,
      "type": "KSampler",
      "pos": [800, 120],
      "size": [280, 260],
      "flags": {},
      "order": 5,
      "mode": 0,
      "inputs": [
        { "name": "model", "type": "MODEL", "link": 1 },
        { "name": "positive", "type": "CONDITIONING", "link": 9 },
        { "name": "negative", "type": "CONDITIONING", "link": 10 },
        { "name": "latent_image", "type": "LATENT", "link": 8 }
      ],
      "outputs": [
        { "name": "LATENT", "type": "LATENT", "links": [11], "slot_index": 0 }
      ],
      "widgets_values": [42, "fixed", 30, 3.5, "euler", "simple", 0.55]
    },
    {
      "id": 7,
      "type": "VAEDecodeTiled",
      "pos": [1120, 150],
      "size": [240, 100],
      "flags": {},
      "order": 6,
      "mode": 0,
      "inputs": [
        { "name": "samples", "type": "LATENT", "link": 11 },
        { "name": "vae", "type": "VAE", "link": 5 }
      ],
      "outputs": [
        { "name": "IMAGE", "type": "IMAGE", "links": [12], "slot_index": 0 }
      ],
      "widgets_values": [512]
    },
    {
      "id": 8,
      "type": "VHS_VideoCombine",
      "pos": [1400, 120],
      "size": [300, 260],
      "flags": {},
      "order": 7,
      "mode": 0,
      "inputs": [
        { "name": "images", "type": "IMAGE", "link": 12 },
        { "name": "audio", "type": "AUDIO", "link": 7 }
      ],
      "outputs": [],
      "widgets_values": {
        "frame_rate": 24,
        "loop_count": 0,
        "filename_prefix": "LTX25_V2V",
        "format": "video/h264-mp4",
        "pingpong": false,
        "save_output": true
      }
    }
  ],
  "links": [
    [1, 1, 0, 6, 0, "MODEL"],
    [2, 1, 1, 4, 0, "CLIP"],
    [3, 1, 1, 5, 0, "CLIP"],
    [4, 1, 2, 3, 1, "VAE"],
    [5, 1, 2, 7, 1, "VAE"],
    [6, 2, 0, 3, 0, "IMAGE"],
    [7, 2, 2, 8, 1, "AUDIO"],
    [8, 3, 0, 6, 3, "LATENT"],
    [9, 4, 0, 6, 1, "CONDITIONING"],
    [10, 5, 0, 6, 2, "CONDITIONING"],
    [11, 6, 0, 7, 0, "LATENT"],
    [12, 7, 0, 8, 0, "IMAGE"]
  ],
  "groups": [],
  "config": {},
  "extra": {},
  "version": 0.4
}

工作流使用说明:

  1. 模型准备:将 LTX 2.5 权重(如 ltx-2.5-fp8.safetensors)放入 ComfyUI/models/checkpoints/ 或对应 unet/ 目录;
  2. 导入工作流:将上述 JSON 文件拖入 ComfyUI 网页界面;
  3. 加载输入视频:在 VHS_LoadVideo 节点上传或选择你的本地短视频(建议时长 3-5 秒,768P 分辨率);
  4. 调整提示词与降噪:在正向提示词节点填入目标画风,在 KSampler 中根据需求调整 denoise(0.45 保持较多原貌,0.65 彻底重绘风格);
  5. 一键生成:点击 Queue Prompt 即可在 VHS_VideoCombine 节点实时预览并下载带有原音频的风格化新视频。

关键参数调优建议

参数项推荐取值作用与避坑技巧
降噪强度 (Denoise)0.45 - 0.55(轻度滤镜与光影重塑)
0.60 - 0.72(真人转动漫/赛博朋克重绘)
低于 0.4 几乎无风格变化;高于 0.75 会丢失原视频人物动作和一致性。
帧率 (FPS)24 或与原视频保持一致保持动作自然流畅,避免画面卡顿或抽搐。
采样步数 (Steps)25 - 30 步30 步在画质细腻度与生成速度之间达到最佳平衡。
引导系数 (CFG)3.0 - 4.5避免过高 CFG 导致画面色彩过饱和或边缘灼烧感。
输出分辨率768x5121024x576长宽数值必须为 32 的整数倍,否则 3D VAE 会直接报错。

经典风格转换提示词(Prompt)模板

在进行视频风格迁移时,建议采用 主体保留 + 目标艺术风格 + 光影与材质细节 的结构编写提示词:

1. 实拍真人转赛博朋克未来风

Prompt: A cinematic cyberpunk re-imagining of a person walking along a bustling city street at night. Neon blue and magenta light reflections on wet pavement, cybernetic HUD visor overlays, futuristic carbon-fiber jacket, volumetric steam, 8k cinematic lighting, photorealistic textures, retaining the original body movement and walking rhythm.

2. 真实场景转新海诚唯美动漫风

Prompt: High-end Makoto Shinkai anime aesthetic, hand-drawn 2D animation style, vibrant blue sky with soft cumulus clouds, warm golden hour lighting, clean cel-shaded character outlines, picturesque scenery, retaining smooth camera panning and original scene composition.

3. 定格黏土动画风(Claymation)

Prompt: Charming handcrafted stop-motion claymation style, plasticine clay textures with visible thumbprints, miniature studio lighting, playful tactile aesthetic, clean edges, keeping the exact action and pacing from the source video.


免显卡方案:无需高性能 GPU 如何实现类似效果?

如果本地没有 16GB+ 显存的高配设备,可以通过以下两种策略在云端高效达成目标:

策略 1:首尾帧抽取 + 图生视频(FLF2V)

  1. 从原视频中截取起始帧(第 1 帧)和结束帧;
  2. 将截图通过图像工具换装/风格化处理;
  3. 将两张图分别作为首帧和尾帧,上传至 在线图生视频生成器,由 LTX 2.5 自动补全中间连贯的过渡动作。

策略 2:基于多镜头指令的文本精准复刻

  1. 观察原视频的镜头语言(如“中景推近”、“特写转侧面”);
  2. 利用 LTX 2.5 强大的原生多镜头(Multi-shot)提示词解析能力,在 在线文生视频工具 中直接生成拥有相同镜头调度的全新视频。

常见报错与排查指南

1. 解码时报错显存溢出(CUDA Out of Memory)

  • 解决方法:在 ComfyUI 中勾选启用 Tiled VAE Decode(分块 VAE 解码),避免全量帧同时加载进显存。

2. 视频帧之间剧烈闪烁(Flicker)

  • 解决方法:将 Denoise 强度 下调至 0.55 以下;同时确保原视频光照充足、没有剧烈运动模糊。

3. 主体人物变形或动作漂移

  • 解决方法:适当降低 CFG(建议设为 3.0-3.5),并使用更简洁明确的正向提示词,避免堆砌互相冲突的风格词汇。

常见问题解答(FAQ)

fal.ai 以后会推出 LTX 2.5 Video-to-Video API 吗?

随着社区对视频重绘与画风迁移需求的增长,托管服务商可能会推出基于标准化参数的 V2V 管道。但截至目前,官方主推的仍是文生、图生(含首尾帧)和音生视频接口。

本地运行 LTX 2.5 视频重绘至少需要多大显存?

使用 GGUF Q4/Q8 量化版本时,12GB 显存(如 RTX 3060/4070)即可在 768P 分辨率下运行;若想使用全精度 FP8 模型及高质量扩散解码器,建议使用 16GB 至 24GB 显存 的显卡。

视频重绘时能保留原视频的声音吗?

LTX 2.5 原生支持音视频联合生成。在 ComfyUI 工作流中,可以通过 VHS_VideoCombine 节点将原始 MP4 的音频流直接复用混流到最终输出文件中。