如果你在搜索“LTX 2.5 Video to Video”或“LTX 2.5 视频生视频”,你很可能会遇到一个令人困惑的现象:一方面,社交平台上大量创作者展示了利用 LTX 2.5 实现的惊艳真人转动漫、赛博朋克重绘和动作迁移视频;但另一方面,当你打开 fal.ai、Replicate 等主流模型 API 托管平台时,却找不到任何名为“Video-to-Video”的独立接口。
LTX 2.5 到底原生支持视频重绘(Video to Video)吗?普通创作者如何利用 LTX 2.5 把已有视频转换成新风格?如果没有 24GB 显存的高性能显卡,又该如何体验?
本文将全面解答 LTX 2.5 在视频重绘领域的真实技术现状,提供开箱即用的本地 ComfyUI 工作流搭建指南,并为你提供云端免配置替代方案。
不想折腾复杂本地环境? 立即在浏览器中体验 LTX 2.5 极清 AI 视频生成 →。无需下载几十 GB 模型,零门槛生成影视级动态画面。

核心真相:LTX 2.5 到底支持 Video to Video 吗?
结论:底层架构完全支持,但云端托管平台暂未开放单一的“一键式” API 端点。
目前不同平台和环境下对 LTX 2.5 视频重绘的支持现状对比如下:
| 平台 / 环境 | 视频重绘(V2V)支持情况 | 实际运行与实现机制 |
|---|---|---|
| 本地 ComfyUI / Diffusers | 完全支持 | 通过加载原视频帧,利用 LTX 3D VAE 编码到 Latent 空间,结合提示词通过加噪重采样(Latent Denoise)生成全新风格视频。 |
| 云端 API(如 fal.ai、Replicate) | 无独立 V2V 端点 | 平台目前仅提供标准化程度高的 文生视频(Text-to-Video)、图生视频(Image-to-Video) 与 音生视频(Audio-to-Video)。 |
| 在线 Web 生成工具 | 关键帧/首尾帧替代 | 网页工具主要通过首尾帧过渡(FLF2V)或提示词复刻运镜,而非直接处理原始 MP4 视频流输入。 |
为什么 fal.ai 等云端平台没有直接提供 V2V 接口?
与图生视频只需处理一张固定比例图片不同,纯粹的视频转视频(Video-to-Video)需要服务端处理不同编码格式、帧率、长宽比的 MP4 视频,涉及耗算力的逐帧 3D VAE 编码及时间轴去噪对齐。此外,降噪强度(Denoise Strength)对不同原片极其敏感,极易产生画面闪烁或偏离预期。
因此,云端托管商优先上线了吞吐量大、确定性强的文生/图生接口;而真正的视频重绘与风格迁移,目前主要由开源社区通过 ComfyUI 节点链来实现。
LTX 2.5 视频重绘的底层技术原理
要在重绘过程中既保留原视频的人物动作与镜头轨迹,又完美切换画面风格,理解其背后的处理机制至关重要:
- 3D 时空 VAE 编码:LTX 2.5 采用因果 3D VAE,同时在空间(宽高)和时间(帧序列)两个维度对输入视频进行高倍率特征压缩。
- Latent 级加噪与重采样:将编码后的视频潜空间向量施加高斯噪声(由降噪幅度 Denoise 决定)。
- DiT 时空去噪:Diffusion Transformer 在文本提示词引导下,逐步去除噪声,在保留底层骨骼动作与相机运镜的同时,将像素材质替换为目标画风。
- 扩散解码器细节还原:LTX 2.5 全新的 Diffusion Video Decoder 负责最终帧重建,有效改善传统 VAE 导致的边缘模糊、面部崩坏与时间轴抖动。
本地 ComfyUI 搭建 LTX 2.5 视频重绘工作流
如果你的电脑配备了 12GB 以上显存的 NVIDIA 显卡(如 RTX 3080/4070/4090),可以通过 ComfyUI 轻松搭建专属的视频风格转换工作流。
必备节点与环境准备
请先在 ComfyUI Manager 中安装并更新以下扩展节点:
ComfyUI-LTXVideo(Lightricks 官方节点库)ComfyUI-VideoHelperSuite(VHS,用于视频读取、抽帧与重组输出)ComfyUI-GGUF(选装,用于在 8GB/12GB 显存设备上加载量化模型)
推荐节点连接管线
[VHS_LoadVideo (读取原视频 MP4)]
│
▼
[LTXVideoVAEEncode (3D VAE 编码至 Latent 空间)]
│
▼
[KSampler / LTXVSampler 采样器] ◄── [LTX 2.5 模型 (FP8 / GGUF)]
• 降噪幅度 (Denoise): 0.50 - 0.65 ◄── [正向提示词 + Gemma 4 文本编码]
• 采样步数 (Steps): 25 - 35 ◄── [负向提示词]
• 引导系数 (CFG): 3.0 - 4.0
│
▼
[LTXVideoVAEDecode (解码还原视频帧)]
│
▼
[VHS_VideoCombine (导出风格化新 MP4)]完整开箱即用 ComfyUI 工作流 JSON 模板
你可以直接复制下方 JSON 代码,保存为 ltx25_video_to_video.json,然后直接拖拽或通过 ComfyUI 右侧菜单的 Load 按钮导入:
{
"last_node_id": 8,
"last_link_id": 12,
"nodes": [
{
"id": 1,
"type": "CheckpointLoaderSimple",
"pos": [40, 100],
"size": [320, 100],
"flags": {},
"order": 0,
"mode": 0,
"inputs": [],
"outputs": [
{ "name": "MODEL", "type": "MODEL", "links": [1], "slot_index": 0 },
{ "name": "CLIP", "type": "CLIP", "links": [2, 3], "slot_index": 1 },
{ "name": "VAE", "type": "VAE", "links": [4, 5], "slot_index": 2 }
],
"widgets_values": ["ltx-2.5-fp8.safetensors"]
},
{
"id": 2,
"type": "VHS_LoadVideo",
"pos": [40, 260],
"size": [320, 220],
"flags": {},
"order": 1,
"mode": 0,
"inputs": [],
"outputs": [
{ "name": "IMAGE", "type": "IMAGE", "links": [6], "slot_index": 0 },
{ "name": "frame_count", "type": "INT", "links": null },
{ "name": "audio", "type": "AUDIO", "links": [7], "slot_index": 2 }
],
"widgets_values": {
"video": "input_video.mp4",
"force_rate": 24,
"custom_width": 768,
"custom_height": 512,
"frame_load_cap": 97,
"skip_first_frames": 0,
"select_every_nth": 1
}
},
{
"id": 3,
"type": "VAEEncode",
"pos": [400, 300],
"size": [220, 80],
"flags": {},
"order": 2,
"mode": 0,
"inputs": [
{ "name": "pixels", "type": "IMAGE", "link": 6 },
{ "name": "vae", "type": "VAE", "link": 4 }
],
"outputs": [
{ "name": "LATENT", "type": "LATENT", "links": [8], "slot_index": 0 }
]
},
{
"id": 4,
"type": "CLIPTextEncode",
"pos": [400, 80],
"size": [360, 100],
"flags": {},
"order": 3,
"mode": 0,
"inputs": [{ "name": "clip", "type": "CLIP", "link": 2 }],
"outputs": [
{
"name": "CONDITIONING",
"type": "CONDITIONING",
"links": [9],
"slot_index": 0
}
],
"widgets_values": [
"cinematic cyberpunk aesthetic, neon lights, rainy street, detailed face, keeping original motion"
]
},
{
"id": 5,
"type": "CLIPTextEncode",
"pos": [400, 200],
"size": [360, 80],
"flags": {},
"order": 4,
"mode": 0,
"inputs": [{ "name": "clip", "type": "CLIP", "link": 3 }],
"outputs": [
{
"name": "CONDITIONING",
"type": "CONDITIONING",
"links": [10],
"slot_index": 0
}
],
"widgets_values": [
"blurry, deformed, low quality, static, frame jitter, oversaturated"
]
},
{
"id": 6,
"type": "KSampler",
"pos": [800, 120],
"size": [280, 260],
"flags": {},
"order": 5,
"mode": 0,
"inputs": [
{ "name": "model", "type": "MODEL", "link": 1 },
{ "name": "positive", "type": "CONDITIONING", "link": 9 },
{ "name": "negative", "type": "CONDITIONING", "link": 10 },
{ "name": "latent_image", "type": "LATENT", "link": 8 }
],
"outputs": [
{ "name": "LATENT", "type": "LATENT", "links": [11], "slot_index": 0 }
],
"widgets_values": [42, "fixed", 30, 3.5, "euler", "simple", 0.55]
},
{
"id": 7,
"type": "VAEDecodeTiled",
"pos": [1120, 150],
"size": [240, 100],
"flags": {},
"order": 6,
"mode": 0,
"inputs": [
{ "name": "samples", "type": "LATENT", "link": 11 },
{ "name": "vae", "type": "VAE", "link": 5 }
],
"outputs": [
{ "name": "IMAGE", "type": "IMAGE", "links": [12], "slot_index": 0 }
],
"widgets_values": [512]
},
{
"id": 8,
"type": "VHS_VideoCombine",
"pos": [1400, 120],
"size": [300, 260],
"flags": {},
"order": 7,
"mode": 0,
"inputs": [
{ "name": "images", "type": "IMAGE", "link": 12 },
{ "name": "audio", "type": "AUDIO", "link": 7 }
],
"outputs": [],
"widgets_values": {
"frame_rate": 24,
"loop_count": 0,
"filename_prefix": "LTX25_V2V",
"format": "video/h264-mp4",
"pingpong": false,
"save_output": true
}
}
],
"links": [
[1, 1, 0, 6, 0, "MODEL"],
[2, 1, 1, 4, 0, "CLIP"],
[3, 1, 1, 5, 0, "CLIP"],
[4, 1, 2, 3, 1, "VAE"],
[5, 1, 2, 7, 1, "VAE"],
[6, 2, 0, 3, 0, "IMAGE"],
[7, 2, 2, 8, 1, "AUDIO"],
[8, 3, 0, 6, 3, "LATENT"],
[9, 4, 0, 6, 1, "CONDITIONING"],
[10, 5, 0, 6, 2, "CONDITIONING"],
[11, 6, 0, 7, 0, "LATENT"],
[12, 7, 0, 8, 0, "IMAGE"]
],
"groups": [],
"config": {},
"extra": {},
"version": 0.4
}工作流使用说明:
- 模型准备:将 LTX 2.5 权重(如
ltx-2.5-fp8.safetensors)放入ComfyUI/models/checkpoints/或对应unet/目录; - 导入工作流:将上述 JSON 文件拖入 ComfyUI 网页界面;
- 加载输入视频:在
VHS_LoadVideo节点上传或选择你的本地短视频(建议时长 3-5 秒,768P 分辨率); - 调整提示词与降噪:在正向提示词节点填入目标画风,在
KSampler中根据需求调整denoise(0.45 保持较多原貌,0.65 彻底重绘风格); - 一键生成:点击 Queue Prompt 即可在
VHS_VideoCombine节点实时预览并下载带有原音频的风格化新视频。
关键参数调优建议
| 参数项 | 推荐取值 | 作用与避坑技巧 |
|---|---|---|
| 降噪强度 (Denoise) | 0.45 - 0.55(轻度滤镜与光影重塑)0.60 - 0.72(真人转动漫/赛博朋克重绘) | 低于 0.4 几乎无风格变化;高于 0.75 会丢失原视频人物动作和一致性。 |
| 帧率 (FPS) | 24 或与原视频保持一致 | 保持动作自然流畅,避免画面卡顿或抽搐。 |
| 采样步数 (Steps) | 25 - 30 步 | 30 步在画质细腻度与生成速度之间达到最佳平衡。 |
| 引导系数 (CFG) | 3.0 - 4.5 | 避免过高 CFG 导致画面色彩过饱和或边缘灼烧感。 |
| 输出分辨率 | 768x512 或 1024x576 | 长宽数值必须为 32 的整数倍,否则 3D VAE 会直接报错。 |
经典风格转换提示词(Prompt)模板
在进行视频风格迁移时,建议采用 主体保留 + 目标艺术风格 + 光影与材质细节 的结构编写提示词:
1. 实拍真人转赛博朋克未来风
Prompt:
A cinematic cyberpunk re-imagining of a person walking along a bustling city street at night. Neon blue and magenta light reflections on wet pavement, cybernetic HUD visor overlays, futuristic carbon-fiber jacket, volumetric steam, 8k cinematic lighting, photorealistic textures, retaining the original body movement and walking rhythm.
2. 真实场景转新海诚唯美动漫风
Prompt:
High-end Makoto Shinkai anime aesthetic, hand-drawn 2D animation style, vibrant blue sky with soft cumulus clouds, warm golden hour lighting, clean cel-shaded character outlines, picturesque scenery, retaining smooth camera panning and original scene composition.
3. 定格黏土动画风(Claymation)
Prompt:
Charming handcrafted stop-motion claymation style, plasticine clay textures with visible thumbprints, miniature studio lighting, playful tactile aesthetic, clean edges, keeping the exact action and pacing from the source video.
免显卡方案:无需高性能 GPU 如何实现类似效果?
如果本地没有 16GB+ 显存的高配设备,可以通过以下两种策略在云端高效达成目标:
策略 1:首尾帧抽取 + 图生视频(FLF2V)
- 从原视频中截取起始帧(第 1 帧)和结束帧;
- 将截图通过图像工具换装/风格化处理;
- 将两张图分别作为首帧和尾帧,上传至 在线图生视频生成器,由 LTX 2.5 自动补全中间连贯的过渡动作。
策略 2:基于多镜头指令的文本精准复刻
- 观察原视频的镜头语言(如“中景推近”、“特写转侧面”);
- 利用 LTX 2.5 强大的原生多镜头(Multi-shot)提示词解析能力,在 在线文生视频工具 中直接生成拥有相同镜头调度的全新视频。
常见报错与排查指南
1. 解码时报错显存溢出(CUDA Out of Memory)
- 解决方法:在 ComfyUI 中勾选启用 Tiled VAE Decode(分块 VAE 解码),避免全量帧同时加载进显存。
2. 视频帧之间剧烈闪烁(Flicker)
- 解决方法:将 Denoise 强度 下调至
0.55以下;同时确保原视频光照充足、没有剧烈运动模糊。
3. 主体人物变形或动作漂移
- 解决方法:适当降低 CFG(建议设为 3.0-3.5),并使用更简洁明确的正向提示词,避免堆砌互相冲突的风格词汇。
常见问题解答(FAQ)
fal.ai 以后会推出 LTX 2.5 Video-to-Video API 吗?
随着社区对视频重绘与画风迁移需求的增长,托管服务商可能会推出基于标准化参数的 V2V 管道。但截至目前,官方主推的仍是文生、图生(含首尾帧)和音生视频接口。
本地运行 LTX 2.5 视频重绘至少需要多大显存?
使用 GGUF Q4/Q8 量化版本时,12GB 显存(如 RTX 3060/4070)即可在 768P 分辨率下运行;若想使用全精度 FP8 模型及高质量扩散解码器,建议使用 16GB 至 24GB 显存 的显卡。
视频重绘时能保留原视频的声音吗?
LTX 2.5 原生支持音视频联合生成。在 ComfyUI 工作流中,可以通过 VHS_VideoCombine 节点将原始 MP4 的音频流直接复用混流到最终输出文件中。
