随着开源 AI 视频生成正式迈入“影视生产力”时代,在目前两大顶尖模型 LTX 2.3 与 Wan 2.2 之间做出选择,成为了创作者和开发者社区中最关注的问题。
想立刻体验 LTX 2.3 吗? 在在线平台免费体验 LTX 2.3 AI 视频生成 → — 免部署安装,在浏览器中即可直接生成。

一图看懂 — LTX 2.3 与 Wan 2.2 核心维度对比
| 对比维度 | LTX 2.3 | Wan 2.2 |
|---|---|---|
| 开发者 | Lightricks | 阿里通义实验室 |
| 模型架构 | DiT (Diffusion Transformer) | 27B MoE 混合专家架构 |
| 最高分辨率 | 最高支持 4K | 480p – 720p(常规) |
| 单片段最长 | 最长约 20 秒 | 最长约 5 秒 |
| 帧率 (FPS) | 24 / 25 / 48 / 50 fps | 24 fps |
| 原生音效 | 是(原生音画同步生成) | 否(仅视频,提供 S2V 独立变体) |
| 原生竖屏 | 原生 1080×1920 竖屏 | 非原生裁切 |
| 图生视频 | 大幅改善冻结与微动瑕疵 | 拥有强大的自动 Prompt 推导 |
| 推理速度 | H100 上约 1.22s/步,比 Wan 14B 快 18 倍 | 偏中等,优先追求画质 |
| 消费级显卡 | 蒸馏/量化版轻松运行 | 5B 混合版可在 RTX 4090 上跑 720p |
| 许可协议 | Apache 2.0(年营收 < $10M 免费) | 开源授权(需查阅特定条款) |
| ComfyUI 支持 | 官方及社区节点持续更新 | 拥有一套非常成熟的生态 |
什么是 LTX 2.3?
LTX 2.3 是 Lightricks 团队推出的最新代大模型,基于 DiT (Diffusion Transformer) 架构构建。您可以在 在线平台 亲自体验其强大的生成能力。它是开源领域中少数能在单次扩散生成中同时输出同步视频与音效的基础大模型。
核心亮点:
- 重构的 VAE 编码器:使用更高画质的数据训练,保留头发丝、文字及边缘细节,即使在 4K 下依然锐利。
- 4 倍大文本连接器:能更精准理解多主体、复杂空间关系与艺术风格指令。
- 原生竖屏视频:直接基于 1080×1920 竖屏数据训练,而非传统横屏画面裁切。
- 更纯净的音效:新声码器大幅降低杂音,音画同步更精准。
- 更强劲的图生视频:极少出现画面冻结,有效避免平移滑轨伪影。
什么是 Wan 2.2?
Wan 2.2 由阿里通义实验室开发,基于 27B 参数的 MoE (Mixture-of-Experts) 混合专家架构。它通过专门的分工系统:高噪声专家负责画面大局与构图布局,低噪声专家负责材质、光影与精细细节。
核心亮点:
- MoE 混合专家效率:动态分配计算量,优先打磨关键细节。
- 电影级镜头感:擅长复杂的镜头走位、叙事构图与电影级光影。
- 极致提示词契合度:在将复杂自然语言转化为视觉画面方面表现优异。
原生音效:LTX 2.3 的独特优势
在 LTX 2.3 对比 Wan 2.2 中,最显著的分水岭就是原生音效同步生成。
LTX 2.3 在单次生成中直接同步输出音视频:
- 人物对白与口型自然对齐
- 环境原声完美符合场景上下文
- 背景音乐与动作节奏契合
Wan 2.2 仅生成无声视频。要添加音效,需要借助第三方音频工具(TTS、AI 音乐生成器或后期剪辑)。
选型建议与总结
- 如果您的工作流需要 高清 4K 输出、长达 20 秒片段、原生音效同步、极速生成迭代、9:16 竖屏制作,首选 LTX 2.3。
- 如果您的工作流追求 电影级运镜、复杂的运动物理交互、极致的提示词契合度,Wan 2.2 是极佳的构图利器。
立即开启体验: 在在线平台生成您的第一个 LTX 2.3 视频 →。
