
玩过 Stable Diffusion 就会用从 SD 工作流平移 LTX-2.5 的 10 处关键差异【免费下载链接】LTX-2.5项目地址: https://ai.gitcode.com/hf_mirrors/Lightricks/LTX-2.5如果你是 Stable Diffusion 的老玩家第一次打开 LTX-2.5 的模型目录时大概会愣一下没有那个熟悉的单一checkpoint大文件取而代之的是diffusion_models/、text_encoders/、vae/、loras/、model_patches/、latent_upscale_models/六个目录里面躺着一堆各司其职的.safetensors。这其实是件好事——Lightricks 把 220 亿参数的开放世界模型 LTX-2.5 按组件拆分发布让它在 ComfyUI 里获得了即插即用的模块化能力。官方发布数据显示在 2×GB200 配置下它能在 6.8 秒内生成 10 秒 720p 视频且年度经常性收入低于 1000 万美元的组织可免费商用。但对 SD 玩家而言真正的门槛从来不是显存或速度而是心智模型的迁移视频生成在扩散采样主链之外多了时间轴和音轨两个全新维度。本文基于仓库源码与官方文档梳理从 SD 工作流平移 LTX-2.5 时最关键的 10 处差异并给出参数对照表和一套可直接复用的工作流模板。一、SD 玩家的心智模型从一张图到一段视频先吃一颗定心丸LTX-2.5 的扩散采样主链和 SD 几乎一样——文本编码进条件空间在潜空间里迭代去噪最后 VAE 解码。你熟悉的潜空间心智模型依然成立LTX-2.5 的 DiT 主干同样是在 README.md 中描述的扩散框架下工作。需要升级的是下面三层时间维度潜变量从[C, H, W]扩展为[C, T, H, W]T是帧数。这意味着你不仅要选分辨率还要选这段视频多长而 LTX-2.5 的帧数不是随便填的详见差异 4。音频维度视频生成之外模型同时合成音轨。于是仓库里出现了两个 VAE——负责画面的视频 VAE 和负责声音的音频 VAE详见差异 3。组件维度不再有一个打包好一切的 checkpoint每个子模块独立成文件、独立升级ComfyUI 按文件夹装载详见差异 1。想通了这三点剩下的就是参数与节点的翻译工作。官方在 README 中把 LTX-2.5 定义为 an open world model with open weights, built for local execution and fine-tuning支持文本、图像、视频三种输入生成同步的高保真视频与音频——对 SD 玩家来说图生视频就是最自然的入口。二、10 处关键差异差异 1模型形态——从单文件 Checkpoint到组件化拆分包SD 时代一个sd_xl_base.safetensors就是全部LTX-2.5 则是一套 split, Comfy-aligned pack每个组件独立文件。仓库的完整清单如下组件目录代表文件职责diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors等 5 个 DiT扩散主干有蒸馏版/dev 版、bf16/INT8/NVFP4 多种档位text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors文本编码器含投影层vae/ltx-2.5-video-vae-bf16.safetensors、ltx-2.5-audio-vae-bf16.safetensors视频 VAE 与音频 VAE 分离loras/ltx-2.5-22b-distilled-lora-450-bf16.safetensors官方蒸馏 LoRA用于 dev-transformer 工作流model_patches/ltx-2.5-duration-head-bf16.safetensors时长预测头补丁可选latent_upscale_models/spatial / temporal 两个 x2 上采样器两阶段生成的上采样环节对应到 ComfyUI每个文件有固定落位DiT 进models/diffusion_models/、Gemma 文本编码器进models/text_encoders/、VAE 进models/vae/、上采样器进models/latent_upscale_models/。加载方式也变了——DiT 用UNETLoaderGemma 4 文本编码器用CLIPLoadertype 选ltxv这与 SD 的 CheckpointLoader 完全不同。差异 2文本编码器——从 CLIP/T5 到 Gemma 4 12BSD 玩家熟悉的 CLIP-L/T5 在 LTX-2.5 里换成了定制版 Gemma 4 12B 文本编码器。README 明确其动机holds complex prompts together (multiple characters, camera moves, lighting, actions) instead of dropping details across a longer sequence——长提示词里的多角色、运镜、光线、动作细节不再被丢弃。这意味着两件事第一你可以写更长的提示词而不怕语义稀释第二若你手头只有 SD 的 CLIP 模型文件无法复用必须单独下载 text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors低显存场景用同目录下的-comfy-int8-convrot版本。差异 3一个 VAE 变成两个——视频与音频分开解码SD 只有一个 VAELTX-2.5 的 vae/ 目录下躺着三个文件职责完全不同vae/ltx-2.5-video-vae-bf16.safetensorsDiffVAE画质优先、体积更大vae/ltx-2.5-video-vae-conv-bf16.safetensorsConv VAE更快更轻适合低显存vae/ltx-2.5-audio-vae-bf16.safetensors音频 VAE vocoder专门解码生成的音轨。官方 ComfyUI 模板中文生视频、图生视频都会同时挂上视频 VAE 和音频 VAE。第一次上手最容易漏掉的正是音频 VAE——漏装的结果不是报错而是生成一段默片你甚至一时意识不到少了什么。差异 4帧数约束frames % 8 1宽高必须能被 32 整除SD 里分辨率随便填顶多花屏LTX-2.5 的 README Constraints 写得很硬帧数必须满足num_frames % 8 1即 1、9、17、25……121宽高必须能被 32 整除。官方示例--num-frames 121配合 24fps 约等于 5 秒。这个约束来自视频 DiT 的时间下采样结构绕不过去——调参时先在草稿纸上算好帧数别指望采样器帮你兜底。差异 5蒸馏模型固定 8 步、CFG1——别再把 CFG 拉到 7这是 SD 玩家最容易被惯性坑到的地方。README 的蒸馏版 DiT 备注只有一行Fixed 8-step schedule, CFG1。也就是说步数蒸馏版是固定 8 步调度不是20~30 步出细活的逻辑CFG必须等于 1放大 CFG 非但不能增强提示词遵循反而破坏蒸馏模型已对齐的分布。在 Diffusers 路径的官方示例里也能看到guidance_scale1.0、audio_guidance_scale1.0、stg_scale0.0这一组去 CFG参数。如果你的目标是可控性更强的完整模型请换用diffusion_models/下的 dev 版 DiTltx-2.5-22b-dev-transformer-bf16.safetensors它是可训练、可上 CFG 的完整版——代价是显存和推理时间。差异 6时长从参数变成预测结果——duration headSD 没有时长概念LTX-2.5 引入了可选的时长预测器duration head文件就在 model_patches/ltx-2.5-duration-head-bf16.safetensors。它的工作方式非常反直觉读取提示词、预测该给多少帧。README 说得很直白——Omit--num-framesto let the duration head pick a length from the prompt。按官方约 24fps 估算帧数与时长大致对应25 帧≈1 秒、49 帧≈2 秒、73 帧≈3 秒、97 帧≈4 秒、121 帧≈5 秒。简单提示词它给短时长复杂多镜头提示词它给长时长。想手动控制显式传--num-frames即可覆盖自动预测记得满足%81。这个组件化补丁的思路在 SD 生态里没有对应物理解它需要把时长从固定参数重新理解为模型输出的一部分。差异 7一次生成多镜头——multishot 打破单镜头惯性SD 一次出一张图LTX-2.5 一次可以出一段多镜头视频。README 的 Whats new 里把 Native multishot generation 列在首位单个生成过程内产生多个连贯镜头切镜头后角色身份、环境、光照、声音、视觉风格保持一致。官方提示词指南强调多镜头提示词要在自然语言里写明转场——例如 A hard cut transitions to…、The image dissolves into…并在每次切换后重新交代景别、视角与谁在画面里还要说明音乐/对话/环境音是否延续。这是从画一幅画到导一场戏的思维转变也是提示词工程差异最大的地方。差异 8提示词体系——从 tag 列表到镜头语言段落 Prompt EnhancerSD 玩家习惯masterpiece, best quality, cinematic lighting的逗号堆叠LTX-2.5 官方提示词指南明确警告别把为 Kling、Seedance 等模型写的 tag 式提示词原样粘贴tag 语法与镜头列表格式在 LTX 上表现不佳应改写成流畅的段落式结构。官方建议的六要素是建立镜头景别、风格设定场景光线、色调、氛围描述动作用进行时动词让每个句子动起来定义角色外貌 通过肢体动作表达情绪而非抽象标签指定运镜何时、如何移动描述音频环境声、音乐、带引号的台词。同时LTX-2.5 还带一个可选的Prompt Enhancer用 Gemma 4 E2B 模型在编码前把短提示词扩写成更丰富的电影化指令ltx-pipelines里用--enhance-prompt开启ComfyUI 模板默认开启可通过关闭节点保留原文。对刚迁移过来的 SD 玩家这是最省力的提示词翻译器。差异 9图生视频——从 denoise 强度到首帧/尾帧条件化SD 的 img2img 靠denoising strength控制原图保留程度LTX-2.5 的图生视频是显式首帧条件化README 给出的用法是--image PATH FRAME_IDX STRENGTH例如--image first_frame.jpg 0 1.0——0表示该图作为第 0 帧首帧条件1.0是强度。官方还提供 First-Frame / Last-Frame 模板单阶段给定起始帧与结束帧模型生成两者之间的运动。这个机制更接近视频条件控制而非图像重绘参数语义完全不同。差异 10放大路线——从外挂 upscaler 到潜空间两阶段 量化三件套SD 的高清化靠外挂 ESRGAN/UltraSharp 类模型LTX-2.5 内置潜空间上采样器spatial x2 与 temporal x2 两个文件latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors、latent_upscale_models/ltx-2.5-latent-temporal-upscaler-x2-bf16-1.0.safetensors。官方两阶段流程是第一阶段低分辨率出 latent → 潜空间上采样 → 第二阶段在放大后的 latent 上继续去噪 → VAE 解码节点链形如Sampler → Upscaler → Sampler → VAE Decode。注意spatial upscaler 只用于两阶段模板单阶段首尾帧模板不需要它。显存路线也有量化三件套官方为低显存 ComfyUI 用户准备了 INT8 ConvRot 组合——diffusion_models/ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors text_encoders/gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors Conv 视频 VAEBlackwell 显卡另有 NVFP4 蒸馏版ltx-pipelines路径则可用--quantization fp8-cast --offload cpu动态降精度并 CPU 卸载。注意这些*-comfy-int8-convrot文件是 ComfyUI 专用不能用 PyTorch / ltx-pipelines 加载差异之外最容易踩的雷。三、节点、采样器与 CFG 参数的平移对照表把上面 10 处差异压缩成一张翻译表SD 玩家照此平移即可SD / ComfyUI 习惯LTX-2.5 对应关键说明CheckpointLoader 加载单文件UNETLoader 加载diffusion_models/下的 DiT蒸馏版固定 8 步、CFG1CLIPLoaderCLIP-L / T5CLIPLoadertypeltxv加载 Gemma 4 12B与 SD 的 CLIP 权重不通用单个 VAE loader视频 VAE 音频 VAE 两个 loader音频 VAE 决定有没有声音正面/负面提示词提示词 可选负向蒸馏版 CFG1 时负向作用弱Diffusers 路径有DEFAULT_NEGATIVE_PROMPTKSampler20~30 步、CFG 4~7蒸馏版 8 步固定调度、CFG1dev 版可自定义别拿 SD 步数/CFG 惯性硬套Latent 尺寸宽高宽高 %320额外要求帧数 %81帧数是新的分辨率LatentUpscale / 外挂放大latent spatial/temporal x2 上采样器仅两阶段模板使用LoRA loader通用 LoRA loader官方自带 450 步蒸馏 LoRA官方称 LTX-2.3 训练的多数 LoRA 可直接复用四、前 3 个小时最容易犯的迁移错误结合社区实战反馈与官方文档的排障清单SD 玩家迁移初期最常踩的坑集中在下面七条拿 SD 的 CFG7、30 步去跑蒸馏版蒸馏模型是固定 8 步 CFG1 的调度改参数反而出劣质结果。想要高可控性换 dev 版 DiT。帧数随手填不满足%81直接报错宽高不整除 32 同样报错。先算后跑。在ltx-pipelines里加载*-comfy-int8-convrot文件README 反复强调这批文件 ComfyUI only — not for ltx-pipelines / PyTorchPyTorch 路径请用 bf16 版本。只挂视频 VAE、漏掉音频 VAE不报错但生成的视频永远没有声音排查半天才发现是模型装配问题。把 Kling/Seedance 的 tag 式提示词原样粘贴官方提示词指南明确警告 tag 语法与镜头列表格式会拖累表现要改写成段落式镜头语言或直接交给 Prompt Enhancer 改写。单阶段首尾帧模板里挂上 spatial upscaler它只服务两阶段模板多余节点反而引入错误或显存浪费。显存不够还硬上 BF16 全家桶22B 模型在消费级显存上应优先走量化组合INT8 ConvRot 三件套 / NVFP4 /fp8-cast--offload cpu官方 ComfyUI 模板从 480×720、41~81 帧起步迭代。五、一套可复用的视频工作流模板以仓库官方示例为基础给出三种可直接落地的模板。模板 Altx-pipelines 命令行文生视频 自动时长uv run python -m ltx_pipelines.distilled \ --transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \ --text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \ --video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \ --audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \ --duration-head-path models/ltx-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \ --spatial-upsampler-path models/ltx-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \ --prompt A golden retriever running through a sunny meadow, cinematic lighting \ --seed 42 \ --output-path output.mp4省略--num-frames即启用时长预测想手动控制就显式传入满足%81的帧数如--num-frames 121。模板 Bltx-pipelines 图生视频首帧条件化在模板 A 的基础上加一行图像条件--image path/to/first_frame.jpg 0 1.0 \ --prompt The camera slowly dollies out as wind moves through the grass0 1.0表示首帧条件、强度 1.0这是最接近 SD img2img 的入口但语义上是对第 0 帧的显式控制。模板 CComfyUI 节点链两阶段高清官方 ComfyUI 模板内置三套Text-to-Video、Image-to-Video两阶段与 First-Frame / Last-Frame单阶段。两阶段高清的节点骨架UNETLoader(蒸馏DiT) ─┐ CLIPLoader(Gemma4, ltxv) → TextEncode → Sampler → LatentSpatialUpscaler(x2) → Sampler → VAE Decode(视频VAE 音频VAE) → Save调试节奏建议先 480×720、41~81 帧快速验证效果确认后再开上采样器与更长帧数显存吃紧时把 BF16 三件套换成 INT8 ConvRot 组合或叠加fp8-cast与 CPU 卸载。小结LTX-2.5 与 SD 的相似性在于扩散采样的主干——文本编码、潜空间去噪、VAE 解码——这正是 SD 玩家可以平移的基础真正的差异全部来自视频特有的时间轴、音轨与组件化工程形态帧数约束、固定 8 步 CFG1 的蒸馏调度、时长预测头、双 VAE、多镜头生成与潜空间两阶段放大。把这 10 处差异翻译成参数表和工作流一个 SD 玩家通常只需要一个下午就能跑通自己的第一条视频生成管线——而且比当年学 SD 时有更多官方模板可以少走弯路。【免费下载链接】LTX-2.5项目地址: https://ai.gitcode.com/hf_mirrors/Lightricks/LTX-2.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考