
Wan2.1 这个开源视频生成模型我第一次跑通的时候是在一台只有 24G 显存的机器上出的第一条视频是一个在雨夜里蹲在路边的猫。当时真给我震住了不是因为画面有多惊艳而是这种东西真的可以在自己家里跑不用买 API、不用求人、不用排队。今天就把从零开始本地部署 Wan2.1 的完整过程写下来包括硬件怎么评估、模型怎么下、ComfyUI 怎么搭、参数怎么调、显存不够怎么办。你只要按这个流程走大概率能在一天内让这台“AI 导演”在你自己的机器上开机。先给个最基本的判断如果你手里的显卡是 N 卡、显存 8G 起步那 Wan2.1 的轻量版1.3B就能跑出 4 秒 480p 的视频完全没问题如果有 24G 显存直接上 14B 的大模型画质和动作连贯性完全是另一个档次。A 卡和 Mac 不是不能跑但你别指望玩得顺我后面会单独说。1. Wan2.1 是什么为什么值得本地部署1.1 模型背景与定位Wan2.1 是阿里通义实验室开源的视频生成大模型属于扩散模型这一脉。它能做两件核心的事文生视频T2V和图生视频I2V就是用一段文字描述生成视频或者用一张参考图加上文字让画面动起来。这个模型一开源基本等于把原来只有闭源大厂玩得动的“AI 导演”特权直接下放给了普通人。跟同类的开源视频模型放在一起看Wan2.1 的优势挺明显的一是运动幅度够大人物转身、镜头推拉这类动作不会像早期模型那样糊成一团二是人物一致性控制得不错尤其用了 I2V 模式之后脸不会随便崩三是支持中文提示词这意味着你不需要把你脑子里的画面翻译成英文再喂给模型表达门槛直接降了一大截。从生态上看Wan2.1 已经被 ComfyUI 原生支持了也就是说你不需要去写复杂的 Python 推理脚本直接在 ComfyUI 这个可视化节点工具里把工作流拖出来点一下 Run 就能出视频。这对绝大多数普通用户来说是决定性的优势。1.2 版本矩阵怎么选Wan2.1 发布的时候给了好几个权重包刚接触的人很容易懵。其实按两条轴划分就行。纵向是按参数量分14B 和 1.3B。14B 是完整版画质上限高但模型文件就有 25GB 左右跑起来需要 24G 以上的显存才能舒服极限压缩可以用 16G 磨一磨1.3B 是轻量版模型文件只有 4.6GB 左右8G 显存的卡就能跑画质当然是降级的但胜在什么机器都能上。横向是按功能分T2VText-to-Video和 I2VImage-to-Video。T2V 只吃文字提示词适合你没参考图、纯靠脑洞做画面I2V 需要一张输入图模型会基于这张图做运动生成做角色动画、让静图动起来都走这条线。1.3B 和 14B 两个尺寸都分别给了 T2V 和 I2V 版本。选型建议就一句话先用 1.3B 跑通全流程确认自己的机器没问题再决定要不要换 14B。我见过太多人一上来就下 14B结果显存爆炸以为是自己机器不行直接放弃了。其实先把流程跑通后面换模型就是换个文件的事。1.3 核心原理通俗解Wan2.1 内部结构可以拆成三个核心部件文本编码器、DiT 主模型、3D VAE。文本编码器负责把你写的提示词翻译成模型能理解的向量表示。Wan2.1 用的是 UMT5-XXL 这个大规模文本编码器中文理解能力强主要就是它的功劳。这个编码器本身就有好几个 GB部署时千万别漏了。DiTDiffusion Transformer主模型负责核心的扩散过程。扩散模型的逻辑可以这么理解先有一团纯噪声然后模型根据文字条件一步步“去噪”每去一步画面就清晰一点最终得到一帧帧的视频画面。训练的时候反过来模型学着把真实视频一步步加噪声加到完全看不出内容然后学习反向操作。3D VAE 负责视频的编解码压缩。原始视频数据量太大了直接让 DiT 处理不现实。VAE 先把视频压缩到低维的隐空间DiT 在这个压缩空间里操作生成完再解压回真实画面。整个过程有点像你发微信照片前先压缩图片发完对方再点开看原图。这个基本架构决定了本地部署会遇上的两大难题一是显存因为三个部件都要常驻显存里二是速度扩散模型要迭代几十步才能出最终画面每一步都在干重活。2. 本地部署的环境准备与硬件评估2.1 硬件需求对照表先别急着下载任何东西对着这张表看看你的机器到底能跑到哪个档位。配置项入门级能跑推荐级舒服舒适级14B 爽跑GPUNVIDIA GTX 1080 Ti / RTX 2060 8GRTX 3060 12G / 4060 8GRTX 4090 24G / 3090 24G显存8G12G-16G24G 及以上内存16G32G64G硬盘30G 空闲50G 空闲100G 空闲推荐模型Wan2.1-T2V-1.3BWan2.1-T2V-14B需优化Wan2.1-T2V-14B / I2V-14B注意一个关键点显存不是唯一的瓶颈内存也很重要。Wan2.1 的分层加载机制offload会把部分模型层临时放到内存里内存不够直接报错或者卡死。我试过在一台 16G 内存 16G 显存的机器上跑 14B结果内存直接打满系统都开始卡了。内存建议 32G 起步不是玄学。硬盘方面模型权重文件加起来少说 10GB多则 60GB如果模型下了一大堆又玩 ComfyUI 插件100GB 空间也有可能被吃掉。注意如果 SSD 空间不够我强烈推荐你把模型放在 SSD 上机械硬盘加载 14B 权重的时候那个体感折磨程度你会疯掉的。2.2 驱动与基础软件Windows 系统的话先把 NVIDIA 驱动更新到最新版确保 CUDA 版本在 12.1 以上。不用单独装 CUDA Toolkit因为 PyTorch 通常会自带运行时的 CUDA 库但你得保证驱动支持。怎么看驱动的 CUDA 版本命令行里跑 nvidia-smi右上角能看到。Python 环境建议用 miniconda 来管理因为本地部署 AI 相关的依赖版本依赖关系极其混乱专门建一个虚拟环境是基础中的基础。ComfyUI 本身带了 Python 依赖安装脚本但对小白来说我还是建议先装 miniconda后面出了问题你能多一个回滚的手段。显卡驱动和 Python 环境这两步看似废话但实际排队求助的人里有一半是卡在这。最常见的问题是装了一堆东西跑起来发现提示找不到 CUDA结果一看驱动是 2019 年的老版本。2.3 显存不够的预判与应对策略本地部署视频生成模型整个过程说白了就是一个“显存怎么都不够用”的斗争史。你至少得会在动手前做一次预判直接用半精度fp16跑 14B 模型需要约 26-30G 显存跑 1.3B 模型需要约 8-10G 显存。这只是推理时的峰值占用还没算中间激活值、VAE 解压这些额外开销。如果你手里的卡不够有三个应对方向降模型的档位14B 降到 1.3B这是最直接的办法。用 fp8 量化版模型14B 的 fp8 版能省将近一半显存16G 显存也有机会跑代价是画质轻微下降。开启分层 offload让模型一部分驻留在显存、一部分驻留在内存计算时再动态加载。ComfyUI 和官方代码都支持代价是生成速度明显变慢。降低出视频的分辨率和帧数比如从 720p 降到 480p从 81 帧降到 49 帧显存压力直接缩小一截。实际送的组合拳往往是fp8 模型 分层 offload 480p 分辨率 49 帧这样 12G 显存都能勉强跑 14B。但你要有心理准备生成速度可能从几分钟变成十几分钟。3. 模型权重获取与目录整理3.1 去哪里下载权重Wan2.1 的模型权重主要放在两个平台HuggingFace 和 ModelScope。国内用户建议优先用 ModelScope下载速度要友好得多不用任何额外手段直接命令行就能拉。以 14B T2V 版本为例你需要下载这几个文件文件名大小作用wan2.1_t2v_14B_fp16.safetensors约 25GBDiT 主模型wan2.1_t2v_14B_fp8_scaled.safetensors约 13GB可选fp8 量化版主模型umt5_xxl_fp8_e4m3fn_scaled.safetensors约 6GB文本编码器wan_2.1_vae.safetensors约 250MB3D VAE1.3B 版本对应的是 wan2.1_t2v_1.3B_fp16.safetensors约 4.6GB和 wan2.1_t2v_1.3B_fp8_e4m3fn.safetensors约 2.4GB。I2V 版本的模型文件名里带 i2v 字样结构上多了一个图像编码器组件下载时需要注意区分。下载命令用 ModelScope 的话可以在命令行里直接拉也可以直接网页下载。我倾向于用命令行pip install modelscope # 下载 14B T2V 到本地目录 modelscope download --model Wan-AI/Wan2.1-T2V-14B --local_dir ./Wan2.1-T2V-14B3.2 目录结构怎么摆下载完成之后别急着解压乱放。ComfyUI 有自己的一套目录规则摆错了工作流直接认不出文件。ComfyUI 通常找模型文件的逻辑是主模型DiT放在 models/diffusion_models 目录文本编码器放在 models/text_encoders 目录VAE 放在 models/vae 目录如果你用的是不同的 ComfyUI 前端界面目录名可能略有差异但大逻辑是一样的。还有一个小技巧如果你下了一堆不同尺寸的模型最好在文件名里保留后缀比如 wan2.1_t2v_14B_fp16.safetensors这样加载器里能一眼认出谁是谁不至于选了模型却不清楚当前跑的是哪个参数档。3.3 文件完整性校验这一步很多人会跳过去但大文件下载最容易出问题。下了一半断了再重新连接下载文件可能没有损坏但概率存在。模型文件如果校验不通过加载时报错还算好就怕加载成功了但生成出来的画面全是噪点问题排查起来特别费劲。HuggingFace 和 ModelScope 一般都会提供 SHA256 校验值。下载完用本地命令算一下# Linux/Mac sha256sum wan2.1_t2v_14B_fp16.safetensors # Windows PowerShell Get-FileHash wan2.1_t2v_14B_fp16.safetensors -Algorithm SHA256然后对比官网给的哈希值一致就说明文件完整。这一步 1 分钟的事但能省下后面可能两个小时的问题排查时间。4. ComfyUI 跑通第一条 AI 视频4.1 安装 ComfyUI 与 Wan 支持ComfyUI 本身可以理解为 AI 绘画和生成任务的“乐高积木”每个功能模块就是一个节点连接起来组成工作流。它的安装方式有两种一键整合包和 Git 源码安装。整合包适合纯新手解压就能用源码方式适合你想时刻保持更新并且有动手能力的。官方版 ComfyUI 从 0.2.4 左右的版本已经原生支持 Wan2.1所以一般不需要额外装插件。但有不少人发现用 kijai 开发的 ComfyUI-WanVideoWrapper 插件体验更好因为它的显存优化做得更极致特别是在 offload 方面。我的建议是先试原生支持如果遇到显存不足的问题再装 WanVideoWrapper 作为备选。启动 ComfyUI 的命令里有几个关键参数python main.py --listen 0.0.0.0 --port 8188 --lowvram --preview-method auto--lowvram 会强制 ComfyUI 以低显存模式运行对 8G-12G 显存的机器很有帮助--preview-method auto 可以在生成过程中实时预览视频帧。如果你的显存很紧张建议加上 --reserve-vram 1.0 预留一部分显存给系统 UI。4.2 文生视频工作流详解ComfyUI 跑 Wan2.1 的标准文生视频工作流包含这几个核心节点Load Diffusion Model加载 DiT 主模型Load CLIP / Load Text Encoder加载 UMT5-XXL 文本编码器Load VAE加载 3D VAEText Encode把提示词编码成条件向量Random Noise / Empty Latent Image创建初始随机噪声KSampler执行扩散采样核心的参数都在这里VAEDecode把生成的隐空间张量解码成视频帧Save Video输出 mp4/gif 视频文件手动从零搭建工作流对新手不友好我建议直接在 ComfyUI 官方示例工作流或者模型仓库的 example 目录里找现成的 Wan2.1 文生视频 json 工作流文件导入 ComfyUI 后改几个必要参数就能跑。首次跑通先别想着创意先复现复现成功之后再动手改。4.3 核心参数解读与推荐设置我自己实测下来一套比较稳的起步参数组合如下参数推荐值说明分辨率832x480480p先不要开 720p压力大不少帧数81 帧约 4 秒 16fpsWan2.1 最多支持约 4-5 秒采样步数20-30步数太少画面糊太多纯浪费时间CFG5-6太高色彩会过饱和太低内容对不上提示词Samplereuler / uni_pc这两种对视频模型友好Schedulersimple / normal配合 euler 用的多shift5影响噪声调度曲线Wan2.1 建议 4-6一个最常见的问题是新手把 CFG 拉到 10 以上结果画面出现各种诡异的噪点和重影。道理其实很简单高的 CFG 意味着模型每一步都更激进地往提示词方向推推到过头就会失真。Wan2.1 的训练特性决定了 CFG 在 5-6 附近最舒服。提示词方面由于支持中文所以你可以直接用中文写。但建议把主体、环境、动作、镜头方式分开说清楚比如一只橘猫蹲在窗台上雨水打在玻璃上镜头缓缓推近暖黄色灯光细节丰富。模型对这类结构化描述的理解效果明显好于一句话。5. 图生视频与进阶玩法5.1 图生视频工作流图生视频的核心在于你需要额外加载一个图像编码器把你给出的参考图也编码进条件里。ComfyUI 里多了 Load Image 节点和 Reference Image 相关节点。我的经验是I2V 出片能不能稳定80% 取决于参考图的构图和画风。如果你用了一张复杂背景、人物很多、边缘模糊的照片出来的视频大概率会崩。反过来主体突出、背景简单、光线均匀的参考图成功率会高很多。用一张主体居中、背景干净的人像做 I2VAI 让它转头、眨眼、微笑那效果简直让人上瘾。5.2 让视频更长更长一点Wan2.1 单次生成最长约 4-5 秒这对讲一个完整的“故事”显然不够。我的做法是先生成 4 秒作为基础片段再用首尾帧续写的方式做延长。也就是把上一段视频的最后一帧作为下一段的起始帧配合 I2V 接着生成下一段。这样一段段拼接理论上可以做出 20 秒以上的短剧但每拼接一次画风和人物细节会漂移一点后期需要统一色调微调。另一种思路是不同镜头各生成一段然后用剪辑软件拼接。比如全景交代环境用 T2V中景人物动作用 I2V近景表情特写再来一段剪在一起之后打上字幕和配乐一个小短片就这么出来了。5.3 超分和补帧这些后处理视频生成出来通常都是 480p/720p帧率 16fps直出不够“电影感”。所以后处理几乎必做。超分我推荐用 Real-ESRGAN 系列的视频超分工具项目地址直接搜就能找到。补帧方面把 16fps 拉到 30fps 甚至 60fps最常用的方案是 RIFE 插帧算法。在本地命令行跑一套流程大概是# 先用超分把每帧放大 realesrgan-ncnn-vulkan -i input_frames -o output_frames -n realesr-animevideov3 -s 2 # 再用 RIFE 补帧到 60fps rife-ncnn-vulkan -i output_frames -o interpolated_frames -r 60超分加补帧做完视频的观感能提升一个档次。但记住这两步对 CPU 的占用也不低处理一分钟的视频可能要几分钟甚至十几分钟。6. 显存不够的优化方案与实测经验6.1 低显存跑 14B 的配置套路先说结论12G 显存跑 14B 不是白日梦但你要做好生成速度慢三到五倍的心理准备。我的推荐配置是fp8 量化模型 分层 offload 480p 分辨率 81 帧 20 步。具体操作上模型加载器里选 fp8 权重ComfyUI 里开启 offload 选项采样参数调成 480p 后点击生成然后去泡杯茶。实测 12G 显存的情况下生成一条 4 秒视频大约需要 15-25 分钟比本地 1.3B 版的几分钟慢很多但如果你追求的是 14B 的画质等待就是代价。6.2 1.3B 模型的省心玩法如果你的显存只有 8G别挣扎 14B 了1.3B 是更实际的路线。它出片速度快画质虽然不如 14B但用来做创意短视频、内容平台上的配图视频完全够用。8G 显存跑 1.3B出 480p 4 秒视频通常 3-6 分钟一条已经非常可用了。而且 1.3B 模型的巨大优势是它不仅能跑能出片还可以反复尝试不同的提示词和参数组合。用 14B 出一个废片你要等几十分钟用 1.3B 等几分钟就能试一次调参效率完全不是一个量级。我建议每个刚入门的人先用 1.3B 大量实验确定了自己的提示词风格和参数偏好再换 14B 正式出片。6.3 实测数据参考显卡模型分辨率/帧数生成耗时显存峰值RTX 4090 24GWan2.1-T2V-14B832x480 / 81帧约 2-4 分钟约 22GRTX 3080 10GWan2.1-T2V-1.3B832x480 / 81帧约 2-3 分钟约 8GRTX 2060 6GWan2.1-T2V-1.3Bfp8offload640x384 / 49帧约 5-8 分钟约 6GRTX 4060 8GWan2.1-T2V-1.3B832x480 / 81帧约 3-4 分钟约 8G这些数据受驱动版本、后台进程、内存速度影响会有浮动但大方向是准的。可以看到只要你愿意把分辨率和帧数降下来老显卡也能参与这个游戏。7. 常见问题与排查技巧实录7.1 高频报错速查表报错现象根本原因处理方案CUDA out of memory显存不足换小模型/降分辨率/开 offload/关其他程序KeyError: text_config文本编码器文件不对检查是否用了 UMT5-XXL不是 BERT 之类No module named torchPython 环境没装 PyTorchconda 里安装 PyTorch 的 CUDA 版本RuntimeError: device mismatch模型跨设备确认 --lowvram 和 offload 设置一致视频黑屏/全是噪点VAE 加载错误或步数太少检查 VAE 是否正确加载步数至少 20中文提示词无效编码器加载不完整重新加载 UMT5-XXL确认无 CUDA 错误7.2 我最常踩的坑第一个坑是硬盘空间。有一次下 14B 权重下了两小时准备生成时发现系统盘只剩 500MB直接写入失败。从那以后我养成习惯装模型前先 df -h 看一眼。第二个坑是 Python 环境里的 torch 版本。ComfyUI 官方文档要求 PyTorch 版本至少 2.0但 NVIDIA 的老驱动配新 PyTorch 会有冲突。我的建议是统一用 conda 创建一个 Python 3.11 环境然后重装最新稳定版 PyTorch CUDA 版本不要用 pip 随便装。第三个坑是生成视频闪烁。如果你出的视频画面一帧亮一帧暗大概率是采样步数太少或者 CFG 拉太高。把步数提到 30CFG 回落到 5闪烁问题能解决一大半。如果还闪考虑是不是 VAE 版本不对换官方那个 VAE 文件重新下载。第四个坑是图生视频时画面抖动特别厉害。这通常是因为参考图的构图太乱。用剪刀裁剪把构图切干净背景虚化一下或者换一张更简单的图抖动会明显减轻。7.3 定位问题的通用思路本地 AI 应用出错最怕的就是每个环节都像黑盒。我的排查顺序是先看报错日志末尾的异常类型如果是 CUDA 相关直接查显存和驱动如果是模型加载相关检查文件路径和 sha256如果是采样阶段跑着跑着崩溃优先降分辨率或帧数如果生成完了视频画面质量差那基本不是代码问题是参数问题。日志看不明白时把完整报错关键字复制到搜索引擎搜索大概率能搜到别人踩过同一个坑。社区的力量很强大但前提是你把问题描述清楚显卡型号、显存、模型版本、ComfyUI 版本、完整报错一个都不能少。8. 本地部署 Wan2.1 之后能做什么8.1 个人 AIGC 工作流当你的机器能稳定出视频之后其实等于有了一个可以随时调用的个人视频生成工作室。日常使用最香的场景是做内容时快速出风格化转场、做视频封面动态图、给文章配一条短视频、甚至给家人朋友做生日祝福视频。我会把 Wan2.1 和其他的本地 AIGC 工具串起来用。比如在 Dify 里搭一个工作流管理提示词先让本地的大语言模型比如通过 Ollama 部署的 Qwen帮我改写和优化视频提示词再喂给 ComfyUI 生成视频。这套链路完全在本地跑所有数据不出自己的电脑隐私和安全都有保障。8.2 从玩到用的一些建议本地部署 AI 模型最大的价值不是省掉 API 费用而是你可以不受限制地试验、出片、失败、重来。云端 API 掐着 token 掐着并发你就很难有那种“随便造”的底气。我建议刚上手的人给自己定一个 7 天目标第一天把环境搭好、第二天跑通文生视频、第三天开始尝试图生视频、第四天对比不同模型档位、第五天调出自己的参数组合、第六天做超分和补帧后处理、第七天完整出一条 10 秒以上的短片。节奏感很重要能帮你把精力集中在真正值得研究的地方。8.3 后续可以玩的扩展方向Wan2.1 只是开始。如果你是那种喜欢折腾的人有几个方向可以接着玩下去一是搭一套 ComfyUI 的工作流模板库把自己验证过的好参数组合存下来以后出片一拖就用二是研究提示词工程尝试不同的描述方式对生成结果的影响这个空间很大三是和后处理工具链配合看看怎么把生成视频的审美和品质往上推。真正玩起来之后你会发现技术门槛只是第一道坎创意和审美的门槛才是真正拉开差距的地方。但无论如何现在动手把本地环境跑通你已经赢了大多数人。我个人在实际操作中的体会是本地跑视频生成模型这件事最难的还真不是硬件而是耐心。第一次下载模型失败、第一次显存爆掉、第一次出的片没法看这些都是必经之路。但只要把流程理顺了它就会成为你电脑里一个随叫随到的工具想什么时候拍一条就拍一条。最后再分享一个小技巧出完片别急着删把你觉得不错的提示词、参数组合、甚至失败的案例都记在本地一个笔记里时间久了你会发现这就是你专属的 AI 导演手册。