Wan 2.2 本地视频生成全流程:ComfyUI 从安装到出片
Wan 2.2 本地视频生成全流程:ComfyUI 从安装到出片
开源视频生成在 2026 年的答案基本是 Wan 2.2:画质高、中文支持好、ComfyUI 一条龙。这篇文章完整走一遍「模型下载 → ComfyUI 配置 → 文生视频 → 视频延长」,并给出不同显存下的实际参数和显存峰值规划。

一、Wan 2.2 是什么,需要什么配置
Wan 2.2(阿里通义实验室)是开源视频生成模型,支持文生视频、图生视频、视频延长。相比同期的 LTX-Video、CogVideo,它的画面稳定性更好、中文 prompt 支持优秀,是目前中文用户本地跑视频的首选。
从模型家族说起:Wan 系列最早是通义万相的多模态模型,2025 年开源了支持视频的 2.1,随后 2.2 在画质、运动控制和中文理解上做了明显升级。它最大的特点是「一支模型既能文生视频、又能图生视频」,切换场景只需换输入,不需要换模型。对本地玩家来说,这意味着下一种模型就能覆盖多种玩法,学习成本和磁盘占用都很友好。
和云端视频生成(Sora、Kling、可灵)相比,本地 Wan 的定位很清楚:想要可控、可批量、不上传素材的创作者。云端工具单条视频即用即取,但要按次付费、素材要上传;Wan 本地版一次配好,之后无限生成、素材不出机器,适合需要大量试错或对素材保密的内容团队。
硬件门槛(这是很多人卡住的地方):
| 显存 | 能跑什么 | 体验 |
|---|---|---|
| 8GB | 只适合小尺寸短片段 | 勉强,速度慢 |
| 12GB | 480p 短片段 | 可用 |
| 16GB | 720p 中等长度 | 舒服 |
| 24GB | 1080p / 长片段 | 推荐 |
| 48GB+ | 大分辨率 + 批量 | 最佳 |
帧数与时长换算
视频生成里「帧数」和「时长」的关系,很多人第一次接触会懵:Wan 默认帧率约 24~30 fps,所以 3 秒视频大约是 81 帧(81 / 27 ≈ 3 秒)。规划时记住这个换算:
| 目标时长 | 约需帧数(27fps) |
|---|---|
| 2 秒 | 54 帧 |
| 3 秒 | 81 帧 |
| 5 秒 | 135 帧 |
| 8 秒 | 216 帧 |
帧数直接决定显存和耗时的量级:帧数翻倍,显存约增加一半、耗时接近翻倍。所以「短视频频繁重试」比「一次出长片」划算得多——先用 3 秒把风格和动作定下来,确定满意后再加长。
二、安装 ComfyUI 与 Wan 节点
ComfyUI 本身装好是前提(参考本站 ComfyUI 部署教程)。然后需要装 Wan 专用的自定义节点。
1. ComfyUI-WanVideoWrapper(社区维护,最常用)
在 ComfyUI 的 Custom Nodes 目录下 clone:
1 | cd ComfyUI/custom_nodesgit clone https://github.com/kijai/ComfyUI-WanVideoWrapper.gitcd ComfyUI-WanVideoWrapperpip install -r requirements.txt |
装完重启 ComfyUI,节点面板会出现 WanVideo 相关的节点组。
2. 下载模型
Wan 2.2 模型在 HuggingFace 有多个版本,关键文件:
1 | Wan2.2-TI2V-5B-FP8(文生视频,FP8,体积约 11GB)Wan2.2-T2V-14B-FP8(文生视频,大模型,体积约 24GB) |
提示:FP8 版本是本地玩家的最佳选择,体积小、显存占用低、画质损失可忽略。BF16 原版体积翻倍,非 48GB 大显存不建议。
下载后放进 ComfyUI/models/diffusion_models/ 目录(视频模型专用目录),VAE 和 Text Encoder 按模型页面说明放到对应目录。
模型版本与文件核对清单
Wan 2.2 需要的文件不止 diffusion model 一个,常见的坑是「只下了主模型,VAE / 文本编码器缺了」。核对清单:
| 文件 | 作用 | 存放目录 |
|---|---|---|
| Wan2.2 主模型(FP8) | 去噪主模型 | models/diffusion_models/ |
| Wan VAE | 视频编解码 | models/vae/ |
| Text Encoder(T5) | 文本编码 | models/text_encoders/ |
下载时优先用 HuggingFace 官方仓库页面的「完整下载」按钮,或 hf download 命令一次拉全,避免漏文件。如果跑起来报「找不到 CLIP / T5」之类错误,多半是 text encoder 没放对位置。
三、搭建文生视频工作流
Wan 的工作流核心节点就几个:Load Diffusion Model → 文本编码 → Wan Video 采样 → VAE 解码 → 保存。如果你是工作流新手,先加载官方示例工作流(ComfyUI 社区每天都有 Wan 2.2 模板可导入)。
一个很实用的建议:先导入社区工作流再改,别从零搭。视频工作流的节点连接比图片复杂(VAE 处理帧序列、采样节点参数多),手搓容易漏连。社区模板通常附带完整的模型路径说明,加载后照着换成你自己的文件路径即可。跑通一次之后再理解每个节点,比从零学快得多。
关键参数(以 720p、81 帧为例):
| 参数 | 推荐值 | 说明 |
|---|---|---|
| 分辨率 | 1280×720 | 720p 起点 |
| 帧数 | 81 | 约 3 秒 |
| 采样步数 | 20~30 | 步数越高越稳 |
| CFG | 5.0~7.0 | 视频模型常用中低档 |
| 提示词 | 中文或英文 | Wan 中文理解好 |
| Seed | 固定或随机 | 调试时固定,找灵感时随机 |
| 批量数 | 1~4 | 显存够时可批量生成对比 |

提示:视频提示词要写「动态过程」而不是「静态画面」。写「一只猫在桌上伸懒腰,镜头缓慢推近」远比写「一只猫」出片率高。负提示词对 Wan 影响不大,可留空。
写好视频提示词的三个要点
视频提示词和图片提示词写法差异很大,掌握三个要点能明显提升出片率:
写动作,不写状态:视频的灵魂是「变化」。优先用动词描述:人物「站起来走向窗边」好过「站在窗边」,物体「缓缓旋转」好过「一个旋转的物体」。把你想看的「动线」写清楚,模型才知道往哪个方向动。
写镜头语言:本地视频模型对镜头指令有一定理解。「镜头缓慢推近」「俯拍」「跟随人物移动」这类词能显著改变成片观感。不加镜头词,默认是固定机位,画面会显得单调。
控制信息密度:一段提示词别塞太多「同时发生」的事件,模型消化不了会互相打架。3 秒的视频,一个主体、一个动作、一个镜头语言就够——信息量控制住,稳定性显著提高。
四、显存峰值规划:先算再用
视频生成是「显存峰值」非常敏感的负载——一个瞬间(采样过程中保存中间结果)可能比最终视频占的显存高得多。规划原则:
算好模型本体:FP8 5B 模型约 6GB,FP8 14B 约 13GB;
KV Cache 和中间帧:会额外吃掉 3~8GB,取决于帧数和分辨率;
实测预留:16GB 显卡跑 720p 建议用 5B-FP8;跑 14B-FP8 建议 24GB。
一个实用组合(16GB 显卡):
1 | 模型:Wan2.2-TI2V-5B-FP8分辨率:1280×720帧数:81采样步数:24预估峰值:约 13GB 显存 |
如果生成中爆显存,按顺序处理:降分辨率(720p→480p)→ 减帧数 → 换 5B 模型 → 减小采样步数。
显存够不够,一个命令提前判断
与其生成到一半才发现 OOM,不如开跑前先查清楚当前显存占用:
1 | nvidia-smi # 看当前占用nvidia-smi -l 5 # 每 5 秒刷新,实时监控生成过程 |
生成过程中用 nvidia-smi -l 5 盯一次,你能看到显存曲线在「采样开始瞬间」冲高——那个峰值才是关键数字。记住:模型的常规占用 + 采样的峰值,两者的和才是你需要的显存。如果峰值已经接近显存上限,下次就按「降分辨率 → 减帧数」的顺序先降一档。
16GB 显卡的推荐配置矩阵
| 需求 | 模型 | 分辨率 | 帧数 | 步数 | 峰值显存 |
|---|---|---|---|---|---|
| 短视频预览 | 5B-FP8 | 480p | 54 | 20 | 约 8GB |
| 日常出片 | 5B-FP8 | 720p | 81 | 24 | 约 13GB |
| 图生视频 | 5B-FP8 | 720p | 81 | 24 | 约 13GB |
| 高质量 | 5B-FP8 | 720p | 81 | 30 | 约 14GB |
| 长片段 | 5B-FP8 | 480p | 135 | 24 | 约 14GB |
16GB 显卡的甜点就是「5B-FP8 + 720p + 81 帧」,再往上就开始贴边。14B 模型留给 24GB 显卡。
五、图生视频与视频延长
Wan 2.2 除了文生视频,还有两个高频场景:
图生视频(T2I2V):给一张图 + 一句动态描述,让图片动起来。工作流里用 Load Image 节点接图,模型用 TI2V 版。这是电商、内容创作者的高频场景。
图生视频的实操要点:
图的质量决定视频质量:输入的静图构图清晰、主体突出,生成的视频就越稳。模糊、多主体的图,动起来容易崩;
提示词只写「动」的部分:图已经是静止状态,提示词描述「接下来怎么动」即可,不用重复描述画面内容;
首帧锚定:Wan 的 TI2V 会把输入图作为首帧,所以「第一帧就是你要的画面」至关重要,先修好图再生成。
视频延长:第一段视频结尾作为第二段的开头,逐段衔接。Wan 支持把上一段的最后一帧作为新段的起始帧,把 3 秒片段接到 9 秒甚至更长。注意每段之间风格要稳定,建议固定 Seed 或在提示词里保持一致风格描述。
视频延长的两个注意事项:
衔接痕迹:段与段之间可能有一两帧的轻微跳变,正常现象,后期用剪辑软件微调即可;
逐段验证:不要一口气接三四段——先延长一段看衔接是否自然,满意后再继续,否则返工成本很高。
六、速度与体验实测
RTX 4090 24GB 实测(Wan2.2-TI2V-5B-FP8):
| 参数 | 耗时 |
|---|---|
| 480p × 81 帧 × 20 步 | 约 1 分 40 秒 |
| 720p × 81 帧 × 24 步 | 约 4 分钟 |
| 1080p × 81 帧 × 30 步 | 约 9 分钟 |
不同显卡的速度参考
用 5B-FP8 模型,720p × 81 帧 × 24 步的耗时在不同显卡上的表现:
| 显卡 | 显存 | 耗时 | 备注 |
|---|---|---|---|
| RTX 4060 | 8GB | 无法跑 720p | 降到 480p |
| RTX 4070 | 12GB | 约 12 分钟 | 可用 |
| RTX 4080 | 16GB | 约 7 分钟 | 流畅 |
| RTX 4090 | 24GB | 约 4 分钟 | 推荐 |
| RTX 5090 | 32GB | 约 2 分半 | 很快 |
速度感知:一段 720p 视频 4 分钟,加上试错(一般要出 35 次才满意),单条成片实际投入 1520 分钟。批量场景建议「先小样挑选 → 再正式生成」,能省下大量等待时间。
关于生成质量的实测体会:Wan 2.2 在「人物动作自然度」上明显优于早期版本,但复杂肢体动作(跑酷、多人交互)仍可能出现「脚滑步、手穿模」这类小瑕疵,这是当前开源视频模型的共性,不是配置问题。3 秒以内的简单动作出片率很高(约 6~7 成直接可用),超过 5 秒的复杂运镜出片率明显下降。把「3 秒内、单主体、动作简单」当作默认目标,出片效率和稳定性最佳。
七、常见问题
| 问题 | 原因 | 对策 |
|---|---|---|
| 报 CUDA OOM | 显存不够 | 降分辨率 / 降帧数 / 换 5B-FP8 |
| 节点找不到 WanVideo | 节点没装好 | 检查 custom_nodes 目录与 requirements |
| 画面闪烁 / 不稳定 | 步数太少 / 提示词太长 | 步数提到 30,精简提示词 |
| 视频糊 | 分辨率与帧数不匹配 | 提高分辨率或缩短时长 |
| 中文提示词无效果 | 版本太旧 | 更新 WanVideoWrapper |
进阶:出片后的后处理
本地生成的视频通常比较「素」,直接发布效果一般。一条内容创作者常用的后处理流水线:
调色:用 DaVinci Resolve 或剪映把视频拉对比度、提饱和度,画面质感立刻提升;
插帧补帧:想要更顺滑的慢动作,用 RIFE 类插帧工具把 27fps 补到 54fps,再放慢播放;
超分:低分辨率片段可用 Real-ESRGAN 视频版放大到 2 倍,弥补「显存不够只能小分辨率生成」的遗憾;
加字幕/音效:配音用本地 TTS,字幕用 faster-whisper 自动生成(本站有教程),全套流程都能离线完成。
这一套「本地生成 + 本地后处理」串起来,内容创作就能完全摆脱云端依赖了。
八、什么时候不该用本地 Wan
本地视频生成有明确的适用边界,先认清再投入:
要出「电影级」长片:本地模型目前做 8 秒以上的连贯长镜头仍吃力,运动逻辑容易崩,这类需求交给云端大模型更现实;
显存低于 8GB:480p 短片的体验也勉强,投入产出比不划算;
要批量出片、时间敏感:本地生成以分钟计,一小时要出 20 条素材的场景,云端或购买算力更合适;
不适合本地:但如果你「素材保密、量不大、愿意折腾」,本地 Wan 是值得的长期投入——一次配置,无限使用。
小结
Wan 2.2 + ComfyUI 是目前本地视频生成最顺滑的组合:FP8 模型把显存门槛降到 12~16GB,TI2V 图生视频和视频延长让内容创作自由度大增。核心经验:提示词写动态、显存先规划、出片先低清再高清。12GB 以上的显卡,现在就能在本地跑出自己的视频。配套后处理(调色、插帧、超分、字幕)全流程也能本地完成,是一条完全离线的内容生产链路。需要提醒的是:本地视频生成目前仍是「愿意折腾才有好效果」的领域,但正因为门槛在这里,能跑通的人反而能拿到「无限生成、不上传素材」的独特优势。建议从本文的 16GB 配置矩阵起步,跑通一条 720p 文生视频,再逐步尝试图生视频和视频延长,稳扎稳打地把全流程吃下来。
延伸阅读:




