主题
Wan 2.2 视频
Wan 2.2 是以画面运动为重点的视频生成模型,适合制作人物动作、镜头移动和场景变化明显的短片。它既可以从文字设计完整镜头,也可以让一张现有图片中的人物和环境动起来;14B 适合需要更完整画面细节的任务,5B 轻量入口占用的运行资源更少,适合快速尝试。输出是以画面为主的 MP4 短视频。
选择入口
| 入口 | 输入方式 | 帧率与时长 | 更适合 |
|---|---|---|---|
| Wan 2.2 图生视频 | 一张起始画面和提示词 | 16 fps,1–7 秒 | 保留人物、服装和构图,制作较完整的动作与镜头 |
| Wan 2.2 文生视频 | 提示词 | 16 fps,1–7 秒 | 从零设计主体、场景、动作和镜头 |
| Wan 2.2 5B 轻量 | 文生或一张起始画面 | 24 fps,1–5 秒 | 用较小的模型快速完成短片段 |
打开 内容生成,点击页面顶部的 视频,再从 模型菜单中的 Wan 2.2 系列选择对应入口。

选择运行组件
14B 的文生和图生入口都需要高噪、低噪两个主模型,以及 UMT5 文本编码器和 Wan 视频 VAE:
- 在 基础设置中点击 选择高噪权重和 选择低噪权重。
- 文生入口选择 T2V 的一对主模型;图生入口选择 I2V 的一对主模型。
- 在 高级设置中选择 UMT5 文本编码器和对应的视频 VAE。
- 展开 运行组件,确认各项均已就绪。
5B 轻量入口只需点击 选择 UNet选择一个 5B 主模型,再选择 UMT5 文本编码器和 5B 对应的视频 VAE。
从一张图片生成视频
选择 Wan 2.2 图生视频;使用 Wan 2.2 5B 轻量时,在提示词标题右侧切换到 图生视频。随后添加 起始画面:

- 点击 点击选择参考图,使用 ComfyUI 输入目录中的图片。
- 点击 上传本地图片,从当前设备选择图片。
起始画面已经确定人物、服装、背景和构图,提示词主要描述接下来怎样变化:
text
She slowly turns toward the window and smiles.
Her hair and the thin curtains move in a light breeze
as the camera gently pushes in. Warm sunlight gradually brightens the room.动作幅度、速度和镜头方向写得越具体,结果越容易判断。例如,slowly turns her head 比 moves naturally 更明确;the camera slowly pushes in 比 cinematic camera 更容易控制。
添加图片后,分辨率中会出现 贴合起始画面。选择它可以尽量沿用原图比例;选择其他横图、竖图或方形预设时,页面会居中裁切起始画面以适配比例。
根据文字生成视频
选择 Wan 2.2 文生视频;使用 Wan 2.2 5B 轻量时,在提示词标题右侧切换到 文生视频。提示词需要完整写出主体、场景、动作、光线和镜头:
text
A woman in a yellow raincoat walks through a crowded night market.
She pauses beside a steaming food stall and looks back over her shoulder.
The camera tracks forward at walking speed while red signs reflect on the wet road.
Light rain continues throughout the shot, cinematic street photography.可以按下面的顺序组织:
text
主体与外观 → 场景 → 连续动作 → 动作速度 → 镜头运动 → 光线和环境变化短片段可以围绕一个主要动作展开。需要两个动作时,用 then 写先后,用 while 写同时发生,让人物动作和镜头运动保持清楚。
快速与标准模式
14B 入口提供两种速度:
| 速度 | 页面设置 | 适合的阶段 |
|---|---|---|
| 快速 | 固定 4 步、CFG Scale 1 | 比较动作方向、镜头运动、画面比例和不同提示词 |
| 标准 | 默认 20 步、CFG Scale 3.5 | 方向确认后完善人物、背景和运动细节,并使用反向提示词 |
快速通常更适合试构图和运动。满意后切换到 标准,保持提示词和种子不变,可以更直接地比较细节变化。
标准模式显示 步数和 CFG Scale:
- 步数决定模型完善视频的次数。默认
20;运动方向正确但细节粗糙时可以提高到24–30。希望更快比较多个描述时,可以降到16左右。 - CFG Scale决定视频对提示词的服从程度。默认
3.5;主要动作或镜头被忽略时可小幅提高,人物动作发僵、颜色过重或背景跳变时可降低到2.5–3。
5B 轻量入口使用固定的 20 步、CFG Scale 5、采样器 uni_pc 和调度器 simple,页面会直接采用这组设置。
设置分辨率和时长
| 选项 | 怎样选择 |
|---|---|
| 480p | 适合首次试跑、比较动作和镜头,等待时间和显存占用相对较少 |
| 720p | 适合动作与构图已经确定后制作更清楚的结果,会使用更多时间和显存 |
| 横、竖、方 | 根据观看场景选择;横向适合常规视频,竖向适合手机画面,方形适合居中构图 |
| 贴合起始画面 | 图生视频中尽量沿用原图比例,适合减少主体被裁切的情况 |
| 自定义 | 输入特定宽高;14B 会按 16 的倍数调整,5B 会按 32 的倍数调整 |
14B 时长可在 1–7 秒之间按 0.5 秒调整,5B 可在 1–5 秒之间按 0.5 秒调整。动作简单时从 2–3 秒开始;转身、行走或明显镜头运动可以使用 4–5 秒;需要更长时间时,减少同时发生的动作,给每个变化留出过程。
使用反向提示词
14B 标准模式和 5B 轻量入口会显示反向提示词,可以从下面的内容开始:
text
flickering, jitter, deformed body, duplicated limbs,
unstable background, text, watermark视频出现闪烁时保留 flickering,镜头抖动时加入 jitter,人物肢体重复时加入对应描述。快速模式会把重点放在正向提示词,因此页面会收起反向提示词输入框。
添加 LoRA
选择标注支持当前 Wan 2.2 入口的 LoRA。14B 的 LoRA 卡片可以点击阶段标签,在三种方式间切换:
| 阶段 | 适合怎样使用 |
|---|---|
| 双段 | 让 LoRA 参与从整体运动到最终细节的完整过程,适合作为默认选择 |
| 仅高噪 | 更侧重早期形成的构图、运动方向和大范围变化;LoRA 作者明确推荐高噪段时选择 |
| 仅低噪 | 更侧重后期形成的纹理和局部外观;LoRA 作者明确推荐低噪段时选择 |
强度可以从较低值开始,固定种子逐步提高。人物或运动特征较弱时增加强度,动作受到过度限制或画面被单一风格覆盖时降低强度。
生成结果调整
- 人物变化过大:减少静态外观描述,把提示词集中在动作、表情和镜头。
- 动作突然跳变:减少动作数量,写清开始、过程和结束,并适当延长时长。
- 画面主体被裁切:图生视频选择 贴合起始画面,文生视频改用更合适的横竖预设。
- 背景闪烁:减少复杂背景变化,使用标准模式,并在反向提示词中加入
flickering, unstable background。 - 等待时间或显存占用过高:缩短时长、选择 480p,或者改用 5B 轻量入口。
生成完成后,点击 队列 / 历史可以预览和下载视频。