主题
如何选择视频模型
视频生成需要同时安排画面内容、连续动作、镜头移动,以及声音是否与画面一起生成。不同模型接受的起始素材和擅长的成片形式各不相同:Wan 2.2 主要处理人物动作和画面变化,MiniMax H3 还能把对白、环境声与配乐一起生成。明确想从文字、图片还是多份参考素材开始,再选择模型,会更容易得到符合目标的短片。
按创作目标选择模型
| 想完成的内容 | 建议入口 | 需要准备的素材 |
|---|---|---|
| 根据文字生成一段画面 | Wan 2.2 文生视频 | 一段包含主体、动作、场景和镜头的提示词 |
| 用较小的模型完成文生或图生视频 | Wan 2.2 5B 轻量 | 提示词;图生视频再准备一张起始画面 |
| 让现有图片中的人物或场景动起来 | Wan 2.2 图生视频 | 一张起始画面,以及动作和镜头描述 |
| 同时生成对白、环境声和配乐 | MiniMax H3 音视频 | 提示词,可选起始画面和结束画面 |
| 从首帧自然过渡到尾帧 | MiniMax H3 音视频 | 起始画面、结束画面和过渡过程描述 |
| 参考多张图片、视频动作或音频风格 | MiniMax H3 参考生成 | 图片、视频或音频,并说明每份素材负责什么 |

选择 Wan 2.2
Wan 2.2 适合短镜头、角色动作、镜头运动和场景变化,成片以画面为主。
- Wan 2.2 图生视频:起始画面决定人物、服装和构图,提示词主要写动作、速度与镜头。
- Wan 2.2 文生视频:画面完全来自提示词,需要写清主体外观、场景、动作、光线和镜头。
- Wan 2.2 5B 轻量:在同一入口切换文生视频和图生视频,适合使用更少的运行资源完成短片段。
14B 提供 快速和 标准两种速度。快速适合比较动作和镜头,标准会用更多采样步骤完善细节。完整设置见 Wan 2.2。
选择 MiniMax H3
MiniMax H3 适合声音与画面需要同步发生的内容,例如人物说话、脚步与环境声、动作音效和画外配乐。
- MiniMax H3 音视频:可以直接文生,也可以添加起始画面;再添加结束画面时,会生成首尾帧之间的连续变化。
- MiniMax H3 参考生成:可以混合多张图片、视频和音频,让不同素材分别提供人物外观、场景、运动、镜头或声音风格。
H3 的提示词包含画面时间线和声音说明。页面中的 AI 提示词可以把普通描述整理成所需格式,手动编写方法见 MiniMax H3。
设置分辨率和时长
视频的分辨率和时长会同时影响等待时间和显存占用。首次使用某个入口时,可以从较短时长开始:Wan 2.2 选择 480p,MiniMax H3 使用默认尺寸。动作和镜头符合预期后,再提高分辨率或延长时长。
出现显存不足时,优先缩短时长,再降低分辨率,并让队列中一次只运行一个视频任务。Wan 2.2 5B 轻量通常更适合资源较少的设备;需要 14B 或 H3 的完整效果时,可以为模型加载和长片段预留更多显存与系统内存。
编写视频提示词
文生视频需要写清完整画面:
text
主体与外观 → 场景 → 连续动作 → 动作速度 → 镜头运动 → 光线变化图生视频已经由起始画面确定人物与构图,提示词可以集中在变化过程:
text
主体怎样动 → 动作有多快 → 镜头怎样移动 → 环境怎样变化一段短片围绕一个主要动作展开,通常更连贯。需要两个动作时,写清先后关系;需要镜头跟随主体时,同时说明镜头方向和速度。更多示例见提示词与工具。
生成完成后,可以点击右上角 队列 / 历史查看任务、预览视频并下载结果。具体操作见队列、历史与运行方式。