主题
MiniMax H3 音视频
MiniMax H3 是一款同时生成并安排画面和声音的音视频模型,适合制作包含人物对白、环境声、动作音效或配乐的短片。创作可以从文字、起始画面或首尾两张画面开始,也可以混合图片、视频和音频作为参考,用来保持人物和场景一致,并让动作与声音符合设定。
选择模型和组件
打开 内容生成,点击页面顶部的 视频,再从 模型菜单进入 MiniMax H3 系列。
- MiniMax H3 音视频用于文生视频、起始画面生成和首尾帧生成。
- MiniMax H3 参考生成用于混合图片、视频和音频参考。

在 基础设置中点击 选择 UNet,选择 H3 主模型。然后展开 高级设置,选择 Qwen3-VL 32B 文本编码器、视频 VAE 和音频 VAE。确认主模型已经选定,并让 运行组件显示 已就绪 · 3 项。
文生视频与图生视频
进入 MiniMax H3 音视频后,在提示词标题右侧选择生成方式。
文生视频
点击 文生视频。提示词需要完整说明场景、人物、动作、镜头、对白和声音:
text
一间深夜便利店,雨水敲打遮雨棚。一名穿黄色雨衣的女子从右侧走入画面,
镜头缓慢推向玻璃门。她停下脚步,看着亮起的招牌,用中文轻声说:
“还好没有关门。”现场有雨声、远处车辆声和踩过浅水的脚步声,
配乐是留有大量停顿的轻柔钢琴。可以点击 AI 提示词,把这样的普通描述整理成 H3 所需的格式;检查结果后点击 使用提示词写回页面。
从起始画面生成
点击 图生视频,在 起始画面中选择图片:
- 点击选择参考图:使用 ComfyUI 输入目录中的图片。
- 上传本地图片:从当前设备选择图片。
起始画面确定人物、服装和构图,提示词重点描述动作、镜头、对白和声音。手动编写时,在开头说明 <Picture 1> 与 0 秒画面对齐:
text
For the target video, at 0.00 seconds into the target video,
<Picture 1> (from [Shot 1]) is fully referenced.从首帧过渡到尾帧
选择 图生视频后,右侧还会显示 结束画面(可选)。同时添加起始和结束画面,再写清中间怎样变化。
假设视频时长是 5 秒,并使用两个镜头,可以在提示词开头把两张图分别对应到开始和结束:
text
How the reference pictures align with the target video — Picture 1 (from Shot 1)
aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 2)
aligns with the 5.00-second mark of the target video.其中 Picture 2要对应提示词中的最后一个镜头:最后写到 [Shot 2]时使用 Shot 2,镜头更多时换成相应编号;最后的时间与页面时长保持一致。接着描述连续过程,例如人物怎样转身、镜头怎样移动、光线怎样变化。首尾姿势差异较大时,适当延长时长并减少中间事件,可以给过渡留下更完整的过程。
AI 提示词整理
H3 的提示词带有画面时间线和声音分区。不熟悉这种格式时,可以在当前入口中点击 AI 提示词:
- 选择 文字描述。
- 用中文或英文写出场景、动作、镜头、对白、环境声和配乐。
- 点击 生成。工具会结合当前视频时长整理格式。
- 检查台词语言、镜头顺序和声音要求。
- 点击 使用提示词写入页面。
希望精确控制每一部分时,可以继续手动修改生成结果。
手动编写基础提示词
基础提示词由三个部分组成,顺序保持一致:
text
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...| 部分 | 填写什么 | 什么时候需要调整 |
|---|---|---|
integrated_multimodal_description | 画面、动作、镜头、对白,以及在具体时刻发生的声音 | 动作顺序、口型或镜头时机不准确时,修改这里的时间线 |
overall_soundscape | 用几句话概括整段视频持续存在的环境声和动作声 | 声音层次过多时,只保留最主要的雨声、交通声、脚步声等 |
non_diegetic_music | 角色在场景中听不到的画外配乐 | 需要音乐时写风格、乐器和情绪;只要现场声音时填写 N/A |
编写画面时间线
第一段使用 [Shot 1]。出现第二个镜头时,写出开始时间:
text
[Shot 2] At 00:05.000, the camera cuts to a close view of her hands...一段短视频可以只使用一个镜头。需要切镜头时,给每个镜头留下足够时间,并让上一段动作有明确结束。
编写对白
把台词放在说话动作附近,并标明语言:
text
She looks toward the door and says <d>[Chinese] 还好没有关门。</d>一小段时间内安排一句较短的台词,口型和节奏更容易配合。两个人说话时,分别说明是谁开口,并把台词放在对应人物动作后面。
完整示例
text
integrated_multimodal_description: [Shot 1] A small late-night convenience store
seen from across a rain-soaked street. A woman in a yellow raincoat enters frame
from the right as the camera slowly pushes toward the glass doors. Rain taps the
awning and passing cars create red reflections on the road. She pauses, looks at
the illuminated sign, and says <d>[Chinese] 还好没有关门。</d>
overall_soundscape: Steady rain, distant traffic, soft footsteps in shallow water,
and the low electrical hum of the storefront.
non_diegetic_music: A sparse, gentle piano theme with long pauses.参考生成
打开 MiniMax H3 参考生成。在 参考素材中点击 添加图片、添加视频或 添加音频。素材会按类型自动编号为 <Picture 1>、<Video 1>、<Audio 1>。

按照 H3 的参考素材规格整理文件,可以减少上传后重新处理素材的次数:
| 素材 | H3 参考规格 | 常见用途 |
|---|---|---|
| 图片 | 最多 9 张,单张不超过 20 MB | 人物外观、服装、物体、场景或画风 |
| 视频 | 最多 3 段,每段 2–15 秒,总时长最多 15 秒,单段不超过 50 MB | 人物运动、镜头运动和剪辑节奏 |
| 音频 | 最多 3 段,每段 2–15 秒,总时长最多 15 秒,单段不超过 15 MB | 音色、说话方式、旋律、节奏或音乐风格 |
混合素材总数最多 12 个。使用音频参考时,同时添加一张图片或一段视频。需要参考某段视频中的声音时,可以把声音单独保存为 WAV 或 MP3,再通过 添加音频上传。
给每份素材分配一个清楚的用途:
text
<Picture 1> provides the character's face and clothing.
<Video 1> provides the slow clockwise camera movement.
<Audio 1> provides the singer's vocal tone and phrasing.同一素材承担的职责越集中,人物身份、动作和声音越容易保持一致。
手动编写参考生成提示词
参考生成使用六个部分:
text
subject_definitions:
<Subject 1> is the woman shown in <Picture 1>.
summary:
[reference generation] Create a rainy-night street scene featuring <Subject 1>.
retention_analysis:
<Subject 1>: fully_preserved - preserve facial identity, hairstyle and yellow coat.
detailed_description:
[Shot 1] <Subject 1> walks toward a small convenience store...
overall_soundscape:
Rain, traffic, footsteps and the store door bell.
non_diegetic_music:
N/Asubject_definitions给人物或主要物体命名;summary概括成片;retention_analysis说明哪些特征需要保留;detailed_description写镜头时间线;最后两部分写声音和配乐。
保留程度可以按目标选择:
| 写法 | 含义 |
|---|---|
fully_preserved | 尽量保留身份、外观和主要特征 |
partially_preserved | 保留主要特征,同时允许服装、角度或细节变化 |
attribute_transfer | 只借用指定属性,例如发型、配色或材质 |
weak_reference | 只把素材作为较弱的风格或方向参考 |
音频参考对应使用 fully_copy、partially_copy、reference 或 weak_reference,分别表示从强到弱的保留程度。
设置分辨率、时长和种子
| 选项 | 页面设置 | 怎样选择 |
|---|---|---|
| 分辨率 | 768p 横图、竖图、方形,或自定义 | 横图适合常规镜头,竖图适合手机画面,方形适合居中主体。首次生成使用默认横图;显存不足时缩短时长或改用较小的自定义尺寸 |
| 时长 | 4–15 秒,按 1 秒调整 | 单一动作和一句短台词可从 4–6 秒开始;多个动作、镜头或较长对白需要增加时长 |
| 帧率 | 24 fps | 页面会按所选时长显示实际帧数。帧数还会与模型的处理网格对齐,因此显示值可能略高于“时长 × 24”,例如 5 秒会显示 124 帧 |
| 采样器 | res_multistep | H3 的默认采样方式,日常使用保留该值 |
| 调度器 | simple | 与默认采样器配合使用,日常使用保留该值 |
| 种子 | 随机 | 需要探索不同画面时使用随机;希望在同一构图上比较提示词、声音或时长时切换为固定种子 |
视频会以 MP4 形式保存,并包含生成的音频。高级设置中的 文件名前缀可以修改结果名称和保存目录。
生成结果调整
- 对白与口型错开:缩短台词,把台词放在对应人物的说话动作旁,并减少同一时间发生的其他事件。
- 声音层次混乱:时间线只写具体时刻发生的声音,
overall_soundscape只概括持续存在的主要声音。 - 首尾帧过渡突然:减少中间动作,写清姿势怎样逐步变化,并增加时长。
- 参考人物不稳定:在
subject_definitions中建立主体,在retention_analysis中列出脸、发型和服装等重点。 - 多份素材互相干扰:让每份素材主要负责身份、动作、镜头或声音中的一项。
- 等待时间或显存占用过高:缩短时长,减少参考素材,并使用较小的自定义分辨率。