主题
生成参数参考
生成参数控制着扩散模型与流匹配(Flow Matching)模型如何从随机噪声逐步去噪并渲染出最终的图像或视频。了解各参数的作用原理与适用范围,有助于在创作过程中精准控制画面质量、风格表现与显存开销。
核心采样参数
种子(Seed)
种子决定了生成任务初始潜空间中的随机噪声分布:
- 固定种子:保持模型、提示词、分辨率与采样参数不变时,使用固定种子可以稳定复现出构图一致的画面,适合用来微调提示词或对比单项参数的影响。
- 随机种子(-1):每次生成时自动选用全新随机数,适合在构思初期探索不同的构图、姿态与光影创意。
采样步数(Steps)
采样步数表示模型从纯噪声到清晰图像的去噪迭代轮数:
- 传统扩散模型(如 SDXL、Pony、Illustrious):通常推荐使用 20–30 步。步数过少画面模糊或缺乏细节;超过 35 步后画质提升微弱且线性增加生成耗时。
- 现代 DiT 与蒸馏架构(如 Z-Image、Krea 2、FLUX.2 Klein):经过加速蒸馏训练,只需 4–8 步 即可达到全精度生成效果。
- 视频模型(如 Wan 2.2、MiniMax H3):标准渲染通常使用 20 步;Wan 2.2 快速档通过挂载加速 LoRA 仅需 4 步。
提示词引导(CFG Scale 与 Guidance)
引导系数用于调节模型在生成过程中遵循提示词描述的严格程度:
- 传统 CFG Scale(SDXL / Pony / Illustrious):
- 推荐范围通常为 4.0–7.0。
- 数值较低时画面更自然自由,但可能忽略部分冷门 Tag;数值较高时提示词还原度提升,但过高(如大于 9.0)容易导致色彩过饱和、对比度过硬或边缘伪影。
- Guidance Scale(FLUX.1 Dev / FLUX.2 Dev):
- FLUX 系列采用全新的文本引导机制(BasicGuider),CFG 固定为 1.0,通过 Guidance 参数(通常为 3.5–4.0)独立控制文本引导强度。
- CFG=1.0 的蒸馏模型(Z-Image / Krea 2 / MiniMax H3 / 视频快速档):
- 蒸馏与加速模型在训练时已固化了引导方向,必须保持 CFG = 1.0。调高 CFG 不仅不会提升遵循度,反而会导致画面严重崩坏或色彩烧焦。
采样器与调度器(Sampler & Scheduler)
采样算法负责计算每一步去噪的方向与量级,调度器负责规划整段去噪过程中噪声的衰减曲线:
| 算法 / 调度器 | 特点与适用场景 |
|---|---|
euler + normal | 最经典、最稳定的通用采样组合,适合 SDXL 基础模型 |
euler_ancestral (euler_a) + normal | 带有随机扰动的采样器,细节丰富且富有二次元质感,是 Pony、Illustrious、NoobAI 的官方首选 |
euler + simple | 现代 DiT 与流匹配模型的标准配置,广泛用于 FLUX.1、FLUX.2、Wan 2.2、Krea 2 |
res_multistep + simple | 多步残差采样器,为 Z-Image 与 MiniMax H3 带来出色的极速收敛与画面保真度 |
uni_pc + simple | 专为高效扩散模型设计的统一预测校正采样器,是 Wan 2.2 5B 的专属默认组合 |
er_sde + simple | 随机微分方程采样器,为 Anima 模型提供丰富细腻的笔触与暗部过渡 |
提示词与模型组件参数
Clip Skip(跳过层数)
Clip Skip 决定从文本编码器(CLIP)的倒数第几层提取语义特征向量:
- Clip Skip = 1:提取最顶层特征,适用于标准 SDXL 模型。
- Clip Skip = 2:跳过最后一层、提取倒数第二层特征。由于最后一层往往过度偏向分类任务,倒数第二层包含了更丰富、更多样化的视觉表现力。Pony、Illustrious、NoobAI 均基于 Clip Skip 2 训练,必须使用 2 才能准确触发画风与角色特征。
VAE 与 Audio VAE
- 图像 VAE:负责在潜空间(Latent Space)与可见像素之间进行压缩和解压。如果生成图像颜色发灰、对比度异常或出现大面积噪点,通常是因为选用了与主模型不匹配的 VAE。
- 音频 VAE(Audio VAE):在 MiniMax H3 等音视频双生模型中,负责生成与画面动作节拍同步的环境声、角色对白与背景音乐。
图生图与条件控制参数
重绘强度(Denoise)
控制图生图(Img2Img)过程中对输入画面的修改幅度,取值范围为 0.0 至 1.0:
0.2–0.4(微调):仅修复面部五官或进行微小的材质/光影调整,完全保持原图构图。0.5–0.7(风格重绘):保留原图主体轮廓与空间构图,允许更换画风、服饰质感与背景细节。0.8–1.0(创意重构):仅将原图作为粗略的色彩与构图参考,生成全新画面。
ControlNet 条件控制
- 控制强度(Strength):取值
0.0–1.0,决定骨骼姿态、线稿轮廓或深度图对画面的约束力度。 - 起止步数(Start / End Step):设置 ControlNet 在采样周期的哪一段发挥作用(例如
0.0–0.8)。在采样后期(如最后 20% 步数)释放约束,能让模型更自然地补充皮肤纹理与光影细节。
视频生成专用参数
帧率(FPS)与时长换算
视频生成的总帧数由帧率与时长共同决定,计算公式为:
- Wan 2.2 14B:标准帧率为 16 fps,时长上限为 7 秒(
帧)。 - Wan 2.2 5B:标准帧率为 24 fps,时长上限为 5 秒(
帧)。 - MiniMax H3:标准帧率为 24 fps,支持 4–15 秒的整数秒调节(例如 5 秒为 124 帧)。
宽高整除约束
视频模型的 3D 卷积与时空注意力层要求输入画面的宽度和高度必须被指定数值整除:
- 14B 架构(Wan 2.2 14B):分辨率长宽必须能被 16 整除(如
、 )。 - 5B 与 H3 架构(Wan 5B / MiniMax H3):分辨率长宽必须能被 32 整除(如
、 )。
时间采样位移(Shift)
在 ModelSamplingSD3 机制中,Shift 参数用于控制时间维度上的信噪比衰减速度:
- Wan 2.2 14B 推荐设置为 5.0。
- Wan 2.2 5B 推荐设置为 8.0。
- 调高 Shift 会使视频动态更大幅度、镜头运动更剧烈;调低 Shift 则动作更缓和稳定。
推荐的调参工作流
- 选择匹配的模型架构:确认需要生成的风格类型(二次元、写实或视频)。
- 设定目标画幅与时长:选择标准分辨率预设,避免非标准比例导致显存浪费或画质劣化。
- 编写核心提示词:优先使用推荐默认的采样器、调度器与步数生成第一版效果。
- 锁定种子进行微调:满意当前构图时,固定种子数值,通过微调提示词权重或增删修饰词来优化局部。
- 按需叠加高级模块:在主体明确的基础上,按需启用 LoRA、ControlNet、高清修复或面部修饰。