主题
模型功能对照表
ComfyCarry 会根据当前选择的模型架构动态调整生成界面,自动隐藏不适用的参数项并加载对应的工作流编排。下表汇总了所有支持模型的特性、打包形态、默认采样参数与高级模块支持情况,适合在选择模型、准备模型文件或排查参数显示时快速查阅。
图像模型功能矩阵
| 模型架构 | 打包形态 | 提示词 | 反向词 | LoRA | 图生图 | ControlNet | 高清/面修 | 推荐步数 | CFG / 引导 | 推荐采样组合 |
|---|---|---|---|---|---|---|---|---|---|---|
| SDXL | 整合包 | Tag | ✓ | ✓ | ✓ | sdxl | ✓ | 20 | 7.0 | euler + normal |
| Pony | 整合包 | Tag | ✓ | ✓ | ✓ | sdxl | ✓ | 25 | 7.0 | euler_a + normal (Skip 2) |
| Illustrious | 整合包 | Tag | ✓ | ✓ | ✓ | ilnoob | ✓ | 28 | 5.0 | euler_a + normal (Skip 2) |
| NoobAI | 整合包 | Tag | ✓ | ✓ | ✓ | ilnoob | ✓ | 28 | 4.5 | euler_a + normal (Skip 2) |
| Anima | 整合 / 分体 | Tag | ✓ | ✓ | ✓ | — | ✓ | 30 | 4.0 | er_sde + simple |
| Krea 2 | 整合 / 分体 | 自然语言 | — | ✓ | ✓ | — | ✓ | 8 | 1.0 | euler + simple |
| Z-Image | 分体模型 | 自然语言 (中英) | — | ✓ | ✓ | — | ✓ | 8 | 1.0 | res_multistep + simple |
| FLUX.1 (Dev) | 整合 / 分体 | 自然语言 | — | ✓ (双 CLIP) | ✓ | flux | ✓ | 20 | 1.0 (Guide 3.5) | euler + simple |
| Chroma | 整合 / 分体 | 自然语言 | ✓ | ✓ | ✓ | — | ✓ | 26 | 4.0 | euler + simple |
| FLUX.2 Klein 4B | 整合 / 分体 | 自然语言 | ✓ | ✓ | — | — | 仅放大 | 4 | 1.0 | euler + simple |
| FLUX.2 Klein 9B | 整合 / 分体 | 自然语言 | ✓ | ✓ | — | — | 仅放大 | 4 | 1.0 | euler + simple |
| FLUX.2 Dev | 整合 / 分体 | 自然语言 | — | ✓ | — | — | 仅放大 | 20 | 4.0 (Guidance) | euler + simple |
打包形态说明
- 整合包(Checkpoint):将主扩散模型、文本编码器(CLIP)与 VAE 打包在单个
.safetensors文件中,存放在models/checkpoints/目录。 - 分体模型(Split):主模型(UNet/DiT)、文本编码器(
models/clip/)与 VAE(models/vae/)分别独立加载,便于根据显存大小自由搭配量化版本(如 FP8、GGUF)与文本编码器。
视频模型规格矩阵
| 视频模型 | UNet 结构 | 输入模式 | 时长上限 / 帧率 | 宽高整除 | 速度开关 | 音画同步 | 推荐步数 | CFG / Shift | 推荐采样组合 |
|---|---|---|---|---|---|---|---|---|---|
| Wan 2.2 14B 图生 | 双 UNet (高低频) | 起始画面 + 提示词 | 7s · 16 fps | 16 | ✓ | — | 20 (快档 4) | CFG 3.5 · S 5.0 | euler + simple |
| Wan 2.2 14B 文生 | 双 UNet (高低频) | 纯文字提示词 | 7s · 16 fps | 16 | ✓ | — | 20 (快档 4) | CFG 3.5 · S 5.0 | euler + simple |
| Wan 2.2 5B | 单 UNet | 文生 / 图生 | 5s · 24 fps | 32 | — | — | 20 | CFG 5.0 · S 8.0 | uni_pc + simple |
| MiniMax H3 (音视频) | 单 UNet | 文生 / 图生 (首尾帧) | 4–15s · 24 fps | 32 ( | — | ✓ | 20 | CFG 1.0 | res_multistep + simple |
| MiniMax H3 (参考生成) | 单 UNet | 画面/视频/音频 + 文本 | 4–15s · 24 fps | 32 ( | — | ✓ | 20 | CFG 1.0 | res_multistep + simple |
视频模型的特殊约束
- 宽高整除约束:生成视频时,画面宽度与高度必须能被指定数值整除(14B 要求能被 16 整除;5B 与 H3 要求能被 32 整除),否则潜空间采样与 VAE 编码会报错。
- MiniMax H3 帧长网格:H3 生成的总帧数必须满足
的数学网格(例如 4 秒 107 帧、5 秒 124 帧)。ComfyCarry 的时长滑块已在底层自动完成帧长换算与对齐。
选型建议与场景匹配
- 二次元与动漫创作:
- 偏好成熟社区生态与丰富 LoRA 资源:优先选择 Pony、Illustrious 或 NoobAI。
- 追求超清现代画风与丰富色彩:选择 Anima。
- 写实人像、复杂构图与自然语言交互:
- 需要精准理解长文本提示词或渲染文字排版:选择 FLUX.1 (Dev) 或 FLUX.2 系列。
- 需要极速出图与中英双语提示词支持:选择 Z-Image 或 Krea 2。
- 图像转动态视频:
- 画面已有满意的静态图,需要平滑的镜头运动或人物动作:选择 Wan 2.2 图生视频 14B(更高质感与细节)或 Wan 2.2 5B(更低显存占用与更快渲染)。
- 需要视频自带对白、环境音效与配乐:选择 MiniMax H3 音视频。
- 多素材参考驱动生成:
- 手头拥有多张角色设计图、参考动作视频或背景音乐,希望综合生成具有指定视觉与听觉特征的全新视频:选择 MiniMax H3 参考生成。