主题
启动参数设置
ComfyUI 的启动参数决定了模型在运行时的显存分配模式、计算精度、生成加速方案以及缓存机制。在页面右上角点击 设置,可以查看与调整 ComfyUI 的各项启动选项。

显存与内存
控制 GPU 显存(VRAM)与系统内存(RAM)的使用模式与分配边界。

VRAM 管理
| 选项 | 对应参数 | 机制与效果 |
|---|---|---|
| 默认 | 无附加参数 | 由 ComfyUI 自动检测显存大小并决定模型加载与卸载策略。 |
| GPU Only | --gpu-only | 强制将所有模型权重始终保留在 GPU 显存中,不向系统内存卸载。显存充足时切换模型无重复加载等待;显存不足以容纳模型与生成上下文时会直接报错崩溃(CUDA Out of Memory)。 |
| High VRAM | --highvram | 尽量将模型保留在 GPU 显存中,仅在显存吃紧时卸载未使用的模块,以减少重复读写等待。 |
| Low VRAM | --lowvram | 推理时按模块分块将模型权重载入显存,计算完毕后立即释放回系统内存。显存峰值占用显著降低,但频繁的数据搬运会降低生成速度。 |
| No VRAM | --novram | 模型权重始终存放在系统内存中,推理时仅把当前执行的计算层送入显存。显存占用极低,生成速度最慢。 |
显存预留与调度
| 设置项 | 对应参数 | 用途 | 效果 |
|---|---|---|---|
| 显存预留 (GB) | --reserve-vram | 为系统桌面、浏览器等外部程序预留指定的 GPU 显存(单位 GB,填写整数,0 为默认值)。 | 数值越大,ComfyUI 可用的显存上限越低,同时降低外部程序因显存被占满而卡顿的概率。 |
| 动态显存余量 (GB) | --vram-headroom | 在动态显存调度模式下,在计算基线之上额外保留的缓冲空间(单位 GB,填写整数,0 为默认值)。 | 数值调大可降低大分辨率采样或加载多个 ControlNet 时突发爆显存的概率,但会减少模型常驻可用的显存空间。 |
| 异步权重卸载 | --async-offload / --disable-async-offload | 控制在上一层网络计算的同时是否后台异步传输下一层权重。 | 开启后减少 GPU 等待数据传输的空闲时间;关闭后转为同步串行传输。NVIDIA 平台默认启用。 |
| 动态显存调度 | --dynamic-vram / --disable-dynamic-vram | 控制是否根据运行时的实际显存压力动态分配模型各部分的驻留。 | 开启后显存吃紧时自动卸载空闲模块、显存空闲时保留更多权重;关闭后使用静态分配策略。 |
| CUDA 设备 | --cuda-device | 指定 ComfyUI 可见的 GPU 设备编号。 | 填单个编号(如 0)指定单卡运行,填逗号分隔列表(如 0,1)指定多卡协同,留空则使用系统可见的全部 GPU 设备。 |
内存与磁盘优化
| 设置项 | 对应参数 | 用途 | 效果 |
|---|---|---|---|
| 磁盘优先加载 | --fast | 通过页面缓存直接从磁盘映射模型,替代在系统内存中额外复制完整副本。 | 降低加载大模型时的系统内存(RAM)峰值占用,避免内存耗尽;在读取速度较慢的磁盘上可能会增加首次读取耗时。 |
| MMAP 文件映射 | --mmap / --no-mmap | 控制 .ckpt 与 .pt 格式权重文件是否使用内存映射机制加载。 | 开启后复用系统文件缓存加载;关闭后采用常规读取方式,可避开某些网络挂载文件系统的映射错误。 |
| Pinned 内存 | --disable-pinned-memory | 控制是否分配物理锁页内存以加速主机内存向 GPU 显存的数据传输。 | 开启可提升数据搬运效率;关闭可释放被锁定的系统物理内存。 |
精度控制
控制各模型组件在推理计算时的浮点数精度。

模型组件精度
| 设置项 | 支持选项 | 用途 | 效果 |
|---|---|---|---|
| UNet 精度 | 默认、FP32、FP16、BF16、FP8 (e4m3fn)、FP8 (e5m2)、FP8 (e8m0fnu) | 控制扩散模型主体(UNet 或 DiT)的矩阵计算精度。 | |
| VAE 精度 | 默认、FP32、FP16、BF16、CPU | 控制负责图像与潜空间相互转换的变分自编码器编解码精度。 | |
| Text Encoder 精度 | 默认、FP32、FP16、BF16、FP8 (e4m3fn)、FP8 (e5m2) | 控制文本提示词编码器(CLIP / T5 等)的推理精度。 | 改为 FP16 或 FP8 可降低大体量文本编码器(如 T5)的显存占用;改为 FP32 显存占用最高。 |
额外精度与张量选项
| 设置项 | 对应参数 | 用途 | 效果 |
|---|---|---|---|
| 中间张量 FP16 | --fp16-intermediates | 控制工作流节点之间传递的中间特征张量是否强制采用 FP16 格式。 | 开启后减少节点间数据存储占用的显存;关闭后保持原本张量精度。 |
| Channels Last | --force-channels-last | 控制是否将张量内存排列方式强制转换为 Channels Last 格式(NHWC)。 | 开启后在支持 Tensor Core 的 GPU 上提升卷积算子的计算效率;关闭后维持默认内存排布。 |
速度与缓存
配置注意力机制计算(Attention)的硬件加速方案与节点结果缓存机制。

Attention 与优化方案
| 设置项 | 选项 / 参数 | 用途 | 效果 |
|---|---|---|---|
| Attention 方案 | 默认、PyTorch SDPA、Split Cross Attention、Sub-Quadratic、FlashAttention、SageAttention | 选择注意力机制计算的加速后端。 | |
| xFormers | 默认、禁用 (--disable-xformers) | 控制是否启用 xFormers 优化库。 | 开启后为早期 GPU 架构提供显存优化与加速;关闭后不调用 xFormers 算子。 |
| 实验性优化 | 关闭、启用 | 控制是否开启底层算子编译优化。 | 开启后首次运行会经历编译耗时,后续重复执行时的计算吞吐速度提升。 |
| 注意力上采样 | 默认、强制上采样 (--force-upcast-attention)、禁用上采样 (--dont-upcast-attention) | 控制 Attention 矩阵计算时是否将权重提升至单精度(FP32)。 | 开启上采样可避免特定模型在半精度下的计算溢出与噪点异常,但会增加计算开销。 |
缓存策略
| 策略选项 | 用途 | 效果 |
|---|---|---|
| 默认 | 采用 ComfyUI 内置的节点缓存机制。 | 维持程序原本的节点复用行为。 |
| 经典 | 完整保留历史执行过的所有节点结果。 | 再次生成时未变动的上游节点直接读取已有结果,无需重复运算;多次运行复杂工作流会持续增加系统内存占用。 |
| LRU | 采用“最近最少使用”规则维护固定数量的节点缓存。 | 达到指定上限后自动释放最久未使用的节点缓存,在节点复用与系统内存占用之间取得平衡。 |
| 禁用 | 关闭节点计算结果缓存。 | 每次排队生成均从头执行完整计算流程,不额外占用系统内存。 |
当缓存策略选择 LRU 时,可通过 LRU 缓存大小 设置保留的节点数量(可选 16、32、64、128、256)。数值越大,保留的节点缓存越多,同时系统内存占用相应升高。
其他选项
配置实时生成预览、输出文件元数据、上传限制以及自定义启动参数。

预览、输出与上传限制
| 设置项 | 选项 / 参数 | 用途 | 效果 |
|---|---|---|---|
| 预览方式 | 自动、无、Latent2RGB、TAESD (--preview-method) | 控制扩散采样过程中在画布上呈现的实时临时画面算法。 | |
| 预览最大尺寸 | --preview-size | 设定预览图的最长边像素大小(填 0 为默认 512 像素)。 | 数值调小可降低网络传输与渲染开销;数值调大可提高采样画面的细节分辨率。 |
| 输出元数据 | 写入元数据、禁用写入 (--disable-metadata) | 控制保存生成文件时是否写入工作流参数(Prompt、Seed、采样设置与节点连接图)。 | |
| 上传上限 (MB) | --max-upload-size | 控制 ComfyUI 原生界面中通过节点上传单个文件的体积限制(填 0 为默认 100 MB)。 | 调大该数值可解除上传高清原图、大体积素材或视频文件时的体积超限拦截。 |
额外命令行参数
用于直接传入 ComfyUI 原生支持的其他 CLI 启动参数。在输入框中填入的参数会在服务启动时直接拼接到命令行末尾;多个参数之间使用空格分隔(例如 --disable-cuda-malloc --fast)。
保存与生效机制
参数调整完成后,通过底部按钮保存并生效:
- 保存并重启:将新的设置写入配置文件,并立即自动重启 ComfyUI 服务。新参数在服务重启完成后生效。
- 取消:放弃所有未保存的修改并关闭设置。
重启后可在运行概览页面的 启动命令 区域查看实际拼合生成的完整命令行。