主题
SD 1.5
Stable Diffusion 1.5(SD 1.5)是开源 AI 绘画领域应用最广泛的基础模型之一。它以 512 像素分辨率为基础,对显卡显存的要求相对较低,并沉淀了大量微调模型、LoRA、Embedding 以及成熟的 ControlNet v1.1 结构控制工具。无论是快速尝试灵感构思,还是结合姿势与边缘控制进行角色创作,都可以从 SD 1.5 开始。ComfyCarry 的 SD 1.5 入口提供了适配该架构的预设分辨率、采样默认值、反向提示词和全部图像高级功能。
模型设置与首次生成
打开 内容生成,点击页面顶部的 图像,再从 模型 菜单中选择 SD 1.5。在 基础设置 中点击 选择 Checkpoint,选择一个本地模型。

- 在 正向提示词 中描述主体、外观、动作、场景和风格。
- 在 反向提示词 中填写希望减少的低质或瑕疵特征。
- 保留页面默认的
512 × 512、20步、CFG Scale7与采样器Euler a。 - 点击 运行。生成完成后,图片会显示在右侧预览区。
具体模型可能有专属的推荐尺寸、触发词或微调 VAE,在模型详情中提供这些信息时,使用作者给出的设置效果更佳。
编写提示词
SD 1.5 采用传统的 CLIP 文本编码器,习惯使用英文单词或短语,并用英文逗号分隔。把最重要的主体与核心特征放在靠前位置,按照下面的顺序便于逐步丰富细节:
text
质量与画风 → 主体与数量 → 外观与服装 → 姿态与动作 → 构图与镜头 → 场景与光线插画风格的画面可以这样写:
text
masterpiece, best quality, 1girl, solo, long silver hair, blue eyes,
white dress, standing in a flower garden, gentle smile, looking at viewer,
soft sunlight, blooming roses, detailed background, medium shot写实摄影风格可以这样写:
text
masterpiece, best quality, a quiet red fox standing on a mossy rock,
misty pine forest at dawn, soft golden sunbeams, close-up shot,
natural lighting, detailed fur, shallow depth of field需要强调某个关键特征时,可以使用 (tag:1.1) 权重语法对单个标签进行微调:
text
(red coat:1.15), (amber eyes:1.1)权重建议从 1.05–1.15 开始,避免给整段提示词大范围加权,以免造成画面色彩失衡或局部崩坏。
反向提示词
反向提示词用于排除画面中不希望出现的低质表现和常见错误:
text
worst quality, low quality, blurry, bad anatomy, bad hands, missing fingers, extra fingers, watermark, text反向提示词应根据实际出图结果针对性增减。画面肢体已经正常时可以精简肢体词;希望在海报或招牌中生成文字时,从反向提示词中移除 text。
调整生成参数
| 选项 | 页面默认值 | 具体作用与调整方法 |
|---|---|---|
| 分辨率 | 512 × 512 | 决定输出图像的宽高尺寸。SD 1.5 原生基于 512 像素训练,建议优先使用页面提供的 512×512、768×512(横图)、512×768(竖图)等预设。直接将尺寸设置过大容易出现双头或多肢体问题,需要大图时先生成 512 基础图再配合高清放大 |
| 步数 | 20 | 控制去噪迭代轮数。默认 20 步即可获得清晰画面;细节不足时可逐步提高到 25–30;超过 35 步后提升较小且增加等待时间 |
| CFG Scale | 7 | 控制画面对提示词的服从强度。画面偏离描述时可小幅提高到 7.5–8.5;画面出现色彩过浓、边缘粗硬或噪点时降到 5.5–6.5 |
| 采样器 | euler_ancestral | 控制每一步更新画面的数学算法。euler_ancestral(Euler a)在 SD 1.5 中具有出色的细节与多样性;偏好更写实稳定的线条时也可尝试 euler 或 dpmpp_2m |
| 调度器 | normal | 规划去噪过程中的噪声衰减节奏。日常生成保持 normal 即可;如模型作者有专门推荐,可固定种子后对比切换 |
| Clip Skip | 1 | 决定从文本编码器的哪一层提取特征。通用与写实模型通常使用 1;部分动漫微调模型基于跳过最后一层训练时可设为 2 |
| VAE | 跟随 Checkpoint | 影响最终图像的解码色彩与细节还原。整合包模型通常直接跟随 Checkpoint;画面发灰或偏暗时,可在 高级设置 中指定 SD 1.5 专用的微调 VAE(如 ft-MSE) |
调整参数时建议固定 种子,每次只改变一项参数,便于明确对比画质差异来源。
加入 LoRA 与 Embedding
SD 1.5 拥有极为庞大的 LoRA 与 Embedding 资源库:
- LoRA:在 LoRA 模块中选择标注支持 SD 1.5 的 LoRA,并将模型详情中的触发词加入正向提示词。强度通常从
0.7–0.8开始,根据特征显现程度微调。 - Embedding:在提示词编辑器中点击 Embedding,可以直接将对应 SD 1.5 的负面或画风词条插入提示词中。
使用参考图控制画面
SD 1.5 支持完整的参考图与条件控制模块:
- 图生图:保留参考图的基础色调与构图,根据提示词重新渲染。重绘强度建议从
0.3–0.6开始。 - 局部重绘:涂抹遮罩区域,仅重绘指定范围,适合修整五官细节、更换服饰或修复手部。
- 姿势控制:提取参考图中的人体骨骼姿态,搭配 SD 1.5 专用的 OpenPose 控制模型保持人物动作。
- 轮廓控制:提取线稿与边缘轮廓,搭配 SD 1.5 专用的 Canny 控制模型进行线稿上色或轮廓保留。
- 深度控制:提取空间景深,搭配 SD 1.5 专用的 Depth 控制模型保持场景前后层次与镜头视角。
展开各控制模块后,可在模型下拉菜单中选择对应的 SD 1.5 专用控制模型。详细操作与阈值调节说明见图像高级功能。
生成结果调整
- 画面出现多头、多肢体或构图畸变:检查分辨率是否过大,改用 512 像素基础预设生成后通过高清放大提升尺寸;同时在反向提示词中加入
bad anatomy, extra limbs。 - 细节模糊或线条不够精致:固定种子,将步数提高到
25–28,或在高级功能中启用 二次采样。 - 色彩过饱和、画面发硬:适当降低 CFG Scale 至
6.0左右,删去多余的重复质量修饰词。 - 角色特征不够突出:将核心特征标签提前,或适当提高对应 LoRA 的权重。
- 最终成片需要更高分辨率:在高级功能中开启 高清放大,选择 AuraSR 或 SeedVR2 放大到目标尺寸。