ComfyUI 提示词完全指南:权重语法、模板结构与出图调优

很多人把 ComfyUI 的提示词当关键词堆砌:best quality, masterpiece, 1girl, blue hair...。堆是堆得出来,但人物、动作、背景全混在一起,改一处动全身。这篇文章拆解提示词的语法规则和结构模板,让你写出来的提示词「指哪打哪」。

ComfyUI 数字艺术

一、先分清:ComfyUI 用的是什么提示词

ComfyUI 本身不产出提示词语法,它只是把提示词交给背后的模型(Stable Diffusion、Flux、SDXL、Wan 等)。所以要掌握两套东西:

  • ComfyUI 工作流里怎么写:正负提示词各放哪个节点(CLIP Text Encode)、加权怎么写;

  • 模型认什么语法:SD 1.5 / SDXL / Flux 对提示词的理解差异很大。

本文默认以最主流的 Stable Diffusion / SDXL 生态为例,Flux 的特殊之处会在最后单独讲。

在开始之前,先建立一个重要的认知:提示词是写给「文本编码器」看的,不是写给「扩散模型」看的。SD 的 CLIP 文本编码器把提示词转成语义向量,扩散模型再根据这个向量「去噪」出图。所以「模型认不认某个词」,本质上取决于训练时这个词是否出现在图文对里——这也解释了为什么中文效果普遍不如英文、为什么专有名词经常画不对。理解了这一层,你就不会为「我明明写了关键词它却不听」而困惑了。记住:与其纠结单个词,不如把提示词当作「一组意图信号」来整体组织。

二、权重语法:括号和冒号是全部

ComfyUI(A1111 同源)的提示词加权语法靠括号,规则如下:| 写法 | 含义 | 等价 || — | — | — || (keyword) | 权重 1.1 倍 | — || ((keyword)) | 权重 1.21 倍 | — || (keyword:1.5) | 权重 1.5 倍 | — || (keyword:0.8) | 权重 0.8 倍(削弱) | — || [keyword] | 权重 0.91 倍(削弱) | (keyword:0.9) |

提示:(keyword:数字) 是精确控制;不写数字的括号是固定倍率,一层 1.1。别用超过 2.0 的权重——超过 2.0 画面往往开始劣化,出现色块和伪影。推荐范围 0.8 ~ 1.5。

权重的作用:让模型把注意力更多/更少放在某个词上。比如想要「金发」更明显,写成 (blonde hair:1.4);想要背景模糊,可以 (blurred background:0.7) 甚至放进负提示词。

负提示词也要加权:负提示词里权重越高,抑制越强。写 (blurry:1.4) 比写 blurry 更有效地去除模糊。

渐变语法:从一个词过渡到另一个词

[from:to:step] 是进阶语法,常用于画面风格渐变,比如风景转人像:

1
[landscape:portrait:0.5]

含义:在步数 50% 前使用 landscape,之后切换到 portrait。这个语法在 ComfyUI 里通过 KSampler 的步数和 Seed 配合控制,是风格迁移/混合的好工具。

进阶组合:渐变可以叠权重,例如 [(sunset:1.3):(night:1.2):0.4],前半段强调黄昏、后半段强调夜晚,中间的过渡自然。注意 step 是 0~1 之间的小数,表示「在前百分之多少的采样步数时切换」;0.4 就是在第 40% 步切换。这个语法的乐趣在于可控的「过渡段」——比直接写「黄昏与夜晚的交界」要精确得多,因为它控制的是采样过程本身而不是画面的语义。

三、模板结构:把提示词拆成五个维度

单靠权重解决不了「画面混乱」的问题。真正高效的做法是按角色给提示词分层,每个部分各司其职。推荐的五段式结构:

1
主体 + 特征 + 环境/背景 + 风格/光线 + 修饰词(质量/镜头/细节)

举例,想画「窗边读书的少女」:

1
a young woman reading a book, (long black hair:1.2),(wearing a white sweater:1.1),sitting by a rainy window, soft natural light,(cinematic lighting:1.3), detailed face, best quality

拆开看:

段位 内容 例子
主体 谁/什么在画面里 a young woman reading a book
特征 外观细节 long black hair、white sweater
环境 在哪、什么氛围 rainy window、soft light
风格 画风、镜头语言 cinematic、detailed
修饰 质量词 best quality、highres

关键原则:主体放最前面。Stable Diffusion 对提示词开头的词重视程度更高,主体放前面能有效避免「画了个啥都说不清」。

权重分配的艺术

不是所有词都值得加权。经验法则:

  • 主体和核心特征:1.1~1.3,轻微强调;

  • 决定性风格(如 cinematic、anime):1.3~1.5,风格是否出现就看它;

  • 背景氛围:1.0~1.1,不要抢主体风头;

  • 质量词(best quality 之类):0.9~1.0,它们的作用已经被训练得很稳定,不用堆。

三套可直接抄的模板

光讲结构容易空,这里给三套覆盖不同场景的完整模板,直接用、再微调。

1. 人物特写模板(适合头像、角色设计)

1
(portrait of a woman:1.2), (detailed face:1.1),(short silver hair:1.2), blue eyes,wearing a black turtleneck,soft studio lighting, shallow depth of field,photorealistic, 8k, high detail

2. 产品/静物模板(适合电商、平面)

1
a minimalistic desk lamp on a wooden table,(clean white background:1.2),(product photography:1.3), studio light,(high contrast:1.1), centered composition,4k, sharp focus

3. 场景/风景模板(适合壁纸、概念图)

1
a misty mountain valley at dawn, pine forest,(river flowing through:1.2), (golden morning light:1.3), volumetric fog,cinematic wide angle, masterpiece, highly detailed

提示:三套模板都遵循「主体 → 特征 → 环境 → 风格 → 修饰」的顺序。复制去用的时候,只替换加粗标了权重的核心词,其他保持原样,画面结构基本稳定。

AI 艺术示例

四、正负提示词的配合策略

负提示词不是「把想要的反过来说」,而是精准列不想要的。SDXL 时代负提示词通常很短:

1
negative_prompt = "blurry, lowres, bad anatomy, bad hands, extra fingers, watermark, text"

几个容易踩的坑:

  • 负提示词太长反而有害:一堆词互相干扰,模型无所适从;

  • 别把「想要的东西」写进负提示词:比如「no more than 1 girl」这种抽象表述,模型理解不了;

  • hand/finger 这类是硬伤:出图后抽卡(重跑 seed)往往比堆负提示词更有效。

负提示词还有一个被低估的作用:风格收敛。当你想要「没有文字、干净画面」时,把 text, watermark, logo, signature 写进负提示词,出图干净程度立竿见影;想要写实风格时,把 cartoon, anime, illustration 写进负提示词可以防止模型「飘」到二次元风格。它不只是「去掉坏东西」,也是「划定风格边界」的工具。

五、Flux 的特殊之处:提示词越像人话越好

2024 年后的 Flux 模型对提示词的理解方式和 SD 系列完全不同:

  • 不要写逗号拼接的关键词:Flux 更适合「一整句话」描述,像自然语言;

  • 不要堆质量词:Flux 训练时就内置了高质量,写 best quality 反而无意义;

  • 权重语法支持有限:Flux 对括号权重的响应弱于 SD,长句描述更重要;

  • 负提示词几乎用不上:Flux 的 guidance 机制不同,通常空着即可。

一句话总结:用 SD 的思路写 SD,用聊天的思路写 Flux。

六、ComfyUI 工作流里的实操点

在 ComfyUI 界面里,提示词相关的节点主要是 CLIP Text Encode(正向/反向)。实操中的几个注意点:

  • Prompt 节点分开:正向和反向各一个 CLIP Text Encode 节点,别共用;

  • 中文提示词:ComfyUI 默认不支持中文,要装翻译插件(如 ComfyUI-Custom-Scripts 等)或者自己把中文翻成英文再填;

  • 权重实时调试:ComfyUI 里可以直接改节点里的权重数字,配合「查看并修图」(queue prompt)快速试错,不用重排整个工作流;

  • 文本编辑器插件:嫌节点输入框太小,装 Prompt Editor 类插件,编辑体验好很多;

  • 种子与提示词联动:改提示词后如果想对比同构图,固定 Seed 再跑。

工作流级的提示词管理

当工作流复杂起来(多 Lora、多阶段采样、图生图),提示词管理就成了一门「整理学」,几个建议:

  • 给节点命名:把正向/反向节点改成语义化名字(如「主提示词」「风格微调」),复杂工作流里一眼看清;

  • Lora 权重与提示词解耦:Lora 触发词放提示词里,Lora 权重在节点上调,两者分开改,避免互相污染;

  • 存提示词模板:把经常用的 prompt 存成 txt,或者用工作流内置的文本节点保存,换场景直接换文本;

  • 版本化:每次大改存一份工作流 JSON(ComfyUI 支持保存工作流),出问题可以回滚。

这些习惯一开始觉得麻烦,工作流多了以后会感谢当时的自己——「为什么上次那张图好看,但我调不回来了」这种问题,基本都能靠版本化解决。

七、调优方法论:一次只改一个变量

出图不满意时,别一次改三个地方——改了不知道是哪个生效的。正确的姿势:

  • 先固定:固定 Seed、模型、分辨率、采样器、步数;

  • 一次改一个维度:这次只调主体权重,下次只调背景描述;

  • 记录对比:每次改动存一张图,最后对比哪个变量影响最大;

  • 善用权重而非加词:画面里「有但不够」用加权,「完全没有」才加新词。

举例:人物出现了但表情不够悲伤。正确做法是给 (sad expression:1.3) 加重,而不是加 crying, tearful 一堆新词——新词可能引入新的不可控因素。

一个完整的调优实战过程

假设目标是「阳光下的咖啡馆少女」,当前出图的问题是「人物在,但阳光感很弱」。按方法论走一遍:

  • 固定基线:Seed=42,SDXL,512×768,Euler a,步数 25,CFG 7;

  • 问题定位:画面里阳光不够——是「阳光」权重低,还是「咖啡馆氛围」抢了注意力?

  • 第一步只调阳光:把 (morning sunlight:1.0) 提到 1.4,其他全部不动,跑图对比;

  • 观察结果:阳光明显增强,但人物被强光压暗——这是权重过高的副作用;

  • 第二步补人物光:把 (backlight on the girl:1.2) 加上,给人物补光;

  • 收尾:确认画面平衡后,这个组合固定下来,作为这条 prompt 的基线版本。

整个过程只动了两个词、两个权重,改一处看一处,最后得到的是「可复现、可解释」的结果。相比「一次加十个词」的玄学式调参,这种方法的每一步都能说清楚为什么。

八、提示词之外的「隐形因素」

很多新手把出图质量差归咎于提示词,其实提示词之外的几个因素影响往往更大,先排查它们再调词,事半功倍:

1. 模型本身:SD 1.5 基础模型画现代场景、人物结构明显弱于 SDXL / Flux 生态。同一个提示词在不同模型上的差异,远大于「加权 1.2 还是 1.3」。出图效果差,先确认模型选对了,再谈提示词。

2. 采样器与步数:Euler 系列适合快速预览,DPM++ 系列质量更高但慢。步数 20~30 是常规区间,超过 40 基本没有收益,少于 15 会明显欠采样、画面发糊。采样器对最终画质的影响有时比提示词还大。

3. 分辨率与放大:低分辨率直接放大容易糊。正确流程是先小分辨率出构图(512/768),满意后丢进 HiRes Fix 或 latent upscale 放大到 1.5~2 倍,而不是一开始就拉高分辨率。

4. Seed 的影响:同一个提示词,换 Seed 画面结构天差地别。调提示词时固定 Seed,才能隔离变量;找构图时反而应该多换 Seed 抽卡。

5. CFG(分类器自由引导):CFG 太高画面过于「用力」出现伪影,太低模型不跟提示词。SD 系 7 左右、SDXL 5~7 是常见区间。画面发灰、过度锐化,先查 CFG。

把这五个因素纳入排查顺序,「提示词调优」才有意义——否则改了半小时词,才发现是 CFG 的问题,白忙一场。

九、常见问题与排查

问题 大概率原因 对策
主体根本不在画面里 提示词太长、主体被淹没 删掉一半词,主体放最前
加了权重没反应 写错格式(少了冒号) (keyword:1.3),冒号别漏
画面灰/发糊 CFG 太低或步数不足 CFG 提到 7,步数 25+
人物手/手指崩 模型弱项,加词无效 抽卡或换模型
风格不统一 权重分配太散 风格词单独加权到 1.3~1.5
中文提示词无效 模型不认中文 翻成英文,或装翻译插件
图像过度锐化/伪影 CFG 过高 CFG 降到 5~6
> 排查顺序建议:先确认模型与采样器 → 再查 CFG 与分辨率 → 最后才怀疑提示词。根据经验,一半以上的「提示词问题」其实出在这三项上。养成「先外部后提示词」的排查习惯,能省下大量试错时间。

小结

提示词不是关键词越多越好,而是结构清晰、权重精准。记住三个要点:(keyword:数字) 精确控权重,范围 0.8~1.5;五段式「主体+特征+环境+风格+修饰」组织内容,主体放最前;一次只改一个变量做调优。Flux 用户记得切换到「整句描述」的思维模式。三套模板(人物特写、产品静物、场景风景)可以直接抄用,改权重比加新词更可控;遇到画面问题先查模型、采样器、CFG,再回头调提示词——把这两点记牢,你的出图稳定性能超过大多数靠堆关键词的人。

延伸阅读: