Stable Diffusion 风格化写真生成入门教程
SD 风格化写真生成实操:从选模到出片全流程
一、先想清楚:你要的是「写真」还是「绘画」
在动手之前,必须先区分两个容易混淆的目标。所谓的「风格化写真」,通俗讲就是把一张普通照片改造成某种艺术风格的作品——它可以是一个人像写真、一张风景、一组产品图,重点是保留原始构图和主体,只换「皮」。这与纯文生图(text-to-image)完全不同:文生图是从随机噪声开始,由提示词决定一切;而风格化写真有一个「地基」——你的原图,AI 是在这块地基上重绘。
明确了这点,接下来的技术选型就顺理成章了:我们要用的是 img2img(图生图) 工作流,配合 ControlNet 锁结构、风格 LoRA 换风格。这是目前最成熟、效果最稳定的开源方案,N 卡 6GB 以上显存即可流畅运行。
二、第一步:装好底模与工具
推荐使用 AUTOMATIC1111 WebUI 或 ComfyUI 作为运行环境。前者界面直观、新手友好,社区教程最多;后者是节点式工作流,适合需要固定复用的批量生产场景。初学者建议从 WebUI 开始。
「底模」决定画面基本风格与画质上限。常见选择:
写实方向:SD 1.5 系(如 Realistic Vision、ChilloutMix)或 SDXL 系的写实大模型(如 Juggernaut XL),出图细腻、皮肤质感好;
二次元方向:Anything V5、Counterfeit、Illustrious 等,动漫风格表现力强;
通用方向:官方 SD 1.5 / SDXL 底模,风格中性,适合叠加各种 LoRA。
判断底模好坏没有绝对标准,实践上以「同一提示词下的人物手部、五官是否自然」为手感参考。装好后,把模型文件放入 WebUI 的 models/Stable-diffusion/ 目录即可。
三、第二步:选一只风格 LoRA
风格化写真的「风格」绝大部分来自 LoRA(Low-Rank Adaptation,低秩适配)。LoRA 是一种微调产物:它不动底模的全部权重,而是在注意力层和全连接层旁挂载一对低秩小矩阵(秩 r 通常取 8~32),训练时只更新这两个小矩阵。效果上,它能以很小的模型文件(几十 MB)给底模注入一种稳定的「风格倾向」。
这就是为什么同一张原图,挂上不同 LoRA 能出来油画、水彩、赛博朋克等截然不同的效果。Civitai 上有大量免费风格 LoRA,以「oil painting style」「watercolor style」「anime style」等关键词检索,按评分和示例图挑选即可。下载后放入 models/Lora/ 目录,WebUI 的提示词区会出现 LoRA 标签,点一下就能加载。
Ubstein 传奇哥建议用这些风格化的核心参数。实际上常见经验同样适用于写真场景。
四、第三步:写一套「结构化」提示词
img2img 的场景下,提示词描述的是「你想要的目标画面」,而不是重述原图。一套通用的写真风格提示词可以拆成几段:
主体:
a beautiful woman, portrait, detailed face, natural skin texture(人像写真必备)风格:
oil painting, visible brushstroke, thick impasto, palette knife texture, oil on canvas(要油画就写油画词,要水彩就写wet on wet, color bleeding, watercolor on cold press paper,要动漫就写anime key visual, cel shading)质量词:
masterpiece, best quality, highly detailed, 8k——稳定出图质量的老三样负面提示词:至少固定
lowres, bad anatomy, bad hands, missing fingers, extra digits, jpeg artifacts, blurry,人像类强烈建议加ugly, deformed face。负面提示词是少做多的隐藏技巧,直接影响出片率。
风格关键词别混着写。生手最容易犯的错就是把油画词、水彩词、动漫词堆在一起,结果 AI「精神分裂」,出来四不像。一次只锁定一种风格。
五、第四步:调关键参数——重绘幅度是第一优先级
img2img 中最重要的参数是 Denoising Strength(重绘幅度),它决定 AI 对原图改动多大。这个参数直接决定「像不像原图」与「风格够不够」之间的平衡:
0.2~0.3:细微调整,接近原图,只做颜色校正和轻微风格偏移;
0.4~0.6:中等转换,风格明显变化但主体结构和构图基本保留——风格化写真最常用的区间;
0.6~0.7:显著转换,构图仍在但视觉处理已大不相同;
0.8~0.9:接近完全重绘,只有大致结构存活,人像容易「换头」。
具体怎么定:人像怕变形,Denoising 取 0.5 左右比较稳;风景不怕歪,0.55 起步;想更浓的风格化,先 0.6 试一张再微调。记住口诀:太保守没风格,太激进没原样。
其余参数用稳妥默认即可:采样步数 Steps 25~30,CFG Scale 6~7.5(写实可以低一些如 5.5,动漫可以高一些如 7),采样器用 DPM++ 2M Karras 或 Euler a,图片尺寸保持原图比例(WebUI 会自动处理)。
六、第五步:用 ControlNet 锁住结构
如果重绘到 0.6 以上人脸还是容易崩,或者希望连姿势、轮廓都 100% 保留,那就需要 ControlNet 出场。它是目前 SD 保持结构最有用的插件。
思路是「拆两层」:
Unit 0(结构层):上传原图,选 Canny 边缘预处理器(提取线条)或 OpenPose 姿势预处理器(提取骨点)。AI 会严格按照这些线条/骨点重绘,所以姿势和构图完全锁死。权重建议 0.5~0.7。
Unit 1(风格层 / 可选):上传想模仿的风格参考图,选 ip2p 或 reference 预处理器,让 AI 从参考图提取风格特征。权重建议 0.3~0.5。
装上 ControlNet 锁结构后,重绘幅度可以放心调到 0.7 以上——结构被「锁住」了,不怕变形,风格可以更彻底。
安装方式:WebUI 的「扩展 - 安装」里填入 github.com/Mikubill/sd-webui-controlnet.git,把对应的控制模型(canny、depth、openpose 等)放进 models/ControlNet/ 目录,重启即可。
七、第六步:人脸修复与高清放大
人脸是风格化写真最容易翻车的部位。两个常用补救手段:
脸部修复插件 ADetailer:自动检测人脸区域,用独立提示词二次生成,重绘幅度降到 0.15~0.25 只修脸。这是目前处理「脸崩」最高效的方案,强烈建议装了再出片。
Hires.fix(高清修复):先把 512 像素小图放大到 1024+,放大算法选
Latent / ESRGAN_4x,修复锯齿和模糊,让皮肤纹理更真实。放大倍率建议 2 倍以内,过大会引入伪影。
流程上建议:先低分辨率快速试风格 → 满意后再开 Hires.fix 出大图 → 不行再局部重绘修补。一开始就 1024 全开,每张图跑 20 秒以上,试错成本太高。
八、踩坑清单:新手最常翻的五个车
原图质量差:模糊、黑暗、严重压缩的图,AI 只能「锦上添花」不能「无中生有」。输入清晰高分辨率图,输出才有保障。
一张图配所有参数:不同目标需要不同重绘幅度。增强用 0.3,风格迁移用 0.5,彻底重塑用 0.7。别一套参数打天下。
忽略纵横比:原图 16:9,模型却擅长 1:1,强行生成会变形或裁切。先统一比例再生成。
不迭代:第一张图很少是最好的一张。微调重绘幅度、换试种子,生成 4~8 张变体再挑,效果好得多。
不保留原图:风格化输出会新建文件,但原始照片务必保留备份,方便对比和还原。
九、风格化写真可以做什么
掌握这套流程后,可应用的场景非常丰富:
统一人像写真风格:把一组旅游照片统一调成某个艺术风格,适合个人 IP 或影楼预展;
产品图风格统一:电商卖家把多款产品图统一成一致的视觉风格,提升店铺观感;
头像个性化:个人社交头像做成油画/手绘风,辨识度大增;
内容创作配图:自媒体文章封面、短视频封面用风格化图,比纯 AI 绘图更有「真实感」。
十、写在最后
风格化写真生成的完整链路可以浓缩成一句话:img2img 定基调,重绘幅度管「改多少」,ControlNet 管「不变形」,LoRA 管「像不像那个风格」,ADetailer + Hires.fix 管「精不精致」。这套组合拳不需要太高的硬件门槛(6GB 显存的 N 卡即可),也基本不需要花费(全开源免费),剩下的就是多试、多记录、多对比——生成的方差意味着你最好的作品很可能是第六次尝试才出现。




