AI出图进阶篇 06
LoRA与模型微调入门定制专属画风
通用模型画不出你的风格?用自己的图训练专属LoRA
系列四 · AI出图进阶控制 · 第6篇
前面五篇讲的都是在通用模型上做控制——提示词、ControlNet、局部重绘、放大技巧。
但你会遇到一个天花板:不管怎么写提示词,通用模型的画风始终是"大众脸"。你想要自己品牌的插画风格,想要固定的角色形象,想要某种独特的笔触质感——通用模型做不到。
这时候就需要LoRA。它是目前最实用的模型微调方案,用少量的图片就能让AI学会一种特定风格或角色,训练成本低、效果好、使用方便。
这篇讲清楚LoRA是什么、怎么训练、怎么用、怎么避坑,让你从"用别人的模型"升级到"用自己定制的模型"。
![]()
LoRA:在通用模型上叠加一层薄薄的"风格补丁",不改变原模型
LoRA是什么
LoRA全称Low-Rank Adaptation,低秩适配。名字听起来很学术,原理其实简单。
大模型有几十亿个参数,全量微调需要修改所有参数,成本极高。LoRA的做法是冻结原模型所有参数,只在旁边加一个很小的"补丁"模块,只训练这个补丁。
打个比方:大模型是一本百科全书,LoRA是一张手写便签贴在某一页上。便签上写着"这个词条在你这个场景下应该这样理解"。全书内容不变,但加了便签之后,AI在特定场景下的表现就变了。
这个补丁很小,通常只有几十到几百MB,而大模型动辄几个GB。所以LoRA文件可以很方便地分享、加载、叠加使用。
和另外两种微调方式的区别:
Full Fine-tuning(全量微调):修改模型所有参数,效果最好但成本极高,需要专业显卡和企业级资源,个人基本不考虑。
DreamBooth:介于全量和LoRA之间,训练效果不错但生成的模型文件很大(几个GB),切换不方便。
LoRA:只训练补丁模块,文件小、训练快、效果够用,是目前个人用户和中小团队的首选。
LoRA能做什么
LoRA的用途主要分三类。
风格LoRA:让模型学会某种画风。比如你的品牌插画风格、某个画家的水彩笔触、特定动漫风格。训练好之后,任何提示词生成的图都自动带上这种风格。
角色LoRA:让模型学会某个特定角色。比如你设计的品牌吉祥物、虚拟代言人、某个虚构人物。训练好之后,输入角色触发词就能生成这个角色在不同场景、不同姿势下的图。
概念LoRA:让模型学会某种特定概念。比如某种特殊材质(陶瓷釉面)、某种建筑风格(哥特教堂)、某种摄影风格(胶片质感)。比用提示词描述更精准。
实际应用中,风格LoRA和角色LoRA用得最多,也是商业价值最高的两类
训练前的数据准备
LoRA训练效果好不好,80%取决于数据准备。这是最关键的一步。
1. 图片数量
风格LoRA:15~30张同一风格的图就够了。 角色LoRA:20~50张同一角色不同角度、不同表情、不同服装的图。 不是越多越好,质量比数量重要。50张精挑细选的图比200张随便凑的效果好得多。
2. 图片质量
分辨率至少512x512以上,最好768x768或更大。 画面清晰,主体突出,背景不要太杂乱。 风格LoRA选的图风格要统一,不要混入其他风格的图。 角色LoRA选的图要覆盖正面、侧面、半身、全身、不同表情。
3. 裁剪和清理
把图裁剪成正方形或接近正方形,去掉无关内容。 如果图上有水印、文字、Logo,用Inpainting清掉。 不要用别人带版权水印的图训练,训练出来的LoRA也会有水印痕迹。
4. 打标签
每张图配一段文字描述,告诉AI这张图里有什么。 可以用WD14 Tagger自动打标,然后手动修正。 角色LoRA建议给角色起一个独特的触发词,比如"auge_ferly_man"这种不会和普通词冲突的词。 风格LoRA可以用"in auge_ferly_style"作为触发词。 标签描述的是画面内容(人物、动作、场景),不要描述风格本身——风格由LoRA负责,不用写在标签里。
5. 数据文件夹结构
建一个文件夹放所有训练图,每张图旁边放一个同名txt文件写标签。 比如img_001.png旁边是img_001.txt,里面写"a woman in red dress, standing in a garden"。 文件夹命名用数字开头,比如"20_augerferly"表示20张图、触发词augeferly。
![]()
数据准备五步:选图、清理、裁剪、打标签、组织文件夹
训练参数怎么设
目前最常用的LoRA训练工具是Kohya_ss,界面虽然不好看但功能完整。关键参数如下。
基础模型选择
选你要在上面叠加LoRA的大模型。 如果你要做写实风格,选SD1.5或SDXL。 如果要做动漫风格,选Anything V5或Nai Diffusion。 训练用的大模型和使用时加载的大模型必须一致,否则效果会打折扣。
Network Rank(维度)
也叫DIM,决定LoRA的学习能力。 风格LoRA建议设32~64。 角色LoRA建议设64~128。 太低学不够,太高容易过拟合。先从32开始试,效果不够再加。
Network Alpha
控制LoRA权重的大小,通常设为Rank的一半。 比如Rank设32,Alpha设16。 这个参数不用太纠结,默认值就行。
Batch Size
每次训练处理多少张图。 显存8GB设1,12GB设2,24GB可以设4。 大batch size训练更稳定但吃显存。
Learning Rate(学习率)
最关键的参数。 Text Encoder(文本编码器)学习率:1e-4到5e-5。 UNet学习率:1e-4到5e-5。 学习率太大模型会"学坏",太小训练时间太长。 建议用cosine调度器配合warmup,前10%的步数用来预热。
训练步数
经验公式:总步数 = 图片数量 x 重复次数 x Epoch数 / Batch Size。 20张图、每张重复10次、10个Epoch、Batch Size 1,总步数 = 20 x 10 x 10 = 2000步。 一般1500~3000步就够了,超过5000步容易过拟合。
分辨率
设512x512。如果你的基础模型是SDXL,设1024x1024。 训练分辨率要和实际使用时的分辨率一致。
建议训练时每500步保存一个检查点,这样可以从效果最好的那个检查点提取LoRA,而不是只用最后一个
![]()
关键参数七项:模型、维度、Alpha、Batch、学习率、步数、分辨率
怎么判断训练效果
训练完成后,不要直接拿最后一个检查点用。要测试不同步数的检查点,找到最佳的那一个。
方法是用同样的提示词和参数,分别用不同检查点的LoRA生成图,对比效果。
欠训练:触发词加上去和没加一样,风格/角色特征不明显。说明步数不够或学习率太低,需要增加步数。
过拟合:画面出现训练图里的具体内容(比如背景、姿势),而不是学到风格或角色特征。AI在"背诵"训练图而不是"理解"风格。说明步数太多或Rank太高,需要减少步数或降低Rank。
刚刚好:触发词加上去风格/角色特征明显,去掉触发词就恢复正常。不同提示词下角色保持一致但场景可以变化。这就是理想状态。
通常中间的检查点效果最好,比如总共2000步训练,800~1200步的检查点往往比2000步的好。
怎么使用训练好的LoRA
使用LoRA很简单,两步就行。
第一步:把训练好的.safetensors文件放到模型的Lora文件夹里。
第二步:在WebUI的Lora面板里选中它,或者在提示词里用格式
调用。
权重默认1.0,可以调整:
权重0.4~0.6:风格/角色特征比较淡,适合和其他LoRA叠加使用。
权重0.7~0.9:特征明显但不会盖过画面内容,最常用的范围。
权重1.0~1.2:特征非常强,可能影响画面质量,出现过拟合感。
权重1.3以上:通常不建议,画面容易崩。
多LoRA叠加是LoRA的强大用法。你可以同时加载风格LoRA+角色LoRA+材质LoRA,生成"用你的品牌风格画你的品牌角色穿特定材质衣服"的图。每个LoRA权重建议0.5~0.7,避免互相打架。
实战案例:葡萄酒品牌专属插画LoRA
假设你想给葡萄酒品牌做一套统一风格的插画,每次出图都自动带上品牌调性。训练一个品牌风格LoRA是最优解。
案例背景
澳格菲尔品牌插画风格LoRA
目标
让AI生成任何主题的图都自动带有品牌统一的插画风格(暖色调、柔和笔触、优雅质感)
训练数据
25张品牌过往插画作品,全部裁剪为768x768,清除了Logo和水印,风格统一
触发词
augeferly_style(独特词,不和任何现有词冲突)
标签策略
只描述画面内容(wine bottle, grapes, wooden table, warm light),不描述风格。风格由LoRA学习。
训练参数
基础模型SD1.5,Rank 32,Alpha 16,Batch Size 2,学习率1e-4(cosine+warmup 10%),分辨率512x512,总步数2000步,每500步保存一个检查点
效果测试
用同一提示词分别测试500/1000/1500/2000步的检查点。1000步效果最佳:触发词加上后品牌风格明显,去掉后恢复正常,不同主题的画面风格一致
使用方式
提示词里加上
,权重0.8在风格明显和画面质量之间取得平衡。日常出图直接用,不需要每次描述风格。
结果
训练后所有AI出图自动统一品牌风格,不再需要每次写长串风格描述词。团队任何人都能用这个LoRA出风格一致的图,效率提升70%以上。
这个案例的关键是标签不写风格。如果你在标签里写了"warm colors, soft brushstrokes, elegant",AI会把这些当成画面内容来学,而不是当成风格。结果就是LoRA只能生成带暖色调的特定画面,换了主题就不管用了。标签只写内容,风格才能被LoRA"抽象"出来,泛化到任何主题。
![]()
同一提示词,无LoRA vs 加载品牌LoRA:风格立刻统一
五个训练必踩的坑
1. 训练图风格不统一— 风格LoRA混入了不同风格的图,AI学出来四不像。训练前一定要人工筛一遍,把风格不一致的图剔除。宁可少几张图,不要混风格。
2. 触发词用常见词— 触发词用"girl""style"这种常见词,和模型已有概念冲突,加载LoRA后不管触发词写没写效果都一样。触发词一定要用生造的独特组合词。
3. 标签描述了风格— 标签里写"warm tone, watercolor style",AI把这些当画面内容学了,不是当风格学。标签只描述内容(有什么),不描述风格(怎么画的),风格交给LoRA。
4. 训练步数太多— 觉得训练越久效果越好,跑到8000步结果过拟合严重,生成的图像是直接从训练图里抄的。1500~3000步通常就够了,一定要测中间检查点。
5. 训练模型和使用模型不一致— 训练时用SD1.5,使用时加载到SDXL上,效果会大打折扣甚至完全失效。训练用的基础模型和实际使用的大模型必须一致。
LoRA速查卡片
风格LoRA
15~30张统一风格图,Rank 32,触发词用独特词,标签只写内容不写风格
角色LoRA
20~50张多角度图,Rank 64~128,覆盖正面侧面全身半身不同表情
训练步数
1500~3000步,每500步存检查点,测中间步数找最佳点,别只用最后一个
使用权重
单LoRA用0.7~0.9,多LoRA叠加每个0.5~0.7,超过1.2容易崩
LoRA的核心就一句话
不是从头训练一个新模型,是给大模型贴一张风格便签
数据质量决定上限,参数调优决定下限
标签只写内容不写风格,触发词一定用独特词
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.