1. 从“咒语”到“指令”:理解Stable Diffusion提示词的本质
很多刚接触Stable Diffusion的朋友,会把写提示词(Prompt)的过程想象成念“咒语”——似乎只要找到一串神秘的英文单词组合,就能召唤出完美的图像。这种想法其实很普遍,但也是很多人卡在“出图效果不稳定”这个阶段的主要原因。我刚开始玩SD的时候,也经历过这个阶段,疯狂地在网上搜集各种“魔法关键词”,然后一股脑地复制粘贴,结果出来的图要么是四不像,要么就完全偏离了预期。
实际上,提示词更像是一份给AI的、极其详细的“工作指令”或“设计需求文档”。它不是玄学,而是基于CLIP等文本编码模型对自然语言的理解,将你的文字描述转化为AI可以处理的潜在空间向量。你描述得越精确、越符合AI训练数据的逻辑,它“执行”得就越到位。而“人物属性”的刻画,正是这份指令中最核心、最考验功力的部分。它决定了你生成的是一个人物“剪影”,还是一个有血有肉、有独特气质的“角色”。
网络上流传的所谓“一键出美女”的提示词合集,往往只强调了外貌特征(如1girl, beautiful, long hair),却忽略了构成一个生动人物的其他维度,比如神态、气质、服饰细节、光影氛围,以及这些元素之间的和谐统一。这就好比只告诉厨师“做一盘好吃的菜”,却没说是川菜还是粤菜,要辣还是不要辣,最终结果全凭厨师(AI)的心情和训练数据中的常见组合。
所以,这篇内容我们不谈那些空洞的“魔法”,而是扎扎实实地拆解,如何通过系统性的提示词工程,来精准控制Stable Diffusion生成的人物属性。我会结合大量的实操案例,告诉你每个属性关键词背后的逻辑、生效的优先级,以及如何组合它们才能避免冲突,最终实现从“随机抽卡”到“精准定制”的跨越。
2. 人物属性提示词的四大核心维度与权重解析
要系统地构建一个人物,我们需要从多个维度入手。根据我的经验,可以将影响最终成像的人物属性提示词分为四个核心维度:基础身份与外貌、神态与气质、服饰与装扮、环境与光影。理解这四个维度的作用和它们之间的相互影响,是写出高效提示词的第一步。
2.1 基础身份与外貌:构建人物的“骨架”
这是定义一个人物最根本的层面,相当于素描时先打好的形体轮廓。这部分提示词通常具有最高的优先级,AI会优先响应这些指令。
- 性别与数量:
1girl,1boy,2girls,multiple people。这是最基础的指令,务必放在开头。1girl和1woman在AI的语义理解中略有差异,前者更偏向少女、年轻女性形象,后者则更成熟。 - 年龄与种族:
teenage,young woman,middle-aged,elderly;Caucasian,Asian,African descent。这些词能快速定位人物的基本特征。需要注意的是,某些融合模型(Checkpoint)对特定种族的训练数据可能更丰富,生成效果更好。 - 面部特征:这是细节刻画的重点。你需要像法医画像一样去描述:
- 脸型:
oval face,heart-shaped face,square jaw。 - 眼睛:
large eyes,almond-shaped eyes,blue eyes,sparkling eyes。眼睛是心灵的窗户,对神态影响巨大。 - 鼻子与嘴:
straight nose,small mouth,full lips。 - 发型:
long hair,short bob cut,curly hair,silver hair,twin tails。发型是塑造角色风格的重要手段。
- 脸型:
- 身材与体型:
slim,athletic build,plump,tall,petite。这部分需要与服饰提示词配合,例如plump搭配紧身衣物与宽松衣物,效果截然不同。
实操心得:描述外貌时,避免使用过于主观或矛盾的词汇。例如
most beautiful in the world这种程度副词对AI来说意义模糊,不如用具体的特征组合。同时,注意特征的合理性,child和voluptuous figure同时出现会导致图像崩坏。
2.2 神态与气质:注入人物的“灵魂”
如果外貌是硬件,那么神态与气质就是软件和操作系统。它决定了人物是“活”的还是“呆板的”。
- 表情:
smiling,serious expression,angry,wistful look,closed eyes。直接的情绪指令非常有效。 - 眼神与视线:
looking at viewer,looking away,looking up,dreamy eyes。视线方向能极大改变图像的叙事性和与观众的互动感。 - 气质与氛围:
elegant,cool,innocent,mysterious,melancholy。这些抽象词汇依赖于模型对大量图文配对数据的理解。通常,一个强力的模型能更好地捕捉这些细微差别。 - 动作与姿态:
standing,sitting on a chair,running,dancing,holding a sword。动态描述能让角色更生动,但也对构图能力提出了更高要求,有时需要借助OpenPose等骨骼图插件进行精确控制。
这部分提示词与基础外貌词需要巧妙融合。例如,innocent young girl with long blonde hair and bright blue eyes就是一个连贯的描述,将身份、外貌和气质结合在一起,比零散的关键词列表效果更好。
2.3 服饰与装扮:定义人物的“社会角色”与风格
服饰是快速建立人物背景和风格的最强力工具之一。一个穿着t-shirt and jeans的人和穿着elegant victorian dress的人,给人的印象天差地别。
- 服装类型:
casual wear,business suit,hanfu,armor,sci-fi bodysuit。非常具体。 - 材质与细节:
silk dress,leather jacket,embroidered details,torn cloth。细节描述能大幅提升图像的质感和真实感。 - 配饰:
glasses,hat,necklace,wristwatch,backpack。小物件能画龙点睛。 - 发型与妆造:
elaborate braid,neon makeup,earrings。这属于外貌的延伸,但更强调人工修饰的部分。
踩坑记录:服饰描述过于复杂或内部矛盾是导致图像怪异的主要原因之一。例如,同时描述
heavy plate armor和bare legs,AI可能会生成穿着上半身铠甲、下半身光腿的奇怪形象。正确的做法是明确主体服装,或使用括号调整权重,如(heavy plate armor:1.2), (bare legs:0.8),让人物以铠甲为主,腿部有所裸露但非完全光腿。
2.4 环境与光影:营造人物的“舞台”
人物不是悬浮在真空中的。环境光影不仅构成画面背景,更会反作用于人物本身,影响肤色、服饰色彩和整体氛围。
- 场景:
in a classroom,on a rainy street,atop a mountain,in a cyberpunk city。场景词能激活模型中对特定环境的光照、纹理知识。 - 光照:
cinematic lighting,soft sunlight,neon glow,backlighting,rim light。这是专业出图与业余出图的分水岭。好的光影提示能直接提升图像的质感。 - 镜头与视角:
portrait,full body shot,close-up,low angle,from above。这属于构图指令,告诉AI你想要什么样的“照片”。 - 艺术风格:
photorealistic,oil painting,anime style,concept art。这部分通常与模型本身风格强相关。如果你用的是写实模型,加上anime style可能会产生不协调的效果。
权重(Weight)与生效顺序:在Stable Diffusion中,提示词靠前的通常被认为更重要。但更精细的控制需要使用语法:
(word):提高权重,约为1.1倍。((word)):进一步提高,约1.21倍。[word]:降低权重,约为0.9倍。(word:1.5):明确指定权重为1.5倍。AND:连接两个概念,让它们在潜空间中被平等考虑,用于融合复杂特征,如fire AND ice。
理解这四个维度后,我们就能像搭积木一样,有逻辑地构建提示词了。一个完整的提示词结构可以是:[镜头/视角] + [主体:身份+外貌+神态] + [服饰/装扮] + [动作] + [场景/环境] + [光照] + [画风/质量词]。
3. 正向提示词工程:从通用模板到精准控制
掌握了核心维度,我们来实战编写提示词。我将以一个从简单到复杂,逐步添加控制力的过程来演示。
3.1 初级阶段:使用基础模板与质量词
对于新手,从一个稳固的模板开始是最安全高效的。一个常见的通用模板结构如下:
(高质量画质/风格词), (主体描述), (细节描述), (环境场景), (光照效果), (构图视角), (负面提示词锚定)实例1:生成一张简单的肖像
(masterpiece, best quality, ultra-detailed), 1girl, beautiful, long silver hair, blue eyes, looking at viewer, slight smile, white shirt, portrait, soft studio lighting- 分析:开头
(masterpiece, best quality, ultra-detiled)是常见的质量标签,旨在激发模型生成高细节图像。主体是1girl,外貌聚焦于long silver hair和blue eyes,神态是looking at viewer和slight smile,服饰简单white shirt,构图是portrait,光照是soft studio lighting。这是一个非常基础但有效的组合。
常用的画质与风格增强词(可根据模型调整):
- 通用质量:
masterpiece, best quality, ultra-detailed, 8k, HDR。 - 艺术风格:
digital painting, concept art, illustration。 - 照片质感:
photorealistic, 35mm film, fujifilm xt3。
重要提示:这些“魔法词”并非真的具有魔力,其效果严重依赖于你使用的Checkpoint模型。一个针对动漫训练的模型,你加上
photorealistic也出不了照片。所以,了解你所用模型的特长和训练数据倾向,比盲目堆砌关键词更重要。
3.2 进阶阶段:处理多属性冲突与细节刻画
当我们想要的人物属性更复杂时,关键词之间可能会“打架”。这时就需要运用权重和连接词来调和。
实例2:刻画一个复杂气质的角色假设我们要一个“既优雅又带点忧郁的年轻女剑士,在黄昏的古城墙上”。
(masterpiece, best quality), 1girl, (elegant:1.2) AND (melancholy:1.1), young woman, long black hair tied in a high ponytail, sharp eyes, (light practical armor:1.3), holding a slender longsword, standing on an ancient city wall, sunset, golden hour lighting, panoramic view, dramatic sky- 分析:
- 气质融合:
(elegant:1.2) AND (melancholy:1.1)使用AND连接和权重调整,试图让AI同时考虑“优雅”和“忧郁”两种气质,并以优雅为主。 - 外貌与职业统一:
long black hair tied in a high ponytail(高马尾)和light practical armor(轻便实用铠甲)都指向一个敏捷的战士形象,与holding a slender longsword(手持细长剑)动作一致。 - 环境强化氛围:
ancient city wall,sunset,golden hour lighting,dramatic sky共同营造出黄昏古城悲壮、唯美的氛围,与“忧郁”的气质呼应。 - 构图:
panoramic view(全景视图)适合展现环境和人物关系。
- 气质融合:
处理冲突的常见技巧:
- 细化描述:用更具体的词替代宽泛的词。例如,与其用
cool,不如用calm demeanor with a sharp gaze(目光锐利的冷静神态)。 - 分步生成:对于极度复杂的设定,可以先用简单提示词生成大致满意的构图和人物,再用图生图(img2img)或局部重绘(inpainting)配合新的提示词添加细节。
- 利用负面提示词:这是下一节的重点,它通过明确“不要什么”来减少冲突和错误。
3.3 高阶阶段:利用LoRA与Embedding实现风格化与特征绑定
当你需要特定画风、特定角色或非常独特的服饰风格时,仅靠基础提示词是不够的。这时就需要引入LoRA(Low-Rank Adaptation)和Textual Inversion embedding等微调模型。
- LoRA:一个小型网络文件,可以修改基础模型的行为,用于学习特定的风格、人物或物件。例如,有一个“水墨风LoRA”,你可以在提示词中调用它:
<lora:ChineseInkPainting:0.8>,这样生成的图像就会带有强烈的水墨画特征,权重0.8控制强度。 - Embedding:通过几个特定概念的图片训练出的文本向量,可以精确复现某种特征。比如训练一个自己头像的embedding,命名为
myface.pt,然后在提示词中加入myface,就能让生成的人物拥有你的面部特征。
实例3:结合LoRA生成特定风格
(masterpiece, best quality), <lora:FilmGirls:0.7>, 1girl, 1990s fashion, denim jacket, curly brown hair, sitting in a vintage car, cinematic color grading, film grain- 分析:这里
<lora:FilmGirls:0.7>调用了一个可能模拟90年代胶片人像风格的LoRA,与1990s fashion,vintage car,cinematic color grading,film grain等提示词协同工作,能高度统一地生成怀旧胶片感的人物照片。
使用心得:LoRA和Embedding是强大的工具,但必须注意:
- 权重不宜过高:通常从0.5-0.8开始尝试,过高会导致图像扭曲或过度风格化。
- 可能冲突:多个LoRA同时使用,或LoRA与基础模型风格差异太大时,容易产生不可预测的结果。
- 触发词:许多LoRA有特定的触发词(Trigger Word),需要在提示词中包含才能达到最佳效果,下载时务必查看说明。
4. 负面提示词的战略价值:不只是“去除瑕疵”
负面提示词(Negative Prompt)的重要性不亚于正向提示词。它的核心作用是从生成过程中减去你不想要的概念,从而净化图像,突出主题。
4.1 负面提示词的通用配方与原理
一个强大的负面提示词通常包含多个层次:
(worst quality, low quality, normal quality:1.4), blurry, jpeg artifacts, signature, watermark, username, artist name, (bad anatomy:1.2), bad hands, missing fingers, extra digit, fewer digits, mutated hands and fingers, poorly drawn face, mutation, deformed, ugly, disgusting, extra limbs, malformed limbs, (missing arms:1.1), (missing legs:1.1), fused fingers, too many fingers, long neck, bad proportions, duplicate, morbid, mutilated, out of frame, extra fingers, mutated hands, poorly drawn hands, poorly drawn face, mutation, deformed, blurry, bad anatomy, bad proportions, extra limbs, cloned face, disfigured, gross proportions, malformed limbs, missing arms, missing legs, extra arms, extra legs, fused fingers, too many fingers, long neck, (nsfw:1.3)- 质量过滤:
worst quality, low quality, blurry, jpeg artifacts直接过滤掉低质图像特征。 - 水印与信息:
signature, watermark, username, artist name避免生成带有训练数据中常见水印的图片。 - 人体结构修正:这是负面提示词最核心的功能之一。SD模型在生成复杂结构如手部、脚部、多人肢体交错时容易出错。
bad hands, missing fingers, extra digit, bad anatomy, extra limbs, malformed limbs等词能显著降低这些错误的概率。 - 美学过滤:
ugly, disgusting, mutated, deformed过滤掉审美上不可接受的结果。 - 内容安全与风格净化:
nsfw(Not Safe For Work)用于过滤不适宜内容。如果你只想生成清新风格,可以加入blood, gore, weapon等。如果你想保持画面纯净,可以加入text, words, logo。
4.2 针对人物属性的专项负面控制
除了通用配方,我们还可以进行更有针对性的负面控制,来微调人物属性。
- 控制年龄感:生成少女时,加入
old, wrinkles, aged;生成成熟女性时,加入child, kid, teenage。 - 控制表情与神态:想要微笑,可加入
frown, angry, crying;想要严肃,可加入smile, laugh, silly expression。 - 控制服饰暴露度:这是一个常见需求。如果你希望生成得体的服饰,可以在负面提示词中加入
nude, naked, bare shoulders, cleavage, miniskirt, see-through等具体描述。请注意,这并非绝对屏蔽,而是大幅降低这些特征出现的概率。更可靠的方法是选择本身风格保守的模型,并在正向提示词中明确描述你想要的服装,如elegant long dress, high neckline。 - 控制画面元素:如果你想突出人物,可以加入
crowd, multiple people, busy background来简化背景。
实例4:使用负面提示词精确调整目标:生成一位穿着正式西装、表情自信的职场女性半身像,背景简洁。
正向提示词:(professional photo, sharp focus), 1woman, confident expression, wearing a tailored black business suit, white shirt, hair in a neat bun, looking at viewer, studio lighting, upper body shot 负面提示词:(worst quality, low quality), blurry, casual wear, t-shirt, smile, laughing, (cluttered background:1.2), crowd, text, logo, bad hands- 分析:负面提示词在这里起到了“精准修剪”的作用。
casual wear, t-shirt强化了“正式西装”的指令;smile, laughing确保表情是“自信”而非“开心”;(cluttered background:1.2), crowd主动要求简洁背景,避免AI生成办公室人群等复杂场景。
核心技巧:负面提示词不是越多越好。过于冗长复杂的负面提示词有时会过度限制AI,导致生成结果僵硬或缺乏细节。从通用配方开始,根据每次生成结果的具体问题,逐步添加针对性的负面词,是更稳妥的策略。
5. 实战工作流:从构思到成图的完整案例拆解
让我们通过一个完整的案例,将前面所有知识串联起来。假设我们的目标是:生成一幅“未来赛博朋克城市中,一名身手矫健、戴着高科技目镜的女黑客,正在雨夜霓虹灯下的屋顶奔跑”的插画。
5.1 第一步:构思与维度分解
首先,我们将构思分解到四个核心维度:
- 基础身份与外貌:
1girl,young woman,athletic build,pale skin,short cyan hair(青色短发)。 - 神态与气质:
focused expression,determined look,dynamic pose(动态姿势)。 - 服饰与装扮:
cyberpunk hacker outfit,form-fitting black bodysuit,glowing neon highlights on suit,high-tech visor covering eyes,data cables connected to neck port。 - 环境与光影:
cyberpunk city at night,rain,wet streets,neon signs glowing in Japanese and Chinese characters,rooftop,low angle shot,cinematic lighting,volumetric fog,blue and pink color scheme。
5.2 第二步:编写与优化提示词
根据分解的维度,组合成初步提示词,并考虑权重和逻辑顺序。
初始正向提示词:
(cyberpunk style illustration, masterpiece, best quality, ultra-detailed), 1girl, young woman, athletic build, short cyan hair, focused expression, determined look, (cyberpunk hacker outfit:1.3), form-fitting black bodysuit with glowing neon highlights, wearing a high-tech visor covering eyes, data cables connected to neck port, running on a rooftop, (cyberpunk city at night:1.2), heavy rain, wet streets, neon signs in Japanese, low angle shot, cinematic lighting, volumetric fog, (blue and pink color scheme:1.1), dynamic pose通用负面提示词:
(worst quality, low quality), blurry, jpeg artifacts, signature, watermark, bad anatomy, bad hands, extra limbs, (smile:0.8), sunny, daytime, simple background- 这里特意在负面中加入了
(smile:0.8)来抑制笑容,强化专注感;加入sunny, daytime来确保夜雨氛围;加入simple background避免背景过于简单。
5.3 第三步:参数调试与迭代生成
将提示词放入WebUI,开始调试参数:
- 模型选择:选择一个擅长赛博朋克风格或通用插画风格的Checkpoint,例如
ReV Animated或CyberRealistic。 - 采样器与步数:使用
DPM++ 2M Karras或Euler a,步数20-30。CFG Scale(提示词相关性)可以设高一些,如7-10,以加强提示词控制力。 - 种子与批次:先固定种子为
-1(随机)生成几张,找到构图和感觉不错的图,然后固定其种子,进行小幅度变化或高清修复(Hires. fix)。
第一次生成可能的问题:
- 问题:人物动作僵硬,不像在奔跑。
- 优化:在正向提示词中强化动态描述,改为
sprinting across the rooftop, (dynamic running pose:1.2)。或者,使用OpenPose Editor插件,先画一个奔跑的骨骼图,再用图生图来控制姿势。 - 问题:霓虹光效不够突出,画面偏暗。
- 优化:增加光影相关词权重,如
(glowing neon highlights on suit:1.4),(neon signs glowing:1.3)。也可以尝试在负面提示词中加入dark, dull。
5.4 第四步:利用图生图与局部重绘进行精修
得到一张基础不错的图后:
- 高清修复:启用Hires. fix,使用
R-ESRGAN 4x+或Latent放大算法,放大倍数1.5-2倍,重绘幅度0.2-0.3,可以显著提升细节。 - 局部重绘:如果对手部、面部或某个霓虹灯牌不满意,使用局部重绘功能,用画笔涂蒙版,在仅重绘蒙版区域下,输入更精细的提示词(例如,重绘手部时,输入
perfect hands, detailed fingers, holding nothing),进行局部修正。 - 风格融合:如果想加入更强烈的个人风格,可以在图生图时,在提示词末尾加入特定的LoRA,如
<lora:Cyberpunk_Artstyle:0.6>。
通过这样“构思-分解-编写-调试-精修”的流程,你就能系统地、可重复地创造出符合你想象的人物图像。整个过程的关键在于耐心迭代和基于对模型行为的理解进行微调,而不是寻找一劳永逸的“万能提示词”。记住,提示词工程是一门实践的艺术,多试、多分析、多总结,你与AI的协作就会越来越默契。