AI生成多人照片脸崩怎么办?3个提示词思路先稳住五官

AI生成多人照片脸崩怎么办?3个提示词思路先稳住五官

神马中转API

国内直连

企业级中转,600+全模型支持

比官方
便宜77.7%
免费试用福利
注册即送$0.2美金
02
01
00
:
5
4
3
2
1
0
9
8
7
6
5
4
3
2
1
0
GPT5.5 / Claude4.7 / Gemini3Pro
GPT Image 2 / NanoBanana / MJ
高并发不封号
OpenAI接口兼容
立即注册体验
1000+ 新用户今日注册
AI生成多人照片脸崩怎么办?3个提示词思路先稳住五官

用 AI 生成单人人像时,脸部通常比较容易控制,但一旦变成情侣照、三人合影、家庭照或多人聚会照,问题往往马上出现:两个人长得越来越像、眼睛大小不一致、脸型突然变宽、人物五官互相串脸,甚至出现“同一张脸换了几个发型”的情况。

多人照片难做,并不只是因为画面里的人变多了。AI 同时需要理解人物数量、身份差异、站位关系、五官特征、姿态、构图和画面风格。其中任何一项描述不够明确,都可能让人物身份发生混淆。

比较实用的思路,是先把提示词从“描述一张漂亮照片”改成“安排几个人分别站在哪里、长什么样、如何被拍摄”。先固定身份和位置,再加入摄影风格、光线和氛围。

一个适合多人照片的通用 Prompt 公式可以先记下来:

人物数量 + 人物身份特征 + 站位关系 + 五官要求 + 场景 + 构图 + 光线 + 摄影风格 + 输出用途

如果想快速测试不同构图和人物写真方案,也可以使用机灵助手先生成多个版本,对比哪种人物站位和描述方式更加稳定,再逐步细化提示词。

为什么AI生成多人照片更容易脸崩

多人照片最大的难点不是背景,而是身份分配

例如提示词只写:

三个年轻人站在一起拍照,表情自然,真实摄影风格。

对人来说很好理解,但对模型来说,三个角色几乎没有区别。它知道需要画三个人,却不知道三个人应该分别具有哪些面部特征,因此很容易把相似的脸部结构重复使用。

常见问题主要集中在下面几类。

问题 常见表现 提示词需要补充的信息
人物同脸 多个人五官非常相似 发型、配饰、脸型、服装等识别特征
五官变形 眼睛、嘴巴、鼻子位置异常 正脸、无遮挡、五官清晰、自然比例
人脸互串 A人物特征跑到B人物身上 明确左、中、右位置
边缘人物崩坏 中间清晰,两侧人物变形 平衡构图、人物大小接近
面部模糊 氛围不错但脸不清楚 减少复杂光效,提高脸部画面占比
人物数量错误 三个人生成四个人 开头明确具体人数

因此,多人图的第一目标不是“增加更多高级风格词”,而是先让模型建立清晰的人物关系。

多人照片Prompt先固定这套信息顺序

多人照片比较稳定的一种提示词结构,可以拆成三个层级。

身份层

先定义画面中有多少人,每个人有什么明显区别。

例如:三位年轻女性,左侧为齐肩黑色短发、圆框眼镜、浅蓝衬衫;中间为黑色高马尾、白色针织上衣;右侧为棕色长卷发、米色外套。

这里的关键词全部是在回答“谁是谁”。

画面层

接着定义人物之间如何排列以及脸部状态。

例如:三人并排站立,肩部自然靠近,全部正面看向镜头,人物脸部大小接近,头部之间保留适当间距,五官独立清晰,没有头发或手部遮挡面部。

风格层

最后才加入摄影和画面效果。

例如:室内自然摄影,柔和窗光,中景半身构图,背景简洁,肤色自然,轻微景深,适合社交媒体人物合照。

这样写的优势,是人物信息不会被大量“电影感、氛围感、胶片、逆光”等描述淹没。

场景一:情侣双人照,重点解决串脸和同脸

双人照片看起来人数最少,实际上非常容易出现人物相似化。

尤其是情侣写真、朋友合照、婚纱照这类人物距离比较近的画面,两张脸同时集中在很小的区域里,模型容易互相引用特征。

因此双人照片要重点描述三件事:

需要控制 建议写法
身份 分别描述两个人的头发、配饰、服装
位置 明确左侧人物、右侧人物
距离 肩部接近,但脸部不重叠

情侣半身照Prompt

生成一张两人情侣半身合照。画面左侧是一位黑色短发男性,眉形自然,穿深灰色针织上衣;画面右侧是一位黑色长直发女性,露出额头,佩戴小型银色耳饰,穿米白色针织衫。两人肩膀自然靠近,脸部保持独立,不互相遮挡,同时看向镜头,表情放松自然。两个人的五官、脸型和发型保持明显区别,眼睛自然对称,嘴型和鼻子比例正常。使用50mm人像摄影效果,中景半身构图,柔和窗光,浅景深,暖白室内背景,真实自然摄影质感,适合情侣写真和社交平台分享。

如果生成后发现两个人越来越像,可以继续强化:两个人具有明显不同的面部特征,保持各自独立身份和脸型差异。

对于双人图来说,这一句通常比继续堆“8K、高清、极致细节”等词更有针对性。

场景二:三人朋友合照,重点处理左右和中间关系

三人图常见的问题是中间人物很清楚,两边人物开始变形。

原因也比较直观:很多生成模型在人物摄影中天然更重视画面中心,因此中间的人容易成为视觉主体。

三人合照建议把人物明确拆成:左侧人物 + 中间人物 + 右侧人物

而不是简单描述“三个朋友”。

三人朋友合照Prompt

生成一张三位朋友的自然合照。左侧是一位齐耳黑色短发女性,佩戴细圆框眼镜,穿浅蓝色衬衫;中间是一位黑色高马尾女性,穿白色圆领上衣;右侧是一位棕色长卷发女性,穿浅卡其色外套。三人并排站立,肩部自然靠近,头部之间保留适当空间,全部正面看向镜头。三个人的脸部大小接近,五官独立清楚,眼睛自然对称,脸型保持各自差异,没有人物遮挡其他人的脸。户外咖啡店门前,自然阴天柔光,中景构图,50mm真实摄影效果,背景轻微虚化,色彩清爽自然,适合朋友聚会纪念照。

如果希望画面更活泼,可以保留人物身份描述,只替换姿态部分:三个人略微错位站立,中间人物向前半步,左右人物身体轻微向内侧转动。

这种“错位”通常比三个人完全贴在一条线上更加自然,同时还能减少脸部互相干扰。

场景三:四人以上家庭照,重点不是写得更长

人物达到四人、五人甚至更多以后,如果给每个人写一大段五官描述,Prompt反而会变得非常混乱。

更实用的方法,是建立简单编号:左一、左二、中间、右二、右一

每个人只保留2—3个最容易识别的视觉标签。

四人家庭合照Prompt

生成一张四人家庭室内合照。四个人从左到右依次排列:左一为短发成年男性,黑框眼镜,深蓝衬衫;左二为肩部长发成年女性,米色针织衫;右二为黑色短发年轻男性,浅灰卫衣;右一为黑色长发年轻女性,白色上衣。四个人坐在浅色沙发前自然合影,身体略微错位,所有人物正面看向镜头。每个人拥有独立清晰的面部特征,人物之间脸型、发型和年龄感具有自然差异,脸部无遮挡,不出现重叠五官。客厅自然窗光,暖白色调,中景家庭摄影构图,真实肤质,背景简洁整洁,适合家庭纪念照片。

多人越多,越要减少无关描述。

如果本身只是家庭纪念照,就没有必要同时加入“电影感、强逆光、超浅景深、梦幻光斑、复杂背景、时尚大片”等大量视觉要求。

先把人物稳定下来,再逐渐增加风格,成功率通常更高。

用唯一标签把每个人真正区分开

所谓唯一标签,就是某个人身上很容易识别、同时不会和其他人物重复的特征。

常用信息包括:

标签类型 可以使用的描述
发型 短寸、齐耳短发、高马尾、长卷发、中分短发
眼镜 黑框眼镜、细圆框眼镜、无框眼镜
配饰 银色耳钉、红色围巾、棒球帽
服装 米白针织衫、蓝色卫衣、深灰西装
年龄特征 年轻男性、中年女性、老年男性
面部特征 圆脸、偏长脸型、自然胡须

重点不是把一个人物写得非常复杂,而是让不同人物之间具有足够明显的差异。

例如四个人分别使用:

黑框眼镜 + 蓝色衬衫
长卷发 + 米色外套
短发 + 灰色卫衣
高马尾 + 白色针织衫

模型往往比面对“四个年轻人,自然、高颜值、时尚”更容易建立角色关系。

构图也会直接影响脸部稳定性

有时提示词已经写得很清楚,人脸仍然容易变形,这时候问题可能来自构图。

多人全身照中,每张脸在整个画面里的像素占比比较小,模型需要同时处理服装、动作、手脚、环境和背景,能够分配给五官的细节自然减少。

因此可以根据用途调整景别。

用途 推荐构图 原因
情侣写真 半身、中近景 两张脸占比较大
三人朋友照 半身、中景 兼顾人物关系与脸部
家庭照 中景 能展示多人姿态
团队合照 中景或四分之三身 避免脸部过小
社媒头像式合照 胸像 五官稳定性通常更高

如果全身多人照频繁脸崩,可以先生成半身版本测试人物身份是否稳定。

确认人物关系之后,再扩展到更大的景别。

光线和风格词尽量服务于人脸

光线并不是越复杂越好。

多人合照尤其适合:柔和窗光、阴天自然光、均匀影棚光、柔和正面补光。

这些光线能够让几个人的脸保持相对一致的曝光。

而强侧逆光、极暗环境、舞台彩色灯光、非常强的电影阴影,虽然能制造氛围,却会提高某些人物脸部丢失细节的概率。

如果要做电影感,可以先生成稳定版本,再在后续版本中增加:柔和电影光影、轻微胶片颗粒、自然色彩分级。

这样比一开始就加入十几个风格词更加容易测试问题到底出在哪里。

参考图怎么选,也会影响多人五官

如果使用参考照片进行生成或换风格,原图质量同样重要。

比较理想的参考图具有这些特点:

项目 建议
脸部 清晰、无遮挡
角度 正脸或轻微侧脸
表情 自然,避免大幅度表情
光线 面部曝光均匀
分辨率 能清楚看到主要五官
人物距离 头部不要严重重叠

如果某个人在参考图中只有很小的一张脸,又恰好位于画面边缘,即使增加大量提示词,也很难完全恢复身份细节。

因此,在多人换风格、写真重绘等任务里,素材质量和Prompt同样重要。

建立自己的多人照片模板库

经常生成情侣照、家庭照、团队照或朋友合照时,没有必要每次从头写Prompt。

更高效的方法是建立固定模板,只替换人物信息。

可以把模板拆成下面几个字段:

模板字段 可替换内容
人数 2人、3人、4人、5人
人物特征 发型、眼镜、服装、年龄
站位 左右、并排、错位、坐姿
景别 胸像、半身、中景
场景 影棚、客厅、咖啡店、户外
光线 窗光、阴天、棚拍柔光
风格 写真、纪实、胶片、生活方式
用途 社媒、纪念照、宣传图、人物写真

需要快速寻找不同人物构图参考时,可以直接从AI 生图模板中选择接近的写真或人物模板,再替换人物数量、身份标签和场景信息。

核心原则就是四点:

可复制 + 可替换 + 可测试 + 可复用

例如分别保存“情侣双人模板”“三人朋友模板”“四人家庭模板”,之后只换发型、衣服和场景,就可以快速生成新的版本。

出图后重点检查这7项

多人照片生成完成后,不建议第一眼只看“好不好看”。

最好按固定顺序检查。

检查项目 重点观察
人数 是否多出或少了人物
身份 每个人是否仍然具有指定特征
五官 眼睛、鼻子、嘴巴是否自然
人脸差异 是否出现多个人长得过于相似
构图 边缘人物是否被压缩或截断
品牌与服装 指定服装、Logo、商品是否出现变化
输出用途 尺寸、留白、人物位置是否适合最终平台

如果只有其中一个人物出现问题,优先调整这个人物的身份标签和站位,没有必要把整套Prompt全部推翻。

例如右侧人物总是模糊,可以尝试:右侧人物与其他人物保持相同脸部尺寸,面部完整进入画面,五官清楚,正面朝向镜头。

这种局部修改更有利于定位问题。

一套可以长期使用的固定工作流

多人照片不需要追求“一次生成就完美”。

更适合实际使用的是多版本筛选。

推荐流程:

确定用途 → 确定人数 → 分配身份标签 → 确定站位 → 选择构图 → 套用Prompt模板 → 生成多个版本 → 检查五官 → 局部修改 → 精修 → 保存模板

第一轮主要看人物身份是否正确。

第二轮再调整光线、背景和摄影风格。

第三轮才处理细节、画面氛围和平台尺寸。

这种方式特别适合需要持续生产人物素材的设计师、电商运营和内容团队,因为修改过程有规律,也方便把效果比较好的Prompt沉淀成模板。

FAQ:多人AI照片常见问题

AI为什么会把两个人生成得很像?

通常是因为人物之间缺少明显的身份区分。可以分别增加不同的发型、眼镜、配饰和服装颜色,并明确左右位置,再加入“保持各自独立面部特征和脸型差异”。

两个人脸贴得越近越容易脸崩吗?

通常会更难处理。人物脸部区域发生重叠时,模型需要判断两个非常接近的五官区域。可以保留肩膀靠近的亲密感,但让两张脸之间存在一定空间。

三人照片为什么总是中间的人最清楚?

很多人像构图会天然突出中心人物。可以强调“三个人脸部大小接近、清晰度一致”,并减少过强的中心景深效果。

人数越多,Prompt是不是应该越长?

不一定。四人以上更适合使用“左一、左二、右二、右一”这样的结构,每个人保留2—3个明显标签。信息层级清晰往往比单纯增加字数更重要。

全身合照一直脸崩怎么办?

可以先尝试半身或中景构图,提高脸部在画面中的占比。人物身份稳定以后,再逐渐扩展到四分之三身或全身画面。

已经有参考照片,还需要写人物特征吗?

建议保留关键身份描述。参考图负责提供视觉信息,Prompt则可以帮助模型明确哪些特征需要重点保留,尤其是多人换风格、换背景和写真重绘场景。

“高清、8K、极致细节”能改善五官吗?

这类词能够描述整体输出倾向,但不能解决人物身份混淆。多人照片更值得优先控制人数、站位、脸部占比和人物差异,再考虑清晰度与整体风格。

多人照片先解决“谁是谁”,再解决“好不好看”

AI多人照片想减少脸崩,真正需要稳定的并不是形容词数量,而是人物关系。

可以把全文方法浓缩为这一套公式:

人物数量 + 身份特征 + 站位关系 + 五官要求 + 场景 + 构图 + 光线 + 风格 + 输出用途

双人照片重点区分两个身份,三人照片重点控制左、中、右关系,四人以上则用顺序标签减少信息混乱。

实际生成时,再按照:确定用途 → 选择模板 → 替换人物信息 → 生成多个版本 → 检查身份与五官 → 筛选 → 精修 → 保存模板

持续积累。

已经知道自己要生成什么,可以直接在机灵助手 AI 生图里测试不同人数、站位和Prompt版本;还没有明确构图方向,可以先从AI 生图模板寻找人物写真和合照参考,再替换成自己的需求。

把效果好的Prompt保存下来,下一次换人物、换场景、换服装时,只需要替换几个字段,就能明显减少重复试错。