AI生成多人照片脸崩怎么办?3个提示词思路先稳住五官
神马中转API
国内直连企业级中转,600+全模型支持

用 AI 生成单人人像时,脸部通常比较容易控制,但一旦变成情侣照、三人合影、家庭照或多人聚会照,问题往往马上出现:两个人长得越来越像、眼睛大小不一致、脸型突然变宽、人物五官互相串脸,甚至出现“同一张脸换了几个发型”的情况。
多人照片难做,并不只是因为画面里的人变多了。AI 同时需要理解人物数量、身份差异、站位关系、五官特征、姿态、构图和画面风格。其中任何一项描述不够明确,都可能让人物身份发生混淆。
比较实用的思路,是先把提示词从“描述一张漂亮照片”改成“安排几个人分别站在哪里、长什么样、如何被拍摄”。先固定身份和位置,再加入摄影风格、光线和氛围。
一个适合多人照片的通用 Prompt 公式可以先记下来:
人物数量 + 人物身份特征 + 站位关系 + 五官要求 + 场景 + 构图 + 光线 + 摄影风格 + 输出用途
如果想快速测试不同构图和人物写真方案,也可以使用机灵助手先生成多个版本,对比哪种人物站位和描述方式更加稳定,再逐步细化提示词。
为什么AI生成多人照片更容易脸崩
多人照片最大的难点不是背景,而是身份分配。
例如提示词只写:
三个年轻人站在一起拍照,表情自然,真实摄影风格。
对人来说很好理解,但对模型来说,三个角色几乎没有区别。它知道需要画三个人,却不知道三个人应该分别具有哪些面部特征,因此很容易把相似的脸部结构重复使用。
常见问题主要集中在下面几类。
| 问题 | 常见表现 | 提示词需要补充的信息 |
|---|---|---|
| 人物同脸 | 多个人五官非常相似 | 发型、配饰、脸型、服装等识别特征 |
| 五官变形 | 眼睛、嘴巴、鼻子位置异常 | 正脸、无遮挡、五官清晰、自然比例 |
| 人脸互串 | A人物特征跑到B人物身上 | 明确左、中、右位置 |
| 边缘人物崩坏 | 中间清晰,两侧人物变形 | 平衡构图、人物大小接近 |
| 面部模糊 | 氛围不错但脸不清楚 | 减少复杂光效,提高脸部画面占比 |
| 人物数量错误 | 三个人生成四个人 | 开头明确具体人数 |
因此,多人图的第一目标不是“增加更多高级风格词”,而是先让模型建立清晰的人物关系。
多人照片Prompt先固定这套信息顺序
多人照片比较稳定的一种提示词结构,可以拆成三个层级。
身份层
先定义画面中有多少人,每个人有什么明显区别。
例如:三位年轻女性,左侧为齐肩黑色短发、圆框眼镜、浅蓝衬衫;中间为黑色高马尾、白色针织上衣;右侧为棕色长卷发、米色外套。
这里的关键词全部是在回答“谁是谁”。
画面层
接着定义人物之间如何排列以及脸部状态。
例如:三人并排站立,肩部自然靠近,全部正面看向镜头,人物脸部大小接近,头部之间保留适当间距,五官独立清晰,没有头发或手部遮挡面部。
风格层
最后才加入摄影和画面效果。
例如:室内自然摄影,柔和窗光,中景半身构图,背景简洁,肤色自然,轻微景深,适合社交媒体人物合照。
这样写的优势,是人物信息不会被大量“电影感、氛围感、胶片、逆光”等描述淹没。
场景一:情侣双人照,重点解决串脸和同脸
双人照片看起来人数最少,实际上非常容易出现人物相似化。
尤其是情侣写真、朋友合照、婚纱照这类人物距离比较近的画面,两张脸同时集中在很小的区域里,模型容易互相引用特征。
因此双人照片要重点描述三件事:
| 需要控制 | 建议写法 |
|---|---|
| 身份 | 分别描述两个人的头发、配饰、服装 |
| 位置 | 明确左侧人物、右侧人物 |
| 距离 | 肩部接近,但脸部不重叠 |
情侣半身照Prompt
生成一张两人情侣半身合照。画面左侧是一位黑色短发男性,眉形自然,穿深灰色针织上衣;画面右侧是一位黑色长直发女性,露出额头,佩戴小型银色耳饰,穿米白色针织衫。两人肩膀自然靠近,脸部保持独立,不互相遮挡,同时看向镜头,表情放松自然。两个人的五官、脸型和发型保持明显区别,眼睛自然对称,嘴型和鼻子比例正常。使用50mm人像摄影效果,中景半身构图,柔和窗光,浅景深,暖白室内背景,真实自然摄影质感,适合情侣写真和社交平台分享。
如果生成后发现两个人越来越像,可以继续强化:两个人具有明显不同的面部特征,保持各自独立身份和脸型差异。
对于双人图来说,这一句通常比继续堆“8K、高清、极致细节”等词更有针对性。
场景二:三人朋友合照,重点处理左右和中间关系
三人图常见的问题是中间人物很清楚,两边人物开始变形。
原因也比较直观:很多生成模型在人物摄影中天然更重视画面中心,因此中间的人容易成为视觉主体。
三人合照建议把人物明确拆成:左侧人物 + 中间人物 + 右侧人物
而不是简单描述“三个朋友”。
三人朋友合照Prompt
生成一张三位朋友的自然合照。左侧是一位齐耳黑色短发女性,佩戴细圆框眼镜,穿浅蓝色衬衫;中间是一位黑色高马尾女性,穿白色圆领上衣;右侧是一位棕色长卷发女性,穿浅卡其色外套。三人并排站立,肩部自然靠近,头部之间保留适当空间,全部正面看向镜头。三个人的脸部大小接近,五官独立清楚,眼睛自然对称,脸型保持各自差异,没有人物遮挡其他人的脸。户外咖啡店门前,自然阴天柔光,中景构图,50mm真实摄影效果,背景轻微虚化,色彩清爽自然,适合朋友聚会纪念照。
如果希望画面更活泼,可以保留人物身份描述,只替换姿态部分:三个人略微错位站立,中间人物向前半步,左右人物身体轻微向内侧转动。
这种“错位”通常比三个人完全贴在一条线上更加自然,同时还能减少脸部互相干扰。
场景三:四人以上家庭照,重点不是写得更长
人物达到四人、五人甚至更多以后,如果给每个人写一大段五官描述,Prompt反而会变得非常混乱。
更实用的方法,是建立简单编号:左一、左二、中间、右二、右一。
每个人只保留2—3个最容易识别的视觉标签。
四人家庭合照Prompt
生成一张四人家庭室内合照。四个人从左到右依次排列:左一为短发成年男性,黑框眼镜,深蓝衬衫;左二为肩部长发成年女性,米色针织衫;右二为黑色短发年轻男性,浅灰卫衣;右一为黑色长发年轻女性,白色上衣。四个人坐在浅色沙发前自然合影,身体略微错位,所有人物正面看向镜头。每个人拥有独立清晰的面部特征,人物之间脸型、发型和年龄感具有自然差异,脸部无遮挡,不出现重叠五官。客厅自然窗光,暖白色调,中景家庭摄影构图,真实肤质,背景简洁整洁,适合家庭纪念照片。
多人越多,越要减少无关描述。
如果本身只是家庭纪念照,就没有必要同时加入“电影感、强逆光、超浅景深、梦幻光斑、复杂背景、时尚大片”等大量视觉要求。
先把人物稳定下来,再逐渐增加风格,成功率通常更高。
用唯一标签把每个人真正区分开
所谓唯一标签,就是某个人身上很容易识别、同时不会和其他人物重复的特征。
常用信息包括:
| 标签类型 | 可以使用的描述 |
|---|---|
| 发型 | 短寸、齐耳短发、高马尾、长卷发、中分短发 |
| 眼镜 | 黑框眼镜、细圆框眼镜、无框眼镜 |
| 配饰 | 银色耳钉、红色围巾、棒球帽 |
| 服装 | 米白针织衫、蓝色卫衣、深灰西装 |
| 年龄特征 | 年轻男性、中年女性、老年男性 |
| 面部特征 | 圆脸、偏长脸型、自然胡须 |
重点不是把一个人物写得非常复杂,而是让不同人物之间具有足够明显的差异。
例如四个人分别使用:
黑框眼镜 + 蓝色衬衫
长卷发 + 米色外套
短发 + 灰色卫衣
高马尾 + 白色针织衫
模型往往比面对“四个年轻人,自然、高颜值、时尚”更容易建立角色关系。
构图也会直接影响脸部稳定性
有时提示词已经写得很清楚,人脸仍然容易变形,这时候问题可能来自构图。
多人全身照中,每张脸在整个画面里的像素占比比较小,模型需要同时处理服装、动作、手脚、环境和背景,能够分配给五官的细节自然减少。
因此可以根据用途调整景别。
| 用途 | 推荐构图 | 原因 |
|---|---|---|
| 情侣写真 | 半身、中近景 | 两张脸占比较大 |
| 三人朋友照 | 半身、中景 | 兼顾人物关系与脸部 |
| 家庭照 | 中景 | 能展示多人姿态 |
| 团队合照 | 中景或四分之三身 | 避免脸部过小 |
| 社媒头像式合照 | 胸像 | 五官稳定性通常更高 |
如果全身多人照频繁脸崩,可以先生成半身版本测试人物身份是否稳定。
确认人物关系之后,再扩展到更大的景别。
光线和风格词尽量服务于人脸
光线并不是越复杂越好。
多人合照尤其适合:柔和窗光、阴天自然光、均匀影棚光、柔和正面补光。
这些光线能够让几个人的脸保持相对一致的曝光。
而强侧逆光、极暗环境、舞台彩色灯光、非常强的电影阴影,虽然能制造氛围,却会提高某些人物脸部丢失细节的概率。
如果要做电影感,可以先生成稳定版本,再在后续版本中增加:柔和电影光影、轻微胶片颗粒、自然色彩分级。
这样比一开始就加入十几个风格词更加容易测试问题到底出在哪里。
参考图怎么选,也会影响多人五官
如果使用参考照片进行生成或换风格,原图质量同样重要。
比较理想的参考图具有这些特点:
| 项目 | 建议 |
|---|---|
| 脸部 | 清晰、无遮挡 |
| 角度 | 正脸或轻微侧脸 |
| 表情 | 自然,避免大幅度表情 |
| 光线 | 面部曝光均匀 |
| 分辨率 | 能清楚看到主要五官 |
| 人物距离 | 头部不要严重重叠 |
如果某个人在参考图中只有很小的一张脸,又恰好位于画面边缘,即使增加大量提示词,也很难完全恢复身份细节。
因此,在多人换风格、写真重绘等任务里,素材质量和Prompt同样重要。
建立自己的多人照片模板库
经常生成情侣照、家庭照、团队照或朋友合照时,没有必要每次从头写Prompt。
更高效的方法是建立固定模板,只替换人物信息。
可以把模板拆成下面几个字段:
| 模板字段 | 可替换内容 |
|---|---|
| 人数 | 2人、3人、4人、5人 |
| 人物特征 | 发型、眼镜、服装、年龄 |
| 站位 | 左右、并排、错位、坐姿 |
| 景别 | 胸像、半身、中景 |
| 场景 | 影棚、客厅、咖啡店、户外 |
| 光线 | 窗光、阴天、棚拍柔光 |
| 风格 | 写真、纪实、胶片、生活方式 |
| 用途 | 社媒、纪念照、宣传图、人物写真 |
需要快速寻找不同人物构图参考时,可以直接从AI 生图模板中选择接近的写真或人物模板,再替换人物数量、身份标签和场景信息。

核心原则就是四点:
可复制 + 可替换 + 可测试 + 可复用
例如分别保存“情侣双人模板”“三人朋友模板”“四人家庭模板”,之后只换发型、衣服和场景,就可以快速生成新的版本。
出图后重点检查这7项
多人照片生成完成后,不建议第一眼只看“好不好看”。
最好按固定顺序检查。
| 检查项目 | 重点观察 |
|---|---|
| 人数 | 是否多出或少了人物 |
| 身份 | 每个人是否仍然具有指定特征 |
| 五官 | 眼睛、鼻子、嘴巴是否自然 |
| 人脸差异 | 是否出现多个人长得过于相似 |
| 构图 | 边缘人物是否被压缩或截断 |
| 品牌与服装 | 指定服装、Logo、商品是否出现变化 |
| 输出用途 | 尺寸、留白、人物位置是否适合最终平台 |
如果只有其中一个人物出现问题,优先调整这个人物的身份标签和站位,没有必要把整套Prompt全部推翻。
例如右侧人物总是模糊,可以尝试:右侧人物与其他人物保持相同脸部尺寸,面部完整进入画面,五官清楚,正面朝向镜头。
这种局部修改更有利于定位问题。
一套可以长期使用的固定工作流
多人照片不需要追求“一次生成就完美”。
更适合实际使用的是多版本筛选。
推荐流程:
确定用途 → 确定人数 → 分配身份标签 → 确定站位 → 选择构图 → 套用Prompt模板 → 生成多个版本 → 检查五官 → 局部修改 → 精修 → 保存模板
第一轮主要看人物身份是否正确。
第二轮再调整光线、背景和摄影风格。
第三轮才处理细节、画面氛围和平台尺寸。
这种方式特别适合需要持续生产人物素材的设计师、电商运营和内容团队,因为修改过程有规律,也方便把效果比较好的Prompt沉淀成模板。
FAQ:多人AI照片常见问题
AI为什么会把两个人生成得很像?
通常是因为人物之间缺少明显的身份区分。可以分别增加不同的发型、眼镜、配饰和服装颜色,并明确左右位置,再加入“保持各自独立面部特征和脸型差异”。
两个人脸贴得越近越容易脸崩吗?
通常会更难处理。人物脸部区域发生重叠时,模型需要判断两个非常接近的五官区域。可以保留肩膀靠近的亲密感,但让两张脸之间存在一定空间。
三人照片为什么总是中间的人最清楚?
很多人像构图会天然突出中心人物。可以强调“三个人脸部大小接近、清晰度一致”,并减少过强的中心景深效果。
人数越多,Prompt是不是应该越长?
不一定。四人以上更适合使用“左一、左二、右二、右一”这样的结构,每个人保留2—3个明显标签。信息层级清晰往往比单纯增加字数更重要。
全身合照一直脸崩怎么办?
可以先尝试半身或中景构图,提高脸部在画面中的占比。人物身份稳定以后,再逐渐扩展到四分之三身或全身画面。
已经有参考照片,还需要写人物特征吗?
建议保留关键身份描述。参考图负责提供视觉信息,Prompt则可以帮助模型明确哪些特征需要重点保留,尤其是多人换风格、换背景和写真重绘场景。
“高清、8K、极致细节”能改善五官吗?
这类词能够描述整体输出倾向,但不能解决人物身份混淆。多人照片更值得优先控制人数、站位、脸部占比和人物差异,再考虑清晰度与整体风格。
多人照片先解决“谁是谁”,再解决“好不好看”
AI多人照片想减少脸崩,真正需要稳定的并不是形容词数量,而是人物关系。
可以把全文方法浓缩为这一套公式:
人物数量 + 身份特征 + 站位关系 + 五官要求 + 场景 + 构图 + 光线 + 风格 + 输出用途
双人照片重点区分两个身份,三人照片重点控制左、中、右关系,四人以上则用顺序标签减少信息混乱。
实际生成时,再按照:确定用途 → 选择模板 → 替换人物信息 → 生成多个版本 → 检查身份与五官 → 筛选 → 精修 → 保存模板
持续积累。
已经知道自己要生成什么,可以直接在机灵助手 AI 生图里测试不同人数、站位和Prompt版本;还没有明确构图方向,可以先从AI 生图模板寻找人物写真和合照参考,再替换成自己的需求。
把效果好的Prompt保存下来,下一次换人物、换场景、换服装时,只需要替换几个字段,就能明显减少重复试错。
