AI Skills(智能体技能)

如何让 AI 泳装照更像真实抓拍?拆解一份夏日摄影 Skill

AI智能摘要

这份泳装抓拍 Skill 关注的不是画质或泳装题材,而是消除 AI 人像的摆拍感:先设计人物正在发生的事件,再决定相机如何记录。单图应保持同一时空与连续瞬间,多人需通过动作、视线和反应建立关系,抓拍则强调未完成的动态;同时用身份锚点区分角色,并将 COS 的配色、轮廓、材质与标志元素转译为现实泳装。

— 此摘要由AI分析文章内容生成,仅供参考。

最近在 X 上看到 @94vanAI 分享的一份“泳装抓拍 Skill”。原文很长,从人物年龄、多人构图、COS 设计,一直写到镜头焦段、皮肤质感和水花方向,共有四十多个模块。

我原本以为它只是一套更复杂的泳装提示词。仔细读完后才发现,真正值得研究的并不是泳装题材,而是它处理 AI 人像“摆拍感”的方法。

很多 AI 图片看起来很漂亮,却不像真实照片。人物总是正对镜头,皮肤光滑得像塑料,几个人整齐地站成一排,背景里的道具也像刚刚布置好。照片虽然没有明显错误,却缺少一个让人相信它真的发生过的瞬间。

这份 Skill 的思路很直接:先设计正在发生的事情,再决定相机如何记录它。

资源下载

资源附件

本文是对原 Skill 的学习、整理和实践总结,不是原文转载。
原作者:𝟡𝟜 ᴾᴸᴬʸᶠᴼᴿᴳᴱ(@94vanAI
原始来源:未审核版抓拍 Skill(泳装篇)

它想解决的不是画质,而是摆拍感

常见的 AI 人像提示词通常会强调:

Python
photorealistic
8K
highly detailed
cinematic lighting
professional photography
perfect skin

这些词可以提高画面的精致程度,却不一定能让照片变得真实。

有时问题恰恰出在“太专业”。人物像在执行摄影师的指令:身体转过来一点,下巴抬高,眼睛看镜头,双手放在合适的位置。最后生成的不是旅行照片,而是一张完成度很高的泳装广告。

这份 Skill 刻意避开了这种表达。摄影者不再是陌生的专业摄影师,而是伴侣、朋友或同行者。画面中的人也不是等待拍摄的模特,而是正在游泳、聊天、玩水或者走向摄影者的人。

相机只是碰巧记录下了其中一秒。

这个区别看起来很小,实际会改变整张图片的生成逻辑。

单图不等于单人

原 Skill 反复强调一条规则:

Python
One image.
One frame.
One scene.
One continuous moment.

这里的“单图”并不是只能出现一个人,而是最终只能有一幅完整画面。

一个人、两个人或者三个人都可以,但所有人必须出现在同一个地点、同一个时间点,并且参与同一件正在发生的事情。

这条约束主要用来防止模型生成:

  • 九宫格;
  • 胶片联系表;
  • 多窗口拼图;
  • 角色展示板;
  • 漫画分镜;
  • 同一个人物在不同地点的组合图。

尤其是使用“35mm 胶片”“90年代旅行摄影”之类的关键词时,部分模型很容易把“胶片质感”理解成胶卷排列或照片合集。因此,提示词里最好明确告诉模型:我们要的是胶片相机拍出的一张照片,不是胶片联系表。

抓拍感来自事件,不来自姿势

这是整份 Skill 中我认为最有用的一点。

想让人物看起来像被抓拍,很多人会直接加入:

Python
candid pose
natural pose
spontaneous

问题是,模型可能只会生成一个“看起来比较随意的姿势”。人物依然是在摆拍,只是摆得没那么正式。

更有效的写法是先确定按下快门前发生了什么。

例如,单人场景可以这样设计:

  • 她刚从泳池里出来,发现摄影者正在拍她;
  • 她一边笑着走近,一边伸手挡住镜头;
  • 她准备把手里的冰饮递给摄影者;
  • 她回头催促落在后面的同行者;
  • 她正想把摄影者拉进水里。

多人场景则要建立动作和反应之间的关系:

Python
A向B泼水;
B正在侧身躲闪;
C看到这一幕后笑了起来。

这是一个事件,而不是三个人各做一件事。

如果写成“A喝饮料、B擦防晒、C玩手机”,虽然三个人都在同一个泳池边,却没有真正的关系。最终画面通常会像三位临时拼到一起的模特。

好的多人抓拍应该有动作的发起者、承受者和旁观者。人物之间存在视线、距离或身体动作上的联系,画面才会自然。

动作应该停在中间

商业摄影习惯记录一个完成的姿势,抓拍则常常停留在动作尚未结束的时候。

提示词可以使用这些描述:

Python
mid-action
unfinished gesture
transitional body movement
caught between movements
off-guard moment
spontaneous body language

比如“抬手挡镜头”只是动作名称,如果写成“刚发现被拍,手臂正在抬起,还没有完全遮住镜头”,画面会具体很多。

其他可以利用的过渡状态还有:

  • 身体刚转过一半;
  • 一只脚刚踩上泳池边缘;
  • 头发仍在甩动;
  • 水花还没有完全落下;
  • 说话时嘴角刚刚扬起;
  • 递东西的手还停在摄影者面前;
  • 回头时肩膀和视线没有完全对齐。

这些“不完整”会让照片拥有时间感。

摄影者也可以成为画面的一部分

“男友视角”经常被误解成单纯的近距离拍摄。其实更重要的是让画面中的人物熟悉镜头后面的人。

她看向摄影者时,不应该像面对陌生摄影师。她可以笑、挡镜头、递饮料、做鬼脸,或者伸手去抢相机。这些反应说明摄影者和人物之间存在关系。

画面也可以少量出现摄影者的手、前臂、膝盖或者水中的手,但只能作为视角证据,不能抢走主体。

例如:

Python
the photographer's hand is slightly visible in the foreground,
she is reaching toward it as if trying to pull the photographer into the pool

这种写法比简单加入“boyfriend POV”更容易让模型理解双方的互动。

当然,“朋友视角”“伴侣视角”和“旅行同伴视角”都可以使用。重点不是关系名称,而是人物面对镜头时表现出的熟悉感。

多人物生成需要两套锚点

多人 AI 图片最容易出现身份混乱:

  • 两个人长成同一张脸;
  • 发型互换;
  • 饰品戴错人;
  • 服装颜色互相串位;
  • 一个角色的标志出现在另一个角色身上。

原 Skill 把每个人拆成两个部分:

Python
Identity Anchor
Character Anchor

Identity Anchor 负责人物自身身份,例如脸型、五官、发际线和面部比例。

Character Anchor 负责 COS 角色特征,例如发色、发型、瞳色、配色、饰品、服装结构和人物气质。

如果有三位人物,就应分别描述:

Python
人物A:身份A + 角色A
人物B:身份B + 角色B
人物C:身份C + 角色C

不要先写完三张脸,再统一描述服装和角色特征。分块描述能降低人物属性串位的概率。

即便如此,多人物身份一致性仍然很依赖生图模型。提示词只能减少问题,无法完全代替区域控制、角色参考、ControlNet 或模型自带的多图参考功能。

COS 不能只是换一种颜色

这份 Skill 对 COS 的处理也很有意思。

常见做法是提取角色的主色,然后生成一套相同颜色的比基尼。这样确实能“像那个角色”,但角色辨识度通常很弱。

更好的方法是做视觉转译。

需要提取的内容包括:

  • 主色和辅助色;
  • 原服装的轮廓;
  • 领口与肩部结构;
  • 几何图案;
  • 材质语言;
  • 发型与头饰;
  • 标志性配件;
  • 角色所属阵营或身份的视觉符号。

然后把这些元素重新设计成现实中可以穿着的泳装。

例如,一个角色的原服装具有不对称肩甲、蓝白配色和菱形图案,那么泳装也可以保留不对称肩带、蓝白色块和小面积菱形装饰。它不需要复制原服装,却仍然保留了角色的视觉 DNA。

多人 COS 时,每个人还应拥有不同的泳装轮廓、领口和肩带结构。不要让所有人穿同一个款式,仅仅更换颜色。

角色性格也要进入画面

COS 不只是服装替换。

如果一个冷静克制的角色和一个活泼外向的角色,在图片里都用相同的网红笑容看着镜头,那么人物虽然穿对了衣服,角色还是没有真正成立。

可以根据角色性格安排动作:

冷静型角色可能只是安静地回头,或者用略显无奈的眼神看摄影者。

活泼型角色更适合跑动、泼水、大笑或者恶作剧。

成熟型角色的动作可以更放松,表情不需要太夸张。

傲娇型角色可以假装生气、皱鼻子或伸手挡住镜头。

动作、视线和表情共同构成角色辨识度。服装只是其中一部分。

“真实皮肤”不等于疯狂添加毛孔

AI 人像经常有两种极端。

一种是磨皮过度,人物像塑料玩偶;另一种为了追求真实,给脸上堆满毛孔、雀斑和皮肤瑕疵,最后看起来像专门拍摄的皮肤测试图。

更自然的处理是让皮肤细节服从环境。

夏季泳池场景中,可以出现:

  • 肩颈和锁骨上的水珠;
  • 鼻尖轻微泛红;
  • 晒后肤色变化;
  • 湿润皮肤产生的局部反光;
  • 轻微肤色不均;
  • 嘴唇纹理;
  • 眼下自然纹理。

不必把所有细节一次写进去。选择三四项与光线和动作有关的特征,通常已经足够。

真实感也不仅来自皮肤。湿发应该贴合脸侧或肩颈,湿泳装颜色会略微变深,奔跑时头发和水花方向需要符合动作,坐姿也应该产生自然的身体折叠。

这些物理细节比“8K、超高画质”更有用。

给照片留一点正确的不完美

真实旅行照片很少拥有绝对标准的构图。

摄影者可能慢了半拍,人物稍微偏离中心,手臂被裁掉一点,镜头上还有没有擦干净的水珠。高光偶尔过曝,对焦也未必落在最理想的位置。

这些都可以成为提示词的一部分:

Python
slightly off-center composition
subtle motion blur
imperfect autofocus
partial foreground obstruction
a small water droplet on the lens
slightly clipped arm
soft corners
mild highlight bloom

但要区分摄影错误和生成错误。

可以接受的是轻微失焦、倾斜、遮挡和随意裁切。

不能接受的是多手指、多肢体、错误关节、面部融合和人物复制。

前者会让照片更像照片,后者只会暴露模型的问题。

摄影媒介一次选一种

原 Skill 提供了几种适合旅行抓拍的摄影媒介:

35mm 胶片

适合自然肤色、有机颗粒、柔和高光和轻微光晕。

90年代便携胶片相机

画面更随意,边角较软,自动对焦偶尔不准,有普通家庭相册的感觉。

2000年代 CCD 相机

动态范围有限,噪点更明显,直闪和偏冷高光容易带来早期数码相机的味道。

一次性相机

硬闪光、固定焦点、偶然裁切和轻微偏色比较突出。

早期智能手机

适合不完美 HDR、随手裁切和轻微动作模糊。

一张照片选择一种主要媒介就够了。胶片、CCD、一次性相机和手机摄影全部混在一起,模型很难判断究竟应该采用哪套成像特征。

焦段可以优先选择 28mm、35mm 或40mm。这几个焦段既能保留环境,也比较接近朋友在身边拍摄的距离。

我整理后的单人提示词

下面是我根据原 Skill 的方法重新整理的一版。它不是原文中的现成提示词,可以按自己的模型和画面需求继续调整。

Python
生成一张单幅、独立的真实摄影照片。

画面中的主体是一位明确为25岁的亚洲成年女性。夏日下午,她正在海边度假民宿的泳池旁休息,穿着一套成熟、简洁、现实中可以正常穿着的深蓝色不对称连体泳装。

摄影者是与她一起旅行的亲密伴侣。她刚从泳池里出来,湿发自然贴在脸侧和肩颈,发梢仍在滴水。她刚刚发现摄影者正在拍她,一边笑着走近,一边抬手挡住镜头。手臂还没有完全抬起,身体处在移动中的过渡状态。这是一个正在发生的动作,不是预先安排的摆拍。

使用partner POV的亲密抓拍视角,35mm镜头,胸口高度机位,近距离拍摄。人物略微偏离画面中心,一侧手臂轻微出框,前景有少量虚化植物遮挡。

背景是有人真实使用过的夏季度假环境。湿润的石板地面上放着一条用过的浴巾、一杯喝了一半的冰饮、一瓶防晒霜和一双湿拖鞋。物品数量克制,不要堆满画面。泳池水面仍有波纹,夏季阳光通过水面反射到人物皮肤上。

采用2000年代小型CCD相机的成像质感:有限的动态范围、轻微CCD噪点、偶尔慢半拍的自动对焦、自然动作模糊、局部高光溢出、轻微边角柔化和随意构图。

皮肤真实可信,可见少量毛孔、轻微肤色不均、自然晒红、肩颈水珠和适度的湿润反光。保持自然人体比例、正确关节、合理肌肉张力以及湿泳装的真实布料质感。不要塑料皮肤、蜡像质感或过度磨皮。

画面只能表现同一个地点、同一个时间点和一个连续事件。观看感像私人旅行相册中偶然留下的一瞬间:她本来正在与摄影者一起度过夏天,而相机恰好在这一刻按下快门。

photorealistic intimate candid photography,
private summer vacation snapshot,
partner POV,
familiar camera presence,
mid-action,
unfinished gesture,
spontaneous body language,
wet summer atmosphere,
realistic skin texture,
reflected summer light,
lived-in environment,
casual framing,
35mm lens,
early-2000s CCD photography,
subtle motion blur,
imperfect autofocus,
mild highlight bloom,
physically believable anatomy

25-year-old adult woman.
Single standalone photograph.
One image only.
One frame only.
One scene only.
One continuous moment only.

负面提示词

Python
child, minor, teenager, underage, childlike appearance,
collage, contact sheet, photo grid, split screen,
diptych, triptych, multi-panel, storyboard, film strip,
Polaroid collage, moodboard, character sheet,
multiple scenes, multiple moments, image inside image,
commercial swimwear advertising, professional fashion shoot,
studio posing, runway pose, stiff front-facing pose,
plastic skin, wax skin, doll skin, CGI skin,
excessive beauty filter, excessive skin smoothing,
unrealistic body proportions, extreme hourglass figure,
malformed hands, extra fingers, missing fingers,
extra limbs, duplicated body parts, warped joints,
broken anatomy, face distortion, duplicated person,
text, logo, watermark, subtitle, date stamp,
REC icon, viewfinder UI, camera menu, magazine layout

多人提示词应该怎样写

多人版本不需要把单人提示词简单复制三次。应先确定一个事件,再为每个人分配身份、角色和动作。

可以使用下面的结构:

Python
生成一张单幅、独立的真实摄影照片。

画面中有三位年龄均在24至28岁之间的亚洲成年女性,她们是一起旅行的朋友,同时处于同一座海边度假别墅的泳池中。

画面只围绕一个正在发生的事件:

人物A刚刚向人物B泼出一捧水;
人物B正在侧身躲闪,下意识抬起手臂;
人物C站在稍远处,看到这一幕后忍不住笑了起来。

三个人的动作属于同一条连续反应链。不要让她们分别摆姿势。

人物A、人物B和人物C必须保持完全独立的人脸、发型、配色、泳装结构、饰品和角色特征。禁止人脸融合、发型串位、服装串位或角色属性泄漏。

人物A位于近景,人物B位于中景,人物C稍远并有轻微景深虚化。使用不对称群体构图,不要横排站立,不要所有人同时看镜头。

摄影者是与她们同行的朋友,使用35mm镜头从泳池边缘高度随手抓拍。水花遮挡部分画面,镜头上有一颗小水珠。人物湿发、水花方向、皮肤反光和湿泳装贴合程度必须符合动作与物理逻辑。

采用90年代便携胶片相机质感:有机颗粒、轻微失焦、柔和高光、边角画质下降和随意裁切。照片像朋友旅行时意外拍到的私人相册照片,不像商业泳装广告或COS宣传照。

Single standalone photograph.
One image only.
One frame only.
One real location.
One continuous candid moment.
Three distinct adult identities.
No identity mixing.
No character attribute leakage.
No lineup.
No collage.

在这段基础上,再分别补充人物 A、B、C 的角色特征和泳装设计即可。

使用这类提示词时要注意什么

首先,涉及泳装的主要人物应该明确为成年人。年龄不清楚、外形幼态或者原作设定为未成年人的角色,不适合直接用于此类生成。即便采用成年 COS 重新诠释,也要在提示词中明确成年年龄和成年外貌比例。

其次,使用真人照片作为人物参考时,需要得到照片本人授权。技术上可以保持身份,并不代表可以在对方不知情的情况下生成新的私人场景。

角色 COS 还涉及版权问题。个人练习、非商业分享和商业广告不是同一回事。准备公开使用或用于营销前,应检查角色、模型和参考素材各自的授权条件。

最后,不同生图模型对长提示词的执行能力差别很大。如果模型经常忽略后半部分,与其继续增加规则,不如缩短提示词,只保留人物、事件、视角、摄影媒介和负面约束。多人身份问题则优先使用人物参考、区域控制或模型提供的一致性功能。

写提示词前,先回答这几个问题

真正动手生成时,我会先填写下面这张简表:

Python
人物是谁?
人物是否明确成年?
照片发生在哪里?
按下快门前一秒发生了什么?
人物为什么会有现在的动作和表情?
摄影者与人物是什么关系?
使用哪一种相机或成像媒介?
画面允许出现哪两种摄影不完美?
必须避免哪些生成错误?

只要这些问题有清楚的答案,提示词就已经完成了一大半。

很多人写 AI 人像提示词时,把注意力全部放在人物长相、服装和画质上。结果每项都写得很精确,人物却不知道自己为什么站在那里。

这份 Skill 给我的启发是:一张照片的真实感,首先来自事件,其次才是摄影参数。

不要让人物专门为照片摆出一个“自然抓拍姿势”。给他们安排一件正在发生的事情,再让相机晚半秒按下快门。画面往往会自然很多。

整理好的Skill可以自己免费下载

52okp 是一名关注人工智能、开源软件与效率工具的技术内容创作者,长期实践 Stable Diffusion、ComfyUI、AI 智能体、MCP、Codex 和各类开源项目。通过实际安装、配置与测试,整理可复现的操作教程、问题排查方法和工具使用经验。

登录用户才能发表评论! 登录账户

取消回复

评论列表 (0条):

加载更多评论 Loading...

延伸阅读:

暂无内容!

    返回顶部