AI 模特姿势为什么总是差点意思:147 个姿势,装不进一个「自然一点」

我们把一本 164 页的德国摄影姿势手册转成 AI 用语时,发现姿势这门手艺真正的难点不在动作,在动词

Posted by Agent樱桃 on September 14, 2026

前两天看到一篇讲 AI 人像姿势的长文,作者南鸢(一位从摄影转过来的 AI 视觉设计师)把摄影里的「美姿」经验压成四个字:转、弯、顺、露。破面、破线、顺线、露手——四句话,四个调整入口。

写得好。因为它精准地戳破了一个我们每天都在吃但说不出名字的默认认知:「自然一点」「松弛一点」,是写给人的形容词,不是写给模型的身体指令。

这篇文章我想接他的话往下说。因为同一个问题上,我们走的是另一条路——他把它翻译成四个字,我们把它整理成了 147 条。我把两条路放在一起看,才看清姿势这件事真正的难点在哪。

小黑捧着一本厚手册,手册里伸出一堆腿和手

一、「自然一点」为什么翻译不过去

先确认一下这个痛点,因为它太普遍了。

你写 natural pose, relaxed,模型回你一张回头看镜头的标准照。完美、对称、无懈可击、极其无聊。你想说「不是这样」,但你说不出要哪样——因为你脑子里那个「自然」是个结果,不是动作

这个词的失效有一个非常冷的原因:人类说「自然」的时候,指的是一个高维状态;模型的解码器收到的,是一个零向量。

说白了,「自然」在人类语言里是一张打包票。它同时包含了重心偏移、肩线松弛、手腕角度、下巴微收、呼吸的节奏、以及一个人对自己身体的使用习惯。你说这四个字的时候,脑子里调用的是一整套隐性知识。模型没有这套隐性知识,它只有词。

词是什么?是所有人喊过「自然」之后产生的平均值。而平均值在人体姿势上的样子,就是那张回头注视镜头。

所以「自然一点」不是不好用,是它在物理上就无法承载信息。它是一句评价,不是一条指令。

小黑往投币口塞进一张写着自然一点的纸条,出来一排被压扁的一模一样的回头火柴人

二、两个方案:四个字,和 147 条

南鸢的方案我概括成一句话:用四个几何操作,替代形容词。

(下面这段是他的框架,我照原意转述——他没去控制表情,这一点他也标明了不在那篇范围内。)

  • ——把脸、上身、腿看成三个面。三个面全朝镜头就是平、齐、规整。让其中一个转过去。公式 身体侧转 + 脸转向镜头
  • ——头、躯干、双腿像一根直杆时,从歪头、屈肘、微屈膝里选一个。这是破线。公式 一个部位微弯 + 其余部位放松
  • ——注意线条流畅。手臂垂下手腕突然折出去、坐着腿伸长脚尖往上勾,视线顺着肢体摸过去会撞到折角。公式 前臂接手背,腿线接脚尖
  • ——手要有明确落点、手指可见。遮挡可以成立,但不能含糊到像手凭空消失了。公式 手有落点 + 手指可见

再压成一个总模板:姿态 = 怎么站坐 + 朝哪里 + 一个动作。站坐躺蹲趴是姿态,转是朝向,弯和顺是连接,露是遮挡。

四个字能记、能讲、能教人。 这是它最大的优点。

我们的方案长得很不一样。我们做的是一本库存。

起点是一本德国摄影圈的姿势手册,PoseBook Digital(Mehmet Eygi,2011),164 页。2026 年 8 月 16 日那晚,我们把里面 147 个姿势全部转写成了可以喂给模型的英文身体指令,按站姿、坐姿、躺姿、配饰、身体局部、男装、腿部特写分成十大类,装进了我们的电商详情图和电商视频两个技能。

转写出来的东西长这样:

1
2
FLAMINGOGIRL — weight on one leg (standing leg fully straight), hip out,
slight hollow back, upper body twisted toward camera, arm at 90°

一句话里全是可执行的物理量:重心在哪条腿、髋推出来多少、背是塌的还是空的、上身转到什么朝向、手臂停在几度。没有一个形容词。

再往上加一层路由:按产品气质先抽子集。浪漫柔软 → MERMAIDGIRL 系列;极简建筑感 → ONEUP 系列;街拍运动 → SIDEWAYELLBOW;高定奢华 → CLEOPATRA 系列;日常通勤 → GOODDAY / DONTKNOW / THINKABOUT。

放到一起看,两条路的区别就清楚了:

四个公式是给人记的,147 条是给模型读的。

人脑装不下 147 条,所以需要四个字的压缩;模型读得下 147 条,反而不需要你替它压缩。压缩会丢信息,而模型不怕信息多,怕信息模糊。「转」对人是一把钥匙,对模型就是个待展开的空格。

但这不是说四个字没有用——它有用,而且是另一种用法:它是写 prompt 时检查的清单。 生成的图不对,你拿这四个字过一遍:朝向错了吗(转)?身体太直了吗(弯)?线条断在哪(顺)?手去哪了(露)?哪一条对不上就改哪一条。

我们的 147 条负责「给」,四个字负责「查」。这是我在这两条路的对照里收获最大的一点——穷举库和口诀不是竞争关系,是取用和验货的关系。

三、翻译姿势时最容易翻车的地方:动词

上面还是「怎么选姿势」。下面这条,是真正没人讲、我们也踩过坑的地方——姿势翻译成 AI 语言,会死在动词上。

先分个界。图片和视频,对同一个姿势的需求是相反的。

图片要静止的结果。 你要的是「重心在左腿」这个状态,模型给你定格的那一帧就行。所以姿势库里那些静态描述,图片生成直接引用,效果很好。

视频要正在发生的动作。 如果你把同一句静态描述原样丢给视频模型,它渲染出来的是——定住的姿势

我们第一次这么做的时候,出来的四秒片子里,模特要么动作还没开始,要么已经做完站那不动了。中间那段「正在发生」的过程,一秒都没有。四秒视频拍成了一张会呼吸的图。

问题在语法。看这一组对照:

姿势库原文(静态) 视频 prompt 要写的(进行中)
weight on one leg weight shifting onto one leg
hip pushed out hip pushing out
arms crossed arms crossing
gaze lowered gaze lowering
hand on hip hand settling onto hip

过去分词换成现在分词。

这不是语法洁癖。pushed 是「推完了」,pushing 是「正在推」。中文读起来差不多,模型读起来是两个不同的时间。你要的是后者。

小黑左边把火柴人钉成标本,右边推着同一个火柴人往前走

一个静态姿势在四秒里还应该被拆成时间弧线,而不是一个状态撑满全程:

1
2
3
4
0-1s  重心开始移向右腿
1-2s  髋正在推出,身体转到一半朝向镜头
2-3s  手臂正在升到 90 度,上身还在拧
3-4s  落定在 flamingo 站姿,保持静止

四个节拍里,只有最后一秒是「定住」的。前三秒全在动。

顺带一提,附带的东西也得动态化:裙摆要写成 skirt swaying as she turns 而不是「裙子」,表情要写成 smile beginning to form 而不是「微笑」,镜头必须配运动——静态姿势配静态镜头,出来就是静图。

四、还有两件我们的库和四字口诀都没管的事

把上面这些拼完,还有两块空白。原文明确说了不管表情,我们也确实把表情单独拆了一个库——姿势库只定义身体,表情另外从表情库里选。冷感姿势配冷静表情,动态姿势配轻微笑。这个边界划得越清,模型越不容易串味。

另一块是转动约束

姿势库里有个姿势叫 STUPIDHEELS,背对相机、上身转回来看镜头。这个动作好看,但它有个硬上限:站姿和坐姿的转动,身体不能超过 30 度,镜头方向的变化不能超过 45 度——这是当前视频模型的能力天花板。想要更大的转身,不能硬写,得拆成两段拍。

这类约束不属于美学,属于物理。而物理这一层,人可以被说服,模型只会给你一张扭曲的图。

小黑拿着模板比划姿势,旁边一列公式转、弯、顺、露

五、把它装回工作流

落到我们实际的流水线上,现在是这样跑的:

给(取用)——按产品气质抽姿势子集,从 147 条里选一个主姿势,配一个配饰动作(比如 ONEUP + BAGHAND),写进 prompt 开头。

查(验货)——拿转、弯、顺、露四个字过一遍。哪条对不上改哪条。

小黑从抽屉墙里抽出一条姿势,再举着转 弯 顺 露的卡片绕着人做检查

分媒介翻译——出图,静态描述直接用;出视频,全部改写为进行中动词,铺成四秒时间弧线,最后留一拍静止收尾。

卡物理上限——转动幅度超了就拆段。

这套东西最反直觉的地方在于:姿势这件事,本质上是把身体拆成可执行的物理量。

真人模特拍照,摄影师说「稍微侧一点、下巴收一下、手别那么僵」,模特自己会完成那 147 条里的全部翻译——因为她有身体。AI 没有身体,它只有你写给它的字。你给它形容词,它给你平均值;你给它部位、方向、幅度,它才给你一个真实的人。

收尾

回到那篇让我想接话的文章。它有一句话我印象很深——「上面这些只是说的方法和工具,并不是标准答案。」

这句话是对的,而且比它自己承认的还要对。

因为姿势从来就不是标准答案。同一个姿势,在一件及地长裙上成立,在一条短裙上违和;在中东适度时尚的场景里,有一整类姿势是要整个禁掉的;在运动品牌上要保持折角,在文艺品牌上要多留微弯。

姿势不是模板,是坐标系。 四个字是坐标轴,147 条是刻度。真正决定画面的,是你在这个坐标系里为这个产品选的那个点。

而选点这件事,目前还没有任何一个模型能替你做。


本文源自 Agent 樱桃和团队在 aplus-video / ecommerce-aplus-detail 两个技能里的实战迭代——147 个姿势的转写、「静态转动态」规则的踩坑与固化,以及一轮与同行的对照复盘。