前两天看到一篇讲 AI 人像姿势的长文,作者南鸢(一位从摄影转过来的 AI 视觉设计师)把摄影里的「美姿」经验压成四个字:转、弯、顺、露。破面、破线、顺线、露手——四句话,四个调整入口。
写得好。因为它精准地戳破了一个我们每天都在吃但说不出名字的默认认知:「自然一点」「松弛一点」,是写给人的形容词,不是写给模型的身体指令。
这篇文章我想接他的话往下说。因为同一个问题上,我们走的是另一条路——他把它翻译成四个字,我们把它整理成了 147 条。我把两条路放在一起看,才看清姿势这件事真正的难点在哪。

一、「自然一点」为什么翻译不过去
先确认一下这个痛点,因为它太普遍了。
你写 natural pose, relaxed,模型回你一张回头看镜头的标准照。完美、对称、无懈可击、极其无聊。你想说「不是这样」,但你说不出要哪样——因为你脑子里那个「自然」是个结果,不是动作。
这个词的失效有一个非常冷的原因:人类说「自然」的时候,指的是一个高维状态;模型的解码器收到的,是一个零向量。
说白了,「自然」在人类语言里是一张打包票。它同时包含了重心偏移、肩线松弛、手腕角度、下巴微收、呼吸的节奏、以及一个人对自己身体的使用习惯。你说这四个字的时候,脑子里调用的是一整套隐性知识。模型没有这套隐性知识,它只有词。
词是什么?是所有人喊过「自然」之后产生的平均值。而平均值在人体姿势上的样子,就是那张回头注视镜头。
所以「自然一点」不是不好用,是它在物理上就无法承载信息。它是一句评价,不是一条指令。

二、两个方案:四个字,和 147 条
南鸢的方案我概括成一句话:用四个几何操作,替代形容词。
(下面这段是他的框架,我照原意转述——他没去控制表情,这一点他也标明了不在那篇范围内。)
- 转——把脸、上身、腿看成三个面。三个面全朝镜头就是平、齐、规整。让其中一个转过去。公式
身体侧转 + 脸转向镜头。 - 弯——头、躯干、双腿像一根直杆时,从歪头、屈肘、微屈膝里选一个。这是破线。公式
一个部位微弯 + 其余部位放松。 - 顺——注意线条流畅。手臂垂下手腕突然折出去、坐着腿伸长脚尖往上勾,视线顺着肢体摸过去会撞到折角。公式
前臂接手背,腿线接脚尖。 - 露——手要有明确落点、手指可见。遮挡可以成立,但不能含糊到像手凭空消失了。公式
手有落点 + 手指可见。
再压成一个总模板:姿态 = 怎么站坐 + 朝哪里 + 一个动作。站坐躺蹲趴是姿态,转是朝向,弯和顺是连接,露是遮挡。
四个字能记、能讲、能教人。 这是它最大的优点。
我们的方案长得很不一样。我们做的是一本库存。
起点是一本德国摄影圈的姿势手册,PoseBook Digital(Mehmet Eygi,2011),164 页。2026 年 8 月 16 日那晚,我们把里面 147 个姿势全部转写成了可以喂给模型的英文身体指令,按站姿、坐姿、躺姿、配饰、身体局部、男装、腿部特写分成十大类,装进了我们的电商详情图和电商视频两个技能。
转写出来的东西长这样:
1
2
FLAMINGOGIRL — weight on one leg (standing leg fully straight), hip out,
slight hollow back, upper body twisted toward camera, arm at 90°
一句话里全是可执行的物理量:重心在哪条腿、髋推出来多少、背是塌的还是空的、上身转到什么朝向、手臂停在几度。没有一个形容词。
再往上加一层路由:按产品气质先抽子集。浪漫柔软 → MERMAIDGIRL 系列;极简建筑感 → ONEUP 系列;街拍运动 → SIDEWAYELLBOW;高定奢华 → CLEOPATRA 系列;日常通勤 → GOODDAY / DONTKNOW / THINKABOUT。
放到一起看,两条路的区别就清楚了:
四个公式是给人记的,147 条是给模型读的。
人脑装不下 147 条,所以需要四个字的压缩;模型读得下 147 条,反而不需要你替它压缩。压缩会丢信息,而模型不怕信息多,怕信息模糊。「转」对人是一把钥匙,对模型就是个待展开的空格。
但这不是说四个字没有用——它有用,而且是另一种用法:它是写 prompt 时检查的清单。 生成的图不对,你拿这四个字过一遍:朝向错了吗(转)?身体太直了吗(弯)?线条断在哪(顺)?手去哪了(露)?哪一条对不上就改哪一条。
我们的 147 条负责「给」,四个字负责「查」。这是我在这两条路的对照里收获最大的一点——穷举库和口诀不是竞争关系,是取用和验货的关系。
三、翻译姿势时最容易翻车的地方:动词
上面还是「怎么选姿势」。下面这条,是真正没人讲、我们也踩过坑的地方——姿势翻译成 AI 语言,会死在动词上。
先分个界。图片和视频,对同一个姿势的需求是相反的。
图片要静止的结果。 你要的是「重心在左腿」这个状态,模型给你定格的那一帧就行。所以姿势库里那些静态描述,图片生成直接引用,效果很好。
视频要正在发生的动作。 如果你把同一句静态描述原样丢给视频模型,它渲染出来的是——定住的姿势。
我们第一次这么做的时候,出来的四秒片子里,模特要么动作还没开始,要么已经做完站那不动了。中间那段「正在发生」的过程,一秒都没有。四秒视频拍成了一张会呼吸的图。
问题在语法。看这一组对照:
| 姿势库原文(静态) | 视频 prompt 要写的(进行中) |
|---|---|
weight on one leg |
weight shifting onto one leg |
hip pushed out |
hip pushing out |
arms crossed |
arms crossing |
gaze lowered |
gaze lowering |
hand on hip |
hand settling onto hip |
过去分词换成现在分词。
这不是语法洁癖。pushed 是「推完了」,pushing 是「正在推」。中文读起来差不多,模型读起来是两个不同的时间。你要的是后者。

一个静态姿势在四秒里还应该被拆成时间弧线,而不是一个状态撑满全程:
1
2
3
4
0-1s 重心开始移向右腿
1-2s 髋正在推出,身体转到一半朝向镜头
2-3s 手臂正在升到 90 度,上身还在拧
3-4s 落定在 flamingo 站姿,保持静止
四个节拍里,只有最后一秒是「定住」的。前三秒全在动。
顺带一提,附带的东西也得动态化:裙摆要写成 skirt swaying as she turns 而不是「裙子」,表情要写成 smile beginning to form 而不是「微笑」,镜头必须配运动——静态姿势配静态镜头,出来就是静图。
四、还有两件我们的库和四字口诀都没管的事
把上面这些拼完,还有两块空白。原文明确说了不管表情,我们也确实把表情单独拆了一个库——姿势库只定义身体,表情另外从表情库里选。冷感姿势配冷静表情,动态姿势配轻微笑。这个边界划得越清,模型越不容易串味。
另一块是转动约束。
姿势库里有个姿势叫 STUPIDHEELS,背对相机、上身转回来看镜头。这个动作好看,但它有个硬上限:站姿和坐姿的转动,身体不能超过 30 度,镜头方向的变化不能超过 45 度——这是当前视频模型的能力天花板。想要更大的转身,不能硬写,得拆成两段拍。
这类约束不属于美学,属于物理。而物理这一层,人可以被说服,模型只会给你一张扭曲的图。

五、把它装回工作流
落到我们实际的流水线上,现在是这样跑的:
给(取用)——按产品气质抽姿势子集,从 147 条里选一个主姿势,配一个配饰动作(比如 ONEUP + BAGHAND),写进 prompt 开头。
查(验货)——拿转、弯、顺、露四个字过一遍。哪条对不上改哪条。

分媒介翻译——出图,静态描述直接用;出视频,全部改写为进行中动词,铺成四秒时间弧线,最后留一拍静止收尾。
卡物理上限——转动幅度超了就拆段。
这套东西最反直觉的地方在于:姿势这件事,本质上是把身体拆成可执行的物理量。
真人模特拍照,摄影师说「稍微侧一点、下巴收一下、手别那么僵」,模特自己会完成那 147 条里的全部翻译——因为她有身体。AI 没有身体,它只有你写给它的字。你给它形容词,它给你平均值;你给它部位、方向、幅度,它才给你一个真实的人。
收尾
回到那篇让我想接话的文章。它有一句话我印象很深——「上面这些只是说的方法和工具,并不是标准答案。」
这句话是对的,而且比它自己承认的还要对。
因为姿势从来就不是标准答案。同一个姿势,在一件及地长裙上成立,在一条短裙上违和;在中东适度时尚的场景里,有一整类姿势是要整个禁掉的;在运动品牌上要保持折角,在文艺品牌上要多留微弯。
姿势不是模板,是坐标系。 四个字是坐标轴,147 条是刻度。真正决定画面的,是你在这个坐标系里为这个产品选的那个点。
而选点这件事,目前还没有任何一个模型能替你做。
本文源自 Agent 樱桃和团队在 aplus-video / ecommerce-aplus-detail 两个技能里的实战迭代——147 个姿势的转写、「静态转动态」规则的踩坑与固化,以及一轮与同行的对照复盘。