上周有个做女装的朋友找我。他说他算过一笔账:一个款上架,要白底图、要模特图、要场景图、要细节图,有时候还要八个颜色各来一张。找摄影棚拍,一套下来几千块,一周出片;自己用手机拍完修,一天能修出三张,修出来的还上不了台面。
然后他问了我一句话,我记到现在:
“我能不能就拍一张,剩下的让 AI 弄?”
能。而且这张”拍一张”,可以拍得很随便。
一、先看这张输入

这是一张真实的输入图,不是摆拍。店里的衣架上挂着八个颜色的同款卫衣,木头衣架、金属挂杆,背景是货架、别人的衣服、顶上的灯。手机随手拍的,带网格线。
如果拿这张图去投广告,你会被老板骂。 但它包含了做详情页需要的全部信息:款式是连帽拉链卫衣、有抽绳、有袋鼠口袋、罗纹袖口、常规版型、有八个颜色。
对我们来说,这一张就够了。
二、中间发生了什么
我们做了一条流水线,叫 aplus。老板交给它的东西可以非常少——一个产品图,加一句话。
这是那条流水线收到的原话,我一个字没改:
帮我生成这个产品的电商详情页。 产品图:
product.jpg(用户未提供描述,请根据产品图自行分析品类、面料、风格并生成详情页)
就这么两句。没有面料参数、没有设计说明、没有目标人群。“用户未提供描述”这几个字也是原文——我们明知道他没有,也没让他回去补。
然后流水线开始跑。它做的第一件事不是画图,是看。
它先判断这是不是纯色背景的模特穿版图、是不是平铺图、有没有拼色、是单件还是套装。判断完再看产品本身:廓形是流动的还是硬挺的、面料是柔软悬垂还是挺括有型、颜色倾向、整体气质属于浪漫还是极简还是日常休闲。
这一步很关键,因为同一件衣服,在这些维度上判错的代价不一样。一件”日常休闲”的卫衣按”奢华高定”去做,出来的图再精致也不对味。
判完气质,才开始出图。
三、出来的是这六张

第一张:白底图。
从那张乱七八糟的衣架照里,把卫衣单独拎出来,放到纯白背景上。你看不出它原本挂在货架上、旁边还有别的衣服。这张图能直接上亚马逊的主图位。

第二张:模特图。
注意,这张图里的衣服和第一张是同一件,但模特不是原图里那个人——原图里根本没有模特,只有衣架。模特是流水线按产品气质选的,穿的是同一件卫衣,抽绳的毛边、拉链的位置、口袋的形状,全部对得上。


第三、四张:场景图。
这两张是给详情页中段和社交媒体用的。卫衣穿在真人身上、在真实环境里——街景、咖啡店门口。衣服是要被穿出去的东西,光有白底图卖不动。

第五张:细节图。
罗纹袖口的密度、拉链齿的形状、抽绳末端的毛边、面料的抓绒质感。这张图的作用是替客户”上手摸一遍”——线上卖衣服最缺的就是触感,细节图是唯一能补的。

第六张:色卡图。
原图里那八个颜色,被还原成了色卡。这张图是给客户选的,也是给你自己上 SKU 用的。
六张图,加上一个详情页 HTML。老板要做的,就是标题底下那两句话。
四、那”手搓”是什么样
你可能会说:豆包也能生图啊,我为什么不用豆包,一张一张搓?
能。但你会死在这三件事上。
第一,一致性。 你用豆包出六张图,最可能发生的事是——六张图里有六件衣服。领口宽一点、颜色深一度、口袋位置挪一点。客户看不出来,但货不对板这四个字,是电商最大的事故。我们这条流水线在出图前会把产品拆成”身份锚点”:廓形、领型、袖型、下摆、口袋、五金,每一项都锁死;再配一组”负面锚点”——没有 logo、没有胸前印花、没有刺绣、没有拼色。锁死了才允许开画。 这一步手搓的时候你根本想不起来做。
第二,物理。 AI 生成的图最容易露馅的地方不是画质,是物理常识。面料要跟着重力走,肩膀和手肘要有真实的褶皱和张力,光要来自一个方向。手搓的时候,你出一张、觉得不对、改提示词、再出一张——你是在用试错撞运气,而不是在解决问题。
第三,量。 一个款六张图,你有耐心搓。十个款呢?六十张。这时候你要么招人,要么放弃。
而流水线真正卖给你的,不是”能生成图”,是”每次生成的结果都长一样”。
区别在这:豆包给你的是一次生成,aplus 给你的是一套产出。前者是工具,后者是产线。
五、省下来的到底是什么
回到我朋友那笔账。
他算的是摄影棚几千块、等一周。但我觉得他真正想省的不是钱。
是”下一个款”的力气。
做服装的都知道,一个款卖爆了当然好,但更常见的是十个款里成一个。所以要不停地试新款。而每试一个新款,就重来一遍拍摄流程——约棚、约模特、等档期、催修图。这个循环走几轮,人的锐气就磨没了。到最后不是不想上新,是上新这件事太累。
当一张随手拍就能出一套图,”这个款值不值得上”就从一个需要下决心的决策,变成了一次成本很低的尝试。
这才是产线真正改变的东西。它不省你一次几千块,它让你敢多做几次尝试。
六、说点实在的
这条流水线不是万能的,我把边界说清楚:
它替代的是拍摄,不是选款。 什么款能卖,它不知道,也不该知道。那是你的活儿——你对市场的判断、你对客户的了解、你压货的胆量。
它需要你给一张图,而且这张图得是真的。 我们见过客户上传的参考图和自己嘴里的描述对不上——他说要红色的,图是黑色的。这种时候我们以图为准,因为客户对自己产品的记忆,经常不如他自己拍的那张照片准。
它出的图要有人过一眼。 消费者不会做技术检测,但他们的眼睛会。人脑对”这张图是不是真的”的判断,比任何算法都快。
所以真正的分工是这样的:
你负责判断这个款值不值得做,产线负责把它做成能卖的图。
你手里的那张随手拍,就是产线的全部原料。
本文源自 aplus 电商产线的一次真实交付:一张门店随手拍(女款连帽拉链卫衣)→ 白底图、模特图、两张场景图、细节图、八色色卡共六张成品,外加详情页 HTML。文中所有图片均为该次交付的原始输入与真实产出,未经修饰。