就在过去这一年,AI 人像生成悄悄跨过了一条线。
两年前,所谓的“AI 写真”,就是一张融掉的脸、假到发亮的皮肤,外加一根来路不明的第六根手指。隔着一间房都认得出来。今天,只要给它 10 到 20 张清晰的手机照片,最好的模型生成出来的人像,大部分人已经挑不出哪一张是生成的。我们知道,是因为过去几个星期我们就在做这件事,还把成品拿给完全不知情的人看,让他们分哪些是真拍的。
这轮测试后来变成了 Gotchaa Lab 的一条新服务线。不过这篇文章重点不在那里,而在我们学到的东西:AI 摄影实际能做到的,和大家以为它能做到的,两边差距都很大。
现在真的做得到的部分
最让我们意外的用途,是传统婚服。
在马来西亚,一对新人办婚礼,通常想要三套造型:西式婚纱配西装、一套马来 songket,华人新人还要一套红褂。三套全租、摄影棚一间间订、档期一个个排,钱和周末都是实实在在的成本。很多新人最后只挑一套,其余的默默放弃。
AI 改变了这个取舍。我们用普通的手机照片,生成了新人穿整套 songket 站在 pelamin 前、穿绣花红褂走在庙里的灯笼下、白纱站在海边悬崖上的画面,全程没有人试穿过任何一件衣服。布料才是难的地方。songket 的织纹和红褂的绣花,正是以前 AI 最爱画烂的那种重复细节。现在的模型出错率已经低到,只要有人认真挑,交出去的那一套站得住。
场景也一样。清晨起雾的稻田、秋天的公园、黄昏的天台。没有人飞去任何地方。人像也是同一回事:LinkedIn 用的干净棚拍头像、街拍风格、主题写真。宠物写真更是天生适合,因为你家那只猫本来就不可能戴着王冠乖乖坐在天鹅绒宝座上。
老实说,还是会失败的部分
接下来这段,大部分 AI 摄影广告都不会讲。
像不像,是概率。 每有一张脸抓得准的,就有好几张会飘。下巴稍微不对、眼距宽了一点、笑容像别人。单看都很细微,但自己的脸自己认得。想自己动手的人之所以失望,绝大多数卡在这里。
手、牙齿和首饰,还是最容易露馅。 比六根手指的年代好多了,但成品还是常常在这几处悄悄垮掉。放大看的重复图案也一样:蕾丝、织纹、砖墙。
双人照难度加倍。 同一个画面里要稳住两张脸,还要处理两人之间的互动。牵手是 AI 最容易出洋相的地方。
它拍不到一个瞬间。 这是最实在的那条界线。AI 可以把你放进 songket、放到 pelamin 前,但它拍不到你外婆在敬茶那一刻的表情,因为那一刻必须真的在镜头前发生。我们生成的任何东西,都取代不了婚礼当天现场的摄影师。哪一间影楼跟你说可以,那是在卖东西给你。
真正的功夫,在丢掉的那一堆
不管是写代码还是生成人像,我们看到的规律都一样:生成很便宜,判断不便宜。
一组人像,我们生成的张数远远多过交付的张数,大部分都丢掉。不是因为模型差,而是因为“扫一眼觉得可以”和“印出来挂在客厅还可以”,是两个不同的标准。总要有人一张张看过每只手、每条发际线、每一段绣花,然后把新娘戒指跑到另一只手指上的那张剔掉。
生成很多、交付很少,这个比例本身就是产品。这也是 AI 到今天还没取代软件团队的同一个原因。打字变便宜了,知道该留下什么,没有。
想自己试的话
这件事你完全可以自己来,当作好玩,也值得试一次。几个我们踩过坑才学到的:
- 喂它多样的照片。 10 到 20 张不同角度、光线和表情的照片,胜过 50 张几乎一样的自拍。模型要学的是你这张脸,不是你那一张照片。
- 别用滤镜。 美颜过的素材,教会模型的是一张不存在的脸。出来的成品像你的 Instagram,不像你。
- 用摄影师的眼光验收。 先看手,再看牙齿,然后看图案。把脸遮住,看身体比例还合不合理。
- 别期待高留存率。 十张里有两张真的好,就算正常。拿到好成品的人不是生成得比较厉害,是挑得比较狠。
如果你想直接看看,交给别人去做那些“丢掉”的工作时,天花板长什么样,我们把样片放上了新的 AI 摄影页面,旁边还有动态广告,两个都收在同一个 AI media 服务下。那里的每一张图,起点都是几张手机照片。
技术是真的成熟了。只是它并不轻松,而所有有意思的工作,就在这两者的差距里。




