AI绘图为何总显假?真相在此
前一张图错得离谱,后一张图对得没劲。
这两个毛病,前者实在没法修。
六根手指是它的出厂设定。人体骨骼数量有限,姿势千变万化,照片里又常遮挡,训练时没人标注遮挡细节。它心里没数,你写一百遍“五根手指”也拦不住。
能改的是后者。它画得太准,挑不出错,却不打动人。说不清哪里不对,但直觉告诉你这是AI画的。
为了搞懂这事儿,我让AI生成了几百次,没删过一张翻车的。
结果跟我想的完全相反。
人类作画时,手只有一双,时间有限,情绪也是瞬间的。每次都得权衡,选了这个就得舍那个。
为了留住那瞬间的神态,颜料打翻了。
动作抓住了,构图偏了半截。
颜色画嗨了,光影就顾不上。
这些舍弃留下的痕迹,就是所谓的“味道”。
我手机里最好的一张照片是夜拍。噪点粗大,人脸模糊。本不该好看,却是那晚唯一没错过的瞬间。
AI没有这些烦恼。结构、构图、色彩、细节,它能让各项指标同时达标。于是没有一项突出,样样行样样不行。
它没放弃任何东西,也就没留住任何东西。
搞懂这点,我第一反应很自然:既然太完美,就加点瑕疵。
加噪点,加纹理,提示词里写满“粗糙”“不完美”“手工感”“随手画”。
有效果,但不理想。加得越多,越假。
最典型的是,想要手绘的犹豫感,写了“线条略带犹豫,允许重复探索”。结果每个轮廓外都整整齐齐跟着第二条线,间距均匀。
另一次嫌画面平,写了“允许快速斜排线”。结果给了一张大师级手绘效果图:排线工整,带投影,透视精准。
这两张图都在证明同一件事:画的人技术很好。
而技术很好,恰恰是我最不想要的。
它没真犯错,是在模仿犯错。像个演员演紧张,手抖有节奏,咽口水时机精准,细节都对,就是不真。
吃了这两次亏我才反应过来:我塞进去的全是形容词。
“左下角有墨迹,右上角线歪”,这是让它照做,越准越准。而“粗糙”“不完美”只是我的判断。哪里粗糙,为何没画完,我没说清。
交代不清的地方,它就瞎编。编出来的就是花纹和效果图。
于是我换个方式。不再求它不完美,而是告诉它这处不完美是怎么来的。
第一次就见效。删了形容词,只留一句:
你是个生手,画得不好的那种。
图变了。比例失准,透视错,圆不圆方不方。歪是真的歪,因为现在有理由歪:不会画。
之前那些“粗糙”“随意”,它都站在“我会画”的位置演随意,怎么演都端着。
这是最好的一版。唯一的缺点是不合用:像小学生作业。
我又补了一句:像会画画的人几分钟内快速记下的,形体比例基本准,生手感来自速度而非能力。
松,不是拙。一字之差,画面大不同。
理由有很多:
共同点:说的是画画那个人当时的处境,不是画面该长什么样。
处境定了,不完美自然就长出来了。
后来我发现这有个模板:剧本。
剧本不写“演得自然”。它写人是谁,处境如何,急要什么,只剩几分钟。剩下的表情、语气、动作,演员自己长出来,且每条都对。
好提示词也一样。别描述成品,去交代动手的人和处境。
这些都是跟模型讨价还价。还有条更省事的路:挑种不规整工艺。
比如手撕纸拼贴。纸口毛糙,有纤维,边缘翘,贴歪。不用求,撕纸就这样。
比如孔版印刷,独立杂志常用。
一次一种色。想三色,纸进三趟。每趟可能挪一点点,色块线条对不齐,差一两毫米。
油墨半透明。蓝压黄,出第三色。墨不匀处,漏白。
这些“毛病”就是工艺,不是我编的。
模型未必知道机器怎么转。只是见过标“孔版印刷”的图,把这四字和错位、漏白、叠色记在一起。
我打四个字,借走一串毛病。
有个插曲。第一版写成“泛黄纸,不用艳色”,想的是旧印刷味。查资料发现反了:孔版用未涂布纸,不怕艳色。荧光粉红是招牌色,亮过四色。
我凭印象写“复古”,恰好是另一种风格招牌。
得澄清:具象化提示词不是不好。若知墨在哪、线咋歪,直接写最准。问题是画完,提示词废了。下一张换画面,墨和线得重安。
“赶时间的人”不报废。画电脑、街景、椅子,都赶时间,顾不上的地方不同。
中途试过垫图,塞原图让它照画。那次比改一天词都准。参考图给了构图、比例、纹理,连猜都省。
也准过头。下一张只换主体,构图风格像原图揭下来又贴。
只做这一张,叫准。做一套图,成另一种假:每张像原图换脸。
具体要求告诉它哪该错。给理由,让它自己决定顾不上哪。
这招不止画。要像摆拍照,别写“自然”,写“朋友边走边拍,手举着伞”。不看镜头、构图偏、糊,都顺理成章。
做海报也一样。别写“别太精致”,写“活动明早就开始,今晚必须送去印”。时间地点最大,花边来不及收。
还有个更贵的教训,跟画法无关,跟人有关。
有套涂鸦风格,我调了十四版。每次一个毛病,加一条规则治。
太干净,加线条犹豫。
太机械,加速度不均。
嫌空,加内容。真满了,又补留白。
调十三版,成铅笔素描。又黑又密全是线,跟轻快涂鸦差十万八千里。
最后删掉整段规则,退回几句话的早期版,才对。
每条单独看都对。十四条放一起,像十四人围着画指挥。前喊松,后喊密,第三喊留白。模型谁都不敢得罪,谁也没听懂。
更麻烦的是,调到后面,连哪句有用、哪句带偏都看不清。
调提示词,出问题先删。真要加,一次一条。不然第十四版出问题,不知怪谁。
事拆越细越能做。把一堆具体收进一个理由,才是本事。
老实说,光靠提示词,只能改善,不能根治。
模型自带审美:主体居中,光好看,角落填满。只能往回拉,拉不到零。
给它理由,能拉出一点默认审美,不能让它忘光。
还有最朴素一条:真写实,不如截图或垫图。画价值在不像照片。今天有轮,我修图修十三次,最后删了。
回看这六百多次,管用的改动都在做同一事:给模型停下的理由。
它最大毛病是画得太完美。物体清楚,角落填满,细节收净。像人画的,赢在没画完的地方。
别给完美加瑕疵,要让瑕疵有不完美的理由。
理由可来自人:不会画,或赶时间。可来自物:撕开的纸,跑偏的印刷机。
夜里最后一次,删掉整段规则,留最早几句话,敲回车。
图出时,桌沿歪,色出线,屏幕一小块黄没涂满,露白。
拖进文章。翻车图在文件夹躺,六百多张,没翻。
资料支持判断,但各有边界,分开写。
官方文档,说明产品能力、推荐用法,不能说明模型内部运作。
研究,说明模型在组合和隐含语义的瓶颈,不能替实验下结论。
工艺事实,核对孔版段。
顺便说,讲的是创作“取舍”,不是模型采样的概率分布。两件事凑巧都叫“选”,不是一回事。
配图路还在走,封面、插图、竖版,坑会写这个号里。关注“liustack”,写好推你。有用转给被AI图折磨的朋友。