网易首页 > 网易号 > 正文 申请入驻

四大AI手搓蒙娜丽莎!8次临摹,最像那版全被自己改没了

0
分享至


新智元报道


AI第一次拿起彩铅画蒙娜丽莎,但发生了一件奇怪的事:

没有任何一个模型的最终作品,赢过它自己中途最好那版:它们总在最好的时候改过了头。

而且,同样是7幅画,成本相差了20倍!


最左为原作,其余四幅依次出自GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash,全部一笔一笔画成。

AI工具平台TryAI搭了一个「绘画竞技场」,只给模型一张纯白画布、一套彩铅工具,然后走开。

GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash四个视觉模型下场,临摹蒙娜丽莎和梵高的星月夜,再加五道开放式文字命题,一共交出28幅画。

这不是文生图。整场实验里没有一张图片是「生成」出来的,每一笔的颜色、粗细、力度都由模型自己决定,一笔一笔叠上去。

7月21日,TryAI把这场实验的全部记录放了出来,同时也强调,这并非官方benchmark,排名不是重点。

他们真正想测的不是模型的画技,而是它作为一个AI智能体,在没人盯着的几分钟里怎么规划、怎么调工具、怎么评估自己干出来的活。

10件工具

没有一件替它做决定

模型手里的工具一共十件。

plan,一张不落笔的草稿纸,专门用来想事情;

view_target,再看一眼原作;

view_canvas,把当前画布渲染出来给自己看:这一步也正是系统给它打分的时刻;

set_color、set_brush、set_pressure,管颜色、笔尖宽度和下笔力度。力度从0到1,压得轻就是淡淡一层;

draw,一次批量落下若干笔;

smudge,像用擦笔一样把一块区域揉开;

erase和clear_canvas,擦掉一块,或者整张推倒重来。

其中view_canvas是整场实验的枢纽,模型不是闭着眼睛画完就交卷,它随时可以睁眼看一次,再决定下一笔往哪落。

最要命的一条规则是:没有填充色块。

想要一片深蓝的夜空,只能一层一层叠上去,跟真彩铅一模一样。

打分用的是SSIM(结构相似性),把画布和原作都缩到256×256再比对,取值0到1,越高越接近。

默认情况下这个分数不会告诉模型,它只能靠自己那双「眼睛」判断画成了什么样。

四个模型的推理强度统一设成high。整套框架以MIT协议开源在GitHub上,换任何一张目标图、任何一句提示词,都能自己再跑一遍。

于是先画哪里、什么时候回头看、要不要推倒重来,全都得它自己拿主意。

任务分两类。

临摹蒙娜丽莎和梵高的星月夜,有客观分数;

另外5个纯文字提示:老渔夫饱经风霜的脸、橙紫色的海上日落、伦勃朗光下的一支红玫瑰、窗台上蜷着睡觉的虎斑猫、壁炉燃着的小木屋内景。

这5幅没有目标图可以对照,SSIM算不出来,好不好看只能靠人眼判断。

TryAI也顺手试过几个开源权重模型,结果是连画都画不出来。好几个直接交回了一张白纸。

每个模型7幅,一共28幅。


「伦勃朗光下的一支红玫瑰」,四模型交卷。TryAI把Sol这幅列为全场最喜欢的作品之一。

20倍差价

买不到更好的画

7幅画跑完,账单差异很大。

GPT-5.6 Sol:总成本7.74美元,平均6.2分钟,29步。

Claude Fable 5:总成本160.58美元,平均12.5分钟,54步。

Grok 4.5:总成本9.21美元,平均4.8分钟,99步。

Gemini 3.6 Flash:总成本12.87美元,平均6.9分钟,73步。

同样7幅画,Fable 5的账单差不多是Sol的20倍!


7幅画的估算token成本。Fable 5为160.58美元,Sol为7.74美元,差约20倍。

这20倍买到的不是画质,而是更多的步子、更长的时间和更频繁的自我检查:Fable 5平均每幅画要停下来看自己15.6次,Sol只看6次。

这里还藏着一件反直觉的事:花钱最多的,不是token用得最多的。

Grok 4.5一口气吞掉3400万token,全场之最,但其中约98%是缓存读取,按远低于常规输入的价格计费,加上它本身单价最低,最后总账只有9.21美元。


总token消耗:Grok 4.5达3400万居首,账单却只有9.21美元,约98%为缓存读取。

真正在Hacker News上被反复提起的,是Sol和Fable那笔账。有人把两边的数字放在一起对比:340万token对1460万,7.74美元对160.58美元。

这个人的结论是:OpenAI在推理这一块悄悄做出了创新,这个优势只会越拉越大。

在TryAI的主观评价里,Sol整体表现最好。

它的星月夜和那支玫瑰是全场最受偏爱的两幅,考虑到这是从一张白纸上一笔一笔描出来的,观感确实惊人。


星月夜原作与四模型作品。Sol这幅被TryAI列为全场最佳之一

除了老渔夫那一幅,它在几乎每张画的细节上都压过其他模型。

TryAI把Fable 5的画质排在第二,但慢得多、贵得多,在能用的几个里是最不划算的选项。

但它也补了一句:Fable在此前的开放任务里赢过GPT-5.6,包括那次音乐视频挑战。换一个题目,结论未必还是这个。

Grok在这个任务上则相当粗糙。工具调得最勤,很少画出能用的东西。TryAI给的评价很直接:暂时还不敢信任它可靠地理解或判断视觉输出。

Gemini比Grok明显强一档。不过它是Flash型号,拿来跟三个旗舰同场,本来就不太公平。

同一盒笔

四种画法

四个模型拿到的是同一套工具,用出来的却是四套完全不同的工作流。

Sol一次都没单独调用过设色、设笔、设压力,全部内联在下笔动作里。所以它的调用记录几乎只有三件事:画、抹、看。

Grok正相反。

1349次工具调用里,65%花在设颜色、设笔宽、设压力上,于是一幅画要走99步。它把绝大部分动作花在了准备上,真正落到纸上的笔触反而被稀释了。

Sol七幅画总共只调用了223次工具,其中52%是真在画。Grok的调用量是它的六倍,落笔数只有三倍。

Fable重度依赖涂抹,光smudge就调了123次,而且不停回头检查。

Gemini则是最痴迷复查的那个。

近三分之一的调用是看画布,平均每幅画自查约23次。它和Sol一样,从没碰过那三个设置类工具。

没有人教它们该怎么用这盒笔。这些「技法」都是自己长出来的。


同一套工具,四份完全不同的调用分布。Sol从未单独调用设置类工具,Grok有65%的调用花在调笔上。

同一份工具说明书,四个模型读出了四种手感。

而且步数最多的不是画得最好的,自查最勤的也不是。工具调用的频次和最终效果之间,看不出明显的正相关。

8次临摹

全部改过了头

每一次view_canvas都会重新打一次分,于是整场作画过程被记成了一条曲线。

8次临摹,4个模型各画两幅,曲线呈现出两个共同特征。

第一,很早就到顶了。

Claude Fable 5为蒙娜丽莎复查了27次,但从第五次之后,分数就基本走平。后面那22次复查,几乎没换来任何进展。

第二,8次临摹,最终作品得分全部低于中途峰值。

GPT-5.6 Sol的蒙娜丽莎,峰值0.352,收尾0.325;它的星月夜落差更大,峰值0.179,交上来的是0.130。

Fable的蒙娜丽莎峰值0.289,最终0.286;星月夜峰值0.176,最终0.153。

最惨烈的是Gemini 3.6 Flash。它是全场最勤快的检查者,平均每幅画要看自己23次,也确实摸到了整批作品的最高分:蒙娜丽莎0.449。

然后它一路改回了0.337:落差0.112,是这批画里跌得最深的一次。


蒙娜丽莎的相似度曲线。Gemini摸到全场最高的0.449,随后一路滑回0.337。

TryAI给出了一句结论:更多的检查,并没有换来更好的收尾。


平均每幅画的自查次数。Gemini约23次为全场最高,跌幅也最大。

这些模型全都在自己画得最好的那一刻,又多画了一笔。

更微妙的地方在于,模型其实是「看得见」的。

每次view_canvas,它都真的在看自己的画,也真的在根据看到的东西下判断。问题不在瞎改,而是它的判断里缺了一个选项:什么都不做。

而且,工具箱里有橡皮,全场2561次调用只用掉3次。Sol用了1次,Fable用了2次,另外两个一次都没碰过。

这些模型的修改只有一个方向,往上叠。所以曲线一旦过了峰值,就再也回不去了。

还要说清楚一点。

这个分数衡量的是结构和像素上的接近程度,不是美感或创造力。Gemini的原始分最高,但人眼看过去,它并不是最像目标的那一张。

AI学会了下笔

下一课是停笔

过去评一个模型,看的是数学分、编程榜、知识问答,全是一问一答的活。

答对就是答对,交卷之后没有第二次机会把它改坏。

现在模型一跑就是几分钟到几小时。能力上限换了一批变量:会不会规划,会不会看自己的结果,以及最容易被忽略的那一项,会不会收手。

这也不是画画独有的毛病。

代码智能体把本来能跑的版本越改越崩,科研智能体在一个已经成立的结论上继续绕,自我改进系统在没有终点的循环里空转,撞的都是同一道题:怎么判断那个结果「已经足够好了」。

人类画家靠的是一种说不清的东西:老师傅会在某一笔之后放下笔,理由往往只有一句「够了」。这句「够了」,恰恰是现在这套评测都没在测的能力。

四个模型都画出过一幅不错的蒙娜丽莎。

只是没有一个知道,那一笔之后该放下笔。

参考资料:

https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok

编辑:元宇

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
北京的隐形土豪真的太多了

北京的隐形土豪真的太多了

微微热评
2026-07-25 18:34:05
她被丁克耽误了半生,51岁高龄拼命生下龙凤胎,现年67岁后悔吗?

她被丁克耽误了半生,51岁高龄拼命生下龙凤胎,现年67岁后悔吗?

大鱼简科
2026-07-27 19:19:16
皇马4200万欧出售22岁中锋!拥30%二次转会分成,今夏卖人已赚1.7亿

皇马4200万欧出售22岁中锋!拥30%二次转会分成,今夏卖人已赚1.7亿

我爱英超
2026-07-30 20:46:31
性质恶劣,曹彦灏国乒省选拔赛输球后打人,连他哥哥曹彦涛都被扒

性质恶劣,曹彦灏国乒省选拔赛输球后打人,连他哥哥曹彦涛都被扒

社会日日鲜
2026-07-30 06:26:22
200克袋装“卤驴肉”仅卖10元,企业用“配方”把猪肉做成驴肉,销售金额过亿,大量消费者举报称吃出“猪肉味”;两实控人被判无期

200克袋装“卤驴肉”仅卖10元,企业用“配方”把猪肉做成驴肉,销售金额过亿,大量消费者举报称吃出“猪肉味”;两实控人被判无期

大风新闻
2026-07-30 17:34:05
上市四天整体表现“超预期” 长鑫科技能否引领A股科技板块重塑信心?

上市四天整体表现“超预期” 长鑫科技能否引领A股科技板块重塑信心?

每日经济新闻
2026-07-30 19:47:38
强援震撼加盟火箭!这下不仅雷霆,掘金也要紧张了

强援震撼加盟火箭!这下不仅雷霆,掘金也要紧张了

林木体育解说
2026-07-30 13:17:09
当机器人仅要2万元,生理需求被满足后,谁还愿意将就着过日子?

当机器人仅要2万元,生理需求被满足后,谁还愿意将就着过日子?

心灵得以滋养
2026-07-19 07:29:40
23岁洪都拉斯选美亚军突然离世!母亲公开悲痛发声 未排除外力侵害

23岁洪都拉斯选美亚军突然离世!母亲公开悲痛发声 未排除外力侵害

乡野小珥
2026-07-30 14:42:55
秦海璐一家3口游都江堰,48岁被宠成小公主,11岁儿子身高逼近165

秦海璐一家3口游都江堰,48岁被宠成小公主,11岁儿子身高逼近165

喜欢历史的阿繁
2026-07-30 16:22:39
不出 5 年,中国贬值最快的不是房子和现金,而是这 3 样东西

不出 5 年,中国贬值最快的不是房子和现金,而是这 3 样东西

细说职场
2026-04-26 21:04:20
震惊!冉莹颖对邹市明资产重组的路径流出:多名娘家人“发家致富”,网友:一鲸落万物生。世界最强扶娘家魔

震惊!冉莹颖对邹市明资产重组的路径流出:多名娘家人“发家致富”,网友:一鲸落万物生。世界最强扶娘家魔

火山詩话
2026-07-21 06:16:42
这名战犯在功德林隐匿26年,获得特赦后无视众人劝阻执意奔赴台湾,直至垂暮之年才对外坦白自身身负的隐秘任务

这名战犯在功德林隐匿26年,获得特赦后无视众人劝阻执意奔赴台湾,直至垂暮之年才对外坦白自身身负的隐秘任务

唠叨说历史
2026-07-23 16:51:28
进化心理学最不愿公开的秘密:雄性从不会为最漂亮的雌性拼命,却会为一只让它“赢了身体输了心”的雌性自废武功,这是雄性忠诚的唯一开关

进化心理学最不愿公开的秘密:雄性从不会为最漂亮的雌性拼命,却会为一只让它“赢了身体输了心”的雌性自废武功,这是雄性忠诚的唯一开关

心理观察局
2026-06-15 07:47:11
蒯曼连败!1-2不敌陈熠,何卓佳轰出11-0,魏桥8-1天津继续领跑!

蒯曼连败!1-2不敌陈熠,何卓佳轰出11-0,魏桥8-1天津继续领跑!

体坛侃侃球
2026-07-31 00:10:03
具俊晔这下栽了!放弃继承又想往回找补,汪小菲一招直接锁死局面

具俊晔这下栽了!放弃继承又想往回找补,汪小菲一招直接锁死局面

枫尘余往逝
2026-07-30 19:11:28
中顾委许多老同志退下来后,仍干预一线工作,薄一波提醒:你们要保持晚节

中顾委许多老同志退下来后,仍干预一线工作,薄一波提醒:你们要保持晚节

帝哥说史
2026-07-30 15:43:49
曼联有望3000万英镑出售拉什福德!英超劲旅成为最热门下家

曼联有望3000万英镑出售拉什福德!英超劲旅成为最热门下家

夜白侃球
2026-07-30 09:32:44
武汉大学口腔医院通报“24岁女孩正颌手术被做反”:当事医生已停诊,已成立专项调查组开展核查,将及时整改,并依法依规追责问责

武汉大学口腔医院通报“24岁女孩正颌手术被做反”:当事医生已停诊,已成立专项调查组开展核查,将及时整改,并依法依规追责问责

蓬勃新闻
2026-07-28 12:43:11
长安新车官宣:7月30日 ,正式预售

长安新车官宣:7月30日 ,正式预售

科技堡垒
2026-07-30 11:44:35
2026-07-31 04:59:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15825文章数 66982关注度
往期回顾 全部

科技要闻

小米澎程N90 Max预售价29.99万

头条要闻

陕西"公公强奸儿媳案"维持原判 女方精神鉴定结果公布

头条要闻

陕西"公公强奸儿媳案"维持原判 女方精神鉴定结果公布

体育要闻

曝皇马将签罗德里!转会费6000万签约4年

娱乐要闻

周星驰用态度打破快餐式宣发

财经要闻

中共中央政治局:提升资本市场韧性和信心

汽车要闻

FREELANDER神行者8下线 8月10日开启预售/海外版同步推进

态度原创

数码
健康
旅游
艺术
公开课

数码要闻

国家广电总局联合工信部召开一体化电视全国推广工作部署会

最近总忘事,我是要中风了吗?

旅游要闻

这场校园里的夏日旅行 让华裔少年在大理读懂中华文化

艺术要闻

她眼里藏着一整片海,看一眼就让人溺死:摄影大师镜头下的"迷离",是这世上最贵的奢侈品

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版