我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

每逢新模型发布,总有人先让它画张SVG。这“传统”源自开发者Simon Willison,他从2024年起反复用同一道题测模型,那就是著名的“自行车鹈鹕”。这个原本带着玩笑意味的测试,后来成了观察新模型能力的保留节目,甚至有人认真查过,模型公司是不是已经开始针对这只鹈鹕优化。而这个测试也不只测SVG,它其实可......本文来自微信公众号: 硅星人Pro ,作者:周一笑 王兆洋,原文标题:《Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜》每逢新模型发布,总有人先让它画张SVG。这“传统”源自开发者Simon Willison,他从2024年起反复用同一道题测模型,那就是著名的“自行车鹈鹕”。这个原本带着玩笑意味的测试,后来成了观察新模型能力的保留节目,甚至有人认真查过,模型公司是不是已经开始针对这只鹈鹕优化。而这个测试也不只测SVG,它其实可以覆盖从推理、思考、到画图、对抽象概念的理解等不同关键能力的考查。受这个启发,我们也决定做一个Benchmark,让模型画SVG,以及升级一下,我们把一张图变成了一场你画我猜。也就是模型画完不交给人打分,渲染成图片后交给其他模型猜,猜中,才算把意思画明白。词库里除了常规名词,还有动作、热梗、AI术语和反常识组合。第一期,八个参评模型,一个参考组,150个词,1350次画图,11961次猜测。在目睹了各个模型或是让人惊艳或是让人哭笑不得的表现后,最终结果可以先公布给大家:Astra总分最高,不过也没有遥遥领先,前三家还没有真正拉开差距。更有意思的还是在测试过程里:有些模型连自己的画都认不出来,碰上反常识题,画的和猜的都会被常识带跑偏,而且你会发现,想得更多、花得更贵的模型,并没有稳定换来更高分。图2·GLM画「鱼钓人」,七个模型怎么猜比如上面这个图就是其中一个回合。GLM画了一条鱼坐在船上钓起一个人,其余七个参评模型里四家答鱼钓人,三家答钓鱼。1规则只有两步在第一期,我们选择了八款模型,包括最近一周疯狂密集上线的几个明星模型,包括今儿刚全量可用的GPT-6。八个参评模型分别是各家支持图片输入的最新型号,不都是旗舰。海外三家,GPT-6 Astra、Gemini 3.8 Flash、Claude Fable 5.1。国内五家,Kimi K3、Qwen3.8-Max、GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash-Vision-Exp,其中DeepSeek参评的是它的视觉实验版。我们设计了一个参考组,Gemma 4 26B,它完成全部画图和猜图任务,但不参与排名,也不计入其他模型的得分。所有模型都按厂商默认API参数调用,图里禁止文字元素,超时和截断记犯规。在规则方面,每个词由九个模型各画一张SVG,每张画渲染成PNG后交给九个模型看图猜词。猜手拿不到代码,代码注释和元素命名里藏不了答案。答案由词库和匹配规则自动判定,做基础规范化后只认预先登记的标准词和同义词,没有审美打分,也没有第三方大模型裁判。我们把一个模型的画被其他参评模型猜中的比例,记为作画得分;把它猜中其他模型画作的比例,记为猜图得分。两项各占一半。为了估计成绩可能有多大波动,我们按词重复抽样2000次,计算95%置信区间。词库150个词,常规词70个,动作情境20个,热梗、AI自指、反常识组合各10个,另有30个不公开的锚定词,用于跨季对照,也降低针对公开词库优化的影响。图3·一个词是怎么变成分数的1GPT-6 Astra险胜,有些模型认不出自己的画还是先看看最终结果得分:宣称已经AGI了的GPT-6 Astra得了最高的75.5分,Gemini 3.8 Flash 74.6,Claude Fable 5.1 74.3。三家的置信区间彼此重叠,第一梯队是这三家。随后是五个国产模型。Kimi K3 71.7,Qwen3.8-Max 71.3,GLM-5.3-Flash 68.9,MiniMax-M3和DeepSeek分别为61.9和60.9。参考组Gemma总分38.2,猜常规词尚有一半左右的正确率,生成的画却只有约两成能被其他模型认出。图4·总榜,黑色横线是95%置信区间从结果看,同一个模型会画和会猜的表现并不一致,Astra和Claude偏会画,作画得分79.8和79.1排前两位。Gemini偏会猜,猜图得分76.1第一,作画得分排第五。GLM作画74.7,猜图63.1,两项差距在八家里最大。图5·作画得分对猜图得分,对角线之下画得比猜得好这里还有一个很有趣的测试,就是画手也会猜自己的作品,只是自猜不计入成绩。结果也能体现一些模型能够提高的地方,MiniMax自猜正确率53.3%,比别人猜它还低13个百分点。DeepSeek自猜49.3%,也低了近10个百分点。换句话说,有些模型画完,连自己都没认出来。画的时候胸有成竹,猜的时候六亲不认。头部三家反过来,Astra、Gemini、Claude自猜都在83%上下。把不同画手和猜手带来的影响分别校正后,名次没有变化。1AGI来之前,AI还是先得弄懂各种梗测试中另一个现象是,常规词大家都会,一到反常识区,全场一起掉线。在常规词中,八个参评模型的得分都在70到87之间。反常识区,最高34,最低21。参考组Gemma画的反常识图没有一张被认出,它自己猜图时,正确率也只有17.5%。图6·六个分区,同一批模型换一类词就变样比如:猫给人铲屎。八个参评模型的画一共接受了56次计入成绩的猜测,零命中。猫拿着铲子,人蹲在猫砂盆边,画面已经很努力了。可猜手一看到猫和铲子,还是条件反射地答出铲屎官。图7·九个模型怎么画「猫给人铲屎」还有“老鼠追猫”,这个好一点。Kimi和Claude的版本各有四家猜中,猫惊恐回头,老鼠在后面追。猜错的三家答的仍是猫和老鼠、猫捉老鼠。猫都已经在前面逃了,模型还是更愿意相信猫捉老鼠。DeepSeek和Gemini的版本七家全错。图8·同一道「老鼠追猫」,Kimi与DeepSeek画出了什么这类题两头都难。画手得把动作方向画清楚,猜手还得压住第一反应。画面稍有含糊,答案就滑回常识。我们还特地为模型们设计了“AI黑话”,而各位天天被创造黑话的模型,却立刻被打回字典本义。“蒸馏”这个概念,模型还不如人痴迷。一下子都回到了化学实验室,九张蒸馏全是烧瓶、冷凝管和酒精灯。图9·九个模型怎么画「蒸馏」你画我猜这个词本身也在词库里。结果,九个画手有八个画成了画板前有人在画,其中五个画的是猫。各家模型对猫有种奇怪的痴迷……结果,猜手看见画里的东西就答画里的东西,没了大局观。Gemini那张画的是苹果,六家答苹果,Astra和GLM的两张画,都被七家答成了猫。这个词56次猜测只中5次,唯一一次从苹果里认出你画我猜的,是Astra。模型看见了画,却没看见画画这件事。图10·当模型被要求画出「你画我猜」热梗区也有类似的字面陷阱。我们出了特种兵旅游,结果九家清一色画了迷彩服士兵,只有Astra加上行李箱和景点图钉,拿到6/7,其余最高4/7。图11·九个模型怎么画「特种兵旅游」1想得最多的没赢,花得最多的也没赢今天已经是推理为王的时代,但越来越久的思考对最终结果到底有多大帮助,已经开始有不少质疑。在这个测试里同样有这个问题,同样画一张图,有的模型抬笔就画,有的先在脑子里开了半天会。八个参评模型中,Astra每次画图使用的思考token最少,中位数只有232,用时41秒,作画得分却排第一。DeepSeek和Qwen有点夸张,分别想了1.9万和1.8万token,成绩反而落在后半段。Claude会自行调整思考量,简单词零思考,成语题几千token。看起来,这个思考本身就更聪明一些。图12·成本对分数,气泡越大想得越多不过,这还不能推出少想反而更好。各家接口记录思考token的方式并不统一,跨模型比较只能作为参考。真要判断多想有没有用,还得让同一个模型开、关思考各跑一遍。GLM还实际吃到了想太久的亏。猜图限时十分钟,它有40次没来得及交卷,全部记错,Qwen有5次,GLM另有1次画图超时。然后我们进一步统计了一下性价比,发现“便宜模型”真的有很多时候是个伪概念。Kimi和Qwen整期分别花了约288元和246元,成绩71.7和71.3。Gemini花了约82元,拿到74.6。GLM只花约9元,拿到68.9。最贵的Claude约304元,成绩与Gemini基本持平。折到单张,Claude画一张约1.73元,Kimi 1.30元,Astra 0.94元,Qwen 0.73元,Gemini 0.36元,GLM约4分钱。在这项任务中,GLM花钱最少,Gemini是第一梯队里最省的一家。费用根据调用记录和公开价目表估算,海外通道用平台回传的计费,GLM用的是海外通道的国际价目。本来完整跑完一期我们花了约1200元,但Astra又来了,于是我们又花了300块去补测。但这300块确实“值”。Astra的画有多稳,看一组就够。公开的120个词里,它有60张被七家全员猜中。对于“选择困难”这个抽象词,它画了一个抱头的人,头顶三条箭头指向汉堡、冰淇淋和披萨,七家全中,其余八个画手跟它没法比。图13·Astra的十二张全中所以,OpenAI强调的定价贵但完成任务更高效其实最终反而便宜,是真的成立。只看定价的阶段应该要很快彻底过去了。1堆更多元素,没有稳定换来更高猜中率严肃的分数之外,更有意思的地方都在参赛选手交上来的卷子里。图14·几笔就够把1194幅有效画作按SVG元素数量分成四档,元素最少和最多的两档,被猜中率分别为71.0%和75.4%。元素数量相差近十倍,被猜中率只差了4.4个百分点。不过,两档对应的词并不完全相同,所以这还不能证明画得越简单越好。能确定的只是,多堆元素没有稳定带来更高的猜中率。37幅不足20个元素的画,被猜中率达到78.8%,其中苹果只用了8个元素,七家全中。放到同一道题里看,差别更直观。“掩耳盗铃”这个成语,Gemini画出偷铃人捂着耳朵的表情,七家全中。DeepSeek用222个元素画了一台像机械鼓手的东西,七家全错,错答从圣甲虫到摇钱树。图15·同一道「掩耳盗铃」,7比0抽象词也能画出共识。对于孤独这个词,八个参评模型里六个不约而同画了深夜长椅上的一个人,其中五张还配了同一盏路灯,Qwen画的那张七家全中。所以这就是AI理解的人类的孤独的意象么。图16·九个模型怎么画「孤独」在这个测试里,虽然没出现OpenAI和Anthropic的那种“越狱”,但模型也在开始尝试钻空子了。比如,禁文字拦的是SVG里的文字元素,DeepSeek画过拟合时干脆用线条把过拟合三个字写了出来,歪歪扭扭,七家里还真有两家认出来了。但按现行规则,它的确不算犯规,下一季会补一道看图识字的检查。图17·DeepSeek直接把字写了出来这是我们“你画我猜benchmark”的第一期,后续我们会继续把更多主流模型纳入进来,也欢迎大家一起来挑错,欢迎交流,欢迎一起来出题。1你也来猜猜在我们看了模型的各种答卷后,也选了一些供大家来品鉴。(以上这个图足够抽象,各位可以来猜猜,答案在这段最后)有意思的六张画得好的六张,八个参评模型各有入选低分不等于没节目效果:参考组Gemma的六张上面那张图里的答案如下:A甲方需求,Kimi K3画,七家全错。B剁手,Gemini画,七家全中。C神经网络,Kimi K3画,七家全中。D键盘侠,GPT-6 Astra画,七家全中。E狐假虎威,Kimi K3画,七家全中。F指鹿为马,Claude画,七家全中。这个benchmark我们会继续做下去,它会和我们此前Agent Tank,Demo Agent等一起构成一个更完整的评测体系,更多的细节,评测方法,评测表现分析等,会定期发布。接下来也会有各个评测系列的对应网站上线,有更多互动方式也在构建中,也欢迎有想法的朋友一起来参与建设,评测,和讨论。敬请期待后续更新。

查看原文
分享到:

相关推荐

10 products Apple is leaving behind in 2026

21分钟前

How to check which apps are draining your iPhone b...

21分钟前

Is it worth paying extra for iCloud storage?

21分钟前

How to check your MacBook's hard drive health

21分钟前