怎么看现在的 AI Benchmark 污染严重,不能表现出 AI真实水平?

如图,用户发现在 DeepSWE 基准的 multipass ,GLM-5.3 Flash 和 Claude Fable 5 在 pass@1 时有差距明显(63.4% vs 69.7%),但是到了 pass@3 和 pass@4 时,两者反而几乎重合(都到了 84–85%)。 然后 Fidian 的 CEO 做了新测测试,他们把 Terminal-Bench 2.1改成了私有变体版本 TB-fn,里面任务内容相似,但没有公开过内容,结果发现有些模型在换成未公开任务后,pass@3 分数会大幅下降,排名也会明显变动。 比如在 TB-fn 上GPT-5.6 Sol 和 Claude Opus 5 系列基本稳住,GLM-5.3 从接近顶尖掉了约 7 分,其他一些模型比如 Grok 4.5、Kimi K3、GLM-5.2 也掉了 6–11 分不等。 所以我们是不是改换全新的 Benchmark 或者闭源测试集了?

查看原文
分享到:

相关推荐

中国账户试图悄悄煽动美国反数据中心情绪?

56分钟前

硅谷知名风投a16z成立11亿美元基金 布局芯片、内存与机器人

57分钟前

“模型公司每赚100美元,云厂商拿走近40美元”

57分钟前

机器人真正的分水岭:每单位新增真机数据,能换来多少泛化能力

57分钟前