如图,用户发现在 DeepSWE 基准的 multipass ,GLM-5.3 Flash 和 Claude Fable 5 在 pass@1 时有差距明显(63.4% vs 69.7%),但是到了 pass@3 和 pass@4 时,两者反而几乎重合(都到了 84–85%)。 然后 Fidian 的 CEO 做了新测测试,他们把 Terminal-Bench 2.1改成了私有变体版本 TB-fn,里面任务内容相似,但没有公开过内容,结果发现有些模型在换成未公开任务后,pass@3 分数会大幅下降,排名也会明显变动。 比如在 TB-fn 上GPT-5.6 Sol 和 Claude Opus 5 系列基本稳住,GLM-5.3 从接近顶尖掉了约 7 分,其他一些模型比如 Grok 4.5、Kimi K3、GLM-5.2 也掉了 6–11 分不等。 所以我们是不是改换全新的 Benchmark 或者闭源测试集了?
怎么看现在的 AI Benchmark 污染严重,不能表现出 AI真实水平?
来源:知乎热榜
2026年08月30日 12:01
0 阅读
分享到: