这两件事都是真的。
所以我现在越来越警惕一句话:“某模型 benchmark 已经超过人类。”
Benchmark 当然重要,没有统一考试,模型之间根本没法比较。问题是 AI 跑得太快,考试也在不断过期。MMLU、GSM8K、HumanEval 被逐渐刷满以后,研究者又造出 GPQA、FrontierMath、Humanity's Last Exam。HLE 2025 年刚出来时,最强模型连 10% 都不到;Stanford 到 2026 年统计,frontier model 一年又涨了大约 30 个百分点。
卷子自己也未必干净。Stanford 研究者 2025 年专门检查 benchmark 里的歧义题、错误答案和 grading bug;Arena 还被发现可能受到 private variant testing 和对平台分布适配的影响。
但结论绝对不是“benchmark 没用了”。MMLU 不够难,就有人做 MMLU-Pro;静态考试会过期,就做 private、dynamic、task-specific eval。
真正过期的,是把一个总分直接翻译成“智能”。
数学金牌是真的,不会看钟也是真的。AI 的能力越来越像一条凹凸不平的海岸线。下次看到排行榜第一,我现在只想先问一句:它到底考了什么?









