DC娱乐网

03|AI拿了数学金牌,怎么还不会看表?

2025 年国际数学奥林匹克竞赛,Gemini Deep Think 做到 35 分,达到金牌线。可 Stanford 2026 AI Index 还放了另一组很魔幻的数据:在读模拟钟表的 ClockBench 上,最好的模型正确率只有约一半,人类接近 90%。

这两件事都是真的。

所以我现在越来越警惕一句话:“某模型 benchmark 已经超过人类。”

Benchmark 当然重要,没有统一考试,模型之间根本没法比较。问题是 AI 跑得太快,考试也在不断过期。MMLU、GSM8K、HumanEval 被逐渐刷满以后,研究者又造出 GPQA、FrontierMath、Humanity's Last Exam。HLE 2025 年刚出来时,最强模型连 10% 都不到;Stanford 到 2026 年统计,frontier model 一年又涨了大约 30 个百分点。

卷子自己也未必干净。Stanford 研究者 2025 年专门检查 benchmark 里的歧义题、错误答案和 grading bug;Arena 还被发现可能受到 private variant testing 和对平台分布适配的影响。

但结论绝对不是“benchmark 没用了”。MMLU 不够难,就有人做 MMLU-Pro;静态考试会过期,就做 private、dynamic、task-specific eval。

真正过期的,是把一个总分直接翻译成“智能”。

数学金牌是真的,不会看钟也是真的。AI 的能力越来越像一条凹凸不平的海岸线。下次看到排行榜第一,我现在只想先问一句:它到底考了什么?