但同样是 2022 年,DeepMind 的 Chinchilla 已经把这条线掰弯了。它只有 700 亿参数,是 Gopher 的四分之一,却在相近 training compute 下用更多数据训练,最终在几乎所有被测任务上超过 Gopher。MMLU 做到 67.5%,比 Gopher 高出 7 个百分点以上。
两年后变化更夸张。Stanford 2025 AI Index 统计,2022 年 MMLU 超过 60% 的最小模型还是 5400 亿参数的 PaLM;到 2024 年,38 亿参数的 Phi-3-mini 已跨过同一门槛,参数缩了 142 倍。微软自己的技术报告说,Phi-3-mini 训练了 3.3 万亿 tokens,MMLU 约 69%,主要创新集中在高度筛选的数据和 synthetic data,之后还做了 post-training。
但这绝对不能反过来写成“Scaling 已死”。到 2026 年,frontier model 的 training compute 还在高速增长。o1 又证明了另一条路:模型可以靠更多 reinforcement learning 和 test-time compute,在回答时多“想”一会儿来换性能。
所以这几年过期得最明显的,是拿参数量一个数字解释智能。今天再看到“多少 B”,我还是会看,但一定还想问:数据是什么、训练了多久、post-training 做了什么、推理时又愿意花多少 compute?







