DC娱乐网

01|模型越大,就一定越聪明吗?

2022 年看大模型,参数量几乎就是门面。GPT-3 1750 亿、Gopher 2800 亿、PaLM 5400 亿,Google 当年甚至直接把发布标题写成“Scaling to 540 Billion Parameters for Breakthrough Performance”。模型越大越强,这个直觉当时并不奇怪。

但同样是 2022 年,DeepMind 的 Chinchilla 已经把这条线掰弯了。它只有 700 亿参数,是 Gopher 的四分之一,却在相近 training compute 下用更多数据训练,最终在几乎所有被测任务上超过 Gopher。MMLU 做到 67.5%,比 Gopher 高出 7 个百分点以上。

两年后变化更夸张。Stanford 2025 AI Index 统计,2022 年 MMLU 超过 60% 的最小模型还是 5400 亿参数的 PaLM;到 2024 年,38 亿参数的 Phi-3-mini 已跨过同一门槛,参数缩了 142 倍。微软自己的技术报告说,Phi-3-mini 训练了 3.3 万亿 tokens,MMLU 约 69%,主要创新集中在高度筛选的数据和 synthetic data,之后还做了 post-training。

但这绝对不能反过来写成“Scaling 已死”。到 2026 年,frontier model 的 training compute 还在高速增长。o1 又证明了另一条路:模型可以靠更多 reinforcement learning 和 test-time compute,在回答时多“想”一会儿来换性能。

所以这几年过期得最明显的,是拿参数量一个数字解释智能。今天再看到“多少 B”,我还是会看,但一定还想问:数据是什么、训练了多久、post-training 做了什么、推理时又愿意花多少 compute?

#人工智能 #AI #大模型 #生成式AI #科技趋势
#ScalingLaw #大模型参数 #Chinchilla #Phi3 #AI模型