智谱创始人唐杰聊了聊大模型Scaling Law,并认为后训练是当前最具潜力的方向。
这是因为,智谱在只调整后训练这个变量的条件下,能力依然出现了明显提升。
因此唐杰不禁发问:过去行业追逐万亿参数,是不是在走弯路?
2020年,Kaplan等人的研究认为,随着算力增加,参数规模应该比数据规模增长得更快,大约是2.7:1。
这个结论影响了随后几年的大模型路线,GPT-3、Gopher、MT-NLG等模型不断把参数往上堆,万亿参数一度成为行业追逐的目标。
但到了2022年,Hoffmann等人重新研究400多个模型后提出Chinchilla Scaling Law:如果目标是把训练算力用得更划算,参数和训练数据应该大致同步增长,比较典型的比例是每个参数对应约20个Token。
唐杰对此总结道:
“万亿参数这一轮,回头来看,是整个领域一起走了一段弯路,然后又一起折返。”
但Chinchilla也不是最终答案,MoE的普及又让问题复杂了一层。
按照唐杰的理解,总参数量更接近模型能装下多少知识、事实和长尾信息;激活参数以及每次前向计算的有效深度,则更影响模型能把推理链走多远。
这也是为什么他特别提到了漏洞发现。
发现漏洞不能只靠模型记住更多CVE。困难的地方是模型需要连续完成二十步因果推理,并且中间思路不能断。
这类能力,并不能简单通过增加总参数解决。
所以唐杰现在对Scaling的理解,更像是面前摆着很多可以调节的旋钮:参数规模、预训练数据、推理计算量、MoE激活方式、有效深度、中间训练以及后训练。
GLM-5.3这次选择重点拧动后训练,是因为智谱认为这个方向目前还有较大的提升空间,并不意味着其他方向已经到头。
下一次可能调整mid-training,也可能重新回到预训练和基座规模。
大模型的Scaling还在继续,只是行业越来越发现,“模型到底多少参数”这个曾经最受关注的问题,已经很难单独解释模型强不强了。#LLM #大模型

