DC娱乐网

一个半路AI玩家用“小学控制变量法”,拆穿GLM-5.3的“后训练神话”? 副标题:从“堆参数”到“拧旋钮”:大语言模型后训练突破的控制变量评估范式 作者:柳振浩(自封小学数学家 / 野生历史学家 / 半路AI玩家) 首发说明: 本文为公开网络娱乐化解读版本,所有结论基于公开可查的技术报告与榜单数 ​

一个半路AI玩家用“小学控制变量法”,拆穿GLM-5.3的“后训练神话”?

副标题:从“堆参数”到“拧旋钮”:大语言模型后训练突破的控制变量评估范式
作者:柳振浩(自封小学数学家 / 野生历史学家 / 半路AI玩家)
首发说明: 本文为公开网络娱乐化解读版本,所有结论基于公开可查的技术报告与榜单数据,后续正式学术版本将按规范调整表述与参考文献。
作者碎碎念
前两年才开始凑AI的热闹,纯纯半路玩家。前阵子看GLM-5.3发布,官方说和5.2底座一模一样,就多练了一个月强化学习,Artificial Analysis智能指数直接涨了7分。我第一反应是把小学科学课学的“控制变量法”搬出来了——这不就是天赐的实验吗?其他条件全不变,只改一个变量,看结果变不变,这就是最朴素的验证逻辑。
顺便用我当野生历史学家的臭毛病,把这几年的Scaling Law演进串成了工业革命的“工艺改良史”:一开始比谁机器大,后来发现热效率不行,再后来开始抠省油、抠工艺。本文纯属个人瞎琢磨,结论对不对不知道,图一乐就行,要是真有啥价值,那也是我小学数学老师教得好。
摘要
现在大语言模型的参数都卷到万亿级了,光堆参数的军备竞赛眼看要撞墙,业界都开始说模型能力是“多旋钮系统”。但有个问题一直没人说透:怎么证明模型变强不是偷偷换了底座、背了测试集答案,而是真的靠后训练练出来的?
本文试着搞了个土办法——五维交叉验证框架,专门用来抓那些“伪后训练”。咱们拿GLM-5.3当小白鼠:它号称和GLM-5.2共用753B总参数/40B激活参数(注:部分信源披露为743B,以智谱官方最终口径为准)的同款MoE底座,就多练了一个月长程强化学习。咱们逐条验,看看它是真在编程、Agent、漏洞推理上开了窍,还是在ExploitBench这种要完整利用链的硬骨头上露了怯——相当于能找到门在哪,但还没学会怎么把门撬开。顺便提一嘴Qwen3.8-27B,它虽然270亿参数就干翻了不少千亿模型,但按我的标准它不算后训练突破,属于“天生神力”的预训练路线。最后给大伙提个醒:小心厂商玩文字游戏,别被“隐性换底座”给忽悠了。
一、引言:小学数学老师的遗产
2020年Kaplan那帮人搞出Scaling Law,说参数越大模型越强,之后几年的AI发布会跟比武招亲似的,第一个报的就是参数量:GPT-3 1750亿、Gopher 2800亿、MT-NLG 5300亿,谁参数大谁牛。我一个外行看着都眼晕。
直到2022年DeepMind的Chinchilla出来打脸,说你们算力花错了地方,参数和数据得按1:20的比例走,700亿参数的Chinchilla比2800亿的Gopher还强。唐杰后来也吐槽:“万亿参数这一轮,回头看是整个领域一起走了弯路,然后又一起折返。”
这太像工业革命初期了:一开始大家都觉得蒸汽机越大越好,后来才发现是热效率不行,光堆体积没用。现在MoE架构一普及,“参数”这词儿都分裂了:总参数是体重,激活参数是力气,记忆靠体重,推理靠力气。这时候GLM-5.3出来,说底座没换,就练了一个月,分数蹭蹭涨,这不就是典型的“拧旋钮”吗?——现在看来,拧“后训练”这个钮,比换个大发动机划算多了。
二、Scaling Law演进:一部野生历史视角的“技术史”
我当野生历史学家就爱看这种技术迭代的规律,Scaling Law这五年走的路,跟工业革命几个阶段的节奏几乎一模一样:
第一阶段:参数优先(2020-2022)——“大炼钢铁”期
OpenAI的Kaplan团队给出经验公式:算力涨10倍,参数涨约5.4倍,数据只涨约1.9倍。大家只追求规模,不管效率,谁炉子大谁说了算。
第二阶段:Chinchilla纠偏(2022-2023)——“科学管理”期
DeepMind用400多个模型重做实验,结论是参数和数据应该同速增长,每参数配20个Token。大家发现煤烧不透,加再多煤也没用,700亿的Chinchilla反而超过2800亿的Gopher。
第三阶段:推理成本倒逼(2023-2025)——“省油车”普及期
以前只管把模型造出来,现在得管每天几十亿次调用的推理成本。把推理成本算进去之后,最优解转向“小模型+过量训练”:Llama 2 7B约290 tokens/参数,Gemma 2 9B约889 tokens/参数。
第四阶段:多旋钮阶段(2025至今)——“工艺改良”期
参数、数据、架构、后训练都是独立的旋钮,不用同时拧,哪个当前边际收益高就拧哪个。唐杰说现在后训练的剩余空间最大,所以GLM-5.3拧了这个钮。
三、我的“土办法”:后训练突破的五维验证框架
我没受过正统AI训练,搞不出复杂的数学公式,但小学科学课学的控制变量法够用了。判断一次能力提升是不是真的后训练突破,就看这五点:
维度1:控制变量校验(小学数学基本功)
这是最基础的门槛:总参数、激活参数、模型架构、知识截止日期、预训练数据分布,必须和上一代完全一样。要是偷偷改了上下文窗口、位置编码,哪怕参数没变,也算换底座,不算后训练。GLM-5.3目前公开信息看是过关的:753B总参数/40B激活,和GLM-5.2同架构同底座。
维度2:能力特异性验证(防刷榜)
后训练的目标是补短板,不是涨通用知识分。如果MMLU这种常识问答分数涨了,那肯定是预训练偷偷加了新数据,不是后训练的功劳。真正的后训练突破,应该是长程推理、编程、Agent这些特定方向涨分,通用能力基本不变。
维度3:方法论可解释性验证(防瞎蒙)
得说清楚后训练到底练了啥:用了什么奖励模型?长程环境怎么搭的?RL的优化目标是什么?要是只说“我们做了后训练”但说不出具体路径,那大概率是刷榜刷出来的。GLM-5.3公开了路径,过关。
维度4:落地泛化验证(防基准特化)
不能光看公开榜单的分数,得看真实场景能不能用。另外后训练不能大幅增加推理成本,要是靠加一堆适配器涨分,那本质是变相堆参数,不算纯后训练。
维度5:横向对比验证(防自嗨)
得和同级别的开源模型比,也得和闭源前沿比。后训练的价值就是缩小和闭源的差距。
四、案例验证:GLM-5.3是不是真的后训练突破?
咱们拿五维框架逐条验GLM-5.3:
维度1:控制变量校验 ✅
公开信息确认和GLM-5.2同753B/40B基座,架构没改,知识截止日期没变。过关。
维度2:能力特异性验证 ✅
涨分全集中在后训练针对的方向:
· AA智能指数:53→60,与Kimi K3并列开源第一· 编程能力:内部Z.ai Code Bench(智谱内部代码评测基准)整体提升50%· Terminal-Bench 3.0:4.6→28.3· DeepSWE v1.1:46.2→66.9· CyberGym漏洞识别:77.2%→84.5%,超过GPT-5.6 Sol的83.6%
通用知识问答分数基本没变。过关。
维度3:方法论可解释性验证 ✅
官方公开了长程强化学习路径:基于IndexShare处理长上下文、SAO进行长时域任务强化学习、Slime强化学习框架。训练环境从短代码扩展到工程师级别的复杂任务。投入一个月算力换7分涨幅,合理。过关。
维度4:落地泛化验证 ✅
红队测试里挖出269个真实项目的2,436个漏洞,最老的追溯到1981年,还发现了潜伏40年的DNS协议级风险。API定价和5.2完全一致,推理成本没涨。过关。
维度5:横向对比验证 ✅
和Kimi K3并列开源第一,CyberGym超过GPT-5.6 Sol。过关。
五维验证过关,但得说清楚边界:ExploitBench的差距
五维验证过关不代表没短板。在需要完整漏洞利用链的ExploitBench基准上,GLM-5.3拿了54.4%,虽然比GLM-5.2的24.4%翻了一倍多,但离Mythos 5的78.0%、GPT-5.6 Sol的76.5%还差得远。
这就像我前面说的——CyberGym的84.5%说明它能找到门在哪,ExploitBench的54.4%说明它还没完全学会怎么把门撬开。越靠近复杂长链任务,和闭源的差距越大。这也是智谱把开源权重推迟两周发布的原因——核心能力得先做安全加固,不能给坏人留机会。
五、反例排除:Qwen3.8-27B为啥不算后训练突破?
2026年8月阿里开源的Qwen3.8-27B,270亿参数稠密模型,AA智能指数52分,Agent能力超过Claude Opus 4.8,看着很猛。但按我的框架,它不算后训练突破:
1. 它是全新的预训练模型,不是在上一代底座上迭代的2. 架构从MoE改成了稠密,和之前底座完全不一样3. 预训练数据是重新喂的,不属于“预训练不变只做后训练”
它的路线和GLM-5.3完全相反:GLM-5.3是“同底座+后训练提效”,Qwen3.8-27B是“新底座+高密度预训练压缩”。两者转动的不是同一个旋钮,但共同证明了一件事:参数量已经完全没法解释模型能力了——753B的GLM-5.3拿60分,270亿的Qwen3.8-27B拿52分,差8分但参数差了20多倍。
六、暗雷提醒:小心“隐性换底座”的话术陷阱
我得给大伙提个醒,现在厂商的话术坑很多:有的说“底座不变”,但偷偷把上下文窗口从128K扩到1M,或者改了RoPE位置编码的基数——这本质上还是改了模型架构,属于“隐性换底座”,不算纯后训练。
比如如果模型突然能从100万字的文档里精准提取开头的信息,而上一代完全做不到,哪怕参数一模一样,也是位置编码改了,不是后训练练出来的。以后看模型迭代,别光听厂商说“后训练优化”,得问清楚上下文、位置编码、注意力机制有没有动。
七、结论:拧对旋钮比拧到底重要
我把这套逻辑揉成个简单的判断式,小学数学水平就能看懂:
如果模型满足:
· 参数没变、架构没变、预训练数据没加· 编程、Agent、长程推理这些难任务分数涨了· 常识问答这些通用分数没咋变
那涨的分就是纯后训练带来的。
GLM-5.3完美符合这个式子,是目前公开的最靠谱的后训练突破案例。
唐杰说Scaling是一堆旋钮,下一步最该拧的不一定是上一次拧的那个。现在后训练的边际收益最高,所以大家都在拧这个钮,但不代表其他钮没用了——以后可能拧中期训练的钮,可能拧预训练的钮,甚至可能出全新的架构钮。
对我这个半路玩家来说,这事儿挺有意思:以前大家比谁喇叭大,现在大家比谁调音准。Scaling从未终结,它只是变得更复杂了。知道下一步该拧哪一个旋钮,比一味把某一个旋钮拧到底更重要。
免责声明
本文仅为作者个人娱乐化解读,不代表任何官方学术资质或技术指导,所有数据均来自公开技术报告与榜单披露,如有错漏欢迎指正,不接受无理由攻击。后续正式学术版本将按规范补充参考文献、调整表述,本文观点不代表智谱、阿里等任何相关厂商的官方立场。
---
互动钩子:各位大佬要是发现我哪步验证漏了坑,或者有更准确的信源,欢迎评论区拍砖,半路玩家虚心求教~