DC娱乐网

实测GLM 5.3,1/3参数量 + 后训练还能逼平GPT-5.6我也是服了

又有新模型用了,GLM5.3 API上线了,昨天又充值了GLM Coding Plan。5.3的定位很直接,擅长复杂编码
又有新模型用了,GLM5.3 API上线了,昨天又充值了GLM Coding Plan。5.3的定位很直接,擅长复杂编码,长程Agent任务,加上防御性网络安全。
AA榜成绩也出来了,GLM-5.3拿到60分,也是进了前十。60分及以上的模型一共六个,GLM-5.3体量大概750B,是里面最小的。Kimi K3约2.8T,Grok 4.6约1.5T,Eigenigma用IKP(Incompressible Knowledge Probes,不可压缩知识探针)方法预估GPT 5.6 sol和Claude Opus5的参数可能是1.99T和2.1T。

5.3没有选择堆叠参数,和GLM-5.2用的是同一个基础模型。
就做了后训练,分数就这么水灵灵提升上来了,我把技术报告和唐杰老师发的帖子用简单几句话来总结一下,我们平时聊AI变强,默认想到的都是把模型做大,喂更多数据。但是Scaling不应该只关注参数量。GLM5.3这次的提升更像一次控制实验。
Kaplan(优先把模型参数做大)到Chinchilla(同样算力下,模型和数据应该一起涨)说明了参数和数据之间不存在永恒不变的比例;加上大规模推理成本后,最优解又会进一步转向更小训练更充分的模型;MoE(混合专家)让模型参数量分裂为总容量,激活计算和有效深度等多个维度,不同维度的作用并不相同。
Scaling应该是对模型全生命周期的算力进行重新配置。这次智谱选择了后训练,因为剩余的空间最大。

离谱的是,GLM5.3定价还跟上一代一样保持不变,下周还开源,
卷王之王啊。。。
OK,直接先说结论,这次GLM5.3重回我国产模型top1,我称之为额度救星级。
这次改了一下测Coding模型的标准。过去测Coding模型,很多时候看的是第一屏,页面出来了,动画有了,按钮能点,OK结束。拉开差距的是第二轮、第三轮,甚至第十轮的表现,如果我说这个交互动画不对,模型会不会记得原来的设计意图。我说状态管理有bug,它会不会准确定位。
正式开跑Case之前,我先拿GLM-5.3做了点别的。
自从开源了Goodcase .ai,最近case数已经涨到700+了,访问量也上了7天2万。我都是从里面随机抽cases批量测的。但这次随机抽Case之前,我先把最近大家对Goodcase提的一些意见和文档都看了遍,把一个我有点没看懂的问题丢给5.3做了。

说实话,我一开始其实没怎么看得懂,说这个容易变脸是什么意思?
能看出来,5.3对源代码的改动不是那种大刀阔斧的重做,反而关注在比较偏细节层面的整理,一开始我是让模型在收录的时候按照展示尺寸裁剪图片,这样确实会有一部分的信息损失,换了新的资产模式之后可以切换图片来查看同一个提示语跑出来的多个结果,

还能点击放大查看。

那我们开测下一个case,文生3D游戏!
不加规则,不给参考实现,也不提前告诉它页面该长什么样。就给GLM-5.3一句话,看它自己能补到什么程度。素材还是从GoodCase .ai里面找的,
这次挑了一个之前已经用GPT做过的交通模拟效果。
...
write a python code that visualizes how a traffic light works in a one way street with cars entering at random rate.没有UI规范,没有告诉它红绿灯怎么切,也没规定车辆怎么移动。
第一次跑完,整体结构和方向就已经出来了。车随机频率出现,速度有明显变化,遇到红灯会停下来。没出现突然穿车或者整个模拟跑崩的情况。

我跟deepseek v4 pro + deepseek harness标准模式做了一把对比,
质量差不多的情况下,glm5.3的生成速度比ds的12分钟快了两倍左右。

功能有了,但视觉上还偏Demo感,离GoodCase里原本那个效果还有距离。
所以第二轮我基本只补了一句话。
...
Keep the existing traffic simulation logic, but refine the UI and visual quality to make it feel more polished and closer to a finished product.主要交互逻辑没被改坏,整体视觉质感明显又往前走了一步。

这把同样也是用deepseek v4 pro跑了,
可以看到,到了补UI的阶段。GLM-5.3这个UI的精致程度就拉出来差距了,包括它的背景,包括它还给每辆小车追加了大灯,因为是晚上,刹车的时候还会出现尾灯,细节拉满。

除了复杂编码,5.3这次还重点提升了安全能力,甚至还把他们解决过的漏洞都公开出来了。
发布前两周联合安全团队发现了2404个漏洞,其中1088个属于中高危,最早可以追溯到大约40年前,涉及Android、Windows、macOS和常用App等软件生态。

拿了一个我以前真实踩过的坑。
上周折腾Mac测试项目的时候,用了一个叫Ice的菜单栏管理工具。到现在还是噩梦。不知道哪里出了问题,装上之后就把我一些菜单栏图标藏掉了,特别是codex的,还是找不到的那种。。。
这次直接报仇。
把Ice的源代码交给GLM-5.3,让它不要只看表面现象,从代码里面把和菜单栏隐藏、状态恢复相关的逻辑完整查一遍。原本以为这种问题会比较难找,或者没法根除,因为之前真的测到放弃了。。
GLM-5.3真的很快就把问题范围缩了下来。

一路追到了Ice实际隐藏图标的机制,菜单栏状态恢复逻辑,以及对macOS私有API和模拟拖拽事件的依赖。

离谱的是,它还主动去对照了项目自己的文档和GitHub Issues,找到了和我遇到现象高度一致的上游问题,再把外部线索和本地源码对应起来。

最后给出来的是一条完整的问题链。
现象是什么,为什么会发生,哪段代码负责,为什么新版macOS更容易触发,现在怎么恢复,代码层面应该怎么修。
它甚至还顺手做了一轮安全审查,把私有API、Accessibility、屏幕录制权限,以及一个会强制终止其他菜单栏App的高风险行为单独列了出来。同时也明确区分了,哪些是真正的安全风险,哪些只是兼容性或设计缺陷。

同样的提示语丢给我现在用的Grok 4.6找找漏洞,没用gpt 5.6是因为额度完全没有了。。。
同样是找漏洞,Grok 的习惯更多像是去找替代品,以及如何去修复应用给系统带来的问题。
简单来说,它跟 5.3 不一样的是,它没有去研究这个代码怎么改,而是直接给了我一个修复方案,怎么在 macOS 里重新把我的 logo 显示出来,以及给了一个ice作者在 issue 上提到的分支修改。

所以对比下来,5.3的表现效果更好,因为它给出了软件本身的修复方案。Grok反而是倾向于让我改电脑环境配置、把程序删掉换个替代品,而不是去修复。
继续继续,我决定直接把难度往上拉。
这次不再让5.3自由发挥了开始定规则。让它复刻一个我以前4399很沉迷的2D节奏跑酷游戏。直接让它把角色移动,跳跃,音效,特效这些东西全部加进去,看看GLM-5.3面对一个真正需要实时状态不断变化的项目,到底还能不能hold得住。

一共出了三个不同主题的关卡,自己的Canvas渲染器,角色移动和碰撞逻辑。
实际跑起来之后,我觉得它的完成度还是要比我原本预期的还要高不少。
首先是那个手感,居然真的有一点像。角色起跳的时候有对应的跳跃音效,撞击,死亡和一些场景元素也都有反馈。再加上背景,障碍物和前景之间的空间层次,以及镜头跟着角色高速往前推进的感觉,整个游戏跑起来的时候,不会只是几个方块在Canvas上移动。
这个方块跳起来,有点像是有物理引擎的样子的,撞到物体会变形,跳起来也会变形,撞到尖锐的物品上还会爆开。真的跟我童年玩的版本非常非常接近了。挂掉之后可以马上重新开始,不会因为一堆页面切换把节奏打断。镜头跟随也比我想象中稳,角色高速往前跑的时候,基本不会突然被甩到屏幕边缘。
就是有一个难点,我连第一关都过不了,直接差评。
那还是按照惯例,用字节的Seed-Evolving跑一个同款case对比一下效果,
可以很明显看到,这两次做游戏类的时候,GLM-5.3都有注重加强游戏背景,游戏实体的互动性会更多,主要是单个实体的互动。就像这个关卡对应的球体用的是seed做的是发光球体,而不是像5.3用的是弹性球体。

搞完2D,继续搞3D。
还是一个童年小游戏,愤怒的小鸟。
不过大家熟悉的都是2D版本,所以这一次我故意换了个玩法,
让GLM-5.3把它重新做成一个3D游戏。
我也挺好奇,同样是弹弓,鸟,建筑和猪,整个东西放到3D空间里面之后,它到底会怎么理解。
这一轮确实烧得有点久。。。我一晚上直接烧完了20%周额度。

越往后跑越慢,中间一度让我怀疑是不是给它上太大强度了……
但最后结果真正出来的时候,还是挺有意思的。这确实是一个我以前没有见过别的模型做过的3D愤怒的小鸟。

游戏一共做了三个关卡,也补上了自己的音效,弹射,碰撞和关卡流程。实际玩下来,基本玩法都能正常跑,鸟可以拉动,发射,撞到建筑之后也会有对应的物理反馈。
整体完成度其实比我预想中高。
只发现一个比较明显的Bug,射完一只鸟之后,有时候弹弓会直接空掉,下一只鸟没有正确补上来。

同样的case我还在Kimi K3上跑了一遍,
我的预感就是这个3D版愤怒的小鸟说不定还能再火一把,因为它的打击感真的是非常明显,非常好玩。K3和GLM 5.3分别选择了两种不一样的物品消失方式,5.3是鸟击破物体之后,物体会呈粉末状爆破消失,K3是有点延迟物体掉地上后爆开。硬要说有什么区别的话,K3设计的关卡数量没有5.3那么多。

最后一个任务,我做一个音乐工作台,Cadence。
原因其实很简单,一直很喜欢Spotify那种音乐工作台的感觉,但又又又不想为了UI充会员。所以我就想,干脆做一个自己的音乐软件。以后自己的音乐可以直接放进去,界面,交互,操作方式也全部按照我自己喜欢的来。
于是我把自己的需求整理成Prompt,直接丢给了5.3,
Listening,Library,Album,Playlist感觉我没想到的他都注意了,包括不同页面之间的层级和整体视觉质感,第一次生成的时候基本就已经出来了。

它甚至没有简单拿一堆完全一样的Placeholder把页面填满。不同专辑,歌曲,封面和内容之间都有一些变化,第一眼看过去没有那种很明显的AI页面感。
先给自己挖一个坑,说不定之后会开源一个本地AI音乐播放器出来玩玩。
6个case跑完了,
这些效果都是在同一个750B的基座上发生的,也是同分段参数最小的一个。
所以还是由智谱训出来的GLM才对味。
5.3出来之前,我还见过很多用5.2版本继续训练出来的模型,但5.3用后训练Scaling这条路证明了一件事。
我们不需要永远追着做更大的基座。
当环境够真实,奖励够抗打,系统够灵活的时候,
就算参数量只有同分段的1/4,
750B也能往上走很远更远。
这是一种我在做我自己认为对的事的笃定。
有点期待GLM下版本会有什么惊喜了