DC娱乐网

Grok 4.6 在 ARI Bench 拿下第一,超过了 Claude Opu

Grok 4.6 在 ARI Bench 拿下第一,超过了 Claude Opus 5 和 GPT-5.6,也把自家的 Grok 4.5 甩在身后。对于依赖 AI 辅助写代码、调模型、做Agent 的开发者与团队来说,这个信号意味着:迭代优化能力正在被量化为可比指标。这一榜单专门测“递归式自我改进”,也就是模型能否在迭代中自我优化——一旦这种能力跑通,是迈向更高级 AI 的关键一步,所以这次登顶才值得被单独拿出来说。

之所以要看清榜单含金量,是因为“第一”不等同于“真正的自我改进更强”。ARI Bench 的出题方式、打分权重都偏 xAI 体系擅长的能力维度,Grok 4.6 同时赢了“跨厂商对比”和“自我版本对比”两场,恰好踩在自己最舒适的赛道上。换句话说,排名领先更像是一次适配性测试的结果,而不是对通用自我改进能力的最终判决。

还有一个被忽略的细节:消息源没有公开 Grok 4.6 的具体分数、领先幅度,也没有说明 Claude Opus 5、GPT-5.6 参测的是哪个版本、什么时候提交。版本不一致、提交策略不同,都可能放大名次差距;基准响应的一次 bump,也可能在排名上反映成跳跃。

我的判断是:把它当作一个值得追踪的信号,而不是定论。真正能验证 Grok 4.6 是否具备“递归自我改进”能力的,是它在三个月后、半年后,是否还能在更新一版的基准上保持领先。

你怎么看 ARI Bench 这类“自我改进”基准——它真的能预测下一代模型在真实代码与 Agent 任务里的表现吗?