DC娱乐网

就在刚刚,全球正式进入AGI时代!美国当地时间9月3日,OpenAI把新一代模型

就在刚刚,全球正式进入AGI时代!美国当地时间9月3日,OpenAI把新一代模型GPT-6 Astra放了出来,官方给它的定位是"世界上最智能、最对齐的模型"。

说实话,这种自吹自擂的通稿开场白见得多了,本来不觉得有什么特别。

可这次不太一样,公司总裁格雷格·布罗克曼在发布会收尾时撂下一句话——欢迎来到AGI时代。
他还补了一句,这事儿没法一刀切地划出个具体日子,AGI是一步步逼近的,你要说这个模型就是第一个跨过门槛的,好像也说得过去。

这话听着挺唬人,可细一琢磨,里头的分寸感其实拿捏得很微妙,他把最终的判断权,甩给了每一个用的人。

先说这模型是怎么来的,Astra是在得州的Stargate基地训出来的,用了超过十万块GPU,这个规模放在两年前想都不敢想。

发布方式也留了个心眼,不是一股脑全放开,是今天先给一小批机构试用,接下来几天才陆续铺给ChatGPT的Plus、Pro、Business、Enterprise用户,再往后是API和AWS这条线。

老实讲,这种小心翼翼的分批放量,本身就有点意思——真要有十足把握,何必这么谨慎。

它最拿得出手的本事,是能自己操作电脑。

说白了,就是不用你一步步教它点哪儿、填哪儿,它自己就能在浏览器、表格、网页和各种桌面软件里穿梭着把一件多步骤的事儿办完。

业内测这类能力有个专门的考卷,叫OSWorld 2.0,Astra在上头拿了72.6分,比上一代Sol模型的65.7分要高出一截,办同样的事儿还快了47%。

逻辑推理测试ARC-AGI-3上,Astra的得分逼近满分,这几组数字摆在一起看,说它是这几年模型能力里最扎实的一次跃升,我觉着不算夸张。

让人心里咯噔一下的是网络安全这块,Astra是第一个跨过OpenAI"关键"网络安全门槛的模型,在专门测漏洞挖掘的ExploitBench上拿了满分,能在防护严密的系统里找出别人没发现过的漏洞,甚至能把好几个漏洞串成一条完整的攻击链。

这事儿的两面性很直白:防御方能靠它把自家系统的窟窿提前堵上,进攻方要是拿到手里,杀伤力也不是闹着玩的。

OpenAI自己也承认,模型能力越强,它内部的推理过程反而越难被人看懂、看透,这叫"可监控性"在下降。

公司这边的应对是加了好几层网:代码自动审查、行为监控、专门盯着模型有没有"跑偏"的错配监测系统,网络安全相关的能力也先卡着,往后打算通过一个叫Daybreak的计划,一点点开放给做防御研究的人用。

研究团队里有人说得挺实在——模型能自己干的事儿越多,人就越得学会去信任它,这话听着云淡风轻,仔细想想分量不轻。

我个人的判断是,这次跃升是真的,可"AGI"这顶帽子扣得有点急。

为啥这么说?

拿电脑操作和数学推理这两项硬指标看,Astra确实比上一代强出一大截,这是实打实的工程进步,不是营销词藻堆出来的。

布罗克曼自己都说得留有余地,把判断权交给用户,这份克制反倒说明,他心里也清楚这顶帽子还没到能完全扣稳的时候。

英伟达那边有一套叫AVO的架构,配上Anthropic的Claude Opus 5,在同一张ARC-AGI-3考卷上跑出了满分,比Astra还高。

可英伟达自己讲得很清楚,这个成绩是靠一整套带记忆功能的智能体系统跑出来的,不是单靠底层模型自己。

这话一出,行业里吵起来了——大家测来测去,测的到底是这个模型本身,还是加了记忆、加了工具之后的一整套部署方案?

这个疑问站得住脚,它戳中了眼下评测体系一个真实的软肋,跑分越来越像是在比谁的"外挂"搭得好,单纯比拼模型底子反倒说不清楚了。

这个转向背后的逻辑其实挺直白:模型越来越像是能顶一个岗位干活的"数字员工",而不只是个答题机器。

对企业来说,这意味着算总账的方式要改;对普通打工人来说,这事儿真谈不上轻松——能自己操作电脑、能处理多步骤工作流的AI,冲击的恰恰是那些重复性强的白领岗位。

这话我不想说得太满,毕竟这类工具目前还没真正普及成办公室里的日常标配,Anthropic早在2024年就出过操作电脑的测试版,Perplexity今年2月也发过类似的东西,都没掀起太大水花。

Astra这次的分数确实更高,可离人人都用、离真正改写就业格局,中间还有一段路要走。

我倒觉得,与其纠结"AGI"这个标签到底该不该贴,不如多看看这类技术往后会怎么落地、风险怎么防。

中国这边的AI产业这几年也在自己的节奏里往前赶,技术和应用两条腿都没停,往后这场全球竞速里,比的终究是谁能把技术用得稳、用得实。

至于"人类正式进入AGI时代"这句话,我觉着更像是一句漂亮的开场白,热闹是真热闹,可日子还得一天天过,真正的答案,得靠往后一版一版的模型、一次一次的实际应用,慢慢兑现。

这出戏才刚开幕,好戏在后头,咱们不妨接着往下看。