
先说话的人——OpenAI总裁Greg Brockman在媒体吹风会上承认:AGI本身仍旧是个“模糊、灰色”的概念。但他同时又给了一个很明确的叙事方向:未来人们回头看,可能会把Astra当成“AGI到来”的节点。“我认为,现在我们已经进入AGI时代,并不是不合理。”他没有把话说死到“已经实现”,只是把边界放得更像“开始”。
然后是研究员Aidan Clark抛出来的那一串细节:Astra在得州Stargate基础设施上预训练,规模超过10万块GPU;训练里大量使用前代模型参与监督;OpenAI还把它称为目前规模最大的一次模型训练。你会发现,这里讲的从来不是“神迹”,而是一套堆出来的工程量。

说到工程量,读起来最容易让人情绪起伏的地方是——他们给了很多测试分数,但又反复提醒你“不要只看分数”。比如编程这一项,DeepSWE v1.1 Agent里Astra 74.1%,比GPT-5.6 Sol的70.8高,但并没有形成碾压式断层。更要命的是,其他机构的分数也都在同一区间,Muse Spark 1.3最高推理能到75.4%,公开排行榜里Gemini Flash、Claude Opus也差不多贴着70多。1.3个百分点到底意味着“领先”,还是“误差和口径”的结果?原文的回答很直接:很难只靠一项测试下结论。
这就有意思了。因为很多人看到“AGI时代”“最对齐”“关键门槛跨过”,脑子会自动跳到同一种画面:强到离谱、不可阻挡、所有东西都应该被统一比较、统一判断。但Astra这篇信息流给你的反而是一种现实感——强归强,比较永远有门槛。

比如ARC-AGI-3,Astra给到98.6%。表面看是夸张的高分,但OpenAI解释得也很“程序员”:他们用的是Responses API Harness,能在多轮任务之间保留推理信息,并通过Compaction管理长上下文。更直白一点:这更像“模型+Agent系统”的综合成绩,而不是你拿到一颗底座模型就能复刻的那种“单点神功”。同样的逻辑也出现在FrontierMath Tier 4里,Astra 97.6%,覆盖43道私有题中的41道——你以为是纯能力展示,结果他们还补了一句:该benchmark由Epoch AI运行,OpenAI提供过资金,也有部分内容独家访问权限。这不是洗白,是把“边界条件”摊在桌面上。
我最在意的是他们把能力提升落到“人会用得到的事”上,而不是只停留在赛博神话。OpenAI展示了Astra操作KiCad、Excel、Blender、Power BI,也展示浏览器表单填写、网站QA这类看起来很日常的任务。更现实的一条,是他们提到Codex在长任务里的变化:以前靠Compaction把前面的内容压成摘要,后续可能丢掉某些关键细节;Astra可以在跨上下文窗口时保存“笔记”,还能重新搜索此前的消息和工具输出,而不是靠一张压缩的摘要硬扛。这个差别很朴素:长任务不是“答不出来”,而是“记不住、接不上”。

桌面任务也给了时间维度。OSWorld V2-Offline里Astra 72.6%,平均完成一项任务所需时间从大概75分钟缩到40分钟。看起来像是性能的提升,但你把它带回真实工作里想一下:当一个系统要用来做重复操作、排查问题、跑流程,省下的不只是分钟,是你要不要在中间打断它、改指令、反复重来。
当然,最容易被忽略的,是他们同一时间把价格和治理边界也摆出来了。API按输入10美元、输出50美元/每100万Token计费。单价比GPT-5.6 Sol促销价高一些,甚至大约是2.5倍;但OpenAI又说“更重要的是完成一项任务的价格”,他们声称在多项评测和合作伙伴测试里,Astra完成任务消耗Token更少。换句话说:别只盯着“贵不贵”,要盯着“能不能少走弯路”。

再往后,就是把情绪按下去的那部分:网络安全。
Astra被OpenAI称为跨过他们Preparedness Framework里的Critical网络安全门槛,成为首个达到这一等级的模型。测试包括针对加固浏览器和操作系统开发漏洞利用程序,甚至在V8漏洞测试中发现两个此前未知漏洞并披露给维护者。听着很刺激,但OpenAI也强调:这些高级网络安全测试对应的是获得Daybreak Blue权限后的Astra,不等同于普通用户默认版本。并且,对API用户一旦触发安全检查,任务会直接停止,不是暂停等批准。

说得直白点:这不是“更危险了就放任”,而是“更强了所以要更管”。可信访问项目之外的用户可能会遇到速度下降、暂停或拦截——OpenAI提前告诉你,发布初期就得接受这种摩擦。这种摩擦在内容生态里反而容易被拿来做夸张话题,但就原文信息看,他们更像是在提前搭路障,而不是在路上点火。
至于对齐能力,他们也给了一个内部数字:Astra擅自超出授权目标范围比例为0%,GPT-5.6 Sol为48.2%。但他们又强调旧模型对比缺少生产环境安全防护,因此不能直接等号。最后甚至还有一句“如果无法确保未来模型仍能被有效监控,将暂停扩大规模”。这句话放在AGI叙事旁边,气质就变了:你可以期待它更聪明,但不能指望它不需要约束。

所以回到“AGI时代”这个钩子。Brockman说欢迎来到AGI时代,是一种态度,也是一次叙事押注。但真正落地的分水岭,反而不在“AGI是不是到了”的玄学问题上,而在这些具体的边界上:任务能不能跨上下文接得住、成本结构是不是能落到可计算、能力提升是不是伴随可监控、以及不同权限版本之间的差异你到底知不知道。
Astra会不会被后人当成AGI节点——现在没人能给最终答案。至少在这份发布信息里,他们更像是在告诉你:强能力已经开始排队上车,下一步看你愿不愿意把规则一起坐稳。
