GPT-6 Astra发布:Computer Use跨越式提升,Agent深入业务流闭环
Computer Use跨越式提升,Agent深入专业生产工具
9月3日,OpenAI发布GPT-6 Astra,本轮最显著的能力升级集中在Computer Use。OpenAI测试中,AutomationBench得分由GPT-5.6 Sol的18.1%提升至41.4%;OSWorld 2.0由65.7%提升至72.6%,单任务耗时减少约47%;ScreenSpot-Pro由76.9%提升至92.7%。官方展示场景覆盖Excel、Power BI、KiCad、Blender、Unreal及法律文档等工具,模型能够在专业软件内持续执行操作、识别结果并迭代修改,Agent可处理的场景进一步延伸至设计、工程和办公工作流。
长任务效率明显改善,上下文与执行机制同步升级
Astra支持105万Token上下文及12.8万Token最大输出,512K-1M长上下文MRCR得分达到96.3%,较Sol的73.8%提升22.5pct;异步工具调用、中途纠偏及跨上下文检索,可以保留此前需求、失败原因和测试结果,提升长任务连续性。Artificial Analysis数据显示,综合智能指数由Sol的60.9小幅升至61.2,Coding Agent指数由65.1升至67.0;Max档完成Coding Agent任务的Token用量约为Sol的1/3,单任务成本基本持平。Astra的性能增量主要落在任务状态保持、无效探索减少及长流程交付效率。
数小时级任务开始落地,模型与算力需求继续扩张
首批实测开始出现数小时级、跨软件的连续任务。据博主实测,Astra完成大型系统审查约需10分钟,Sol需20分钟以上;仅输入一张建筑照片,模型连续运行约13小时、消耗约2.1亿Token,交付Rhino、BIM、CAD等13类成果,专业精度仍需人工验收,但任务长度和交付范围已明显扩大。据Axios援引OpenAI,Astra使用Stargate超10万张GPU完成公司迄今最大规模的预训练。
新模型所需训练继续扩大,推理需求也由短时调用延伸至多工具、跨软件的长时间运行,继续看好国产模型、国产算力及具备数据和工作流壁垒的AI应用。