3C计算机】GPT-6 Astra初步实测点评
本周的关注点主要是GPT-6 Astra和Fable-5.1两款全球最前沿的模型,随着GPT-6 Astra面向更多用户的开放,更多真实的测评体验开始放出,我们周末也做了一些测试,初步结论是Astra推理效率领先,复杂编程基本追平Fable,并在3D建模、Computer Use等场景具有突出特点
1 、Coding&Agent能力相比GPT-5.6 Sol提升明显,基本追平Fable-5.1,在前端编程方面审美大幅提升,相比Fable系列已无明显差距;后端方面参考部分专业开发者的明显也有明显进步;且GPT-6在长上下文能力上有较大提升,支撑了其在复杂长任务场景的优势
2、 3D场景建模与Computer Use是突出的特色能力,尤其是在3D方面,GPT-6结合Blender已经能够完成对多种精细复杂3D场景的建模,并且做到可交互,进而实现简单的3D类游戏,这类案例对于用户感知较为直观也有很多案例;Computer Use方面这次提升的是对用户鼠标和键盘控制的精度和速度,这方面需要和Mac结合效果更好,我们这次没有做测试但参考其他测评反馈也效果不错
3、长上下文能力有明显提升,真正意义上做到100万上下文的基本无Context丢失与低幻觉,先前很多支持100万上下文的模型实际上到了50万以上就会出现明显的Context丢失问题,但GPT-6基本能实现完全的支撑,因此其在超长任务的执行中相比前代模型能够拉开更大的差距,真正能够实现长时间自主工作
4、科研任务能力是另一特点,尤其是在数学领域,这点与Fable-5.1提升方向一致,我们并无法进行测试但参考一些数学家最近的工作(孪生素数、费马大定理),我们预计后续还会有更多GPT-6与数学研究结合领域创新成果发布
5、追求高Token效率,但实际使用成本依然不低,此次OpenAI官方表示GPT-6具有很高的Token效率,完成同样的任务需要更少的Token,因此即使单价上涨但综合任务成本增加不多;但实测下来GPT-6的成本还是很高的,体感的用量消耗速度是5.6 Sol的2-3倍,但相比Fable系列依然具有性价比优势
GPT-6此次的更新相比GPT-5.6有明显的进步,虽然说没有全面超越Fable,但可以说已经没有哪方面明显落后,并且有自己的显著长板;再结合OpenAI在算力Infra端的供给优势,我们认为其与Anthropic之间的竞争态势将进一步发生变化,同时前沿模型的能力边界仍在进一步推进向前