OpenAI官方社交账号发布GPT-6 Astra新版公告但ARC Prize公布的结果里藏着一个细节:同一套题,同一个模型,换到标准中立测试框架下,得分立刻从99.9%跌到62.7%。
多出来的37个百分点,不是来自模型本身变聪明了,而是来自考试时允许它“带草稿纸”——一套叫Provider Adapter的外围适配技术,让模型在连续答题时能把上一轮没想完的推理结果悄悄保留下来,压缩打包,带到下一轮接着用。
多出来的37分,来自允许它多想一步,且这一步不用说出口。
ARC-AGI-3考的不是知识,是“悟性”要理解为什么62.7%到99.9%的跃升全靠Adapter而非模型本身,得先搞清楚ARC-AGI-3到底在测什么。
这套测试跟普通的大模型考试完全不同。它不考知识储备,不考代码能力,也不考数学推导。你进去以后面对的是一个完全陌生的交互环境——没有说明书,没有人告诉你规则,甚至没人告诉你赢的条件是什么。你得自己动手探索:按一下这个按钮会发生什么?
碰到红色区域是死是活?然后从观察到的结果里倒推规则,建立因果模型,最后制定策略完成任务。
ARC-AGI-3创始人Francois Chollet把这种能力称为“在不确定性下探索、从有限数据中建立因果世界模型的能力”。通俗点说,它测的是“悟性”——面对一个从没见过的东西,你能多快搞懂它。
人类的平均得分是48%。今年3月这个基准刚发布时,当时最强的AI得分是0.51%。到GPT-5.6 Sol时进步到7.8%,Claude Opus 5进步到30.2%。GPT-6 Astra在标准测试框架下直接跳到62.7%,已经远远甩开所有对手。

但62.7%到99.9%中间剩下的37个百分点,不是靠更强的推理能力填上的,而是靠一个跟模型本身没关系的技术改动。
保留推理:把“草稿纸”留在下一轮接着用ARC-AGI-3的测试过程是一个多轮交互的探索链条。每答一道题,模型需要先试探环境、观察反馈、建立假设、推翻错误假设、重新试探——这个过程往往需要几十步操作,每一步的推理结果都依赖前一步的中间结论。
在标准测试框架下,每一次请求都是独立的。模型完成一轮交互、返回答案后,这轮推理过程中产生的所有隐藏状态——那些已经探索过的假设、验证过的候选规则、排除掉的死路——全部被清空。下一轮请求开始时,模型必须从头推导,不能复用任何之前的探索结果。
就像你解一道证明题,每算完一行就有人把你的草稿纸撕了,下一行重新从零开始。
Provider Adapter的保留推理特性,就是允许模型在多次调用之间完整保留隐藏推理状态。它不用每次都从零推导,而是能直接复用上一轮已经探索过的中间结果、已经验证过的因果假设、已经排除掉的错误路径。
ARC-AGI-3的测试环境里,这意味着模型在环境探索阶段建立的“这个世界大概长什么样”的认知,不会因为请求结束就丢失,而是能直接带到下一关接着用。
上下文无损压缩:不让“记忆”在长任务里蒸发ARC-AGI-3里有一类任务,涉及大量候选规则需要同时遍历,且每条规则都附带复杂的约束条件。比如你在一个迷宫里同时有几十条岔路要试,每条岔路还有自己的子规则,走错一步之前的探索记忆就可能被覆盖掉。
普通模型处理超长上下文时,会对之前的对话内容做压缩总结——有些细节在这个过程中会被当作“不重要”而丢弃。对于ARC-AGI-3这种每个边缘约束条件都可能决定成败的场景,丢掉一个细节就意味着前面的探索白费了。
这就像你同时开了几十个网页查资料,浏览器为了省内存偷偷关掉了几个,等你回去找的时候发现关键信息没了。
Provider Adapter的上下文无损压缩,就是在压缩过程中不丢弃任何探索过程中的关键决策信息。它把探索历史做无损编码,需要时再增量解码还原,让模型在大规模候选规则遍历时,不会因为“忘了”某个较早记录的约束条件而走错路。
实测数据显示,这一特性落地后,ARC-AGI-3单题平均操作次数较人类中位数减少51.7%。
两个特性叠加,把基准62.7%下遗留的近40%错题全部覆盖——
不是模型变强了,是考试方式变了有一条反例能直接证明这个跃升跟模型本体没关系。
第三方评测机构Artificial Analysis的独立综合智能指数显示,GPT-6 Astra得分仅61.2,只比上一代GPT-5.6 Sol的60.9高出0.3分——同一个评测维度上,两代模型之间几乎不存在代际能力跃迁。
OpenAI公布GPT系列大模型多任务性能对比数据如果ARC-AGI-3从62.7%到99.9%的跃升是来自模型参数优化、额外训练数据注入或本体微调,那综合智能指数上不可能只涨0.3分。
另一个更直接的反例来自OpenAI自己的数据:上一代GPT-5.6 Sol接入完全相同的Provider Adapter框架后,ARC-AGI-3得分仅为7.8%,远低于99.9%。这证明Adapter本身不能独立实现得分跃升——它需要搭配GPT-6 Astra这个级别的原生推理能力。
但反过来,仅靠GPT-6 Astra的原生能力而不加Adapter,得分也只有62.7%。两者缺一不可,但提供37个百分点增量的那部分,不是模型本身。

还有一个理解框架:ARC-AGI-3创始人Francois Chollet明确表示,这套测试的环境规模比真实人类智能低4-5个数量级,99.9%的高分充其量只是AGI的必要条件,远非充分条件。
ARC Prize Foundation官方也提出,真正公允的高得分应当能在统一中立的Standard Harness下复现,当前基于专属Adapter的99.9%结果不具备跨模型横向对比的公平性。
这套适配技术目前在OpenAI专属框架下运行,脱离这个环境得分就回到62.7%。截至2026年9月5日,还没有第三方机构能脱离OpenAI的定制测试环境独立复现99.9%的完整结果。这个数字到底有多大泛化性,仍然是一个行业争议中的问题。