DC娱乐网

5/68 的数学答卷:GPT-6 算不算真正的 AGI? 2026 年 9 月

5/68 的数学答卷:GPT-6 算不算真正的 AGI?
2026 年 9 月,OpenAI 扔出了史上最强模型 GPT-6 Astra。 官方把它定位成全球智能最高、对齐效果最优的生成式 AI。 训练基地落在美国德州 Stargate 超算集群,预训练动用超过 10 万张 GPU。 这一回,GPT-5 也首次下场当监工,参与监督训练。 真有官方吹得那么神?得拉出来遛遛。 Epoch AI 联合曼彻斯特大学放出了 FrontierMath Erdős(FME)基准测试论文。 测试集里全是 68 道人类几十年没解开的 Erdős 数学猜想。 GPT-6 Astra 是全场唯一拿到有效答卷的大模型。 它一口气拿下 5 道长期未解猜想。 剩下的 GPT-5.6、Claude Fable 5.1 等四款主流 AI 全部挂零。 这场测试设计得很毒——全是没标准答案的开放题。 模型必须输出 Lean 形式化证明,由内核自动判定对错。 所有参赛者预算 300 美元、限时 72 小时,规则完全对等。 标准测试环节,GPT-6 Astra 解出 2 道题目。 算力预算放开后的追加实验里又啃下 3 道。 其中包括 1931 年 Erdős 18 岁时提出的解离集猜想,他自称那是人生第一个正经问题。 极值图论里赫赫有名的 Erdős-Sós 猜想也被它收入囊中。 这些问题几十年里困住过一代又一代顶尖数学家。 5 道成果里有构造反例推翻旧猜想的活儿。 也有完整证明全新命题的硬骨头,类型相当多样。 但算力账单并不漂亮。 GPT-6 Astra 这 5 道题所有尝试合计消耗超 22 万美元算力。 标准基准测试本身只花了大约 2 万美元。 按 300 美元一次尝试、3% 成功率粗算,解一道开放问题的期望成本接近 1 万美元。 数学界也有冷静的声音。 论文指出,模型有时能想出正确思路,却卡在转写成 Lean 形式证明这一步。 现有基准只考察解题,没衡量提出新问题的能力。 68 道难题里仍有 63 道高悬未解。 即便 OpenAI 高调宣告 AGI 时代到来,距离真正攻克高阶数学还有长路要走。 这场数学大考,本质上仍是 GPT-6 与人类顶尖智力的对话。 5 道猜想被破,是工具进化的一次注脚。 真正值得追问的是:算力堆到 22 万美元时,我们到底在衡量智能,还是在烧钱?