四年不到,我们讨论 AI 的词已经从 chatbot 换到 reasoning、Agent、computer use、Physical AI、AI for Science。更有意思的是,连判断 AI 的尺子都在换。
Stanford 2023 AI Index 记录的 2022,PaLM 已经做到 5400 亿参数,训练成本估算约 800 万美元。模型确实在变得更大、更贵,产业界也明显压过 academia。所以当时盯着参数,并不蠢。同一份报告其实也已经提醒:traditional benchmarks 正在越来越快地 saturation。今天看起来很明显的反转,当年的迹象往往早就在,只是还没成为主角。
心理学把这种“知道结果以后,觉得自己早就能预测”的感觉叫 hindsight bias。它最危险的地方,是会把一段充满岔路的历史,重新整理成一条很顺的因果线。
所以这个合集不会搜十个当年被打脸的 AI 预测。后面十篇更想问:当时的人到底看见了什么?后来哪个变量变了?有些可能是高估,有些是低估,有些方向没错只是时间尺度错了,还有些突破是真的,只是我们把功劳记错了对象。
从模型、benchmark,到 coding、Agent、工作、电力、机器人、AI for Science。回头看 2022 到 2026,我越来越怀疑,我们反复出错的地方很可能就在这儿。今天最显眼的瓶颈,总被顺手当成明天最重要的瓶颈。






