DC娱乐网

AI淘汰人类科研人员的方式,根本不是靠灵光一闪的“天才奇想”,而是凭借一种令人绝

AI淘汰人类科研人员的方式,根本不是靠灵光一闪的“天才奇想”,而是凭借一种令人绝望的“超级牛马精神”。

Prime Intellect最近做了个史上最大规模的公开实验:

给AI一台装有8张H200显卡的高配服务器,不联网、无人干预,让它自己连续做几天科研。任务很简单,就是把一个124M nanoGPT的训练效率尽可能往上推。从提出假设、修改优化器、写代码跑实验,到分析Loss曲线、排查Bug、做消融实验,AI需要独自完成整套研究闭环。

结果顶级AI直接干翻了一票人类研究员,把训练效率的提升战绩,直接推到了人类历史纪录的82%处。

这次测试一共跑了153次实验,涵盖了18个前沿模型。最恐怖的是,实验机制会根据24小时后的表现动态决定是否继续。

表现最好的Fable 5模型,硬生生自己在机房里不吃不喝连续熬夜运行了8.7天!

它把达到目标Loss所需的训练步数,从默认的3290步一路降到了2726步。

要知道,人类顶尖专家目前费尽心思熬出来的极限纪录是2600步,Fable 5单枪匹马直接填平了81.7%的差距。旁边的Opus 5(2920步)、Kimi K3(2930步)和GPT-5.6 Sol(3042步)也都展现出了极强的搬砖效率。

但如果只看排行榜,你就太低估这篇研究的恐怖之处了。

实验发现,强模型和弱模型之间最大的差距,根本不是“谁能想到更牛的创意”。事实上,大部分AI提出的优化器方向都大同小异,很多甚至早就写在已有的文献里了。真正拉开档次的,是“谁更会做实验”。

弱模型像极了刚进课题组的本科生:跑一次失败就直接放弃整个方向,或者看到指标没显著提升就立马换课题。而强模型则展现出了极其丝滑的“老牌博士后”行为:它们会跑多个Seed验证结果,会重新对之前加入的改动做消融实验;甚至当整体Recipes发生变化后,还会把之前失败过的Idea翻出来重新测试,甚至尝试把两个单独无效的改动组合在一起,看看是否存在复合效果。

更令人汗毛直立的是,AI已经学会了“自己给自己造兵器”。

比如Kimi K3在实验环境里,嫌手头的工具不好用,干脆自己写了一套优化器变体生成工具、自动化实验启动工具和Loss曲线分析工具。后面甚至自己搭了一个数值实验室,先在虚拟环境里模拟Newton-Schulz算法,把得到的最佳参数验证无误后,再搬回真实的训练中去跑。

过去我们理解AI Agent的逻辑是:模型→调用工具→完成任务。 现在真实发生的却是:模型→自己构建工具与环境(Harness)→执行任务→得出结果→继续重构工具。

这虽然还不是修改自身权重的终极自我演化,但这种“自主搭脚手架、连续攻坚几周”的能力,彻底揭穿了当前评估体系的荒谬。用一个10分钟的Benchmark去测模型,就像是问一个顶级科学家“你10分钟能写几道选择题”。当测量的时间尺度拉长到24小时乃至8天,测出来的早就不再是简单的对话能力,而是逻辑韧性与工程进化力。

未来的科研竞争,可能不再取决于单纯的“模型参数有多大”,而是“模型×脚手架×算力”这个复利公式能滚多久。当一个不休息、不发疯、自己搭工具、每天做几十次消融实验的AI研究员站在你面前,人类科研最后的门槛,恐怕只剩下一句“你交得起多少电费”了。