DC娱乐网

最便宜的AI打赢了贵57倍的Claude,同一个模型换个壳就翻盘 8月7日

最便宜的AI打赢了贵57倍的Claude,同一个模型换个壳就翻盘

8月7日,一家叫AOE Tech Labs的公司公布了一组评测数据,结果让不少人愣住了。

他们用市面上最便宜的AI模型DeepSeek V4 Flash,混合成本每百万token 0.175美元,在五项第三方基准测试上,全部打赢了Anthropic最贵的旗舰模型Claude Opus 4.8——后者的价格是每百万token 10美元,贵了57.1倍。

第一反应可能是:便宜模型追上旗舰了?但数据不是这个意思。

同一个DeepSeek模型,跑在DeepSeek官方自己的执行系统上,编程基准DeepSWE只得了54.4分,低于Claude Opus 4.8的58.0,五项测试一项没赢。但把同一个模型接到Floatboat执行系统上,DeepSWE直接跳到67.25分,五项全胜。模型一个字都没改,价格没变,唯一换的是外面那层壳。

更关键的规律是:任务越长,差距越大。短任务差距只有1.9%,中等任务9.6%,长程任务一路涨到23.6%。研究团队算了一笔账:不换模型、只换执行系统带来的性能提升,最高达到"把模型升级成贵57倍的旗舰"所带来提升的3.57倍。换句话说,与其花57倍的价钱买更好的模型,不如把包裹模型的那套执行系统做好。

为什么?因为AI做长任务时会犯两种错:一是人的需求一开始没说清楚,做到一半标准才浮现;二是模型每一轮输出都带点小偏差,二十步之后偏差累积成方向性错误,而且它跑得很自信。执行系统的作用就是在每一步把模型拽回正确方向,发现偏差及时纠正,该回头时回头。一个只会往前跑的AI,跑得越久错得越远。

我的判断是:过去两年整个行业都在比拼模型参数和榜单分数,但这组数据说明真正决定AI能不能干活的,可能不是模型本身,而是模型外面那层"操作系统"。这就像同样一个员工,在管理混乱的团队里啥也干不成,在流程清晰的团队里能超常发挥。

模型是发动机,执行系统是底盘和方向盘。发动机再强,没有底盘也跑不起来。

AI DeepSeek Claude 人工智能

════