五个模型同做一道密码题,中国三家全解出,英伟达和Meta没答一个字
同一道五位数密码题,同一个测试环境。Kimi K3和阿里千问都把答案推出来了,两个美国模型的答题框里一个字都没有。
七月底到八月中,Kimi K3、千问3.8、DeepSeek V4 Pro陆续放出权重。美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5。五个模型被接进同一个环境跑同一套题。
十项测试,K3拿了六项满分排第一,DeepSeek第二。
密码题是照线索倒推五位密码,考多步推理。中国三家都推对了,两个美国模型交了白卷。查日志才知道原因:它们把推理跑成了马拉松,话说到一半被输出上限掐断。这两家的额度本来也紧,一个16K一个24K。
真正扎心的是加时赛。
每家30美分预算,换一套新题,解不出可以重试,花完为止。英伟达十轮花了不到10美分,密码锁十次全败。Meta重试到第四次才解出,花15美分。DeepSeek一轮五题全对,只花4美分,比Meta便宜四倍。
K3也强,可它一次认真思考就要35美分,反倒超了预算线。
K3证明的是中国模型的天花板已经能跟最前沿闭源模型摆一起比,DeepSeek拉的是另一根线:它在把"一个够用的模型该卖多少钱"这个预期往下按。企业采购AI,最后签字看的就是这根线。
这次走的是OpenRouter通道,价格跟官方标价不完全一致。但答不出来的时候,多快多便宜都没意义。
下一轮真正该盯的不是谁分高,是同一道题谁花的钱少。
AI DeepSeek 英伟达