DC娱乐网

Code Arena 把 WebDev 这个榜刷新了一遍,Kimi K3 拿到

Code Arena 把 WebDev 这个榜刷新了一遍,Kimi K3 拿到 1674 分排到开源第一,紧随其后的开源模型是 DeepSeek-V4-Pro 的 1607 分,差距 67 分,差不多一次中等难度的提交就能抹平的分数。

真正让人停下来的不是名次,是账单。按 1M 输入加 1M 输出的最简单算账方式,Kimi 一轮要花 18 美元,DeepSeek 1.305 美元,前者是后者的约 13.8 倍;拆开看,输入贵约 6.9 倍,输出贵约 17.2 倍,输出这块的剪刀差尤其刺眼,因为 Web 项目里经常要模型吐回完整代码、补注释、生成测试样例,输出 token 占比天然偏高。

但 67 分到底是能给真实项目省下多少工时,材料里没有给出现成的换算。X 上 @rohanpaul_ai 转发了这个对比,把 67 分和 13.8 倍的价差摆在一起,配上 @arena 官方对 DeepSeek 排在开源第二的提示,等于把球踢回了开发者。AutoEval 的早期分差、在你自己仓库里能不能复现,是这道题还没拆掉的外壳。

只看材料能下的判断只有一个——如果项目体量小、尝试次数少,多花的十几倍很难用更少的 Bug 和返工赚回来;要是每天都在跑几十上百次生成,差距才可能被真实工时填平。你那边的 Web 项目,多花的 API 钱是真换回了更少的返工,还是依旧只在账单上?