DeepSeek V4性价比登顶
DeepSeek V4 Flash 0731仅比GPT-5.6 Luna(max,51分)低1分。即使OpenAI今日降价80%,其在DeepSeek官方API的单任务成本仍比智力相当的GPT-5.6 Luna(max)低约60%,因DeepSeek官方API缓存命中折扣达98%,远超行业常见的90%。
新模型较上代DeepSeek V4 Flash(40分)大幅提升,仅差GLM-5.2(max,51分)1分,落后开放权重前沿Kimi K3(max,57分)7分,与Gemini 3.6 Flash(50分)持平,比Muse Spark 1.1(xhigh,51分)低1分。DeepSeek预计数周内发布完整权重。
上下文窗口仍为100万token,规模不变:总参数2840亿,激活130亿。
主要结果:
➤ 智能体能力提升:GDPval-AA v2 Elo升至1559(原1189),发布后将居开放权重第二(次于Kimi K3 max 1687,领先GLM-5.2 max 1510)。Terminal-Bench 2.1升17分至79%,τ³-Bench Banking升8分至31%。
➤ token用量降12%:完成测试约用2.06亿输出token(原2.34亿),效率更高。
➤ 各项评测全面提升:CritPt至17%(+9),SciCode至50%(+5),Humanity's Last Exam至37%(+5),AA-LCR至66%(+3),GPQA Diamond至91%(+1)。
➤ AA-Omniscience提升源于幻觉减少而非准确率提高:指数为负16(+7),幻觉率降12点至84%,准确率不变,与GPT-5.6 Terra(max,85%)、Mistral Medium 3.5(82%)相当。
模型详情:
➤ 上下文:100万token(同上代)
➤ 规模:2840亿总参数,激活130亿
➤ 模态:仅文本输入输出
➤ 接入:DeepSeek官方API
➤ 定价:0.14/0.28美元每百万输入/输出token(不变),缓存命中0.0028美元每百万token,折扣达98%
继续滑动查看完整内容。



