DC娱乐网

DeepSeekV4公测:Agent能力超过了自己旗舰版

7月31日,DeepSeek把V4-FlashAPI推进了公测。Agent评分全面超过了自家旗舰V4-Pro。看几个关键

7月31日,DeepSeek把V4-FlashAPI推进了公测。Agent评分全面超过了自家旗舰V4-Pro。

看几个关键分数。TerminalBench2.1编码Agent任务:82.7。DeepSWE软件工程:54.4。Cybergym网络安全:76.7。Toolathlon工具调用:70.3。每一项都是Agent能力。编码、修bug、做安全测试、调API。企业真正要AI干的就这些。

DeepSeek说,这次更新没改模型架构,没加参数,只是重新做了一遍后训练。

参数大战打了两年,所有人都在比谁更大、谁分更高。但企业用户只关心一件事:能不能用,用不用得起。

GPT-5.6很强,贵。就在DeepSeek发公测前一天,OpenAI把GPT-5.6Luna的价格砍了80%。企业客户对AI成本的敏感,已经逼到OpenAI要靠降价来稳市场了。

DeepSeek这次的答案不一样。它选择让一个更小的模型变得更能干。Flash本来就比Pro便宜,现在Agent能力还反超了。企业不用买最贵的Pro,用Flash就能让AI干活。

让AI靠谱地完成一个完整任务全靠,模型本身的能力和在真实环境里不跑偏的能力。第一个是基本功,第二个才是难点。很多模型在标准测试集上分数漂亮,扔进真实环境就拉跨。DeepSeek这次专门测了网络安全实战和全栈开发实战,就是想证明Flash在真实任务里撑得住。

中国AI的竞争策略在变。一年前还在追参数、追benchmark排名,现在DeepSeek、月之暗面、MiniMax这批公司开始把重心放在怎么让AI真正干活上。

价格战还在打,下一轮的战场已经很清楚:谁的模型能像员工一样干活,谁赢。