DC娱乐网

DeepSeek V4 Pro正式版测评报告刚出来,综合总榜第2。 8月13号才发的旗舰模型,这回在SuperCLUE跟13个国产模型硬碰硬,智能体编程直接从47.37涨到63.16,涨了15.85分,写代码这块算是支棱起来了。幻觉控制也拉到89.73分,推理耗时还优化了。 我看了眼具体数据,百

DeepSeek V4 Pro正式版测评报告刚出来,综合总榜第2。

8月13号才发的旗舰模型,这回在SuperCLUE跟13个国产模型硬碰硬,智能体编程直接从47.37涨到63.16,涨了15.85分,写代码这块算是支棱起来了。幻觉控制也拉到89.73分,推理耗时还优化了。

我看了眼具体数据,百万级长文本解析是原生支持的,官方说推理、编程、智能体任务都到第一梯队了。

不过精确指令遵循这回调了一点点,能看出来团队先把宝押在长链路推理和智能体能力上了。跟Qwen3.8 Max比,幻觉和推理表现好点,但智能体任务规划还差5分上下,指令遵循也得再追。

测试全是纯文本场景,任务规划这块多少有点受限。

办公室一搞开发的同事已经准备试了,说就冲编程涨这15分也得跑一遍。这波更新看着更适合写代码、做复杂任务的,不是那种全维度无死角增强,选型还是得看自己干啥用。