最新基准数据显示,DeepSeek 新模型在多个 Agent 测试中表现亮眼:
⚡ DeepSWE:59.3 vs Opus-4.8 58.0,文本 Agent 能力反超
⚡ Agents’ Last Exam:27.3 vs 25.7,多模态 Agent 更强
⚡ ZeroBench:35.0 vs 34.0,零样本表现领先
⚡ Terminal Bench 2.1:83.9 vs 85.0,基本追平
⚡ Toolathlon、Chartography 等测试也仅有微小差距
虽然部分项目仍落后,但整体表现已经逼近顶级闭源模型。
DeepSeek V4 Flash Vision-Exp 这波,正在证明:开源模型也能在多模态 Agent 赛道掰手腕🔥
#DeepSeek #DeepSeekV4 #AI大模型 #多模态 #Agent #howto入门codex #ai #AI工具 #大模型
