DC娱乐网

DeepSeek 多模态逆袭,逼近 Opus 4.8

最新基准数据显示,DeepSeek 新模型在多个 Agent 测试中表现亮眼:

⚡ DeepSWE:59.3 vs Opus-4.8 58.0,文本 Agent 能力反超
⚡ Agents’ Last Exam:27.3 vs 25.7,多模态 Agent 更强
⚡ ZeroBench:35.0 vs 34.0,零样本表现领先
⚡ Terminal Bench 2.1:83.9 vs 85.0,基本追平
⚡ Toolathlon、Chartography 等测试也仅有微小差距

虽然部分项目仍落后,但整体表现已经逼近顶级闭源模型。

DeepSeek V4 Flash Vision-Exp 这波,正在证明:开源模型也能在多模态 Agent 赛道掰手腕🔥

#DeepSeek #DeepSeekV4 #AI大模型 #多模态 #Agent #howto入门codex #ai #AI工具 #大模型