DC娱乐网

DeepSeek新模型引争议#大模型[超话]# 8月12日深夜,DeepSeek将V4 Pro预览版切换为正式版上线API,官方成绩单亮眼:Terminal Bench 2.1得87.9分,距Anthropic的Fable 5仅差0.1分;DeepSWE软件工程测试从预览版12.8分飙至62.7分。但社区实测却反响平平:多名开发者反馈表现不及预期,甚至常被自家更便宜 ​

DeepSeek新模型引争议大模型 8月12日深夜,DeepSeek将V4 Pro预览版切换为正式版上线API,官方成绩单亮眼:Terminal Bench 2.1得87.9分,距Anthropic的Fable 5仅差0.1分;DeepSWE软件工程测试从预览版12.8分飙至62.7分。但社区实测却反响平平:多名开发者反馈表现不及预期,甚至常被自家更便宜的V4 Flash"斩杀",独立评测机构智能指数也仅53分。官方跑分是否可信,成了最大争议。