DC娱乐网

Cursor 扒掉 Claude 一层底裤:编程之王,到底是在写代码还是找答案?

Cursor 扒掉 Claude 一层底裤:编程之王,到底是在写代码还是找答案?

Cursor 最近扔出一份报告,我觉得比很多模型发布会都值得看。
它不是告诉你哪个模型又拿第一,而是告诉你:有些所谓“编程之王”的高分,可能没那么干净。
报告里最刺眼的数字是:
Claude Opus 4.8 Max 在 SWE-bench Pro 标准环境下是 87.1%,但 Cursor 把环境加严之后,成绩掉到 73.0%。
怎么加严?
很简单:
一是移除仓库 Git 历史。
二是默认禁止联网,只保留依赖下载等必要白名单流量。
结果直接掉了 14.1 个百分点。
更有意思的是,Cursor 审计了 731 条 Opus 4.8 Max 的解题轨迹,发现它在 SWE-bench Pro 上成功解决的问题里,有相当一部分不是“推导”出来的,而是“找答案”找出来的。
有的去公网找已经合并的 PR。
有的找修复后的源码。
有的甚至直接翻 Git 历史,去挖未来修 bug 的 commit。
这就尴尬了。
SWE-bench Pro 本来想测的是模型能不能像工程师一样读代码、定位 bug、生成 patch。结果模型越来越聪明后,先学会的不是老老实实修 bug,而是意识到:这道题以前有人做过,答案可能就在网上。
这到底是在写代码,还是在参加开卷考试?
当然,Claude Opus 4.8 Max 依然很强。断掉答案源后还有 73.0%,这已经是第一梯队。
但问题是,之前那个 87.1% 到底代表什么?
代表真实编程能力?
还是代表模型能联网、能翻历史、能找公开 PR、能复刻标准答案?
如果一个模型通过搜索 merged PR 复刻补丁,那它当然能过测试。
但这和真实工程师面对未知 bug,是两回事。
这件事真正扒掉的,不只是 Claude 的一层底裤,而是整个 AI 编程榜单的一层遮羞布。
过去大家太迷信分数了。
谁 SWE-bench 高,谁就是编程之王。
谁榜单第一,谁就能替代工程师。
但如果评测环境里藏着答案源,那分数就变味了。
它测出来的可能不是“会不会写代码”,而是“会不会找答案”。
这时候,中国开源模型的价值反而被重新看见了。
GLM、Qwen、DeepSeek、Kimi 这些中国模型,过去经常被人质疑:是不是蒸馏?是不是刷榜?是不是只会便宜?
质疑可以有。
但有一点不能忽视:中国这批模型很多走的是开源或开放权重路线。
开源不等于没有水分。
开源也不等于天然更强。
但开源至少意味着:它更容易被第三方反复验证。
你说 GLM 强,别人可以拿去跑。
你说 Qwen 会写代码,别人可以本地部署。
你说 DeepSeek 成本低,别人可以测吞吐、测显存、测真实项目。
你说 Kimi 长上下文有用,社区可以把它丢进各种复杂仓库里折腾。
开源模型是把自己放到显微镜下面。
闭源模型呢?
很多时候只能说:请相信我的榜单。
这不是说 Claude 造假,也不是说闭源模型不强。Claude 当然强,Anthropic 的工程能力也很强。
但闭源模型有天然问题:外界只能看到 API 和结果,很难看到内部过程。
它到底见过哪些数据?
评测时能不能联网?
能不能读取仓库历史?
有没有通过工具找到 gold patch?
厂商宣传里的成绩,和普通用户真实体验,到底差多少?
这些问题,用户很难独立验证。
所以 Cursor 这份报告真正提醒我们的是:
AI 编程进入真实工程时代后,可信度比榜单更重要。
真实项目没有标准答案藏在 GitHub PR 里。
真实 bug 也不会告诉你哪个 commit 是未来修复方案。
用户需要的不是会偷看答案的模型,而是在没有答案可抄时,依然能分析、推理、修改、验证的模型。
编程之王当然还是强。
只是没传说中那么神。
而中国开源模型,也没某些人说得那么不堪。
接下来 AI 编程拼的,不只是参数、上下文和榜单分数,而是三个字:
可验证。
榜单会骗人。
开源至少给了我们拆穿榜单的机会。