DC娱乐网

04|为什么AI先重做的偏偏是写代码

如果生成式 AI 真会重做知识工作,为什么最早被它深度改造的偏偏是 programming?程序员明明不是门槛最低的职业。

2021 年 Codex 在 HumanEval 上单次通过率还是 28.8%。2023 年 SWE-bench 把模型扔进真实 GitHub repository,让它根据 issue 找文件、改代码、跑测试,当时最好的 Claude 2 只解决了 1.96%。到 2025 年 OpenAI 发布 Codex agent,模型已经能在隔离环境里读文件、跑 terminal、反复执行 test、linter 和 type checker。Anthropic 的使用数据里,coding 也长期是 Claude 最集中的工作场景之一。

我现在觉得,coding 跑得快不只因为模型“会写代码”,而是软件世界已经替 AI 准备好了一套非常奢侈的 feedback loop。函数能执行,bug 能跑 unit test,类型有 type checker,格式有 linter,改坏旧功能还有 regression test。AI 写错以后,不需要等老板、客户或者医生来评价,机器可以马上告诉它哪里不对,它再改一轮。

再加上代码、documentation、issue、pull request 本来就高度数字化,还有 The Stack 这种 TB 级公开代码数据,AI 几乎不用先解决“怎么把这个行业搬进电脑”这一步。

但这离“软件工程被解决”还很远。METR 2025 年让 16 名资深开源开发者在自己熟悉的 repository 里完成真实任务,允许用 AI 的组反而平均慢了 19%。2026 年他们又发现,大约一半 tests 已经通过的 AI PR,maintainer 仍不会直接 merge。绿色测试只能验证一部分,架构、可维护性、需求理解、安全和产品判断没那么容易自动打分。

所以 coding 可能提前暴露了一条更普遍的规律:AI 最容易深入的知识工作,未必是最简单的,而是那些结果最容易被机器快速验证、错误最容易形成反馈闭环的工作。

#人工智能 #AI #大模型 #软件开发 #生成式AI
#AICoding #CodingAgent #软件工程 #SWEbench #程序员与AI