DC娱乐网

犀利评测!107 个真实任务,AI 搞砸了一半 先说一个反常识的真相:现在的 A

犀利评测!107 个真实任务,AI 搞砸了一半
先说一个反常识的真相:现在的 AI 写代码大杀四方,但让它上个班,直接现原形。

上周阿里国际站开源了一个评测集 RealReplicaBench,不考做题,考干活。107 个任务全部来自真实电商场景,是从 160 万条真实对话里一层层筛出来的。

什么活儿?上架一款定制瑜伽垫,要自己从一堆相机自动编号的照片里挑出能用的图;规划东莞到达拉斯的海运路线,保险、清关、平台费全算明白,找出最便宜那条;处理退货争议,订单记录、物流扫描、客户聊天、现场照片全对上,逐单判定退款还是申诉。

听着就累对吧,但这些本来就该是 AI 干的脏活累活。

结果呢?

百分制 107 个任务,第一名 Claude Opus 5 拿了 60.75 分,是唯一及格的。Qwen 3.8 Max 和 DeepSeek V4 Pro 只有 49.53%——一半的任务直接搞砸。

而且评分极其狠。一道采购题,23 组 42 项检查:选对供应商、标出 3 封钓鱼邮件、草稿地址、会议日期、JSON 格式,错一个就是 0 分,没有过程分。因为真实商业世界就是这样,你差一步,丢的就是一单生意。

你以为只有电商惨?腾讯混元联合清华出的 E-Bench,323 个真实操作任务,成绩最好的 Kimi K3 单次能跑 73.79%,但同一道题连做 3 次、3 次全对的只有 58.82%,11 个模型稳定性全部没过 60%。

的生活任务评测 VibeLifeBench 更惨。租房、健身、差旅、购物,200 个持续数周的任务,全场最好的模型只拿到 32.5%。三十二点五。

再看看 Coding 评测,同样的顶级模型,通过率 70% 起步。看出差距了吗——会解题和会工作,中间隔着一条太平洋。

代码有标准答案,工作没有。你的工作里全是改来改去的需求、同一家供应商换 4 个邮箱发来的报价、散落在 10 封邮件里的"最终版"。琐碎、混乱、没有标准答案,这才是真正的人类世界。

所以下次再看到"AI 要取代所有人",先让它把退货处理明白再说吧。

AI 阿里国际站 AIAgent 大模型 Kimi