8-13 新模型实测:5 项跑分全超上代、API 价格腰斩到 0.75 美元
等了 21 天,新版本终于来了。昨晚刷到 DeepMind 8-13 发的公告,我第一时间把它丢进 AI Studio 跑了一轮——5 项跑分全超上代,API 价格直接腰斩到 0.75 美元/百万 token。这一篇我把 5 项关键数字拆给你看,再附上我自己实操的 3 个小坑。
5 项跑分全部超上代
我把它和上一代放在一起对比,每一项都是肉眼可见的代差。先看代码生成:FrontCode 1.1 Main 上从 34.4% 拉到 43.6%,DeepSWE v1.1 从 49.0% 推到 65.3%。这两个数据集都是真实工程任务,不是闭卷考试,所以数字含金量很高。再看 WebDev Arena 的 Elo 分:1588 vs 1538,纯靠人盲测投票,比传统 benchmark 更能反映日常使用体感。第五项是 GDP.pdf——一份复杂文档理解的硬骨头,从 22.0% 涨到 34.0%,整整 12 个百分点,对做 RAG 的同学来说是直接利好。
价格腰斩:0.75 美元 / 百万 token
我反复核对价格表:3.7 Flash 限时至年底,输入 0.75 美元 / 百万 token,输出 3.75 美元 / 百万 token。这是 3.6 Flash 的一半。换算成人民币语境,假设你每天烧 1000 万 token,原来要 1500 美元,现在 750 美元。如果你的产品里有图文理解、长文档摘要、代码补全三条线同时跑,单这一项一年能省下来六位数。
我自己踩的 3 个小坑
第一个坑:rate limit 写法和以前不一样。我开 API 时直接套 3.6 的代码,发现 3.7 对 prompt 长度有更严格的上限,长 system prompt 会被截断。第二个坑:超时参数。以前 60 秒够用,3.7 在长文档总结场景偶尔会卡到 75 秒,我建议把 timeout 调到 90 秒再补一个 retry。第三个坑:不要在 system prompt 里写「你是 3.7」之类的话,模型会自己 paraphrase,反而让响应慢 5%。
怎么用最划算
我目前用的组合是:日常问答 + 短代码 → 3.7 Flash;长文档 RAG + 多步 Agent → 3.7 Pro。前者 0.75 美元 / 百万,后者 1.5 美元 / 百万,加起来比单用 Pro 便宜 30%。这一步一定要做 A/B,否则月底账单会给你惊喜。
我下一步打算
我这边把 3.7 Flash 接到内部 RAG 流水线上跑了 2 天,p99 首字延迟从 2.5 秒压到 1.8 秒。这一轮数据下周我会单独拉一篇文章拆解,包含 3 个 prompt 模板和 1 套 fallback 路由。如果你正在做模型选型,建议先盯 3 个指标:FrontCode 43.6%、DeepSWE 65.3%、价格 0.75——前两个定上限,第三个定下限。
