Google正式发布Gemini3.8
Gemini 3.8 来了。谷歌这次倒是很实在,直接自曝底牌:这代变强,主要不是靠换了多聪明的脑子,而是干活更卖力了——碰到复杂任务,多跑几步推理、多调几轮工具,硬把分数磨上去。
◆ 一、勤奋到什么程度?看数字:代码长任务 DeepSWE 干到 73.7%,直接追平 Claude Opus 5 的 74.0%;终端实操 Terminal-Bench 2.1 冲到 89.4%,反超 Opus 5 的 89.1%。勤奋有实锤:解一道 DeepSWE 题,它平均要 166 步、烧 14.3 万 token,Opus 5 只要 99 步、11.8 万——分数追平了,步数翻着倍地堆。速度还快得离谱:实测输出 299 token/秒,同类推理模型的中位数才 70.8,快四倍多。intro 价输入每百万 token 只要 $0.75——又勤奋又便宜,摆明了冲着普及款去。
◆ 二、但勤奋不是万能药一上难度就露馅。金融分析这种熟路活,它 61.4% 能反超 Opus 5 的 58.6%;可到了 OSWorld(让 AI 自己操作电脑干杂活),它只有 59.0%,Opus 5 是 75.4%;更难的 Terminal-Bench 4.0 直接崩到 19.1%,对面 51.8%。说白了:熟能生巧的活儿它能追平旗舰,真到要临场发挥的硬骨头,差距还在那儿摆着。
◆ 三、勤奋是要付钱的谷歌自己都提示了:这代可能比 3.7 Flash 烧更多推理 token。第三方算下来,同样一个任务,成本比上代贵约 40%——多跑的那几步,最后都进账单。好在它给了个旋钮:推理强度分低中高三个档位,要快就快,要准就加钱烧。
◆ 四、说下格局三个月三发 Flash,3.7 到 3.8 只隔三周——谷歌的路线明摆着:不憋大招,靠迭代速度和生态铺量。OpenAI 押会干活的代理,Fable 押推理极致,谷歌押又快又省的勤奋款,三条道各走各的。旗舰拼天赋,走量拼勤奋。烧 token 换来的强也是强,就是记得看账单。
Google正式发布Gemini3.8AI大模型热点科普

