谷歌正式发布 Gemini 3.8 Flash 与 3.8 Flash Cyber:三周再迭代,性价比与能力双升级
谷歌正式推出 Gemini 3.8 系列模型,包括通用版 Gemini 3.8 Flash 与专为网络安全设计的 Gemini 3.8 Flash Cyber。这是继三周前发布的 3.7 Flash 之后的又一快速迭代,也是过去六周内第三款 Flash 模型,延续了谷歌在 Flash 系列上的高频更新节奏。
官方称 Gemini 3.8 是目前“最强的推理与编码模型”,在保持与 3.7 Flash 相同速度和低成本的同时,实现了显著性能提升。
Gemini 3.8 Flash 被定位为最智能的“工作马”(workhorse)模型,重点强化软件工程、智能体任务以及专业领域的多步推理能力。它在多项基准测试中表现出色,常接近甚至超越更高成本的前沿模型。
在长周期软件工程基准 DeepSWE v1.1 上,3.8 Flash 能自主端到端解决复杂工程问题,表现超过大多数更大的前沿模型,而成本仅为其一小部分。
在金融 Agent(Vals Finance Agent V2)和法律 Agent(Harvey’s Legal Agent Benchmark)等专业领域,它也优于 3.7 Flash 和其他竞品。在需要跨 STEM、人文和专业领域多步推理的 HLE-Verified 上,它取得了 54.9% 的成绩。
在复杂任务中,它会执行更多推理步骤、迭代调用工具,必要时消耗更多 token 来最大化表现(尤其在高 effort 模式下)。开发者可通过调整 thinking level(low / medium / high)在质量、成本和延迟之间灵活权衡;若更看重效率,仍可继续使用完全支持的 3.7 Flash。
模型规格方面,支持约 100 万 token 的上下文窗口,最大输出 6.5 万 token,输入支持文本、图像、视频、音频和 PDF,输出为文本。它具备代码执行、函数调用、计算机使用(预览)、搜索 grounding、结构化输出等能力,并支持可调节的思考强度。
同步发布的 Gemini 3.8 Flash Cyber 专注于网络安全场景,在漏洞检测和自动化补丁方面达到前沿水平,仅通过新推出的 Fairwind Program 向受信任的防御方(政府、关键基础设施运营者、软件维护者等)开放。
在行业标准漏洞发现基准 CyberGym 上,它超越了前代 3.5 Flash Cyber 以及更大的前沿模型。在覆盖 20 种编程语言的内部综合基准中,成功率超过 70%。在补丁能力基准 CWE-Bench 上,pass@1 达到 47.2%,与领先前沿模型接近,但成本显著更低。
价格延续了 3.7 Flash 的优惠:每百万输入 token 0.75 美元、输出 3.75 美元,优惠持续至 2026 年 12 月 31 日,2027 年 1 月 1 日起将调整为 1.50 / 7.50 美元。缓存输入仍享 90% 折扣。