登录

刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃


速读:在DeepSWEv1.1(长周期软件工程任务)测试中,Gemini3.8Flash能够自主完成复杂工程问题的端到端解决,在性能上超过了大多数参数规模更大的前沿模型,同时成本仅为后者的一小部分。 与此同时,Google还推出了面向网络安全领域的专用模型Gemini3.8FlashCyber。
2026年09月03日 06:3

深夜,谷歌正式推出 Gemini 3.8。这是谷歌在短短六周内推出的第三款 Flash 系列模型。

据介绍,Gemini 3.8 Flash 在保持与 Gemini 3.7 Flash 相同速度和成本优势的基础上,进一步提升了推理与代码能力,重点强化软件工程、Agent 任务以及复杂多步骤推理场景。

Gemini 3.8 包含两个版本:

Gemini 3.8 Flash :高智能通用工作模型(workhorse model)。相比 Gemini 3.7 Flash,它在软件工程、Agent 任务以及专业领域中的关键多步推理能力方面实现了显著提升。

该模型采用与 Gemini 3.7 Flash 相同的首发价格:输入 Token:每百万 Token 0.75 美元;输出 Token:每百万 Token 3.75 美元。

与此同时,Google 还推出了面向 网络安全领域的专用模型 Gemini 3.8 Flash Cyber 。

该模型被定位为 Google 目前能力最强的网络安全模型之一,重点提升漏洞发现和自动化补丁修复能力,并将通过 Google 推出的 Fairwind Program 向经过认证的安全防御人员开放。

Google 表示,两个版本虽然面向不同部署环境,但均基于同一套底层模型能力,并通过长期运行的 Agent 循环机制进一步增强模型表现。

谷歌 DeepMind 核心成员姚顺宇表示:对模型而言,这只是迈出了一小步;但对于 RSI(递归自我改进,Recursive Self-Improvement)来说,却是一次巨大的飞跃。

Aigora.ai CEO John Ennis 将 Gemini 3.8 Flash 与 Anthropic 的模型进行了比较,称其具备:Opus 5 级别的代码质量,但成本只需一小部分,而且速度非常快。

Gemini 3.8 Flash:为长周期代码任务和自主 Agent 打造

Gemini 3.8 Flash 相比 Gemini 3.7 Flash 实现了显著提升,在许多任务中,其性能已经接近成本更高的前沿旗舰模型。

在 DeepSWE v1.1(长周期软件工程任务)测试中,Gemini 3.8 Flash 能够自主完成复杂工程问题的端到端解决,在性能上超过了大多数参数规模更大的前沿模型,同时成本仅为后者的一小部分。

此外,Gemini 3.8 Flash 在专业知识领域中也展现出了支撑关键企业级自主任务所需的可靠性。

在需要高级分析和报告能力的定量分析、专业领域任务中,Gemini 3.8 Flash 在 Vals Finance Agent V2 和 Harvey 法律 Agent Benchmark 等测试中均超过了 Gemini 3.7 Flash 以及其他前沿模型。

同时,Gemini 3.8 Flash 在 HLE-Verified 测试中取得了 54.9% 的成绩,展现出其处理跨越 STEM(科学、技术、工程、数学)、人文学科以及专业领域的多步骤复杂推理任务的能力。

这些性能提升源于一个核心设计选择:Gemini 3.8 Flash 会投入更多计算量来完成任务。

在处理复杂任务时,该模型展现出更高的执行深度 —— 它会执行更多推理步骤,并反复调用工具完成任务。有时,为了最大化性能,尤其是在更高推理强度(higher effort levels)设置下,模型可能会消耗更多 Token。

对于计算效率是首要限制因素的应用场景,开发者可以选择较低的推理强度级别,以减少 Token 消耗;或者继续使用 Gemini 3.7 Flash。后者仍将持续获得支持,适用于更强调效率优先的工作负载。

Gemini 3.8 Flash Cyber:专家级网络安全能力

通过 Fairwind Program 向一批可信安全防御人员开放的 Gemini 3.8 Flash Cyber,针对当前日益复杂的网络安全环境提供了关键优势,同时保持 Flash 系列模型的速度和成本优势,使安全团队能够快速迭代。

自主漏洞发现:在用于漏洞发现的行业标准基准测试 CyberGym 中,Gemini 3.8 Flash Cyber 展现出了前沿水平的自主漏洞发现能力。

该模型不仅超过了 Gemini 3.5 Flash Cyber,同时也击败了参数规模明显更大的前沿模型。

为了更贴近现实世界中的安全防御需求 —— 现实场景并不局限于 CyberGym 中的 C/C++ 代码库,谷歌还使用一个更全面的内部基准测试对 Gemini 3.8 Flash Cyber 进行了评估。

在该测试中,模型需要在覆盖 20 种编程语言、包含复杂代码库的环境中,发现各种类型的漏洞。

测试结果显示,Gemini 3.8 Flash Cyber 相比此前模型实现了显著跃升,漏洞发现成功率超过 70%。

自动化补丁修复:在 Gemini 3.8 Flash Cyber 的研发过程中,谷歌重点关注如何赋予安全防御人员专家级能力,使他们能够在与攻击者的对抗中获得优势。

因此,从一开始,团队就投入资源用于漏洞修复能力建设,并优先提升修复能力,而非漏洞利用等攻击性能力。

由 Collinear 运行的 CWE-Bench 是一个用于评估补丁修复能力的高难度外部基准测试。

在该测试中,Gemini 3.8 Flash Cyber 位于性能与成本权衡的 Pareto 前沿:其 Pass@1 成功率达到 47.2%,与领先的前沿模型 47.8% 的成绩接近,但成本显著更低。

真实世界影响:保护 Google 代码安全

Google 已经开始使用 Gemini 3.8 Flash Cyber 来保护公司内部代码安全。例如:

Chrome 安全团队发现,与规模更大的商业模型相比,Gemini 3.8 Flash Cyber 为 Chrome 漏洞生成的正确修复补丁数量提升了 2.6 倍。 

Wiz 发现,在其内部渗透测试基准中,相比其他领先的前沿模型,Gemini 3.8 Flash Cyber 的漏洞发现召回率(recall)提升了 7.5%~9.7%,同时成本降低了 2.3~5.2 倍。 

Google 云漏洞研究团队利用 Gemini 3.8 Flash Cyber,在不到 2 小时内发现了一个关键基础漏洞。而此前,这类漏洞的研究和发现通常需要数月时间。

目前,Gemini 3.8 Flash 已面向开发者、企业和消费者开放。开发者可以通过 Google AI Studio、Android Studio 等平台调用模型,企业用户可通过 Gemini Enterprise 使用相关能力;而 Gemini AI Pro 和 Ultra 用户则可以在 Gemini App、Google 搜索 AI Mode 以及 Google Sheets 中体验该模型。

对于网络安全领域,Google 通过 Fairwind Program 向可信政府机构、关键基础设施运营商和软件维护人员提供 Gemini 3.8 Flash Cyber 的优先访问权限。

主题:Gemini3.8Flash|能力|专业领域|该模型