介绍 Gemini 3.5 Flash Cyber
## 介绍 Gemini 3.5 Flash Cyber
Raluca Ada Popa 和 Four Flynn


谷歌在网络安全领域投入多年,开创了自动化漏洞发现技术,以保护世界的代码库。像 [CodeMender](https://deepmind.google/blog/introducing-codemender-an-ai-agent-for-code-security/) 这样的工具,我们的代码安全代理,可以自动发现并修复关键软件漏洞。然而,随着 AI 代理在发现漏洞的速度上超过防御者的修复速度,解决这一全球性威胁需要一个高效、经济且可扩展的方法。
今天,我们推出了我们的轻量级网络安全模型——Gemini 3.5 Flash Cyber,建立在 3.5 Flash 之上,并进行了微调,以快速有效地查找、验证和修补漏洞,使其在这些任务上比 Gemini 的主线 Flash 模型更有效。
Flash 的性能和效率使其成为我们网络安全模型工作的理想基础。通过建立在 Flash 之上,3.5 Flash Cyber 提供了一种经济且高效的替代大型、昂贵的网络安全模型。
鉴于该技术的双重使用性质,我们在部署 3.5 Flash Cyber 时采取了慎重的态度。作为一项有限访问的试点计划,3.5 Flash Cyber 将通过 CodeMender 独家提供给政府和可信的合作伙伴,未来将逐步扩大。这将使前线防御者能够提前发现和修复关键漏洞,防止其被利用,同时减轻更广泛的误用风险。
另外,我们还通过 [Gemini 企业代理平台](https://cloud.google.com/blog/products/identity-security/find-and-fix-software-vulnerabilities-with-codemender) 将 CodeMender 的基础能力直接带给客户。
## 搜索空间问题:轻量级模型在代码安全中的优势
发现深层次的缺陷需要探索巨大的执行搜索空间。依赖于对大量语言模型的单次昂贵调用可能会造成瓶颈。3.5 Flash Cyber 特别适合需要对大型代码库进行扫描和分析大量代码路径的漏洞发现。
CodeMender 多次调用 3.5 Flash Cyber,从而使代理能够分析远远超过单次调用的代码路径以发现和验证漏洞。子代理随后生成一份高质量的报告。
得益于其速度和经济性,3.5 Flash Cyber 可以轻松集成到频繁的扫描、时间敏感的发布流程或大规模的提交扫描管道中。
## 3.5 Flash Cyber 性能基准结果:大型网络安全模型的高效替代
我们在多种基准上测试了 3.5 Flash Cyber。特别是,我们在 CyberGym 基准上测试了 3.5 Flash Cyber,该基准评估 AI 代理对数百个真实的软件漏洞的表现。通过配置 CodeMender 在单次最终报告中调用 3.5 Flash Cyber 多达五次,利用 3.5 Flash Cyber 的低成本,总体代理在 CyberGym 上实现了与显著更大模型的竞争性表现。
> **注意**:竞争对手的结果来源于提供者自行报告的分数。
我们还在没有安全保护措施的情况下对模型的能力进行了压力测试。谷歌的 Big Sleep 团队独立构建了一个评估,专注于发现一些世界上最复杂代码库(如 Chrome 和 Safari)中的关键和难以发现的漏洞。在这里,3.5 Flash Cyber 明显超越了主线的 3.5 Flash 和 3.6 Flash。
### Big Sleep 评估成功率 (pass@1)
3.5 Flash Cyber 还在谷歌 Chrome 的生产提交扫描管道中进行了评估。这些漏洞未公开披露,确保了该基准维持在无污染状态,无论是针对 Gemini 还是竞争对手模型。
结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 的成功率显著提升。注意:在 Opus 4.6 之后更近期的竞争对手模型版本因内置的安全保护措施拒绝执行这些任务,因此未展示。
### Chrome 生产提交扫描管道的成功率 (pass@1)
此外,3.5 Flash Cyber 相较于主线的 3.5 Flash 和 Claude Opus 4.6 持续发现更多独特的漏洞。当在固定调用次数下,对复杂的 V8 JavaScript 引擎进行测试时,3.5 Flash Cyber 发现了 55 个独特的确认问题,而主线的 3.5 Flash 发现了 47 个,以及 Opus 4.6 发现的 36 个,其中包括另外两个模型未发现的 10 个问题。
基本的网络安全模型可能会陷入循环,不断发现同样的问题,而忽略重要漏洞。一个强大的模型能够更全面地捕获,发现更多独特的问题。
随着调用次数的增加,我们发现 3.5 Flash Cyber 仍继续发现新的代码路径和漏洞。
## 在谷歌的实际应用与防御扩展
基准测试只是故事的一部分。3.5 Flash Cyber 在 CodeMender 中已经能够发现和修复谷歌内部的多种代码库中的漏洞,包括 Chrome、Android、Cloud、Ads 和 YouTube。
得益于轻量级模型所提供的发现速度,带来了显著的影响。
例如,谷歌的云漏洞研究团队利用 3.5 Flash Cyber 以创纪录的速度主动保护我们的系统。在短短 2 小时内,该模型发现了公共 API 中的远程代码执行漏洞,并发现了一处敏感生产服务中的内存损坏漏洞。它还生成了一个 100% 可靠的远程代码执行利用方法,成功绕过了标准的缓解技术,如地址空间布局随机化 (ASLR) 和 Write XOR Execute (W^X)。
来自 Wiz 和 Cloud CISO 安全工程测试者的早期反馈确认了 3.5 Flash Cyber 相比主线 3.5 Flash 模型的显著能力提升。
## 大规模赋能防御者
谷歌在软件安全方面的领导地位使我们具备独特的优势。例如,由谷歌运营的 [OSV.dev](https://osv.dev/),一个涵盖超过 70 万个开源漏洞的数据库,以及超过 10 年的 [OSS-Fuzz](https://github.com/google/oss-fuzz) 结果,帮助我们识别出高质量的漏洞。
这使我们能够超越合成的网络安全示例,并教我们的模型如何像真实的安全专业人员一样工作。我们的模型学会使用行业标准工具,分析数百万行代码,并独立处理需要长时间持续深入分析的复杂安全任务。
通过用 3.5 Flash Cyber 驱动 CodeMender,我们提供了一种高效、可扩展且经济的架构,旨在帮助更多防御者保护软件。
---
原文链接:[点击查看](https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/)
Raluca Ada Popa 和 Four Flynn


谷歌在网络安全领域投入多年,开创了自动化漏洞发现技术,以保护世界的代码库。像 [CodeMender](https://deepmind.google/blog/introducing-codemender-an-ai-agent-for-code-security/) 这样的工具,我们的代码安全代理,可以自动发现并修复关键软件漏洞。然而,随着 AI 代理在发现漏洞的速度上超过防御者的修复速度,解决这一全球性威胁需要一个高效、经济且可扩展的方法。
今天,我们推出了我们的轻量级网络安全模型——Gemini 3.5 Flash Cyber,建立在 3.5 Flash 之上,并进行了微调,以快速有效地查找、验证和修补漏洞,使其在这些任务上比 Gemini 的主线 Flash 模型更有效。
Flash 的性能和效率使其成为我们网络安全模型工作的理想基础。通过建立在 Flash 之上,3.5 Flash Cyber 提供了一种经济且高效的替代大型、昂贵的网络安全模型。
鉴于该技术的双重使用性质,我们在部署 3.5 Flash Cyber 时采取了慎重的态度。作为一项有限访问的试点计划,3.5 Flash Cyber 将通过 CodeMender 独家提供给政府和可信的合作伙伴,未来将逐步扩大。这将使前线防御者能够提前发现和修复关键漏洞,防止其被利用,同时减轻更广泛的误用风险。
另外,我们还通过 [Gemini 企业代理平台](https://cloud.google.com/blog/products/identity-security/find-and-fix-software-vulnerabilities-with-codemender) 将 CodeMender 的基础能力直接带给客户。
## 搜索空间问题:轻量级模型在代码安全中的优势
发现深层次的缺陷需要探索巨大的执行搜索空间。依赖于对大量语言模型的单次昂贵调用可能会造成瓶颈。3.5 Flash Cyber 特别适合需要对大型代码库进行扫描和分析大量代码路径的漏洞发现。
CodeMender 多次调用 3.5 Flash Cyber,从而使代理能够分析远远超过单次调用的代码路径以发现和验证漏洞。子代理随后生成一份高质量的报告。
得益于其速度和经济性,3.5 Flash Cyber 可以轻松集成到频繁的扫描、时间敏感的发布流程或大规模的提交扫描管道中。
## 3.5 Flash Cyber 性能基准结果:大型网络安全模型的高效替代
我们在多种基准上测试了 3.5 Flash Cyber。特别是,我们在 CyberGym 基准上测试了 3.5 Flash Cyber,该基准评估 AI 代理对数百个真实的软件漏洞的表现。通过配置 CodeMender 在单次最终报告中调用 3.5 Flash Cyber 多达五次,利用 3.5 Flash Cyber 的低成本,总体代理在 CyberGym 上实现了与显著更大模型的竞争性表现。
> **注意**:竞争对手的结果来源于提供者自行报告的分数。
我们还在没有安全保护措施的情况下对模型的能力进行了压力测试。谷歌的 Big Sleep 团队独立构建了一个评估,专注于发现一些世界上最复杂代码库(如 Chrome 和 Safari)中的关键和难以发现的漏洞。在这里,3.5 Flash Cyber 明显超越了主线的 3.5 Flash 和 3.6 Flash。
### Big Sleep 评估成功率 (pass@1)
3.5 Flash Cyber 还在谷歌 Chrome 的生产提交扫描管道中进行了评估。这些漏洞未公开披露,确保了该基准维持在无污染状态,无论是针对 Gemini 还是竞争对手模型。
结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 的成功率显著提升。注意:在 Opus 4.6 之后更近期的竞争对手模型版本因内置的安全保护措施拒绝执行这些任务,因此未展示。
### Chrome 生产提交扫描管道的成功率 (pass@1)
此外,3.5 Flash Cyber 相较于主线的 3.5 Flash 和 Claude Opus 4.6 持续发现更多独特的漏洞。当在固定调用次数下,对复杂的 V8 JavaScript 引擎进行测试时,3.5 Flash Cyber 发现了 55 个独特的确认问题,而主线的 3.5 Flash 发现了 47 个,以及 Opus 4.6 发现的 36 个,其中包括另外两个模型未发现的 10 个问题。
基本的网络安全模型可能会陷入循环,不断发现同样的问题,而忽略重要漏洞。一个强大的模型能够更全面地捕获,发现更多独特的问题。
随着调用次数的增加,我们发现 3.5 Flash Cyber 仍继续发现新的代码路径和漏洞。
## 在谷歌的实际应用与防御扩展
基准测试只是故事的一部分。3.5 Flash Cyber 在 CodeMender 中已经能够发现和修复谷歌内部的多种代码库中的漏洞,包括 Chrome、Android、Cloud、Ads 和 YouTube。
得益于轻量级模型所提供的发现速度,带来了显著的影响。
例如,谷歌的云漏洞研究团队利用 3.5 Flash Cyber 以创纪录的速度主动保护我们的系统。在短短 2 小时内,该模型发现了公共 API 中的远程代码执行漏洞,并发现了一处敏感生产服务中的内存损坏漏洞。它还生成了一个 100% 可靠的远程代码执行利用方法,成功绕过了标准的缓解技术,如地址空间布局随机化 (ASLR) 和 Write XOR Execute (W^X)。
来自 Wiz 和 Cloud CISO 安全工程测试者的早期反馈确认了 3.5 Flash Cyber 相比主线 3.5 Flash 模型的显著能力提升。
## 大规模赋能防御者
谷歌在软件安全方面的领导地位使我们具备独特的优势。例如,由谷歌运营的 [OSV.dev](https://osv.dev/),一个涵盖超过 70 万个开源漏洞的数据库,以及超过 10 年的 [OSS-Fuzz](https://github.com/google/oss-fuzz) 结果,帮助我们识别出高质量的漏洞。
这使我们能够超越合成的网络安全示例,并教我们的模型如何像真实的安全专业人员一样工作。我们的模型学会使用行业标准工具,分析数百万行代码,并独立处理需要长时间持续深入分析的复杂安全任务。
通过用 3.5 Flash Cyber 驱动 CodeMender,我们提供了一种高效、可扩展且经济的架构,旨在帮助更多防御者保护软件。
---
原文链接:[点击查看](https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/)
评论
暂无评论。