Gemini 3.5 Flash Cyber:用轻量模型扩大漏洞搜索,但只向受信防御方试点

Google DeepMind 发布 Gemini 3.5 Flash Cyber,以多次调用轻量模型扩大代码路径搜索,并披露 Big Sleep、Chrome 扫描和 V8 漏洞发现结果;由于能力具有双重用途,专用模型暂只通过 CodeMender 向政府和受信伙伴有限开放。

浏览 56
Gemini 3.5 Flash Cyber:用轻量模型扩大漏洞搜索,但只向受信防御方试点封面

Google DeepMind 在 7 月 21 日发布 Gemini 3.5 Flash Cyber 官方说明。它不是面向所有人的通用聊天模型,而是在 Gemini 3.5 Flash 基础上针对漏洞发现、验证和修补进行微调的网络安全模型,主要作为 CodeMender 安全 Agent 的专用能力。

这次发布值得关注的地方不只是“又一个安全模型”,而是 Google 把成本、调用次数与漏洞搜索覆盖面放在同一套工程逻辑里:较轻的模型可以被更频繁地调用,让 Agent 探索更多代码路径,再汇总为一次报告。与此同时,Google 也承认这类能力具有明显双重用途,因此把专用模型限制在受信防御方范围内。

轻量模型承担的是搜索宽度

深层漏洞往往不在一条明显路径上。CodeMender 需要扫描大型代码库、尝试不同执行路径并反复验证候选问题;如果每一步都依赖昂贵的大模型,调用成本和等待时间会限制搜索范围。按照 DeepMind 对架构的解释,CodeMender 可以多次调用 3.5 Flash Cyber,让多个子任务并行探索,最后生成一份报告。

这意味着模型价值不能只看单次回答质量。对于代码安全 Agent,更实际的指标还包括:固定预算内能探索多少路径、能否减少重复发现、发现后能否生成可验证的修复,以及整条流水线能否在提交扫描等高频场景持续运行。

官方基准显示提升,但证据仍来自厂商

Google 披露了三组结果。第一组是在 CyberGym 上,把 3.5 Flash Cyber 最多调用五次后汇总为最终报告;文中同时注明,竞争模型数据来自各提供商自行报告。第二组 Big Sleep 内部评估中,官方给出的 pass@1 为 72%,高于主线 3.5 Flash 的 36% 和 3.6 Flash 的 42%。第三组 Chrome 生产提交扫描中,官方报告 3.5 Flash Cyber 为 72%,对比 3.5 Flash 的 55% 和 Opus 4.6 的 54%。这些数字及测试口径均来自 Google DeepMind 发布页,不是独立第三方复测。

在 V8 JavaScript 引擎测试里,Google 称固定调用次数下,专用模型发现了 55 个经确认的独特问题,主线 3.5 Flash 为 47 个,Opus 4.6 为 36 个,其中 10 个问题未被另外两个模型发现。这个结果支持“扩大搜索宽度可能带来更多独特发现”的判断,但公开页面没有给出足以独立复现实验的完整任务集、样本分布和原始运行记录,因此不能据此推导它在所有代码库上都更强。

生产案例强调速度,也放大了双重用途风险

DeepMind 表示,CodeMender 已在 Google 内部的 Chrome、Android、Cloud、Ads 和 YouTube 代码库中使用。官方还举例称,Cloud Vulnerability Research 团队在两小时内发现了公共 API 的远程代码执行漏洞和一个敏感生产服务中的内存破坏问题,并生成了能够绕过 ASLR 与 W^X 的利用代码。这是厂商报告的内部案例,说明能力上限可能很高,但并非公开环境下的独立验证。

同一案例也解释了为何发布边界比性能数字更重要。模型如果能够寻找漏洞、生成可靠利用链,就既能帮助防御者,也可能降低进攻成本。Google 因此计划先通过 CodeMender 的有限试点,只向政府和受信伙伴提供 3.5 Flash Cyber,并逐步扩大;普通客户可通过 Gemini Enterprise Agent Platform 使用基于通用 Gemini 模型的 CodeMender 基础能力,但这不等于专用 Cyber 模型已全面开放。

对安全团队的实际启示

对企业和开源维护者而言,现阶段更适合把这类模型理解为“高频搜索和验证组件”,而不是自动安全结论。落地时仍需要隔离运行环境、最小权限、可审计工具调用、人工确认修复、回归测试和清晰的漏洞披露流程。模型发现数量增加,并不自动代表误报更低、修复质量更高或上线风险更小。

真正需要持续观察的信号包括:有限试点的准入标准、可复现评估材料、独立测试结果、误报与重复发现率、修复合入率,以及专用模型未来是否扩大开放。当前证据可以说明 Google 正在用轻量专用模型扩展防御 Agent 的搜索规模;它还不能证明这一架构已经成为通用、可独立部署的网络安全答案。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

56