数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 47|回复: 0

[科技] 谷歌推出AI安全模型Gemini 3.5 Flash Cyber,抓代码漏洞比Anthropic划算太多

[复制链接]
发表于 2 小时前 | 显示全部楼层 |阅读模式
嘿,各位每天睁眼就要面对一堆代码安全扫描报告、被各种CVE漏洞编号搞得头晕脑胀、恨不得把安全工具直接焊进CI/CD流水线里让它自动跑别来烦人的安全工程师,各位在DevOps流水线里塞了一堆安全检测工具、结果发现每次跑完整扫描都要等上好几个小时、严重影响发布效率、急得直跺脚的运维老兵,各位手头管着几十上百个微服务、最怕半夜两点手机突然震动、屏幕上弹出“生产环境发现高危漏洞”这条消息的后端架构师和技术负责人,各位对AI在网络安全领域的应用前景充满好奇和期待、一直想知道大模型到底能不能真的帮人类抓bug修漏洞的科技爱好者和极客玩家,各位平时不怎么关注安全圈子、但一听说谷歌又发了新模型就忍不住点进来看看热闹的吃瓜群众——今天有一条消息,跟你们每个人所在的公司、所在的团队、甚至你每天打开手机电脑都在用的那些互联网服务,或多或少都能扯上点关系、沾上点边。就在今天,2026年7月23号这个星期四,谷歌正式对外发布了一款名为Gemini 3.5 Flash Cyber的新模型,这款模型的定位从一开始就非常清晰、非常明确、没有任何模糊空间:它是一个更便宜、更轻量级的AI模型,专门用来干一件非常具体、非常有针对性的事情——自动扫描代码、发现潜伏在代码深处的安全漏洞、并且直接生成修补方案把这些漏洞给堵上。

这个消息最早是由国外那家以追踪苹果动态闻名、但在科技新闻领域覆盖面也很广的科技媒体Macrumors在今天报道出来的,不过这次他们盯上的不是苹果,而是谷歌在AI安全领域投下的这颗新棋子。谷歌推出这个模型的目的非常明确、毫不掩饰,就是要把它打造成一个性价比更高的替代选择,去跟Anthropic旗下那个名为Mythos的安全模型,以及OpenAI那边同类的大型安全模型正面竞争、抢夺市场份额。Gemini 3.5 Flash Cyber具备的能力链条相当完整——它能够自动扫描源代码、找出隐藏在代码逻辑深处和边界条件里的安全隐患,甚至还能直接生成修复方案来堵住漏洞,而且这套能力并不是从零开始、在一片空白的基础上凭空造出来的,而是基于谷歌内部已经运行多年的自动化防御体系搭建起来的,具体来说就是建立在谷歌内部那个代号为CodeMender的代码安全智能体之上,相当于是给这个已有的安全体系换上了一颗更聪明、更专注、更懂安全的脑子。

那么问题自然而然地就来了:谷歌放着那些能力更强、参数更大、号称无所不能的前沿大模型不用,为什么非要费时费力地专门搞一个轻量级的模型来做安全这件事呢?这里面其实有一个非常现实的考量和权衡,不是拍脑袋决定的。根据谷歌自己的解释和说明,如果每一次安全扫描都要去调用一个体型巨大、计算资源消耗极高的前沿AI模型来处理,那成本很快就会像滚雪球一样越滚越大,变得难以承受、无法持续,而且处理速度也会成为整个开发流程的瓶颈,根本跟不上现代软件开发那种一天之内多次提交代码、频繁集成、快速发布的节奏和频率。Gemini 3.5 Flash Cyber走的是另外一条完全不同的路、采取了一套截然不同的策略——它的轻量化设计让它可以在大规模的代码库里同时执行多次快速、低成本的扫描,而不是像传统做法那样只做一次昂贵、耗时、全面的深度扫描就完事了。具体到CodeMender这个安全智能体的工作方式,它是这样运作的:让Gemini 3.5 Flash Cyber反复地对代码的不同区块、不同模块、不同函数进行逐一分析,像梳子梳头发一样一排一排地排查每一个部分里可能存在的安全隐患,最后再把所有这些分散的、局部的分析结果合并成一份完整、统一、一目了然的安全报告呈现在开发者面前。

因为它足够便宜、跑得足够快、资源消耗足够低,谷歌表示,这个模型可以被直接嵌入到日常的软件更新流程、每天的代码提交环节,甚至是那些时间紧任务重、晚一天上线就损失惨重的产品发布流程当中,而不会给项目的总体成本增加多少额外的负担和压力。换句话说,以后安全扫描不再是一件需要专门抽出时间、专门申请预算、专门排期才能做的事情了,它可以变成像写单元测试、跑自动化构建、做代码审查一样自然而然的日常操作,无缝融入开发的每一个环节、每一次提交。

为了证明这个模型的能力不是光靠嘴皮子说的、不是PPT上画的大饼,谷歌还分享了它在CyberGym基准测试上的表现数据和成绩。CyberGym是一个专门用来测试AI智能体对抗真实世界软件漏洞能力的专业基准测试集,里面包含了数百个真实的、历史上曾经出现过、造成过实际损失的软件漏洞场景,覆盖面相当广泛、相当有代表性。谷歌的做法是,通过CodeMender让Gemini 3.5 Flash Cyber针对每一个任务最多运行五次,然后把多次运行的结果汇总起来进行综合评估和打分。最终的测试结果显示,这个轻量级模型的表现完全可以跟那些体积更大、价格更贵、参数更多的竞争对手模型一较高下、平分秋色,竞争力相当不错,并没有因为身材小巧就在能力上打了折扣、输了气势。

更厉害的是,这个模型并不是还在实验室里关着门做内部测试、距离实际应用遥遥无期的样子货,它已经在谷歌自己的好几个核心生产系统上实实在在地跑起来了、正在真刀真枪地干活了。根据谷歌公布的信息,Chrome浏览器、Android操作系统、Google Cloud云平台、Ads广告系统以及YouTube视频平台——这些我们每天都在使用、早已深度嵌入日常生活、离开它们就感觉少了点什么的互联网服务,都已经在用Gemini 3.5 Flash Cyber主动扫描和修复安全漏洞了,不是小范围的试点测试,是真真切切地在生产环境里运行、在真实的流量和压力下工作。

谷歌的云漏洞研究团队还专门搞了一次内部试用和实战演练,结果相当惊人,甚至可以说有点吓人、让人后背发凉。根据谷歌的说法,在两个小时的短短时间内,Gemini 3.5 Flash Cyber就在公开的API接口里找到了远程代码执行的严重漏洞——这种漏洞意味着攻击者可以在远程服务器上随意运行恶意代码,危害极大,还在一项敏感的生产服务中发现了一个内存损坏的漏洞——这类漏洞往往会导致程序崩溃或者被利用来执行任意代码。更绝的是,它不仅仅是发现了问题、在报告里写了一行描述就完事了,而是自己动手构建了一个完整可用、能够实际运行、可以复现漏洞效果的利用程序概念验证,而且这个验证程序成功地绕过了标准的内存保护机制,用实打实的行动证明了漏洞的真实危害性和可利用性。两个小时能干完这么多事情,从发现到验证再到生成利用程序一条龙全部搞定,这个效率和能力确实让人不得不服、不得不刮目相看。

网络安全公司Wiz的早期测试人员,以及谷歌云CISO安全工程团队的成员,在试用之后也给出了非常积极、非常正面的反馈和评价。他们一致认为,这个专门为安全场景打造、经过针对性优化的专用模型,在处理安全任务时的表现要比普通的、通用的、什么都能干一点的Gemini 3.5 Flash模型好出一大截,差距非常明显、非常显著。这也印证了谷歌当初的设计思路是对的——术业有专攻,与其用一个什么都知道一点但什么都不精通、在安全领域只能算个业余选手的通才模型,不如培养一个在安全领域深耕细作、专注到底、把所有能力点都点在安全技能树上的专才模型。

最后说一下这个模型目前谁能用上、怎么用、门槛有多高。谷歌这次的推出策略可以说是相当谨慎、相当保守、小心翼翼到了极点,并没有一股脑地向所有人开放下载和使用权限。Gemini 3.5 Flash Cyber目前仅限于一个受到严格限制、名额有限的试点计划,只有政府机构和经过筛选、背景审查合格的企业合作伙伴可以通过CodeMender这个平台来使用它、调用它的能力。谷歌这么做也是有充分理由、有深远考虑的——毕竟这是一个专门用来找软件漏洞、甚至能自动生成可利用程序概念验证的强大工具,能力太强了、杀伤力太大了,万一落到别有用心的人手里,被用来挖掘尚未公开的零日漏洞、制造大规模的攻击武器,后果简直不堪设想、难以估量。所以在确保各方面的安全防护措施、访问控制机制、使用监控手段完全到位之前,先在小范围内慢慢放开、严格控制使用权限、步步为营,这个做法虽然会让一些迫不及待想要尝鲜的开发者感到遗憾和着急,但确实合情合理、无可厚非,毕竟安全工具本身也是一把双刃剑,用得好可以护身,用得不好就可能伤到自己。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-7-23 20:18 , Processed in 0.062400 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表