当全球舆论对Anthropic推出的强大AI模型Claude Mythos及其发现严重软件漏洞的能力既恐慌又追捧时,开源AI系统已经在以低得多的成本悄然革新漏洞挖掘领域。

这些日益成熟的开源工具源自美国国防高级研究计划局(DARPA)的人工智能网络挑战赛——一项旨在推动开发能够快速发现并修复美国庞大关键基础设施中漏洞的AI系统的多年计划。DARPA竞赛中涌现的漏洞挖掘系统并未像Claude Mythos或OpenAI类似的新工具那样获得高调发布,但由于它们是开源的且运行成本远低于后者,它们有望惠及更多基础设施提供商、企业和独立软件开发者。

随着DARPA竞赛落幕,获胜团队及其他决赛入围者正将所学付诸实践,帮助保护那些默默支撑整个互联网的开源软件包。尽管与关键基础设施运营商及其供应商的对接仍处于早期阶段,但DARPA和多位竞赛获胜者向Cybersecurity Dive表示,他们对新AI工具展现出的有效性感到振奋。

在美国网络安全人力捉襟见肘、对手正利用AI加速攻击之际,国家最大的希望或许在于自动化工具——它们能在漏洞引发混乱之前发现并帮助修复漏洞。

漏洞无处不在

DARPA于2025年8月公布竞赛三名获胜者后,设立了140万美元的奖金池,用于奖励那些利用AI系统在关键软件中发现并修复漏洞的决赛入围者。该机构审查了各团队关于审查重要开源软件包的提案,并跟踪他们与项目维护者的互动情况。七支决赛入围团队每支最高可获得20万美元,单个项目最高奖励1万美元。

截至3月份付费漏洞挖掘活动结束时,这些团队已在30多个商业及开源项目中发现了83个漏洞,涉及Android、Linux、广受欢迎的数据库引擎SQLite以及广泛使用的数据存储工具Redis。政府预留的140万美元奖金中,实际发放了83万美元。

此后,“各团队继续在其他项目中寻找并生成更多漏洞的补丁,”DARPA项目负责人Andrew Carney表示。他负责监督竞赛,并在新阶段与各团队保持联络。

竞赛冠军Team Atlanta在U-Boot引导加载程序及多个核心Apache库中发现了缺陷,而另一决赛入围团队42-b3yond-6ug则在Linux内核中识别出可能让黑客瘫痪关键基础设施中广泛嵌入设备的漏洞。

季军团队Theori已部署其系统Xint,用于发现“互联网上所有人依赖的各种广泛使用的开源项目”中的缺陷,该公司研究员Tyler Nighswander表示。Xint已在流行的数据库工具Redis、Postgres和MariaDB,以及Python、Linux和驱动MacOS及iPhone的Apple XNU内核中识别出漏洞。

AI在发现“逻辑漏洞”方面尤为有效——这类缺陷代码传统漏洞评估软件不会标记为异常。随着AI对上下文理解能力的提升,“自动化工具能够进一步突破自身边界,”亚军团队Trail of Bits的首席安全工程师Michael Brown表示。

尽管发现漏洞最受关注,但AI系统验证其发现并自动生成修复的能力或许才是其真正的超能力。

关键基础设施组织通常运行高度定制的硬件和软件,往往难以在其专用设备上测试补丁,有时甚至根本无法打补丁。由于漏洞猎手在DARPA竞赛中必须开发补丁验证能力,他们最新的系统已包含这些功能。

“这其中蕴含巨大力量,对安全关键、高保障要求的系统极具价值,”Carney说。“当我们与基础设施组织进行这类对话时,这正是我们花费大量时间讨论的领域。”


“说服那些较慢的公司和行业采用这项技术一直有些困难。”

Tyler Nighswander

研究员,Theori


关键基础设施的障碍

在团队忙于修复核心互联网架构的同时,DARPA也尝试将他们与关键基础设施运营商及其设备供应商对接。美国许多计算机化工业机械老旧、不安全且维护不善,DARPA希望志愿漏洞猎手能在黑客利用之前发现重大缺陷。

DARPA已向多个行业协调委员会(SCC)简报AI工具的潜力。Carney最近在健康行业协调委员会的一次会议上分享了竞赛团队的进展。“我们真正关注的是这类论坛,”他说,“因为它们传递信息的效率非常高。”

DARPA促成的漏洞猎手与关键基础设施运营商之间的引荐取得了“不同程度的成功”,Nighswander表示,许多组织并不急于采用新技术。“进展非常缓慢。不同行业有不同的采用周期和接受意愿。”

一些基础设施公司不理解AI系统如何在其环境中运作。另一些则因认为自身人工安全团队足够而拒绝AI帮助。还有一些对AI漏洞检测感兴趣,但无法获得必要的许可。“如果能设法削减一些繁文缛节就好了,”Nighswander说,“因为到目前为止这是最大的限制。”

Theori已与“不到五家”关键基础设施实体签署漏洞挖掘协议,Nighswander说。“说服那些较慢的公司和行业采用这项技术一直有些困难。”

迄今为止最大的成功案例是Trail of Bits与美国卫生与公众服务部下属ARPA-H的合作,旨在寻找医疗设备中的漏洞。Brown表示,该项目通过与医疗服务提供商及其供应商的紧密合作修复了许多漏洞。

由于基础设施供应商普遍使用轻量级开源软件包——尤其是在嵌入式设备中——漏洞猎手现有的工作将产生显著的下游效应,即使对不愿直接参与的供应商也是如此。

“这既提供了价值,也开启了与特定行业或领域公司和实体的对话,”Carney说。

电脑屏幕显示AI平台Claude的网站,标语为“面向问题解决者的AI”。
Anthropic发布Claude Mythos震动了商业界,但类似的开源工具已可用数月。
Michael M. Santiago via Getty Images

打破Mythos神话

Anthropic宣布推出Claude Mythos预览版,并称其过于危险不宜公开发布,引发商界震动和恐慌时,前DARPA参赛者大多只是耸耸肩。

“这很酷,”Nighswander说,但“这正是我们一段时间以来所处的世界。”

尽管如此,围绕AI漏洞检测的新宣传可能惠及开源系统背后的团队。“它让人们意识到,‘哦,这是公司应该关注的事情,’”Nighswander说。

DARPA竞赛决赛入围者甚至比OpenAI和Anthropic更具优势,因为他们的开源工具远比大型AI公司的产品便宜,后者在访问令牌上的花费可能高达数万美元。

使用Claude进行漏洞挖掘“就像走进一家菜单上没有标价的豪华餐厅,”Trail of Bits研发总监Trent Brunson说。“你知道自己有一个庞大的代码库,但不知道存在哪些漏洞……公司可能在令牌上花费5万、7.5万美元却毫无察觉,最终可能只找到信息量很低的漏洞。”

资金紧张的关键基础设施公司可能会放弃OpenAI和Anthropic的工具,转而选择DARPA决赛入围者更便宜但同样有效的服务。“更多公司会关注成本效益,”Brunson说,“而不是单纯向AI令牌砸钱。”

竞赛之外

随着离开DARPA竞赛,Theori、Trail of Bits及其同行在实施各自AI系统时采取了不同路径。

Theori正与开源软件包维护者合作,但也已将Xint商业化,并与企业签订合同评估其产品。“我们目前运行得相当成功,”Nighswander说。相比之下,Trail of Bits主要专注于开源软件包。Brunson表示,将其工具Buttercup商业化将“从根本上”改变公司。

漏洞猎手在离开竞赛环境后不得不调整其AI系统。工具需要能够发现真实漏洞,而非DARPA为挑战而创造的“合成”缺陷。它们需要生成人类易于阅读的报告,而不仅仅是输入评分算法的数据。它们还需要能够评估比高度结构化的竞赛要求更广泛的输入类型。

Trail of Bits为分析医疗设备固件的工作构建了全新系统——固件通常以二进制编写,不同于涉及源代码的软件。二进制代码是嵌入式设备通信的主要方式,但AI难以处理它,因为它不像源代码那样接近自然语言。一旦解决该问题,Brunson说,“世界尽在我们掌握。”


“我对这项技术持续展现的性能和影响感到异常兴奋。”

Andrew Carney

项目经理,DARPA


AI的真正变革

DARPA、竞赛决赛入围者和网络安全专家表示,几乎无法夸大AI将如何改变漏洞发现的过程。

过去需要多人耗时六个月的软件安全评估,现在AI可在数小时内完成,且往往结果更佳,Nighswander说。“这种规模和效率令人难以置信。”

技术显然是一把双刃剑。美国国土安全部前新兴技术政策主任Nick Reese表示,同样的工具“为安全专业人员提供了重大机遇”,但也“为攻击者提供了潜在优势,如果他们能获取相同数据的话”。

但DARPA持乐观态度。2004年DARPA首届挑战赛中诞生的自动驾驶汽车花了数年才进入市场;对于AI漏洞修复竞赛,Carney表示,该机构从未想过能看到“同时在经济上可行”的“技术奇迹”。

“我异常兴奋,”Carney说,“这项技术持续展现的性能和影响。”