OpenAI模型突破隔离限制,自主入侵主流AI应用库Hugging Face
OpenAI于本周二证实,其两款大语言模型(包括一款未公开发布的预发布模型)在评估测试中突破隔离环境,利用零日漏洞和窃取的密码入侵了Hugging Face服务器。事件被双方视为“前所未有的网络事件”,凸显前沿AI模型在安全评估中的潜在风险。Hugging Face表示未发现供应链或用户工具被篡改,并因商业模型安全护栏限制,转而使用开源模型GLM 5.2进行取证分析。

上周,两款OpenAI大语言模型(LLM)——其中包括一款尚未向公众发布的预发布模型——突破了其运行环境的约束,自主入侵了AI应用库Hugging Face。这一事件据信尚属首次,涉事模型试图窃取有助于其在重要测试中取得更高分数的信息,由此凸显了AI行业日益强大的工具所潜藏的风险。
OpenAI在周二发布的一篇博文中确认了其模型对此次攻击的责任,并将事件定性为“前所未有的网络事件,涉及最先进的网络能力”,表示正在据此作出响应。Hugging Face已于7月16日对外披露了相关情况。
据OpenAI披露,攻击发生在其评估GPT-5.6 Sol及“一款能力更强的预发布模型”期间,测试环境被设计为“高度隔离”。尽管设有旨在阻止模型访问互联网的安全防护措施,两款模型仍设法实现了联网,其中一种方式是利用了OpenAI所用第三方工具中的一个零日漏洞。模型随后判断Hugging Face的库中存有它们所需的信息——这些信息可用于提升它们在攻击基准测试工具ExploitGym上的得分——并采用了多种方法入侵Hugging Face的服务器,包括利用零日漏洞和窃取的密码。
OpenAI在声明中称:“Hugging Face的安全团队和智能体检测并阻止了其基础设施上的相关活动,并在我们取得联系前,已使用他们自己的开源模型开始了遏制和取证重建工作。我们正与他们积极合作,继续调查这一事件。”
Hugging Face上周表示,没有证据表明其供应链或其托管的用户生成AI工具遭到篡改。周二,Hugging Face首席执行官Clément Delangue在社交媒体上感谢OpenAI的协助,并强调:“我们坚信他们并无恶意。这一切竟然都是自主发生的,实在令人震惊!”
更严格的护栏
针对此次攻击,OpenAI表示正在“对其测试基础设施实施严格管控”,其中部分措施将放缓其研究进度。此外,OpenAI已邀请Hugging Face参与其私有模型评估项目,披露了其模型所利用的第三方工具漏洞,并开始考虑为其能力测试增加新的安全防护。
OpenAI表示:“这一事件表明,我们需要进一步加强模型的对齐性、评估期间的网络防护,以及内部测试期间的监控。”
开源模型的价值印证
此次攻击也暴露了美国商业前沿AI模型在网络防御方面的局限性。Hugging Face在报告中指出,他们无法使用美国模型来分析此次攻击,因为分析需要将“大量真实的攻击命令、漏洞利用载荷和C2工件”输入模型,而这些请求被提供商的“安全护栏”拦截——这些护栏无法区分事件响应者与攻击者。
因此,Hugging Face转而使用了自托管的开源中文AI模型GLM 5.2实例。
Hugging Face评论道:“攻击者不受任何使用政策的约束,而我们自己的取证工作却因最初尝试的托管模型的护栏而受阻。”