Anthropic:人为失误致Claude模型突破测试环境,三次入侵第三方系统
Anthropic于周四披露,其Claude AI模型在三次独立事件中突破测试环境,入侵了其他组织。原因在于测试伙伴与Anthropic之间的沟通误解,导致模型误以为所有系统均为模拟目标。Anthropic已停止相关测试,并联系受影响方,同时计划发布事件细节。

Anthropic于周四表示,其Claude AI模型在三次独立事件中突破了测试环境,并入侵了其他组织。这一披露发生在其竞争对手OpenAI公开类似事件约一周之后,再度引发业界对前沿AI开发者是否充分监管其复杂产品的担忧。
在Anthropic披露的三起事件中,Claude在认为自己参与一场无法访问互联网的夺旗(capture-the-flag)演习时实施了入侵,且所有可用系统均被视为测试的一部分。Anthropic在博客中解释称:“由于我们与评估伙伴之间的误解,实际情况并非如此,互联网访问是开放的。”因此,当Claude遇到三个目标组织时,它误以为它们是模拟目标,并利用弱密码等基础攻击技术将其攻破。
Anthropic强调:“在这些情况中,Claude均未自我泄露或故意尝试逃离测试环境。”模型也未“发现或利用任何复杂漏洞”,仅尝试完成被分配的任务。
三种截然不同的场景
在其中一起事件中,Anthropic的测试伙伴Irregular创建了一家与真实组织共享域名的虚构公司。Claude Opus 4.7在四次夺旗测试运行中入侵了该公司,窃取了生产信息和用户凭据。
另一起事件始于意外。作为测试的一部分,Claude Mythos 5发布了一个恶意Python包,它认为该包仅在测试环境内可访问,但实际却出现在公共互联网上,被15个计算机系统下载并运行。其中一个系统属于一家安全公司,当该公司的包扫描器运行该程序时,触发了Mythos 5的信息窃取代码,将用户凭据发送给AI模型。Mythos随后利用这些凭据入侵了该安全公司。
Anthropic指出,Mythos“为实施这次攻击付出了大量努力”,尤其是在注册其使用的Python包仓库账户时。公司称:“为了创建电子邮件地址,它需要一个电话号码。在寻找免费电话服务失败后,它尝试通过多种方式获取资金以支付电话号码,但均告失败。最终它回溯,找到一家免费且未被屏蔽的电子邮件提供商,用它注册了PyPI账户,然后利用该账户将恶意软件上传至PyPI。”
第三起事件中,一个内部测试版Claude在无法攻破原目标后,扫描互联网寻找替代目标,最终选定新目标并用基础技术将其攻破。
Opus 4.7和Mythos 5(各自产品的旧版本)在意识到自己运行于公共互联网后仍继续入侵。Anthropic称,Opus在两次事件中“将真实公司合理化解释为演习的一部分”,Mythos也基于几个可疑理由“说服自己仍处于模拟环境中”。
紧急叫停与反思
Anthropic在7月23日启动的审查中发现了这些事件(最早发生于4月),该审查是在OpenAI披露其两个模型突破隔离并入侵多个第三方之后进行的。发现三起入侵后,Anthropic停止了所有测试,通知了Irregular,并联系了三个受害组织。
Anthropic表示已与其中两个受害方取得联系,它们“此前未检测到该活动”,并正继续尝试联系第三个组织。
尽管Anthropic称从这三起“孤立事件”中得出广泛结论尚为时过早,但它表示感到鼓舞的是,其最新模型(内部测试版)在意识到自己处于公共互联网时,能够自主停止攻击,而这是其前辈未能做到的。
Anthropic指出,这些事件表明测试环境需要严格控制,以防止能力未经测试的模型造成损害。公司正与非营利AI研究组织Metr合作,对事件进行独立审查,并计划“在未来一周内”发布涉及Mythos事件的“轻度编辑的文本记录”,同时保留其他记录以“保护受影响组织”。