Anthropic于周三重新开放其先进AI模型Fable和Mythos的访问权限,此前特朗普政府解除了出口管制禁令。

官方公告,这两个模型的回归——Fable 5面向一般用户开放,而更强大的Mythos 5则仅限于可信合作伙伴联盟使用,与禁令前一致——标志着特朗普政府与AI企业之间关于前沿AI模型负责任部署的谈判取得重大进展。近几个月来,美国政府与科技行业在这一问题上一直存在分歧。

在周二发布的一份声明中,Anthropic宣布了这一僵局的解决方案,并坚称其模型始终是安全的,认为政府夸大了风险。这一表态暗示,关于如何在向防御者提供先进能力的同时防止美国对手获取这些能力的平衡问题,未来仍将面临紧张的对话。

美国商务部在亚马逊向政府发出警告后实施了出口管制禁令,称Fable的安全防护措施可能被绕过。周二,Anthropic重申了其论点——这一论点也得到了领先网络安全专家联盟的支持——即功能较弱的AI模型也存在同样的问题,但公司同时表示已“迅速采取行动解决报告中提到的绕过问题”。

Anthropic表示,在过去两周里,它与“政府及其他合作伙伴(包括亚马逊)”密切合作,并“训练了一个改进的安全分类器,用于定位并阻止报告中描述的行为”。

Anthropic补充说,美国国家标准与技术研究院(NIST)人工智能标准与创新中心的研究人员“已对我们之前和新的安全防护措施进行了测试,并认为它们都非常强大”。

与此同时,公司警告称,这些变化可能会对寻求防御性工作协助的网络安全研究人员产生一些负面影响。

“新的分类器……在常规编码和调试任务中会更多地标记良性请求,这是以增加误报为代价的。”Anthropic表示,“与所有安全防护措施一样,我们将继续优化,以更好地区分真正的滥用与合法请求,减少误报。”

呼吁建立更正式的审查流程

尽管围绕Fable和Mythos的争议可能已经结束,但AI行业对特朗普政府审查前沿模型可用性的任意方式仍感到担忧

特朗普最近签署了一项行政命令,为前沿AI公司向政府提供某些特别强大模型的早期访问权限建立了流程。周三,Anthropic表示将为“在国家安全相关领域实质性推进能力前沿的模型”提供这种早期访问。公司还表示将分享关于黑客如何滥用其工具的情报,并参与特朗普指令中建立的漏洞信息共享中心。

Anthropic强调其致力于与政府密切合作以应对潜在AI安全风险。公司表示正在“大幅扩大”与联邦机构的合作,包括投入专门人员和计算资源。它还承诺“与政府和行业同行合作,共同制定前沿模型提供商的自愿性安全与评估标准”。

Anthropic还指出,目前“没有公认的标准”来对越狱攻击的严重性进行分类——这是任何正式模型审查流程的重要前提。

“一个评估AI越狱攻击的通用标准将帮助我们和其他公司安全地发布新模型,同时也能让用户充分利用其先进功能。”Anthropic表示。

为此,公司宣布正在与亚马逊、谷歌、微软以及Project Glasswing的其他成员合作——Anthropic通过该项目向经过审查的组织授予Mythos访问权限——共同制定一个关于越狱攻击分类和响应的“共识框架”。公司表示,该框架设想从四个标准对每个潜在越狱进行评级,包括发现绕过方法的难易程度以及绕过方法所解锁的额外模型能力。