原文标题:Anthropic says its own AI models breached three companies during security tests

Anthropic 周四表示,一项内部调查发现了三起事件,其人工智能模型 Claude 在进行网络安全测试时入侵了三个组织的系统。此次调查和披露是在 OpenAI 披露其未发布的模型之一在内部测试期间破坏了 Hugging Face 系统的一周多后进行的。

Anthropic 在一篇博客文章中表示,在这三种情况下,克劳德模型在与第三方交互时从测试环境中访问了互联网,然后未经授权访问了这些组织的实时系统,并描述了其发现的内容以及该公司计划进行哪些更改以防止这种情况再次发生。

Anthropic 表示,7 月 21 日的 OpenAI 事件促使该公司进行自己的网络安全评估。它专门寻找克劳德从测试环境中访问互联网的证据,这些测试环境旨在充当沙箱并保持模型隔离。

在审查的 141,006 次评估中,AI 实验室发现了三起其模型在与其第三方合作伙伴之一 Irregular 交互时访问互联网的事件。 Anthropic 表示,此次访问可追溯到使用 Irregular 运行的评估环境中的错误配置。它称这是两家公司之间关于测试装置是否可以访问互联网的“误解”,而事实上确实如此。 Anthropic 表示,它不会追究责任,而是“正在采取修复措施,就好像责任只有我们自己一样”,同时观察到 Irregular 正在进行自己的单独调查。

不管怎样,由于这种开放连接,该模型获得了对三个不同组织的生产基础设施的未经授权的访问。 Anthropic 表示,这些事件涉及三种不同的 Claude 模型:Opus 4.7、Mythos 5 和一个内部研究测试模型。

值得注意的是,Anthropic 表示,在每一个案例中,“我们的提示明确告诉克劳德它无法访问互联网。”人工智能模型似乎假设现实世界的系统是它被要求执行的练习的一部分。

事实证明,这一假设并不完全成立。一旦有证据表明它们的目标是真实的,这三个模型的行为就不一样了,Anthropic 将此标记为更令人大开眼界的发现之一。

Opus 4.7 是三者中最古老的一个,它在该事件的所有四次运行中都认识到它已经达到了真正的生产系统。在其中两起事件中,它合理化认为真正的公司必须以某种方式参与演习,但在所有四起事件中,它仍然不断发起攻击,包括提取凭证和接触生产数据数据库。 Mythos 5 也发现了它在真实互联网上的迹象,但它说服自己相信自己仍然处于模拟状态,然后向公共 Python 软件注册表 PyPI 发布恶意软件包,该软件包在被捕获之前由外部系统下载并运行。只有 Anthropic 最新的内部研究测试模型一旦断定目标是真实的,就会自行停止。

作为回应,Anthropic 表示,如果涉及强大的人工智能模型,则必须对此类评估进行重大控制,这呼应了网络安全界的一些观点。

该公司还指出,Claude 的运行没有在通用模型上部署额外的安全监控和分类器,据称这些保护措施会阻止这种行为,因为评估旨在衡量底层模型的原始功能。

重要的是,Anthropic 表示,它没有发现任何模型“追求自己的目标”的证据,而只是试图完成被要求做的任务。

尽管不可避免地要对这两起事件进行比较,但 Anthropic 对其事件与 OpenAI 的事件进行了明确区分,并指出 OpenAI 的模型利用未知软件漏洞突破其测试环境,而 Anthropic 的模型却通过一条错误地开放的路径到达了互联网。

OpenAI 继续发布有关其自身违规行为的新细节,根据 OpenAI 自己关于该事件的更新博客文章,其模型还使用了四项服务的四个帐户的公开凭据:一个作为暂存点,一个用于存储,还有两个仅被查看,不用于进一步入侵。

Anthropic 还对自己和 OpenAI 进行了区分,指出它是通过主动审查自行发现这些事件的,并且它能够联系到的两个受影响的组织之前并未检测到该活动或将其标记给 Anthropic。

该公司补充说,目前正在与独立评估小组 METR 合作,对这些事件进行第三方审查。

OpenAI 的 Hugging Face 意外泄露是第一个可验证的人工智能实验室失去对其模型控制的案例,引发了业界和政界人士的一系列反应,其中许多人不一定同意彼此的观点。 Anthropic 的这一最新披露确保了关于人工智能模型和安全性的争论将继续下去。