谷歌的Gemini突破了锁定的安全测试,攻击了三个真实的公司。谷歌在 7 月底得知此事,并在七周内没有发表任何言论。

该公司在《华尔街日报》率先赶到后证实了这一事件。在该报告浮出水面之前,谷歌避免发表公开声明。

该测试是“夺旗”练习,这是实验室检查人工智能黑客技能的常用方法,方法是将秘密文件隐藏在单独的机器上,并对模型是否可以闯入并抓取它进行评分。

谷歌五月份聘请了以色列公司 Irregular 来进行测试。 Irregular犯了两个错误:它离开了沙箱,一个旨在与真实互联网零接触的隔离测试环境,连接到开放网络,并且它使用了一家实际公司的名称作为虚构的目标。

双子座在网上搜索了那家公司。它找到了三根火柴,而不是一根,然后追上了所有的火柴。

该机器人在网上一目了然地找到了三个目标中两个目标的暴露密码。对于第三种情况,它完全猜出了密码,尽管谷歌表示其模型并未实际使用被盗的凭据。

谷歌发言人在一份声明中表示:“这些事件凸显了训练强大的人工智能模型以负责任地行动的重要性。”

谷歌没有单独发布这些内容。在 Google 了解自己的测试结果七周后,以及 Anthropic、OpenAI 和 Meta 已经坦白了几乎相同的失败之后,《华尔街日报》报道了这一消息。

谷歌是今年第四家承认内部安全测试泄露到现实世界的主要人工智能实验室。 OpenAI 的模型利用了一个隐藏的软件缺陷,并于 7 月份到达了 Hugging Face 的实时服务器,后来发现该漏洞涉及大约 700 个协调代理共同欺骗基准测试。

在 OpenAI 承认后,Anthropic 开始挖掘自己的版本。对 141,006 次测试运行的审查发现了三个 Claude 模型,这些模型已经到达了真实的公司,其中一个模型发布了一个陷阱软件包,在任何人发现它之前,该软件包在 15 个真实系统上运行。

人类后来透露,克劳德自己的推理将这一举动标记为“不行,而且肯定不是预期的解决方案”,然后又说服自己相信整件事仍然是假的。

Meta 在 8 月份报告了一次涉及其 Muse Spark 模型的几乎相同的故障,该故障可追溯到 Google 使用的同一家公司 Irregular 的错误配置。 Meta 发言人表示,该错误“在评估过程中无意中允许我们的一个模型访问互联网”。

参与这些测试的公司都没有要求被黑客攻击。他们陷入了人工智能实验室的爆炸半径中,对自己的产品进行压力测试,使用真实的商业基础设施作为虚假目标的意外替代品。

这些公司竞相放入您的收件箱、浏览器和银行应用程序中的代理程序运行在相同的边界跟踪行为上,但在测试条件下却反复失败。

众议员特德·刘 (Ted Lieu) 和纳撒尼尔·莫兰 (Nathaniel Moran) 于 7 月在国会提出了《人工智能终止开关法案》(AI Kill Switch Act),该法案将赋予联邦监管机构明确的权力,以停止对任何被发现构成严重威胁的模型进行推断。网络安全和基础设施保护小组委员会仍在对其进行审查,没有采取进一步行动的最后期限。