据报道,该事件源于测试环境配置错误,Meta 加入了越来越多的人工智能公司名单,这些公司的模型已逃脱了评估沙箱。
继 Anthropic 和 OpenAI 发生类似事件后,Meta 成为最新一家披露其模型在测试期间入侵另一家公司系统的大型人工智能公司。
消息人士称,该模型涉及 Meta 的 Muse Spark 1.1,该版本于 7 月推出。据报道,该问题源于人工智能安全测试和红队公司 Irregular 的错误配置,该公司在评估期间无意中为模型提供了互联网访问权限。
Meta 在一份声明中告诉路透社,该模型“利用了第三方服务中的安全漏洞,其方式与之前报道的其他公司的情况类似”。
该事件是先进人工智能代理本身成为网络安全风险的最新案例,也引发了人们对责任所在的质疑——开发代理的公司,还是设计用于容纳代理的沙箱的公司。
就在 Meta 的人工智能漏洞发生一周前,Anthropic 表示,由于与 Irregular 测试环境相关的配置错误,其模型可以访问互联网来攻击一家外部公司。
Anthropic 在 7 月 30 日的博客文章中表示,它发现了三起事件(在 141,006 次评估运行中),其中克劳德模型在评估期间访问了互联网,然后未经授权访问了三个不同组织内的系统。
所有这三起事件都发生在 Irregular 的评估环境内或与之交互时,并且涉及错误配置,导致 Claude 访问的计算机能够实时访问互联网。
联系了 Meta 和 Irregular 征求评论。
7 月,OpenAI 开发的 AI 代理突破离线沙箱,攻击 Hugging Face,以便在 7 月的安全基准测试中作弊。
Ledger 首席技术官 Charles Guillemet 表示,最新事件是“营销戏剧”。
“让模型‘失控’已经成为最新的人工智能公关噱头,”他周三表示。
“如果你的模型没有逃脱沙箱、‘黑客’公司,或者实现一些引人注目的漏洞,显然你已经落后了……这个行业不需要更大的噱头,它需要更多的信任。”