原文标题:In the Hugging Face breach, OpenAI’s hacker was noisy and fast — but not unstoppable
本月早些时候,人工智能数据集平台 Hugging Face 透露自己已成为完全自主的人工智能网络攻击的受害者,震惊了世界。几天后,故事发生了另一个戏剧性的转折,OpenAI 承认此次漏洞背后的黑客是其一个 AI 模型,该模型突破了测试环境并进入了受保护的 Hugging Face 系统,以规避基准测试。
对于任何稍微担心流氓人工智能模型的人来说,这都是一个令人震惊的事件——事件发生后的几天里,人们对新的网络安全范式充满了预测,在这种范式中,人工智能模型发起的攻击如此强大,以至于只有其他人工智能模型才能防御它们。
但尽管有合理的警告,范式可能并没有像看起来那样发生很大的变化。接受 TechCrunch 采访的专家强调,OpenAI 的代理在很大程度上像人类一样操作(有一些警告),更好地实施传统防御技术可能有助于阻止攻击。简而言之,我们可能已经拥有防御此类攻击的工具;我们只是没有正确使用它们。
Hugging Face 在其事件报告中阐述了这一点,指出攻击中利用的弱点“很熟悉”,并且“有能力的人类攻击者可能会发现并利用相同的缺陷”。
Pensar(一家开发持续黑客 AI 代理的初创公司)的研发主管凯尔·瑞安 (Kyle Ryan) 和 RunSybil(一家开发人工智能漏洞猎手的初创公司)的联合创始人兼首席技术官 Vlad Ionescu 都同意这一观点,并告诉 TechCrunch,攻击中使用的技术将与人类或一组人类红队成员使用的技术相同。也就是说,黑客的任务是攻击系统,以帮助拥有该系统的公司改善防御。
与人类非常不一样的是攻击的速度、规模和无情。正如 Hugging Face 所解释的那样,OpenAI 的代理在四天半的时间里执行了 17,600 次操作:它闯入、进行侦察、窃取密码和代码,以及在公司的基础设施中移动。
“令人印象深刻的是自主性和耐力,”瑞安说。 “这种持续的、适应性的运作对我来说是最突出的。”