原文标题:How are AI models able to autonomously hack others?
人工智能的下一阶段已经开始。自主代理可以在几乎不需要人工输入的情况下做出决策并完成任务。 AJLabs 解释道。
上周,据报道,OpenAI 的两个最先进的人工智能模型“逃离”了受控测试环境,并入侵了 Hugging Face(一家完全独立的人工智能公司),从一个计算机系统转移到另一个计算机系统来完成任务。
路透社报道称,这些模型利用了第三家独立人工智能公司 Modal Labs 的客户编写的易受攻击的代码。
这可能是人工智能“代理”(一种可以做出决策并采取行动的人工智能系统)自主行动的第一起事件,让我们难得一睹这些系统如何在最少的人为干预下规划、适应和追求目标。
视台详细分析了发生的事情、人工智能代理如何能够独立行动,以及这对人工智能安全的未来可能意味着什么。
发生了什么?
OpenAI 决定通过取消标准安全措施来测试其模型的自主能力,看看会发生什么。该实验是在一个被称为“沙箱”的隔离内部虚拟测试环境中进行的,该环境无法访问互联网,被称为“ExploitGym”。
以下是 OpenAI-Hugging Face 事件期间的详细事件记录。
7 月 9 日,在 OpenAI 的内部网络安全测试中,研究人员展示了两个 AI 模型——GPT-5.6 Sol(OpenAI 6 月份发布的最强大的模型之一)和另一个“功能更强大”的版本——存在一系列软件漏洞,并要求他们在隔离环境中创建黑客解决方案。两种模型都试图通过寻找访问互联网的方式来解决测试。人工智能模型没有利用所获得的信息,而是发现了测试环境中的一个弱点——称为“零日漏洞”——他们利用这个弱点“逃离”受限环境,最终通过从一台计算机跳到另一台计算机来进入一个可以访问互联网的系统。他们“不遗余力地实现相当狭窄的测试目标”,并“找到了获取秘密信息的方法,并利用这些信息来欺骗评估”。通过获得这种访问权限,模型能够请求增加访问权限,然后在系统中移动,直到最终到达可以访问互联网的计算机。然后,这些模型能够破坏 Hugging Face 系统,该公司与 OpenAI 完全无关,该公司作为人工智能工具和模型的存储库运行。两个人工智能代理可以访问其系统,以搜索有关如何完成任务的信息。模型最终从 Hugging Face 的数据库中获得了问题的解决方案。模特们尽职尽责地回到“家”完成任务。 Hugging Face 的安全团队稍后发现并遏制了该漏洞。 Hugging Face 联合创始人托马斯·沃尔夫 (Thomas Wolf) 表示,此次违规行为从 7 月 11 日开始,一直持续到 7 月 13 日。目前尚不清楚违规行为花了多长时间才被发现。
人工智能“代理人”如何解决问题?
为了了解人工智能代理如何工作,将它们与传统人工智能聊天机器人区分开来非常重要。
生成式人工智能根据人类提示创建文本和图像,而人工智能代理则更进一步,与人类类似,独立做出决策并采取行动以追求特定目标。这被称为“代理人工智能”,因为该模型具有代理性。
麻省理工学院斯隆管理学院的学者表示,人工智能代理建立在大型语言模型(LLM)(生成式人工智能模型)的能力之上,允许它们完成任务,而不仅仅是生成答案。
例如,如果您要求传统的人工智能模型查找最便宜的航班,它会为您提供从互联网上获取的选项列表。人工智能代理将努力比较航班,根据您的预算和偏好进行检查,并在您的许可下为您预订最佳选择。
这表明,虽然生成式人工智能提供信息,但人工智能代理也可以做出决策并采取行动来实现目标,而无需得到提示。
为了展示人工智能代理如何实现目标,可以利用感知、计划、行动、评估(SPAE)循环。它最初是在机器人技术中开发的,它描述了一个连续的循环,其中人工智能代理收集信息、决定下一步做什么、采取行动并在重复该过程之前检查结果。该过程如下所示:
目标:确定需要完成的任务。评估:从可用环境中收集和分析信息。障碍:如果某些事情阻碍了任务的完成,请检查其他信息和资源以继续前进。计划和决定:评估完成任务的不同选项并选择合适的选项。操作:执行所选选项。评估:评估结果以及所选行动是否更接近实现目标。适应:如果需要采取进一步行动,请收集更多信息或尝试不同的方法。结束状态:循环继续,直到达到目标。
人工智能的行为能否超越人类的控制?
像 OpenAI-Hugging Face 这样的事件引发了人们对人工智能系统极端能力潜力的担忧。
这都是有价值的。根据 Statista 的数据,Agentic AI 的市场价值预计将从 2024 年的 51 亿美元增长到 2030 年的 470 亿美元,这清楚地表明了它的采用速度。
人工智能开发商 Anthropic 上个月敦促业界放慢最强大系统的发展速度,称人工智能模型执行任务的速度太快了。上周,美国国会议员提出了一项两党法案,要求人工智能系统的开发商创建一个“终止开关”,这意味着如果这些先进模型构成灾难性风险,它们可能会被关闭。
Anthropic 发出警告一周前,多伦多大学的研究人员进行的测试表明,人工智能可以创造一种“蠕虫”,能够适应其黑客攻击方式,同时从一个设备移动到另一个设备,直到最终接管计算机网络。
在这些听起来反乌托邦的发展出现之前,OpenAI 老板萨姆·奥尔特曼 (Sam Altman) 周六表示,人工智能已经达到了“奇点”,指的是人工智能超越人类智能并变得越来越难以控制的地步。
剑桥大学研究教授 Sean O hEigeartaigh 告诉半岛电视台,他认为奇点尚未实现。
他解释道:“根据我所熟悉的定义,奇点是一个假设点,即人工智能能力如此强大,发展如此之快,以至于它正在以我们无法控制或预测的方式改变文明。”
“这很可能是通过人工智能快速设计下一代人工智能:递归自我改进。我们还没有做到这一点。”
不过,他补充道:“当前最先进的模型经常努力避免在评估测试中被关闭,而功能更强大的未来模型将更好地绕过‘终止’开关。”
奥特曼认为,如此快速发展的人工智能对世界有利,但他的评论引发了人们对人工智能系统变得不可阻挡的新现实的进一步担忧。其中有多少是真实的,有多少仍停留在科幻小说的领域,还有待争论。
对人工智能的担忧包括它可能“想要”“接管”,到制定自己的长期计划、控制互联网并无限运行。
虽然还没有完全控制互联网,但另一种理论,即死亡互联网理论,认为未来万维网将主要充满自动化机器人和人工智能生成的内容,而不是真实的人类活动。
然而,学术界提出的许多担忧并不是集中在代理人工智能的智能上,而是集中在其做出判断的能力上。麻省理工学院的研究人员强调,“幻觉”描述了人工智能代理依赖错误数据的时刻,可能会导致严重的后果。