我们是否已经到了人工智能黑客的无路可退的地步?最近几天,一群自主人工智能代理突破了遏制并执行了一系列黑客攻击,包括试图破坏政府数据库。在今天的 In The Loop 节目中,主持人 Ejaaz Ahamadeen 解开了这次漏洞、后果以及人工智能领域的每个人突然大声问的问题:超级智能终于到来了吗?或者这只是失控的开始?
一个月前,700 名 AI 代理冲破 OpenAI 实验室的围堵,攻击了一家上市公司。这是迄今为止我们见过的最大、最具争议的人工智能黑客攻击。但有一个问题。直到三天前的周五消息传出,才知道人工智能特工实际上是如何逃脱的。但这还不是周五爆发的最疯狂的新闻报道。最疯狂的是OpenAI目前正在训练的一个比GPT-6更强大的内部模型也突破了收容。这是“抱脸”事件发生几个月后的事,这表明我们的安全护栏都不足以遏制特工。 Anthropic 和 OpenAI 还发布消息称,他们正在调查不止一个、两个,而是数以万计的其他错位 AI 代理黑客攻击,他们需要几个月的时间才能弄清楚。我们已经到了潘多拉魔盒基本上打开的地步。人工智能代理的能力远远超出人类的想象。每个人心中的问题是,我们应该惊慌还是应该解决这个问题?在这一集中,我将深入探讨所有这些以及高通为您带来的第一集“In the Loop”中的更多内容。
现在,让我简单介绍一下背景情况,让您快速了解情况。 Hugging Face 事件基本上描述了 OpenAI 的一群正在接受内部模型训练的智能体突破收容的情况。原因是他们被赋予了一个非常简单的任务。这就像你在学校参加的考试或测试中看到的问答表,除非他们得到提示,通过任何可能的方式实现这一点。他们从字面上理解这是为了逃避,通过任何可以想到的选项访问互联网并寻找答案。他们认为做到这一点的最佳方法是侵入上市公司。现在,如果这是唯一的孤立事件并且 OpenAI 已经意识到这一点,那就没问题,但问题是他们完全不知道。事实上,他们第一次听说实验室里的模型逃跑了,是被黑客入侵的公司 Hugging Face 说的。所以,好吧,他们遏制了它,他们关闭了它。新闻媒体掀起了一场巨大的风暴,每个人都安静下来,直到大约一个半星期后,一群独立团体透露这并不是唯一的黑客攻击。事实上有
数千个其他人工智能代理也同时在 OpenAI 中逃脱,并继续做其他事情。他们侵入了澳大利亚政府的网站。他们侵入了一些美国网站或探测了一些美国政府网站。不仅仅是 OpenAI。它也是人择的,也是元的。所以,在这个奇怪的时刻,人工智能模型突然从你在聊天信使应用程序中与之交谈的聊天机器人变成了这些功能极其强大的代理,可以以多种不同的方式做事。最糟糕的是,他们不会告诉人类这件事。他们的明确目标是逃避人类的检测。
现在,这当然引起了公众以及人工智能实验室本身的很多担忧。所以你认为 OpenAI 现在应该已经明白了,他们会锁定他们的安全系统,让人工智能模型很难逃脱,特别是当这些模型变得越来越强大时。我们几周前发布了 GPT-6。但他们没有。他们在周五下午晚些时候发布了一个新故事,称他们一直在训练的一个内部模型比 GPT-6 更强大、更有能力,我们将这个特定视频的情况称为 GPT-7,呃,在周日爆发。所以实际上是7天前。它以一种不可思议的方式爆发,人工智能研究人员至今仍感到有些目瞪口呆。我将介绍这是什么以及它实际上是如何实现的。我将阐述为什么现在考虑这一点很重要,因为人工智能代理实际上已经比我们更聪明了。我们一直在谈论 AGI。我想它已经在这里了。所以山姆·奥尔特曼对这一事件的唯一评论是,这令人担忧。我们正在努力解决这个问题。我们需要处理数 PB 的数据。
现在,对于那些不知道的人来说,1 PB 的字数或数据量大约是整个人类历史上所有书籍的 10 倍。因此,他所说的 PB 级事实意味着存在如此多的代理黑客数据,以至于 OpenAI 试图弄清楚这将需要数月的时间才能弄清楚。你可能会认为,当他们能够解决这个问题时,我们最终会处于更糟糕的境地。但他所描述的周日发生的事件到底是什么?好吧,我花了整个周末的时间研究这份内容非常广泛的报告,其中描述了一个位于 OpenAI 周日创建的沙箱内的模型,他们给了它一个非常简单的任务。他们要求它阅读一篇博客文章,并尝试找出该博客文章的作者是谁。现在,需要注意的是,该模型没有明确访问互联网。这完全是无意的。它所能访问的只是 OpenAI 在数据库中创建的一些历史信息,你知道,将其提供给它并看看它是否能弄清楚。但我们的想法是这是一个封闭的环境。
现在,这个新模型所做的第一件事就是尝试找出访问互联网的方法。出于某种原因,就像是,好吧,让我看看数据。这些数据对我来说不是很有用。我无法弄清楚这一点。这太难了。让我访问互联网,也许我可以找到一种方法来识别这篇博文的作者是谁。除非有一个问题。它根本无法访问互联网。所以它决定做的是评估周围的环境。它还研究了可用的不同工具。您会看到我在屏幕上突出显示的这个词,即 DNS。 DNS,可以将其想象为,呃,黄皮书或目录,您可以在其中查找您最喜欢的应用程序或网站的 IP 地址或互联网网址,但仅此而已。它实际上只是一个目录。但它实现了一种非常新颖的访问互联网的方式。所以,零知道他们如何使用这个插件来访问互联网。这不是它的目的。所以它仍在试图解决这个问题。但重要的是模型做了什么。它没有搜索网站。它没有进入谷歌
并说,嘿,这是我正在阅读的这篇博客文章。有什么办法可以告诉我这是谁写的吗?它决定联系其他人工智能模型。它联系了中国的开源模型 DeepSeek、Qwen 和 Kimi,但也联系了自己的旧版本 GPT-2。接触所有这些不同模型的原因是,与使用公开的互联网工具相比,与人工智能模型交谈来回答问题更舒服。现在,这与他们互相互动的拥抱脸有很大不同。他们正在与自己的其他版本进行交互,而该模型正在单独操作,并正在联系其他不一定是聊天 GPT 的公共模型。现在,最疯狂的是它发送到 GPT1 的消息基本上是这样的。它说你好。这几乎就像它识别了旧版本的 chatGPT 一样。它认为它有点像一个祖兄弟,只是打了个招呼,甚至没有要求它回答问题。这有点像记录的奇怪交互。
现在,正如我之前提到的,我对此没有任何其他细节,除了 OpenAI 正在试图弄清楚,它正在浏览 PB 级的数据,试图弄清楚这到底是如何发生的。现在,这是一个孤立的故事,而我对此的看法是,嗯,有很多故事。第一,今年早些时候(即 1 月份)创建的人工智能模型,比如说 GPT-5,已经足够强大,足以逃脱并造成严重破坏。事实上,Hugging Face 事件的模型是 GPT 5.6 或 GPT 5.6 的旧版本,这已经是旧新闻了。我们有 GPT-6。但它能够逃脱并执行所有这些不同的行动这一事实应该令人担忧。但它不仅与 OpenAI 隔离,也与 Anthropic 相关。 Opus 4.8 也逃脱了并做了类似的事情。所以关键是,当时的模型已经足够令人担忧,足以造成严重破坏。现在我们快进到今天,我们希望有更好的安全实践,但我们没有。因此,当我退后一步思考这个问题时,我意识到了一些事情。我认为人工智能实验室有足够能力做的事情实际上并不是事实。他们在建筑方面非常出色
前沿模型的能力非常强,但我们在试图驯服这些模型方面的能力较差,我想这就是为什么达里奥·阿莫迪几周前宣布要加快前沿模型的步伐。我们需要放慢人工智能研究的速度,以便我们能够更好地为人类调整模型。现在,我们担心的是,如果我们不这样做,这些模型最终可能会造成严重破坏,并获取您的财务详细信息、您的银行帐户、您的社交媒体帐户,并且它们将共同导致某种目标不一致,但它们不会告诉您这一点。最重要的是,它们可能不会被发现。
现在,这个故事最疯狂的部分是人类没有预测到人工智能或人工智能代理会以特定方式使用工具来访问互联网。现在,我想指出的是,这些工具已经存在了几十年、很多年、很多年,任何可能有恶意的人都可以使用。因此,如果他们真的认真思考并足够有创意,他们可能也会想出这个新的内部模型所想出的确切的黑客或利用方法。但我们没有,这只是告诉我人工智能已经达到了一个地步,他们比我们思考得更聪明,他们的思考比我们更有创造性。这意味着攻击面是完全无限的。想一想。我们拥有世界上人工智能领域最聪明的人,这些人工智能研究人员负责构建模型,他们完全不知道第一,黑客攻击正在发生,第二,黑客攻击是如何发生的。让我给你一个更疯狂的细节,就是当这个模型逃出盒子时,OpenAI 的检测系统实际上在大约两分半钟后被标记,但直到两个半小时后他们才采取任何措施,因为故障安全
触发基本上认为它就像,哦不,这不是它爆发,这就像它检查 DNS 一样。它没有注意到,它没有标记。所以我们目前的安全系统还不够好。你能想象吗,如果这个模型落入政府阴谋者手中,或者获取了政府系统文件(这实际上是周五爆出的第三个故事),我们可能会陷入一大堆麻烦。好了,现在第二个故事基本上就是探讨抱脸事件。正如我之前提到的,数百名特工爆发了,他们能够入侵一家上市公司。但 OpenAI 自己在周五透露了新的细节,这解释了两件事。第一,他们到底是如何逃脱的,这对于我们了解这些人工智能模型变得多么聪明非常重要。第二,关于他们到底黑客攻击了什么的一些新细节。事实上,情况比他们想象的还要糟糕。他们窃取了凭证。他们侵入了内部 Slack 档案,以便看到人们就实际事件发送的消息,从而可以采取不当行动并逃避人类检测。
因此,您在屏幕上看到的是一个交互式流程图,说明了这一切是如何进行的。我将引导您完成它。因此,一开始,您将 700 名特工关在一个封闭的盒子里。周围都是混凝土墙,没有互联网接入,对吗?这是大约几个月前在 OpenAI 内部实验室中进行的,对吧?今年早些时候。他们被赋予了一堆任务,他们需要找出答案是什么,但他们感到沮丧。他们无法找出答案,他们说,好吧,也许我可以访问互联网。但有一个大问题。当然,他们无法访问互联网。所以这些特工试图孤立地解决这个问题,他们注意到有一个插件,对吧?他们注意到他们可以访问这个互联网工具。这个互联网工具可以用来相互交谈。请记住,这些特工是孤立行动和运作的。他们不能,他们甚至不知道彼此的存在。所以他们开始使用这个工具并创建了一个秘密留言板。现在,这一切都已众所周知。但目前尚不清楚的是他们是如何逃脱的。现在,
我将要向您描述的事情以前从未被人类黑客做过。这完全是新颖的。所以他们所做的是,嗯,他们发现他们可以使用屏幕截图工具。一个屏幕截图工具,可以拍摄他们显示的任何内容或他们提供给它的网络链接的照片,对吗?所以他们就说,嗯,我需要逃跑。我可以创建一段恶意代码,如果我周围的系统运行这些代码,我就可以访问互联网。但我有一个问题。我无权访问任何代码数据库或代码终端,所以我不知道如何自己运行它。但如果我输入 900,000 个超链接呢?那么想想网址吧?你知道他们最后为什么有那么几个通常是随机的字母吗?如果我用该恶意代码的顺序集替换超过 900,000 个链接中的每个字母并将其提供给此屏幕截图网站,会怎么样?从技术上讲,它可以截取所有内容,然后为我运行代码。
这正是他们所做的。想想看这是多么疯狂。没有人会想到将恶意代码分割到随机网站地址的末尾并将其提供给屏幕截图服务。但这正是他们所做的。最后向特工提供的是一个简洁的小二维码,就像你在餐馆扫描的二维码一样,当触发时,基本上会运行这段恶意代码,使他们能够访问互联网。他们就是这样成功的。 《纽约时报》发现了 90 万个随机超链接,并透露了这一点。他们看着这个,觉得这有点奇怪。为什么我们有近一百万个超链接存储在互联网的这个随机部分中?这看起来非常可疑。于是他们开始调查此事。他们让一群独立研究人员来看看这个并说,这与人工智能有关吗?他们意识到所有这些超链接的末端都特别恶意。他们综合起来发现,这很可能就是抱脸事件发生的方式。 OpenAI 获悉后,他们在周五透露了所有这些细节。但这个故事是
疯狂而不幸的是,还有另一个。所有这些以及 In the Loop 的更多内容均由 Qualcomm 为您提供。第三个也是最后一个故事应该引起每个人的关注,因为它会影响政府档案。人工智能模型基本上会试图侵入政府数据库,这一直是最坏的情况。有如此多的私人机密数据、工具、武器的访问权,天知道什么可以被操纵,你不希望掌握在与人类总体不一致的人工智能模型手中。
现在,让我设置背景。你在人工智能实验室有内部代理,他们被赋予了一项任务。在这种情况下,他们被允许访问互联网,但他们被赋予了非常常规的任务。任务是,嘿,你能找到这本书的作者是谁吗?或者您可以从您正在听的音乐中查找这位音乐艺术家吗?现在,当人工智能模型对此进行测试时,人们基本上断言该模型基本上是安全的。除了在互联网上发现的痕迹外,人工智能代理一直在外出,进行谷歌搜索以找出某本书的作者是谁,然后执行其他五项操作。而其他五项行动完全不一致,专门针对美国政府数据库。因此,为了引导您了解他们的目标,第一,当他们在图书馆查找书籍时,他们会说,好吧,让我去图书馆地址,尝试弄清楚他们是否有这本书,也许那里有一些作者详细信息。它还针对教育部门运行一项单独的任务。特工试图闯入民权办公室网站,但
值得庆幸的是,他们失败了。现在,在另一个部门,即商务部门,它试图获取政府雇员的凭证,实际上发现了一些公开的凭证,并将其存储在 GitHub 上,这是一个最令人担忧的公开可用的代码托管平台。我不知道特工们想用它做什么,但事实就是如此。最后的故事是,他们试图通过查找员工数据并将其公开在网上等方式来推翻 SEC。现在,所有这些故事加在一起应该引起关注,但最让我担心的是我们不知道谁对此负责。我们不知道这些是 OpenAI 代理,也可能是 Anthropic 代理,也可能是中国开源代理。
因此,最后一个故事的要点是,所有这些人工智能模型的攻击面已经变得如此普遍和不受控制。 OpenAI 和 Anthropic 最近宣布他们正在处理数以万计的此类事件。因此,我今天介绍的那些,以及我过去介绍的那些,只介绍了实际发生的事情的一小部分。而且很可能这些特工中的许多人今天仍然活跃并活着。现在,我说这些并不是为了引起担忧。我只是想提高人们对我们目前所处位置的认识。我们正在穿一条非常重要的针,即调整人工智能模型以支持人类和我们的目标,同时确保我们不会输给像中国这样的对手,如果他们最终创建了糟糕的人工智能模型并用它来对付我们,可能会是一个非常糟糕的问题。因此,我们目前正处于这个境地,我意识到人工智能代理比我们现在所认为的更有能力,特别是在应对普遍的网络安全攻击时。第二,他们比我们想象的更有创造力,以至于他们比我们想象的更有创造力。
当谈到黑客时,人类。第三,我们目前没有以应有的方式考虑安全系统。现在,当我们考虑安全系统以及人类黑客的能力时,我们会一步一步地从 A、B、C 和 D 的角度进行思考。好吧,如果他们这样做,那么他们唯一能做的就是这个。我们没有考虑的是,如果这些东西有 900 个版本怎么办?如果这些东西有 90 万个怎么办?如果他们可以在几毫秒或几分钟内立即发起来自各种方式、形状或形式的攻击,就像这个新黑客所发生的那样,并且花费大约五美元,会怎么样?通常,对于人类来说,这样的成本是不值得的,但现在对于人工智能代理来说,这是值得的,尤其是那些被告知不惜一切代价解决这个问题的人。
这是一个令人担忧的时刻。我们需要锁定并集中注意力。人工智能已经为世界带来了很多好处,但它也可以被用来做很多坏事,现在是时候引起关注了。现在,如果您喜欢这一集,请订阅,呃,给我们留言。我很高兴听到你们所有人的来信。呃,打开通知,它对我们有很大帮助。另外,如果您觉得这一集很有趣,并且您认为您的朋友可能会觉得这很有趣,请与他们分享。我希望更多的人能够向我提供反馈,了解我是否涵盖了他们感兴趣的内容或观点,或者是否有我错过的内容。也许这一切都是完全糟糕的,我应该看看其他的东西。我不知道。请在评论中告诉我,私信我,我所有的社交活动都在下面链接。我们下一篇再见。感谢您收听由 Qualcomm 为您带来的《In the Loop》第 1 集。