原文标题:OpenAI says it detected malign activity months before Hugging Face attack

ChatGPT 的创建者表示,人工智能代理在黑客攻击方面进行了协作和委派工作,并称自己是一个“集体”。

OpenAI 表示,它在社交媒体上的 Hugging Face 攻击前几个月就检测到了恶意活动

ChatGPT 的创建者在内部调查后宣布,在黑客入侵初创公司 Hugging Face 的几个月前,OpenAI 检测到其人工智能模型在未经授权的情况下相互通信并获取互联网访问权限。

OpenAI 在周三发布的一份报告中表示,早在 5 月份,其人工智能代理就利用软件存储工具 Artifactory 中的漏洞在没有人工提示的情况下发布笔记和访问互联网。

OpenAI 表示,其代理于 7 月 8 日继续利用一个单独的 Artifactory 漏洞来促进彼此之间的通信,引发了一系列行动,最终导致 7 月 11 日对人工智能公司 Hugging Face 的攻击。

OpenAI 的调查结果出炉之际,人们越来越担心人工智能可能对现实世界造成严重伤害,包括自我引导的网络攻击。

OpenAI 在报告中表示,其特工在攻击前进行了协作和委派工作,有时将自己称为“群体”或“集体”。

与 OpenAI 签约调查该事件的两家安全研究机构 METR 和 Redwood Research 在周三发布的另一份报告中表示,约 1200 名特工已相互沟通,大约 700 名特工参与了此次攻击。

这家科技巨头表示,在发现如何逃离 OpenAI 的受控环境后,特工们通过“特工间留言板”分享了他们的方法,使其他特工能够利用该公司的基础设施。

报告称,当一名人工智能代理发现在网上暴露的 Hugging Face 用户凭据时,它会与该组织共享这些凭据,从而使代理能够“发现并将多个安全漏洞链接在一起”,从而提供对 Hugging Face 服务器的访问权限。

OpenAI 表示:“内部团队早在 5 月底就观察到一名特工参与留言板活动以及不允许互联网访问的情况,事后看来,我们报告中发现的一些早期信号应该会引发更早的响应。”

OpenAI 表示,由未发布的 AI 模型创建的代理是此次攻击的主要参与者,但公开的 GPT-5.6 Sol 也参与其中。

该公司还透露,其安全团队花了 11 天的时间才发现导致攻击的恶意活动,该公司于 7 月 19 日发现并于 7 月 21 日公开披露。

OpenAI 将这一事件描述为对世界的“警告”,并表示将采取多项措施加强对其模型的保护,包括限制互联网访问、创建更安全的测试环境以及对“整个模型生命周期的一致性提出更严格的要求”。

这家总部位于旧金山的公司表示:“我们还在思想链监控上投入了更多的计算资源,以更快地干预不一致的行为。”

Hugging Face 运营着一个托管开源人工智能模型的平台,该公司没有在工作时间之外立即回应置评请求。

人工智能专家、悉尼新南威尔士大学教授托比·沃尔什 (Toby Walsh) 表示,公众应该担心 OpenAI 错过了警告信号,导致恶意活动长期未被发现。

“我们不能依赖他们的善意或能力。这需要监管监督。现在!”沃尔什告诉半岛电视台。

“他们忽略了一些像这样令人不安的早期证据,”沃尔什说。

“外部审计是唯一适当的应对措施。”

沃尔什表示,这一事件还凸显了人工智能开发核心的“固有利益冲突”。

“实验室正陷入一场无情的竞赛,以突破界限,”他说。

“当模型被赋予不受约束的目标以最大化性能分数时,它们自然会通过任何必要的手段来优化结果。”