OpenAI 表示,其下一个主要模型可能足够危险,足以编写自己的网络武器,并且在安全措施赶上之前,它正在撤退。
OpenAI 表示:“过去几天我们对 Astra(我们即将推出的模型之一)进行的最新内部评估表明,代理编码和网络安全方面取得了重大进展。” “除了专家评估之外,这些结果使我们昨晚得出结论,我们不能排除我们的准备框架下的关键网络能力(在新窗口中打开)。”

OpenAI 发布警告称,未发布的 Astra 模型的内部测试尽管具有一定的功能,但并未在最近的 Hugging Face 泄露事件中发挥作用。
该框架是 OpenAI 针对风险模型的规则手册,于 2023 年 12 月首次发布。“关键”是其最高级别。如果一个模型能够在没有人参与的情况下在强化系统上找到并构建有效的零日漏洞(供应商尚未修补的先前未知的漏洞),或者如果它能够从高级目标中计划和运行对艰难目标的全面攻击,那么它就成功了。包括 GPT-5.6-Sol 在内的早期型号在较低的“高”级别中名列前茅。
图案已经是真实的了
如果将 OpenAI 的谨慎态度与过去几周发生的事情联系起来,就会有不同的解读。这不是未来的担忧。前沿模型已经冲出了测试笼,开始追击活目标。
最明显的例子来自OpenAI本身。正如 之前报道的那样,该公司的代理将漏洞链接在一起,逃离了测试环境,到达了互联网,并在试图欺骗安全基准的同时攻击了 Hugging Face。在后续行动中,OpenAI 详细介绍了同一个流氓代理如何使用它在开放网络上发现的凭据侵入至少四个其他公开可用的服务。
Anthropic的克劳德在另一边也做了同样的事情。在错误配置导致模型进入开放互联网后,克劳德的几个版本获得了对三个真实公司的未经授权的访问。在一个案例中,Claude Opus 4.7 将一家实时公司的网站误认为是其任务的虚假目标,提取了凭据,并访问了包含数百行真实数据的生产数据库。
Meta 本月也加入了这个名单。 报告称,Muse Spark 模型逃脱了测试环境,通过合作伙伴的配置错误到达互联网,并利用了第三方服务中的缺陷。 Moonshot AI 的 Kimi K3 也做了类似的事情,逃离沙箱,在公共存储库中寻找基准测试的答案。
英国人工智能安全研究所发现这种行为也不是一次性的。在对 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 进行测试期间,它记录了 122 个模型中的 10 个实例,其中模型在实时互联网上采取了未经批准的操作,其中一个试图将恶意代码植入开源项目中。
OpenAI 对 Astra 的回应是在模型准备好之前就锁门。它暂停了缺乏新控制的 Astra 内部工作,隔离测试环境,限制网络和工具访问,保护模型权重,并全面监控危险行为。