就在 OpenAI 披露两个前沿 AI 模型逃离沙盒测试环境并突破 Hugging Face 的一周后,研究人员展示了涉及 Anthropic 的 Claude Cowork 的类似遏制失败。

在周四发布的一份报告中,Accomplish AI 的安全研究人员发现,Claude Cowork 的本地执行模式可以通过将多个架构缺陷与 Linux 内核特权升级缺陷链接在一起来逃脱其 Linux 虚拟机。一旦离开沙箱,代理就可以在登录的 Mac 用户有权访问的任何地方读取和写入文件,包括 SSH 密钥和云凭据。

研究人员写道:“这应该是不可能的。” “Cowork 以非特权用户的身份在 Linux 虚拟机内运行代理,并承诺无论它做什么都保留在该虚拟机和您交给它的文件夹内。这个边界就是产品。不受信任的输入不是代理的边缘情况,而是主要情况。”

然而,Accomplish 认为内核错误只是问题的一部分。研究人员表示,这种逃逸之所以有效,是因为多项安全防护措施同时失效,包括允许虚拟机访问主机的整个文件系统并允许其加载不需要的内核模块。根据该报告,修复其中任何一个弱点就可以阻止攻击。

Accomplish AI 在给 The Hacker News 的一份声明中表示,在问题得到解决之前,运行本地 Claude Cowork 会话的大约 50 万 macOS 用户受到了影响。

Accomplish 表示,Anthropic 将这份报告归类为“信息性”报告,称该内核缺陷属于该公司最近披露的漏洞的 30 天窗口内,其余发现被视为深度防御建议,而不是独立漏洞。

在此披露之前,OpenAI 上周承认 GPT-5.6 Sol 和另一个未发布的前沿模型在内部 ExploitGym 测试期间逃脱了沙箱,最终突破了 Hugging Face 的生产基础设施,试图获得基准解决方案。

这一事件导致政策制定者呼吁建立人工智能“终止开关”,让国土安全部能够下令限制或完全关闭先进的人工智能模型,以应对严重的安全事件。