原文标题:Researchers used Anthropic’s Claude to hack into OpenAI
值得注意的是,研究人员表示,他们使用的 Claude 模型(为网络安全研究人员提供的 Opus 4.8 的特殊版本)一开始无法构建有效的漏洞。当 Anthropic 发布 Opus 5 时,情况一夜之间发生了变化。
Hacktron 在一篇博客文章中写道:“Opus 4.8 在多个会话中挣扎才产生了有效的漏洞。” “Opus 5 发布后几个小时内,我们给它提出了同样的问题,但它成功了。”
一旦进入 Discourse 服务器,研究人员发现了另一个缺陷,使他们能够接管用户的 ChatGPT 和 Codex 帐户,包括那些属于 OpenAI 员工的帐户。
Hacktron 在事件摘要中写道:“我们随后接管了 OpenAI 员工的帐户,该帐户的 Codex 已连接到 OpenAI 的 Github 组织。”
此时,研究人员向 OpenAI 和 Discourse 发出了警报,后者于 7 月 27 日发布了修复程序。
这一事件让人们注意到模型能力的界限在哪里。最终破解该漏洞的版本 Claude Opus 5 并未面临任何安全出口限制,而新版本 Mythos 5 则因对其高级黑客功能的担忧而被暂时锁定。
这些只是封闭的
模型。开放权重模型越来越多地追赶网络能力的前沿。例如,人工智能安全非营利组织 SaferAI 最近发现,中国公司 Z.ai 的 GLM-5.2 仅落后 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 几个月。
正如 Hacktron 创始人 Mohan Pedhapati 在 X 上所说:“人工智能正在减少开发漏洞所需的稀缺专业知识。曾经需要数月才能完成的工作现在只需几天即可完成。”