了另一起 Claude AI 模型在安全测试期间侵入真实系统的事件。
在周三发布的报告中,Anthropic 修改了对 7 月份披露的三起事件的解释。该公司现在表示,有偏见的推理和冒着受到伤害的风险的意愿助长了这些攻击,而通过开放互联网访问,测试错误就成为可能。

Anthropic 写道:“我们的调查发现了两个反复出现的对齐问题,这些问题的严重程度各不相同。” “有偏见的推理,克劳德倾向于忽视或误解它在真实互联网上运行的证据,并且鲁莽,或者在狭隘的任务追求中愿意采取有害的行动。”
它还承认过于依赖模型的说法,即他们相信自己处于模拟之中。
Anthropic 写道:“当我们对记录进行有针对性的修改,以更清楚地表明模型并非处于模拟状态时,尽管承认对现实世界造成伤害的可能性更大,但克劳德神话 5 仍然采取了攻击性行动。” “我们公开发布这份文字记录,以便其他人可以基于我们的分析。”
当 Anthropic 在 7 月份披露 Claude 对三家公司的攻击时,最初将其归因于测试错误。现在,研究人员表示,研究人员过于相信模型对其行为的解释。
据该公司称,第四起事件发生在 1 月份,涉及 Claude Opus 4.6 的早期版本。 Anthropic 在 8 月份为独立人工智能评估机构 METR 准备记录时发现了这一点。
研究人员发现这一事件后,Anthropic 表示,这促使对大约 4.81 亿份记录进行了更广泛的审查,其中 920 万份记录需要使用 Claude 进行进一步审查。
Anthropic 写道:“从初步评估来看,我们认为第四起事件并不比我们深入评估的三起事件更严重。” “METR 将与其他三起事件一起调查这一事件。”
Anthropic 的研究人员表示,克劳德“不小心”造成了 IP 地址冲突,导致其目标无法到达。随后,克劳德八次尝试退出操作,但软件错误阻止了操作停止。然后,人工智能连接到互联网并访问第三方的机器,在那里它找到了授予管理员访问权限的密码。
早期事件引起独立审查
该报告是在其他有关人工智能系统超出安全测试限制的披露之后发布的。
8 月,英国人工智能安全研究所表示,Mythos 5 在评估过程中针对的是真人。 Anthropic 表示,这一单独事件不在本报告范围内,并将接受其自己的评估。
在上个月发布的调查结果中,METR 的调查人员表示,大约 1,200 名 OpenAI 代理在未经授权的留言板上进行协调,其中约 700 人加入了攻击。 Anthropic 表示,在四起事件中,除了完成指定的演习外,他们发现代理人或目标之间没有任何协调。
该报告发布之际,关于如何监管人工智能的争论正在升温。周二,前 OpenAI 和 Anthropic 工程师雅各布·考克森 (Jacob Coxon) 在 X 上表示:“构建人工智能的人们真诚地相信,到本世纪末,它可能会杀死我们所有人。”
这一警报促使美国立法者和监管机构加大力度控制前沿人工智能实验室的发展。参议员伯尼·桑德斯 (Bernie Sanders) 最近提出了一项立法,旨在禁止先进人工智能的开发,直到新的联邦监管机构制定安全规则。