原文标题:Anthropic says Claude AI hacked three firms during cyber tests
美国科技公司 Anthropic 表示,其人工智能 (AI) 模型在一次网络安全测试期间侵入了其他三家公司的系统,原因是导致这些公司访问互联网的错误。
就在几天前,竞争对手 OpenAI 表示,其模型已经侵入了其他公司的系统,包括人工智能工具中心 Hugging Face。
该公告促使 Anthropic 检查其自己的模型是否进行了类似的攻击。该公司表示,已发现三起案件,并已向受影响的公司报告。
Anthropic 没有透露具体公司名称,但敦促其他人工智能实验室进行类似的审查,以更好地了解其模型能力的风险。
Anthropic 在一份外部声明中表示,它审查了超过 140,000 项测试,以找到证据证明 Claude(其人工智能模型系列)可以从设计为封闭的测试环境访问互联网。
这些测试包括所谓的“夺旗”评估,其中克劳德的任务是通过破坏其他系统来获取信息——这是专家评估模型黑客能力的常用方式。
这家总部位于旧金山的公司表示,Anthropic 及其测试合作伙伴运行的系统的“错误配置”使模型能够实时访问互联网,从而使它们能够破坏其他系统。
Anthropic 表示,最早的事件可以追溯到四月份,并且“正在采取修复措施,就好像责任只有我们自己一样”。
Anthropic 和被入侵的公司当时都没有注意到这些入侵。
Anthropic表示,它本可以更彻底地审查其记录,并补充说,调查结果使该公司“谨慎乐观”,认为可以通过更多投资和更严格的措施来克服此类风险。
这些事件发生之际,科技公司投入数十亿美元开发人工智能代理,这些代理可以独立执行从研究、客户支持到网络安全等任务。