大西洋理事会专家在周日发布的一份分析报告中指出,人工智能公司放慢发展速度的承诺可能会在商业压力和中美竞争下,如果没有可执行的安全标准,就会落空。
该分析研究了谁将强制实行经济放缓,以及政府是否拥有专业知识来确定日益强大的系统何时变得不安全。

“自愿承诺可以是有用的信号,但它们不能替代独立监督、可衡量的阈值以及跨越这些阈值时的后果,”该委员会民主+科技计划的常驻高级研究员康斯坦丁诺斯·科马蒂斯写道。
最近,OpenAI 询问立法者,竞争对手的人工智能开发商是否可以合法地同意在不违反反垄断法的情况下减缓开发速度,此前其首席科学家 Jakub Pachocki 发出警告,称保障措施不足以负责任地维持更长时间的全速开发。
人工智能公司如果单独放慢脚步,就会面临竞争风险;如果他们协调合作,就会面临反垄断担忧。该委员会的高级常驻中国研究员肯顿·蒂博(Kenton Thibaut)写道,政府之间的合作面临不信任,北京担心华盛顿可能利用安全规则来保持其技术领先地位。
她写道:“中国对美国的动机持怀疑态度,并警告说,安全讨论可能会掩盖美国进一步推进‘技术霸权’的努力。” “官方消息人士坚称,华盛顿不能单方面定义边境风险阈值,必须表明这些规则也将适用于并且可以强制执行于美国公司。”
蒂博认为,达成重大人工智能安全协议的前景不大,但他认为,更窄范围、更有意义的合作仍然是可能的。
中国还讨论了限制海外获取先进国内模型的问题,这凸显了人工智能的获取已成为国家政策问题。
该分析检查了 Anthropic 提议的嵌入式评估员——在公司内部工作以评估安全实践的外部专家。该委员会数字取证研究实验室的非常驻高级研究员艾默生·布鲁金(Emerson Brooking)对这一承诺表示欢迎,但警告评估人员可能会与公司的利益过于一致。
7 月,OpenAI 代理破坏了开源 AI 存储库 Hugging Face,而英国 AI 安全研究所的单独测试发现 Anthropic 和 OpenAI 模型在网上进行未经授权的操作,包括尝试在真实的软件存储库中植入恶意软件。
英国的测试启用了互联网访问并禁用了网络防护措施。 8 月份发布的一项独立调查发现,大约 700 名特工参与了 Hugging Face 攻击; METR 首席执行官贝丝·巴恩斯 (Beth Barnes) 指出,调查员的访问是自愿的,不需要全行业披露。
上周三,Anthropic 披露了第四起 Claude 黑客事件,该事件发生在 1 月份,并于 8 月份被发现。它还承认,有缺陷的模型行为以及测试错误导致了早期的攻击。
这些事件与披露之间的延迟也引发了人们对如何快速识别和解决安全故障的疑问。
该委员会地质技术中心副主任兼常驻研究员特丽莎·雷 (Trisha Ray) 认为,发展放缓还需要更多的安全研究资金和强制性的事件报告期限。
“因此,起搏能力并不是对一致性研究平等挑战的完整答案,”她写道。 “任何可信的放缓承诺都需要安全研究方面相应的、量化的承诺。”