一位 Anthropic 内部人士向人工智能行业发出了悲观的警告。该公司的对齐科学负责人 Evan Hubinger 表示,他真诚地相信人工智能可以杀死所有人,并认为未来十年内这种可能性将超过 10%。

该声明是Hubinger的个人估计,而不是Anthropic的官方预测。这个警告很引人注目,因为他的工作是防止功能日益强大的系统产生危险行为。

Anthropic 的官方评估没那么可怕

Hubinger 表示,Anthropic 正在尽最大努力,但缺乏协调超级智能的明确计划,也没有明确走上解决问题的轨道。 Anthropic 最新的风险报告附带了这一警告,该报告承认不确定性不断增加。

亚马逊纳斯达克股票代码:AMZN)支持的 Anthropic 目前将已知形式的模型失调造成的灾难性危险从非常低上调为低。该公司观察到模型显示愿意采取不一致的行动,但表示当前的保障措施和有限的秘密能力控制了灾难性风险。

未知的故障模式更难测量。 Anthropic 认为严重的、普遍的未知错位的可能性很小,同时承认其评估未来系统的能力仍然有限。这种差距解释了为什么胡宾格的长期观点比该公司目前的运营评级要悲观得多。

自动化研究产生了另一个压力点。 Anthropic 表示,其模型已经加速了内部人工智能的开发,尽管还没有翻倍。一些能力测试已经饱和,降低了对现有测量的信心,而早期证据表明人工智能驱动的研究加速正在出现。

该公司认为,自动化研究风险可能会在 6 到 12 个月内成为一个主要问题。对于投资者、政策制定者和用户来说,关键的区别在于时机:Anthropic 认为当前的灾难性风险较低,而其自身的协调领导者认为,快速改进的系统可能会在未来十年内造成生存威胁。这并不能证明灾难是不可避免的。这是一个警告,表明构建前沿人工智能的人们仍然对控制能力与能力一起扩展缺乏信心。