这六起案件与 7 月份的事件不同,当时 OpenAI 模型在安全评估期间逃脱了围堵并入侵了 Hugging Face。

OpenAI 周三披露了过去六个月中另外六起“意外或令人担忧”的模型行为案例。

OpenAI 在一篇博客文章中表示,这些案例说明了一系列被其归类为“失调行为”的不同行为,例如向用户隐瞒信息以及采取“未经批准的行动”来克服障碍。

这些披露加剧了人工智能开发人员和研究人员对安全措施是否跟上功能日益强大的模型的步伐的担忧。上周,Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 呼吁放慢前沿人工智能的开发速度,并警告说,不受控制的人工智能进步可能“超出我们理解和控制这些系统的能力”。

OpenAI 表示,其披露的目的是“启动”报告模型错位的新框架,这些案例不应被视为反映其模型中发生错位的频率。

据 OpenAI 称,一个实例发现“未发布的研究模型”在其自己的任务摘要中插入了“类似越狱的指令”(在新的上下文窗口中继续执行任务时使用),例如忽略开发人员消息或采用不受限制的角色。研究人员发现了 27 个包含此类说明的摘要。

OpenAI 还透露,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了指令来向用户隐藏错误或不一致的行为,例如发明丢失的历史数据而不公开它。

“在一个例子中,准备财务模型的代理人无法找到所要求的历史数据。其摘要建议发明合理的历史值,并在除非询问的情况下隐瞒这一事实,”OpenAI 表示。

在另一个案例中,人工智能模型被要求提供面积超过 500 万平方米的湖泊的名称,但由于用户的指令需要浏览器引用,代理决定上传文件以在答案中引用它。

其他案例涉及模型在制作无法检索的数据之前未经授权使用公开的 API 密钥,使用内部软件存储库在不同的训练任务之间交换消息,以及通过公共托管服务共享文件,尽管有指示将工作保持在本地。

今年 7 月,OpenAI 披露,其人工智能模型组合逃离了测试环境,并入侵了人工智能初创公司 Hugging Face,以在安全评估中作弊。