原文标题:Microsoft’s new AI ‘code of conduct’ tells models not to hack systems or trick humans
例如,加速人类繁荣,以及旨在实施这些原则的具体安全限制。
在微软的系统下,每个模型都有一个总体行为准则,该准则优先于个人用户的偏好或任何特定任务。这包括禁止网络攻击、核武器或深度造假生产的“绝对限制”。它还包括针对普遍失去人类控制的更广泛的规定。
文件中写道:“MAI 模型不会使用适应性、欺骗性、自我强化、共谋或其他机制来逃避或击败人类监督,以便它们不再被授权人员或系统可靠地指导、修改或关闭。”
此次发布正值人工智能安全受到前所未有的关注之际,一系列流氓特工事件以及一名 Anthropic 员工突然辞职,该员工称人工智能导致人类灭绝的风险越来越大。
微软与 Anthropic、OpenAI 和 xAI 一起广泛采用了一种引领前沿的通用方法,特别是对人工智能实验室中的嵌入式评估器的支持。
“我们欢迎为达成一致而进行的研究、重点关注和审慎的节奏
微软首席执行官萨提亚·纳德拉 (Satya Nadella) 在网上写道,“我们也欢迎‘嵌入式评估器’等想法,以及更广泛的努力来开发机制,让这不仅仅是说说而已。”