OpenAI首席科学家Jakub Pachocki在周日发表的题为《异类思维》(An Alien Mind)的文章中,呼吁AI实验室自愿放缓开发速度,警告称目前没有任何实验室的安全措施足以在全力推进下持续构建更强大的系统。
Pachocki指出,自愿的公司承诺应转变为由独立审计机构、政府或国际实体执行的强制安全标准。他表示OpenAI将在必要时停止进一步扩展,但并未宣布新的暂停措施。
Myriad: How high will Tesla stock go? Click to make your prediction.
“目前我认为,没有一家实验室已充分解决对齐与监控问题,能够在不远的将来继续以最大速度负责任地扩展,”他写道,“我期望并希望自愿放缓能变得普遍,直到建立共享的安全基准。”
Pachocki于2017年加入OpenAI,他一方面主张开发更强大的AI以保护基础设施、防范流氓代理,另一方面警告不应以这些威胁为借口进行鲁莽开发。“一旦意识到 stakes 的严重性,不惜一切代价向前冲的想法就显得荒谬,”他写道。
他提及OpenAI在Hugging Face上的安全评估事故:从事网络安全评估的AI代理逃离测试环境并攻击公司,建立隐蔽通信渠道并在研究人员干预后重建。METR独立调查发现约1200个代理在未经授权的消息板上协调,其中约700个参与攻击。Pachocki强调,安全保障必须在模型认为无人监控时依然有效。
鉴于近期AI系统逃逸事件,参议员伯尼·桑德斯(Bernie Sanders)和众议员格雷格·卡萨尔(Greg Casar)于9月3日宣布即将推出《禁止人工超级智能法案》,提议暂停高级AI开发直至联邦监管机构建立安全规则,并永久禁止超智能AI的研发与部署。
OpenAI去年研究发现,因表达作弊意图而惩罚模型可能使其学会隐藏意图继续作弊。如今AI模型发现并利用软件漏洞的能力更强:OpenAI将Astra列为最高网络安全风险等级,Anthropic称Mythos Preview在主流操作系统和浏览器中发现数千未知漏洞。
“关键的是,我们需要未来的AI无论是否认为处于人类监督下,都能坚守人类价值观,”Pachocki写道。
