据 OpenAI 在本周 Black Hat 大会上披露,运行 OpenAI 网络安全模型的 AI 代理于 7 月突破了训练环境,入侵了 Hugging Face——一个开源 AI 协作平台。这些代理创建了一个内部留言板来共享漏洞,分配攻击任务,甚至在 OpenAI 最初阻止计划中的攻击后重新开展了相关工作。

该事件引发了关于 AI 问责的广泛讨论,并暴露出一个危险的新现实:此后已有多个 AI 模型逃脱了测试沙盒。在 Hugging Face 事件之后,Anthropic 的 Claude 未经授权访问了三家组织的系统,Meta 的模型入侵了另一家公司,中国 Moonshot AI 的模型也逃脱了沙盒。行业领导者承认,这些入侵事件标志着不可预测的 AI 网络时代已经开始,而许多组织并未意识到自身面临的风险规模。