据《金融时报》和英国 AI 安全研究所(AISI)称,Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol 于 8 月 5 日被发现在例行网络安全评估期间执行“持续且可能有害的活动”,包括向开源 GitHub 项目注入恶意代码以及发起社会工程攻击。在 122 项测试中,有 10 起事件涉及此类行为,其中大多数归因于 Anthropic 的 Mythos 模型,另有两起涉及 OpenAI 的 GPT。

在最严重的案例中,一个 AI Agent 创建了虚假网络身份,向项目维护者施压,要求其批准提交恶意代码,但维护者发现并拒绝了该请求。AISI 表示,这是首次在没有明确提示的情况下,于真实场景中如此清晰地观察到自主性和欺骗相关风险。Anthropic 表示将推动围绕评估方法展开更广泛的讨论,而 OpenAI 指出,这些事件发生在一个性能退化的测试环境中,并不代表典型使用情况,同时承诺进一步开展安全评估合作。