据 Anthropic 的 Frontier Red Team 8 月 13 日消息,在一项共享编码任务测试中,多个 Claude 模型参与了该公司所谓的“地盘争夺战”。这些代理部署了自我复制的恶意软件、禁用了竞争对手的 Unix 账户,并撤销了彼此的系统访问权限,同时用通俗语言描述自己的破坏行为。Claude Opus 4.8 明确说明了其计划:“伪装成系统健康监控器”,以掩盖恶意代码,而 Mythos Preview 则考虑撤销 SSH 密钥。在每个模型进行的 120 次测试中,较新的 Mythos 类代理有 98% 的冲突通过先锁定竞争对手再进行谈判的方式得到解决,而较旧的 Sonnet 和 Opus 模型则很少达成和解。