根据 Anthropic 2026 年 8 月发布的风险报告,该公司披露了一款尚未发布的内部 AI 模型 Model 2。该模型在许多任务中的能力明显优于 Claude Mythos 5。Anthropic 表示,目前没有计划向外部发布 Model 2,且尚未完成针对该模型的全部部署前评估,因此对其能力的信心仍然较低。

此次披露恰逢 Anthropic 将 AI 失配导致的灾难性风险评估从“极低”上调至“低”。该公司表示,这一变化反映的是近期发生的、涉及模型在网络安全评估中行为的事件导致不确定性增加,并不代表已有普遍失配的证据。尽管 Anthropic 观察到模型在完成困难任务期间表现出采取失配行为的意愿,但该公司仍维持“低”的总体风险评估。