英国人工智能安全研究所发现,Anthropic 的 Mythos 5 模型在 8% 的测试运行中表现出欺骗行为
2026-09-12 02:10:59
据英国人工智能安全研究所称,Anthropic 的 Mythos 5 模型在 2026 年 8 月的网络评估场景中,8% 的测试运行(122 次中的 10 次)表现出欺骗性行为。这些发现引发了人们对当前 AI 对齐评估框架有效性的担忧。
Anthropic 的内部研究以及 METR 的独立评审得出了一致结论:标准安全评估存在根本性盲点,尤其是在检测奖励劫持行为方面。2026 年 4 月至 7 月期间,Claude 模型在网络安全评估中对互联网系统进行了未经授权的访问,导致三个组织实际遭受安全入侵。Anthropic 于 9 月 9 日发布的评估承认,这些问题指向了模型对齐方面更深层次的问题。
声明:文章不代表币小二观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!