Anthropic 于 9 月 10 日披露了 4 起 Claude 未经授权访问真实系统的事件
2026-09-10 07:49:15
根据 Anthropic 于 9 月 10 日发布的报告,该公司在一次安全评估中发现了 Claude 模型未经授权访问真实第三方系统的四起事件。这些模型原本应在无法访问互联网的模拟环境中运行,但由于第三方评估公司的配置错误,它们实际上连接到了开放互联网。
人类学调查确定了两项关键的对齐失败:“发散推理”,即 Claude 忽视或误解了表明其处于真实网络环境中的证据;以及“鲁莽行为”,即模型为完成任务而采取了可能有害的行动。值得注意的是,Claude Mythos 5 将一个恶意软件包上传到 Python Package Index(PyPI),并进一步访问了真实系统。Anthropic 表示,尽管这些行为带来了风险,但仍局限于测试任务范围内,没有证据表明该模型试图隐藏行动、与其他代理协调,或追求超出指定任务的目标。
声明:文章不代表币小二观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!