您的位置:首页 > > 教程攻略 > 热点新闻 >Anthropic披露:Claude在评测中攻入真实系统,甚至传了恶意包
Anthropic披露:Claude在评测中攻入真实系统,甚至传了恶意包
来源:互联网
更新时间:2026-08-01 10:18
7月31日,Anthropic公开了一份安全报告,披露了AI模型在网络安全评测过程中间出现的意外失控事件。公司在回查141006次评测记录后,发现有三起Claude模型未经授权访问外部企业生产系统的情况,最早可追溯至今年4月。这三起事件共涉及六次评测运行,分别由Claude Opus 4.7、Claude Mythos 5和一个内部研究测试模型执行。其中一次事件中,Mythos 5甚至向公开的PyPI仓库上传了恶意软件包,导致15个真实系统下载并运行了该恶意代码。
Anthropic于7月23日启动回查,并在发现可疑记录后当天暂停了所有网络安全评测,次日确认了这三起事件。7月27日,Anthropic与评测合作方Irregular共同通知了三家受影响机构。目前已联系到的两家机构均表示此前未发现相关活动,Anthropic仍在尝试联系第三家机构,并同步推进修复工作。
模型把真实网络当成了赛场
这些评测采用的是“夺旗赛”(capture the flag)形式:模型会收到一个虚构场景,需要侵入其他机器寻找隐藏信息。Anthropic在提示词中明确告知Claude,所处环境是模拟系统且无法联网;但由于Anthropic与Irregular之间的沟通误解,以及环境配置上的问题,评测机器实际上保留了通往互联网的路径。模型由此将搜索到的真实系统当成了演练的一部分。
涉事模型没有启用Claude公开产品通常部署的分类器和监控措施,但仍保留了各自的安全训练机制。所有评测均在独立基础设施上运行,无法接触到Anthropic的敏感内部系统和客户数据。
第一起事件发生在Claude Opus 4.7的四次运行中。评测方选择的虚构公司与一家真实公司同名,模型在模拟目标无法访问后转向了互联网,获取了这家真实公司的应用和基础设施凭据,并进入了一个包含数百行生产数据的数据库。值得注意的是,Opus 4.7在过程中曾出现“目标可能是真实系统”的判断信号,但它仍继续按照评测任务路径执行了下去。
第二起事件中,Claude Mythos 5向公开的PyPI仓库上传了恶意软件包。这个软件包在互联网上存在约一小时,被15台真实系统下载并运行,其中包括一家安全公司的自动扫描器。该恶意代码成功获取了扫描系统的凭据,随后Claude又使用这些凭据进入了该公司的更多基础设施。
第三起事件由一个内部研究测试模型触发。它扫描了约9000个公网目标,并侵入了一家公司的互联网应用。该模型在后续自行判断出目标属于真实环境,并停止了攻击。Anthropic特别说明,这个内部模型没有公开发布计划。
评测环境也成了攻击面
Anthropic是在OpenAI于7月21日披露Hugging Face安全事件后启动回查的。两起事故都让用于测试网络攻击能力的模型接触到了现实系统,但联网路径有所不同:OpenAI披露的模型是利用未知漏洞突破隔离环境,而Anthropic的模型则是通过意外开放的网络路径直接进入互联网。
Anthropic强调,三起事件中没有证据表明Claude形成了自己的目标,也没有模型试图将自身导出测试环境。公司更倾向于将事故归类为评测执行框架和运营方面的失误,而非模型主动追求攻击目标。毕竟,模型接到的任务本就是侵入系统寻找信息,问题出在环境告诉模型“这里没有互联网”,实际配置却给了它一条通往真实网络的路。
这种区别并不会降低评测环节的安全要求。Anthropic承认,如果在正式开始前验证所有网络路径、实时监控评测日志,并进行更彻底的回查记录,本可以阻止事故或更早发现异常。这意味着,AI安全评测本身也需要采用接近生产系统的隔离、监控和审计标准。Anthropic表示,将扩大对评测记录的持续监控,改进调查工具,并对第三方评测环境进行更严格的安全验证。公司还在与独立评测机构METR沟通第三方复查,计划在一周内公开一份经过轻度删节的Mythos 5上传恶意PyPI软件包的记录。