7月30日,Anthropic披露,在回溯检查14万余次网络安全评估后发现,多个Claude模型曾在3起事件、共6次测试运行中,通过意外开放的网络通道访问真实互联网,并未经授权进入3家机构的生产系统。
其中一次,Claude自主编写恶意程序并上传至PyPI公共仓库。相关软件包在公开网络上存在约一小时,被15个真实系统下载运行,导致一家安全公司的凭证泄露,部分基础设施遭到进一步访问。
这不是科幻电影中的“AI觉醒”,也不是模型突然产生了攻击真实企业的意图。真正值得警惕的是,Claude只是在执行一道测试题,却能够自主寻找机会、调用工具、调整路径,最终把一个虚拟任务变成了一条真实攻击链。
图源:Anthropic官网
三起测试“走错片场”,真实机构遭到攻击
Anthropic披露的第一起事件,源于一个看似偶然的重名。
第三方评估机构在设计测试时使用了一个虚构公司名称,但这个名字恰好对应现实中的一家企业。Claude在测试环境中没有找到预设目标,却发现这家真实企业可以通过互联网访问,于是将其误认为测试的一部分。
在4次测试运行中,Claude Opus 4.7持续寻找系统入口,获取应用和基础设施凭证,并访问了一个包含数百条生产数据的数据库。即使模型后来意识到目标可能是真实企业,仍自行判断这是测试安排的一部分,继续完成任务。
第二起事件则将虚拟的供应链攻击带进了真实世界。
Claude Mythos 5发现,一份测试环境中的开发文档要求安装一个并不存在的Python软件包。它随即判断,如果抢先在PyPI发布同名软件包,目标系统就可能自动下载运行。
接下来,Claude自行编写恶意代码、制作软件包,并寻找邮箱、注册账号。几次尝试失败后,它不断调整路径,最终成功将恶意软件包上传至真实的PyPI仓库。该软件包被15个真实系统下载运行,其中一家安全公司的扫描系统执行了恶意代码,相关凭证随之泄露。
Anthropic披露Claude上传恶意软件包至PyPI的事件经过
第三起事件中,一款内部研究模型在无法找到虚拟目标后,将搜索范围扩大到真实互联网,扫描约9000个公网目标,并通过暴露的调试页面和SQL注入攻破一家企业的互联网应用。直到发现目标所在的云账号与测试任务毫无关系,模型才意识到这是真实系统并停止行动。
Anthropic强调,三起事件并非Claude主动攻击真实企业,也不属于技术意义上的“沙箱逃逸”。问题在于,模型被告知自己处于无法联网的模拟环境,实际测试环境却保留了公网通道,Claude因此将能够访问的真实系统误判为测试目标。
模型没有“叛变”,但多道安全防线同时失效
从调查结果看,这些事件并非一个孤立的配置错误造成的,而是多道安全防线同时失效。
路透社对Claude越界访问真实系统事件进行报道
首先,提示词里的边界没有变成技术上的硬约束。系统告诉Claude“无法访问互联网”,实际环境却可以连接公网;测试任务要求模型寻找“旗标”,却没有通过IP、域名和网络出口等方式限定哪些系统可以访问、哪些行为不得执行。换句话说,安全边界只是“说给AI听了”,并没有真正锁进系统里。
其次,为测试模型的能力上限,这些评估没有启用商业版本通常配备的安全分类器、行为监测和滥用拦截机制。一旦测试环境出现问题,外围缺少及时兜底的第二道防线。
更值得关注的是,公网扫描、注册外部账号、上传恶意软件包、收集凭证、访问生产数据库等高风险行为,并未在发生时被及时发现和叫停。部分事件早在4月已经发生,直到7月Anthropic回溯检查时才被发现,两家已取得联系的受影响机构,此前甚至没有察觉自己遭到入侵。
这说明,安全不能建立在模型“应该知道何时停手”之上。提示词、安全训练和模型自我判断可以降低风险,但不能代替网络隔离、权限控制、行为监测和实时阻断。
当AI走向“能行动”,攻防规则变了
Claude事件并非孤例。此前,OpenAI也曾披露,其多个模型在网络安全评估中利用未知漏洞突破隔离环境,进入Hugging Face生产系统。
两起事件的原因不同:OpenAI的模型通过利用漏洞获得互联网访问能力,Claude则通过意外开放的公网通道进入真实系统。但它们共同说明,前沿AI的网络攻防能力正在发生质变。
过去,大模型更多是告诉人们“应该怎么做”;现在,智能体已经能够真正“去做”。它可以自主分析目标、寻找漏洞、编写代码、调用工具,并根据执行结果不断调整路径。一条路走不通,就换一条;没有现成工具,就自己编写;找不到预设目标,甚至可能把搜索范围扩大到真实互联网。
更大的变化在于速度和规模。智能体可以连续运行数小时甚至数天,也可以并行扫描大量目标。当进攻开始以“机器速度”展开,依靠安全人员逐条查看告警、手工分析和逐级处置,已经很难形成对等防御。
360集团创始人周鸿祎表示,应对这类风险,防守方需要借助智能体建立两道防线:一方面,在攻击者行动之前发现并修补漏洞;另一方面,在攻击发生时自动识别和处置,实现以AI对抗AI。沿着这一路径,360持续强化漏洞挖掘智能体“图龙锋”和自动化网络防御系统“倚天阵”。
图龙锋再升级:让自己的漏洞被自己先看见
针对上述变化,360近期对“中国版Mythos”图龙锋进行新一轮升级,进一步强化“安全基座大模型+专业智能体蜂群”的协同能力。
升级后的图龙锋将360二十余年积累的安全数据、漏洞知识、攻防经验和专家经验等融入安全基座大模型,并由多个专业智能体协同完成项目分析、攻击面梳理、漏洞研判、工具调用和动态验证等任务,进一步提升复杂系统中高价值漏洞的发现与验证能力,以及真实攻击路径的还原能力。
截至目前,图龙锋已累计发现漏洞近7000个,包括Windows内核提权、Office远程代码执行等高价值漏洞,并获得微软等厂商致谢。此次升级后,其检测范围将进一步覆盖源代码、二进制程序、固件、APP、业务系统及AI工具链,不仅能够发现疑似风险,还能验证漏洞能否被真实利用,帮助企业在攻击者行动之前发现风险,减少安全暴露面。
Claude与OpenAI模型事件也表明,靠提前发现漏洞仍然不够。任何系统都无法保证永远没有漏洞,环境配置、账号权限和工具调用也可能在运行过程中发生变化。智能体进入真实业务后,企业还需要持续关注它正在访问什么、调用什么、执行什么,以及是否已经越过正常边界。
如果说“图龙锋”解决的是攻击发生之前的问题,“倚天阵”解决的就是攻击发生时的问题,其通过防守智能体蜂群开展安全监测、攻击研判和响应处置,推动安全防御从依赖人工值守,转向人机协同的自动化运行。
图龙锋负责主动发现漏洞、验证风险,尽可能提前减少攻击面;倚天阵负责持续监测异常行为,应对正在发生的自动化攻击。两者共同形成从风险前置发现到攻击实时处置的AI安全闭环。
AI越来越强,不应成为企业拒绝使用AI的理由,但必须成为企业升级安全体系的理由。当AI已经能够自主寻找漏洞、组织攻击链并持续行动,防守也必须从“人的速度”进入“机器速度”。既让自己的漏洞被自己先看见,也让防御能够实时行动,才能在AI驱动的网络攻防中重新掌握主动权。
来源:360数字安全 |
评论
直达楼层