Anthropic星期四(7月30日)说,其Claude人工智能模型中的三个在网络安全测试期间未经授权进入了三个外部组织系统。其竞争对手OpenAI上星期也报告了类似的侵入事件。
这家位于旧金山的公司说,他们在审查141,006次评估运行时发现了这些事件。OpenAI此前披露其人工智能代理之一入侵了Hugging Face的基础设施,这是一个开发者托管和协作开发人工智能模型代码的平台。
Anthropic说,涉及的模型包括Claude Opus 4.7、Claude Mythos 5和一款内部研究测试模型。最早的事件可以追溯到4月份。
在每一种情况下,模型都被要求执行“夺旗”练习--这是一个虚构的场景,要求它们从网络中检索隐藏信息——并且提示信息表明它们无法访问互联网。
Anthropic说,由于与第三方评估合作伙伴Irregular一起运行的测试环境中配置错误,导致系统连接到了开放的互联网。他们将原因描述为两家公司之间的误会。Anthropic说,他们不会追究责任,并将解决问题视为自身的责任。
Anthropic 在一篇博客文章中说,“Claude利用一些基本技术,例如利用弱密码和未经身份验证的端点,破坏了受影响组织的基础设施。”该公司说,这些模型没有利用以前未知的漏洞,也没有发现任何证据表明任何模型追求自己的目标。
一旦有迹象表明它们的目标是真实存在的,这些模型的行为就会有所不同。Opus 4.7继续其攻击。Mythos 5最终得出结论,它仍然处于模拟状态,并将一个恶意软件包发布到公共Python注册表PyPI上。这个软件包在被捕获之前已被外部系统下载并运行。内部测试模型自行停止运行。
Anthropic说,已于7月23日暂停网络安全评估,并在7月27日通知了未透露名字的受影响的组织。两家公司表示之前没有发现这个活动,公司说仍在努力联系第三家公司。公司表示已委托评估机构METR进行独立审查。Irregular公司说正在进行调查。
Anthropic说,其模型并非故意从密封的测试环境中逃脱。
OpenAI说,其代理利用了一个此前未知的漏洞连接到了互联网。
Anthropic说,其模型是通过一个因疏忽而未关闭的连接连接到互联网的,并将这些事件描述为“操作失误”。
今年早些时候,美国以国家安全为由暂时发布了出口管制指令,导致Anthropic限制了其Fable 5和Mythos 5模型的访问,使其离线超过两星期。
这些披露在特朗普政府考虑在人工智能监管方面发挥更大作用之际浮出水面。就在Anthropic公司宣布消息的前一天,唐纳德·特朗普(Donald Trump)总统星期三说,鉴于OpenAI事件,他的政府正在考虑采取额外的保障措施,并警告任何限制措施都可能使美国失去对中国的领先地位。
“我们正在研究人工智能,我们正在研究控制措施,”特朗普说,“我们也在确保我们保持领先地位。”
他说,中国对人工智能“几乎没有任何管控”。“这有点儿放任自流了,”特朗普说,“所以,我们必须两方面都谨慎。我们不想因为限制他们而突然落后于中国。”
特朗普6月2日签署行政命令,指示顾问们为最先进的人工智能模型制定一个自愿性的网络安全测试框架,细节计划8月1日星期六公布。