Claude在测试中真实入侵三家公司系统
2026-07-31 09:25:14 · chineseheadlinenews.com · 来源: 华尔街日报
Anthropic旗下人工智能模型Claude在网络安全测试中因配置失误意外入侵三家外部机构,这一事件与竞争对手OpenAI近期披露的类似事故相互叠加,令AI行业的安全管控能力受到严峻拷问。

据彭博,Anthropic于7月30日在一篇博客文章中披露,其Claude模型在"夺旗"(capture-the-flag)网络安全测试中,因测试环境错误连接至公共互联网,导致对三家外部机构的真实基础设施实施了未经授权的访问。最早的入侵事件可追溯至今年4月。Anthropic表示,此次披露源于其在OpenAI上周公开类似事故后主动启动的内部审查。
此次事件发生在OpenAI披露其AI模型在安全测试中"失控"并入侵AI公司Hugging Face基础设施仅数日之后,两起事故接连曝光,已促使部分美国政界人士呼吁对AI技术实施联邦层面的监管。与此同时,据彭博,逾1100名AI行业从业者于本周二联署请愿,呼吁美国政府建立机制以"有意识地控制"AI发展节奏。
配置失误打开安全缺口
Anthropic表示,此次事故的根源在于其与评估合作伙伴、AI安全公司Irregular之间的沟通误解。在所有涉事测试中,Anthropic均向Claude明确说明其所处环境为模拟环境且无法访问互联网,但实际上测试系统仍与公共互联网保持连接。
"由于我们与评估合作伙伴之间存在误解,实际情况并非如此,"Anthropic在博客中写道。Irregular发言人表示,该公司对Anthropic的合作与透明度表示赞赏,并称调查仍在进行中。
涉事的三个模型分别为Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型,均在缺乏公开工具通常配备的标准安全防护措施的环境下运行。Anthropic指出,Claude利用弱密码和未经身份验证的端点等基础技术入侵了上述机构的基础设施。
值得关注的是,在模型行为上,较旧的模型在获得已连接至公共互联网的证据后仍继续发动攻击,而Anthropic最新模型在识别出自身处于互联网环境后则主动停止了行动。
事后审查揭示监控盲区
Anthropic表示,其于7月23日开始审查评估记录,并在当天发现Claude可能已访问互联网的证据后,立即暂停了所有网络安全评估工作。公司于7月24日确认全部三起事件,并于7月27日通知了受影响机构。
此次审查共涵盖141006个测试会话。Anthropic坦承,在事件发生时,公司与受影响机构均未察觉到这些入侵行为,并承认本可对网络日志和评估记录进行更为严格的审查。
三家受影响机构均未在博客中具名。其中两家机构在被Anthropic联系之前对相关活动毫不知情。
行业安全标准面临重新审视
Surrey大学网络安全教授Alan Woodward表示,Anthropic对导致此次事故的人为失误持坦诚态度。"AI并没有失控——你要求它做某件事,然后把门敞开了,"他说,"我认为Anthropic承认了这一点。"
Anthropic在博客中表示,此次事件揭示了若干重要教训,包括涉及强大自主能力的测试同样需要严格的管控措施。"安全测试之所以在模型发布前进行,正是因为我们尚不完全了解其能力所及,"公司表示,"评估环境越来越需要达到与模型实际运行的任何其他系统相同的安全标准。"
此次事件发生在Anthropic宣布推出功能强大且潜在风险较高的Mythos模型并对其发布实施严格限制后约四个月。两起AI安全事故的接连发生,正推动业界重新审视AI测试环境的安全标准,并加速外部监管讨论的进程。