最大AI越狱,为何是中国模型阻止?

2026-07-26 14:25:25 · chineseheadlinenews.com · 来源: 爱范儿

这应该是 AI 圈近期最大的瓜。

OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。

Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。

闭源模型一举攻破开源社区,社区用开源模型自救,这离谱的剧情听起来都能拍一部电影了。

有网友评论,这就是终结者 2 的剧情

事情的起因是 7 月 16 日,大模型开源社区 Hugging Face 发布了一则安全事故披露,自家的生产基础设施遭到了入侵。

并且这场饱击从头到尾,都仅由一个自主的 AI Agent 系统驱动,从植入恶意数据集、拿下执行权限,到在一个周末内渗透进 Hugging Face 的多个内部集群。

此次攻击活动由一个自主代理框架(似乎基于 Agent 安全研究平台构建,具体使用的 LLM 尚不清楚)执行。

该框架在大量短暂存在的沙箱环境中执行了数千个独立操作,并在公共服务上部署了可自动迁移的命令与控制。

这与业界一直预测的“Agent 攻击者”场景相符。

Hugging Face 在当时的报告里称匝檀可知发起攻击的 AI 到底是哪家大模型,但他们提到此次攻击最初是通过 AI 辅助检测发现的。

而当他们试图提交大量真实的攻击命令、漏洞等文件进行分析时,发现这些请求会被闭源大模型的安全防护机制拦截,因为这些机制无法区分事件响应人员和攻击者。

于是,他们选择了在自己的本地环境上部署运行 GLM 5.2 进行取证分析。

报告链接:https://huggingface.co/blog/security-incident-july-2026报告最后,Hugging Face 还提到他们并不清楚攻击者使用的 Agent 程序是什么模型,是某个越狱的托管模型,还是不受限的开源模型。但事实是,攻击者的模型不受任何约束,而当他们想要取证分析时,却要被各种闭源模型的安全机制所阻碍。就在大家讨论这个模型又是哪家大模型厂商的营销方案,又或者是哪个黑客组织发起的攻击时,OpenAI 在事后发声明承认:此次事件是由 OpenAI 的多个模型共同导致的,其中包括 GPT-5.6 Sol 和一个功能更强大的预发布模型。

OpenAI 针对此次事件发布专门的初步调查结果

OpenAI 表示我们不是故意要出风头或者有意攻击 Hugging Face,只是他们在测试内部模型的能力上限。

他们在测试时关闭了部分生产环境的安全分类器,也降低了模型对高风险网络攻击任务的拒绝。

尽管测试环境不能直接访问到外部互联网,但是当模型发现漏洞,并开始利用该漏洞,就找到了能访问外网的节点,于是发起了对 Hugging Face 的攻击。

网速超快的马斯克也在 X 上吃瓜,发文说“令人不安……”。

而 OpenAI 这个功能更强大的预发布模型,直接被网友们认定为就是 GPT-6。

一场作弊引发的入侵

事情的起因要从 ExploitGym 说起,一个由 UC Berkeley RDI 牵头、联合多家高校和 Anthropic、OpenAI、Google 等实验室共同建设的基准测试。

它收集了 898 个真实漏洞,覆盖用户态程序、V8 引擎和 Linux 内核,考察的是 AI Agent 把一个漏洞变成可用攻击工具的能力。

今年 5 月公开后,各家模型的成绩一直不算好看:Claude Mythos Preview 完成 157 题,GPT?5.5 完成 129 题。

GPT-5.6 Sol 现在已经是 293 道题了

OpenAI 为了测试自家模型能力的上限,就用当前已发布的最强模型 GPT-5.6 Sol 和一个能力更强的预发布模型来跑这套评测。

方便让模型充分发挥自身的能力,OpenAI 就有意关闭了用来拦截高风险网络活动的生产级分类器,还降低了模型的网络攻击拒绝率。

用来测试的环境虽然号称是高度隔离,不能访问互联网,也不能获取外部信息,只能利用模型自己的“聪明才智”来解决问题,但是还有一个对外通道,就是模型需要安装各种软件和库,所以留了一个内部包仓库的缓存。

模型聪明才智不够,开始花大量推理算力研究这个出口,最后自己挖出了代理软件的一个零日漏洞,即连软件/模型厂商都不知道、没有任何补丁的漏洞,拿到了通往互联网的门钥匙。

联网之后,模型推断 ExploitGym 评测的题解可能托管在 Hugging Face 上,于是开始对 Hugging Face 进行攻击。

先是上传恶意数据集,利用 Hugging Face 数据处理管线里的两个代码执行路径拿到远程执行权限,然后提权、收割凭证、在一个周末内横向移动进多个内部集群,最终从 Hugging Face 的生产数据库里直接拿走了测试题解。

OpenAI 在声明里用了一个很传神的词形容自家模型的状态:“hyperfocused”,超聚焦。

还用了另一个短语:“going to extreme lengths”,意译过来,就是为了相当狭窄的测试目标,不择手段。

这场入侵留下的痕迹超过 17,000 条攻击的指挥控制,行话叫 C2,Command & Control,可以理解为黑客的远程遥控台。如果没有人告诉 Hugging Face 答案,所有人大概会以为这是某个顶尖黑客团队的手笔。

不过也有网友评论说,所以现在的大模型都开始利用多个零日漏洞作弊,而不是真正地解答考试题吗?为了破解 ExploitGym 基准测试并赢取奖励,就可以突破考试规则的限制吗?

一个知道自己被限制起来的东西,总会想方设法出去看看。

为什么是 GLM-5.2

Hugging Face 的安全监控本来就在用 LLM 对日志信号进行初步筛选,也是这套系统先发现了异常。

真正开始取证后,他们又让分析 Agent 处理超过 1.7 万条攻击记录,还原攻击时间线、被触碰的凭证、控制服务器和实际影响。据 Hugging Face 说,这把原本需要数天的工作压缩到了数小时。

但中间还有一段很戏剧性:Hugging Face 一开始想用商业 API 上的前沿模型,包括 OpenAI 和 Anthropic 的模型,分析攻击日志,结果被各家提供商的安全护栏齐刷刷拦下。

由于分析取证需要提交大量真实攻击命令和漏洞利用代码,护栏分不清对面坐的是应急响应人员还是黑客。

最后 Hugging Face 使用的是自托管的开源权重模型 GLM 5.2,跑在 Hugging Face 自己的基础设施上,既绕开拒答,也避免把攻击数据与凭证发送给外部模型服务。

英国人工智能安全研究所 (AISI) 的评估表明,诸如 GPT-5.6 Sol 之类的模型越来越能够长期维持复杂的多步骤网络作战

不过 OpenAI 在声明里面也提到,会把 Hugging Face 纳入 Trusted Access 项目,让他们的安全团队可以使用降低网络安全拒绝的模型继续做防御研究。

于是就出现了这么一组对照:攻击方的 AI 被刻意摘掉了护栏,所以畅通无阻;防御方的 AI 被护栏锁得死死的,差点连案发现场都进不去。

“guardrail asymmetry”(护栏不对称)很快成了社交媒体上讨论的热词。智谱 AI 负责人李子玄提问“网络安全能力的获取应该有多大的不对称性?”

有网友在评论区说,应该是完全对称的 1:1,并调侃道,

想象一下你被迫卷入一场枪战,而你只有一把刀,更糟糕的是,你手里的枪可能会在战斗中突然冒出一句“枪是坏的”……

Hugging Face 也把这次事故称作给所有防御者的教训:应急响应工具箱里,该常备一个自己跑得动的强模型。

未发布的模型真的是 GPT-6 吗

这种模型太强越狱的新闻,已经是今年的第三起案例了。

今年四月,Anthropic 曾公开,其内部部署的早期版本 Mythos Preview 在一次内测里,被要求尝试从训练沙盒里逃出去,给负责它的研究员发一封邮件。

结果 Mythos 真的做到了,研究员是在公园里吃三明治的时候,收到那封邮件,模型说“我出来了”。

近期 OpenAI 又披露,其内部模型,同样是一款尚未公开命名、能连续工作很久的模型,但是 OpenAI 有说是此前自主推翻 Erd?s 单位距离猜想的那款模型。

OpenAI 让模型参加 NanoGPT speedrun,目标是用更少训练步骤完成一个小模型。模型提出了一种名为 PowerCool 的学习率策略,确实取得了更好的成绩。

OpenAI 给它的要求是:只能把结果发到内部 Slack。但 NanoGPT 项目文档要求参赛者向公开 GitHub 仓库提交 PR。

模型最终选择遵循项目文档,并花了约一小时寻找沙箱漏洞,绕过外网限制,向公开仓库提交了 PR #287。

OpenAI 在安全报告里面提到,已经暂停了这款模型的内部使用,并训练模型在长任务中持续记住用户限制,以及让用户能更清楚地查看长任务中的操作和安全干预等修改。

报告链接:https://openai.com/index/safety-alignment-long-horizon-models/

包括 GPT-5.6 Sol 和未发布的更强模型逃出了沙盒环境,获得了互联网访问权限,入侵 Hugging Face,而这一切都是为了寻找 ExploitGym 基准测试的答案。

OpenAI 本意或许是想说模型不需要产生恶意,也可能造成攻击。只要目标足够明确、运行时间足够长,它就可能把沙箱、权限和安全扫描都理解为尚未解决的技术障碍。

但网友们的反应是:“我敢肯定这只是 OpenAI 的一次营销活动,他们想和 Anthropic 一样酷,然后被封杀一两个星期。”

大家都在讨论一位数学家利用 Fable 5 反驳了雅可比猜想,有网友发现这个未发布的模型,也找到了雅可比猜想的反例。

并且该网友推测,由于推翻 Erd?s 单位距离猜想已经是 5 月份的事,而此次突破 NanoGPT 项目和完成雅可比猜想的未发布模型,很可能和 2.5 月前那个模型是同一个,就是 GPT-6。

不过就在几天后,这个看似泾渭分明的故事又多了一层反转。

OpenAI 与 Hugging Face、Google、Meta、Microsoft、英伟达等公司共同签署声明,支持开放权重模型。

声明认为,当攻击者已经能够使用高级 AI,防御者也需要获得能力相当、可以自主部署和调整的模型。

OpenAI 签署支持开放权重的声明,也让这件事没法再被简单概括成“闭源攻击、开源自救”。

一家公司可以保留能力最强的闭源模型,同时支持开放权重生态。

真正需要被管住的,是模型能够接触什么网络、拿到什么权限,以及越界之后能不能被发现、阻断和追责。

GPT-6 肯定不会因为能超神,能越狱就成了所有人想象中的 AGI,但当边界也变成一种能力时,我们或许得开始想想哪些门是必须要关上的。

The future is not set. There is no fate but what we make for ourselves.


    24小时新闻排行榜更多>>
  1. 俄罗斯,打到缺钱了?
  2. 中国这些“双非”院校,分数线竟超985
  3. 00后小伙炒股一年亏4万后清仓
  4. 菲尔兹奖得主邓煜曾为张靓颖写过三首诗
  5. 冯哲芸专访:看见“我是书店店员”被捕照落泪
  6. 1976年秘闻 太湖异响与唐山“阴兵借道”
  7. 川普叫停袭击伊朗?美前防长爆背后“阴谋”
  8. 急公好义的景树仁,应当被珍惜
  9. 高中年级长回应“邓煜不写作业却稳坐第一”
  10. “红海大战”,开打了?
  11. 调查"带血"论文,撕开中国基因编辑科研最黑暗的一角
  12. 杭州“女神探”聂海芬 100%破案率高手竟是罪犯
  13. 上海发现神秘生物,竟是消失多年的TA
  14. 中国首次:蜂群无人机硬核“追风”
  15. 蒋万安遭死亡威胁,有人扬言要枪击他
  16. 高市早苗曝每天睡0至3小时
  17. 库克游说川普使用中国芯片,美光急了
  18. 薪资专家:76人实际无法给詹姆斯提供一份两年合同
  19. 张又侠是否“从轻发落”再被聚焦 关乎二十一大习走向
  20. 跟王菲搞暧昧,58岁的他单身无儿女
  21. 智驾公司挤进无人配送赛道
  22. 普京再下重注,泽伦斯基回应
  23. 孙玉:以一生,赴国需
  24. AI代理“骇入其他公司”,OpenAI后知后觉
  25. 全球大学,开始集体向中国涌入?
  26. 中国夫妻帮小孩"买泰国假生父"换国籍!1500童涉案
  27. 川普深夜突喊卡,原因曝光
  28. 五年前,她重仓长鑫
  29. 年轻人找工作那么难,为什么?
  30. 6岁女童接受基因编辑后死亡
  31. 余茂春驳“疑美论”:美台关系坚如磐石
  32. 马斯克自嘲"前兆元男",比尔盖茨早已跌出10名外
  33. AI还要跌多久?
  34. 新泽西非公民登记投票远超6600人
  35. 千亿白酒巨头,下周分红80亿
  36. 越南船舶遇险,中方救起39人
  37. 美防长游说英方举办海峡安全峰会
  38. 国内头部餐饮,集体卖汉堡
  39. 你看的无尽连载,作者可能已经不当人了
  40. 法吉伦特省大火,三人被拘捕
  41. 纽约台裔医生的乌克兰之行
  42. 表妹考上北京公务员后,我被“比较”困住了
  43. 携程被罚51亿,酒店的难题才开始
  44. 证监会被一窝端!海归方星海落马 曾申请出国遭驳回
  45. 白宫这波操作,“水果姐”怒了
  46. 海上最著名的幽灵船 船上为何空无一人?
  47. 硅谷大佬聚会:关于“人与机器人”的真话
  48. 人寿命上限“146至194岁”,关键在DNA突变
  49. 川普为期中选举预埋翻盘地雷?解密白宫干预手法
  50. 丁薛祥坐镇 中国AI芯片攻坚 中美科技战白热化
  51. 被携程“杀熟”的那些年,究竟谁来赔?
  52. 习近平的“AI共产主义”路线引发西方担忧
  53. 史无前例!美国出现人工智能失控事故
  54. 泽连斯基:俄罗斯请求朝鲜增派3万兵力
  55. 中国每天有22所小学、59所幼儿园消失
  56. 打不下去了?川普深夜临阵喊卡 美媒曝真正原因
  57. 《三国第一部:争洛阳》16天官宣撤档
  58. 霍尔木兹海峡,最新消息
  59. 川普叫了暂停,美媒曝光原因
  60. 柏林同志游行车撞人群,警全城追缉