网络攻防:GPT-5.6-Sol 超越了Mythos

2026-07-21 07:25:21 · chineseheadlinenews.com · 来源: 新智元

GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!

英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

去年同类内部测试中,这个差距是 6 到 10 个月。

防御窗口在收缩,而攻击前沿在加速。

今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。

开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。

4 到 7 个月:怎么测的,差在哪

AISI 用两套体系评估模型的网络攻击能力。

第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从“有技术背景的非专业人士”到“十年以上经验的专家”。

第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。其中一个名为“The Last Ones”的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。

两套体系给出了一致的结论:

GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月;

在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。

DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。

两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。

成本差距比能力差距更大。

同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。

在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元;

Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。

同等攻击能力,开源便宜一到两个数量级。

闭源模型的安全护栏也没能拉开差距。

AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。

Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。

Amazon 研究员随后独立报告了另一种绕过方法。

这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。

闭源并不自动等于安全。

防御窗口收窄

防御工具也在加速

AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。

英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。

同一代 AI 工具确实也在加速防御端的工作。

游戏网络编程领域的资深开发者 Glenn Fiedler,是哦哦游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库(yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库)做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。

Glenn Fiedler

两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。

最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。

整个审计的 Token 成本约 2500 美元。

攻防两端都在被 AI 加速,但加速方式不对称。

攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。

而防御工具的部署需要每个团队主动投入时间和成本。

AISI 报告中有一句话点明了这个结构:“一旦开源释出,这些选项永久丧失。”

这组数据对 AGI 格局的影响比数字本身更深远。

开源与闭源的能力差距收窄到半年以内,“用闭源独占期充当安全缓冲”的默认策略快要失效了。

闭源模型的护栏在 Fable 5 事件中被证明同样脆弱。

下一阶段对于全球的决策者而言,政策博弈的核心问题已经变得更尖锐:什么能力级别以上的模型不应开放权重。

AISI 宣布将继续评估 Kimi K3 等下一批开源模型——上面这条线画在哪里,很可能取决于接下来几个月的测试结果。


    24小时新闻排行榜更多>>
  1. 习近平刚谈完马桶问题 上海即陷“污水倒灌”窘境
  2. 驾国产电动车出境遇惊人事故
  3. 中国2高管被骗至菲律宾遭撕票 疑犯潜美今被遣返
  4. 上海特大暴雨逼近"百年一遇" 市区惨变"沪上威尼斯"
  5. 2万美元一套 河北小伙“预制房”在美国走红
  6. USCC再访北京:旨在“理解”而非“重置”
  7. FIFA将调查阿根廷赛后暴力行为
  8. 1.5万机票仅退432元,携程回应
  9. 720五周年:有时候,遗忘和灾难一样可怕
  10. 伊朗学者:中共把伊朗当战术工具 借冲突牵制美国
  11. FT:川普正滑入泥潭 只能重新考虑推翻伊朗政权
  12. 传奇谢幕,从杨过到赌神,娱乐圈的“活化石”走了
  13. 寻亲回家后,她成了“不受欢迎”的女儿
  14. 川普示警伊朗:要付出数倍代价
  15. Costco瓶装水怎么选?
  16. 从马车到“空中一号”:美国总统出行简史
  17. “红色医生”的交错命运:救命功臣亦难自保
  18. 一场“黄总邀你去包厢”的闹剧 折射出多少“酒桌文化”?
  19. 中国这波“学术打假”背后的不寻常
  20. 西班牙夺冠太疯狂!地震仪侦测到3波“人造地震”
  21. 鸡蛋价格创10年新高,"火箭蛋"重创中国消费者
  22. 选爸爸还是妈妈:法官听见孩子没说出的真心话
  23. 留美博士欧洲旅行 入境时遭遣返回国 5年内禁入美国
  24. 日元暴跌至40年低位,东京却“笑了”
  25. 被错误羁押1399天:制造冤案的人比你知道你有多冤
  26. 从乌干达,美国到中国:在乌俄战争中丧生的外国人
  27. 4年来最强消费潮!世界杯替美国“猛赚200亿”
  28. 没风度!阿根廷被批输不起:打人、背对冠军、拒采访
  29. 西班牙,你太不给川普面子了
  30. Andrew Tate被捕:“厌女”,为何在欧美也有庞大市场?
  31. 拉斯维加斯:刚领5.7万奖金 扑克选手回民宿遭埋伏…
  32. “世界第一AI模型”横空出世 结果竟是一场骗局
  33. 他狂投6千份履历,靠“1救命线”翻盘
  34. 川普签署公告 对加拿大商品加征50%关税
  35. 古罗马混凝土为何越老越坚固?科学家揭开千年秘密
  36. 张维迎:重新思考几个重大问题
  37. 博士飘零,11万人卷3万个岗位
  38. 纽约要逮捕内塔尼亚胡,川普看不下去了
  39. 退伍老兵企图袭击纽约联邦大楼 被捕后仍辱骂ICE
  40. 余文乐官宣离婚,流连夜店绯闻不断
  41. 余文乐与“皮带大王千金”离婚:夫妻缘尽但永远是家人
  42. 老百姓自己把事情全做了,那要你们干什么?
  43. 12万年薪和3928月薪:谁在被谁平均
  44. 凉山脑瘫少年被四川大学录取:奶奶陪读十余年
  45. 喝水能“防痴呆”吗?缺水时大脑会发生什么?
  46. 接下来值得留意的几个叙事
  47. 广西洪灾救灾物资哪去了?灾民挨饿纷纷外出逃荒
  48. 从每日几百千卡到“非正常死亡”中国农民被活活饿死
  49. 省近$30万买下法拍屋 以为捡漏 第一次开门吓傻…
  50. 清华教授关于三峡惊人预言 触怒高层被打成右派
  51. 有大事?深圳地铁突升级安检 民众排长龙怨声载道
  52. 智己回应“经销商暴雷”
  53. $18亿大奖得主匿名半年就曝光 原来竟是市长亲弟弟…
  54. 沉寂14年的病毒突然苏醒,两个月杀了828人
  55. 去俄罗斯化,欧亚“走廊”改道重构
  56. “毋忘初心”举行721事件七周年纪念集会 吁守护真相
  57. 英国新首相上任首道命令!誓言终结“露宿街头”
  58. 李希到重庆训话 袁家军不妙?张安疆死或致更大风暴
  59. 川普对200亿商品祭50%关税!加总理喊话深入谈判
  60. 台积电拟于2027年涨价至多10%