智谱发布GLM-5.3模型,性能比肩Fable 5

2026-08-13 23:25:17 · chineseheadlinenews.com · 来源: 华尔街日报

智谱发布7000亿参数旗舰模型GLM-5.3,通过后训练扩展在编程与网络安全领域实现重大突破。其智谱 Code Bench编程能力提升50%,在部分高难度任务上超越Claude Opus 4.8;网络安全挖掘能力“涌现”,现实代码库中已累计识别2436个漏洞。模型权重将在两周内开源,在DeepSeek上调价格之际进一步强化其市场竞争力。

智谱最新旗舰模型GLM-5.3正式亮相,在编程能力和网络安全漏洞发现方面取得重大突破,向Anthropic、OpenAI等AI头部企业发起新一轮挑战。

据智谱官方声明,GLM-5.3基于与前代GLM-5.2相同的7000亿参数基础模型构建,所有性能提升均来自后训练阶段的持续扩展。在自研评测基准智谱 Code Bench上,GLM-5.3的编程能力较GLM-5.2提升50%;在开源编程基准Terminal-Bench 3.0上,得分从4.6跃升至28.3。

智谱介绍模型时表示:GLM-5.3专为编程而生,随时迎接网络防御挑战。GLM-5.3在网络安全漏洞挖掘能力上亦出现超预期的"涌现"式跃进,在现实代码库中累计识别出2436个安全漏洞。

智谱表示,模型权重将在发布两周后公开,届时将完成安全评估与加固工作。此次发布恰逢DeepSeek昨日上调旗下V4模型定价,进一步加强其在国内AI市场的竞争地位。

编程能力大幅跃升,超越Claude Opus 4.8

GLM-5.3的核心突破集中于复杂编程与长链路任务。智谱官方数据显示,在智谱 Code Bench的最高难度设置下,GLM-5.3以约7.5万个输出token完成了34.5%的任务,而GLM-5.2在消耗更多token(9.6万)的情况下,完成率仅为23.4%。在高难度设置下,GLM-5.3以约5万个token达到31.4%的完成率,超越了Anthropic的Claude Opus 4.8(29.5%,耗用12万token)。不过,GLM-5.3目前仍落后于Claude Fable 5——后者在最高难度设置下完成率为39.5%。

在公开基准测试上,GLM-5.3同样表现亮眼:DeepSWE v1.1得分从46.2升至66.9,Agents' Last Exam得分从23.8升至28.5。

为实现上述进展,智谱在后训练阶段大幅扩展了训练环境的规模与多样性,引入更贴近真实工程场景的任务——部分任务的工作量相当于一名经验丰富的工程师数天的工作量。智谱还构建了自动化流水线,用于端到端合成训练环境及强化学习奖励信号。

网络安全能力"涌现",已披露逾两千个漏洞

在网络安全领域,GLM-5.3展现出超出预期的能力跃升。在智谱引入漏洞发现数据和训练环境后,模型不仅能够识别单一缺陷,更开始跨多个漏洞利用阶段进行综合推理,形成完整的利用链路规划。

在CyberGym基准测试中,GLM-5.3以84.5%的得分超越Anthropic的Mythos 5(83.8%)和OpenAI的GPT-5.6 Sol(83.6%),位居榜首。在要求更深层漏洞推理的ExploitBench上,GLM-5.3得分从GLM-5.2的24.4%跃升至54.4%,涨幅超过一倍;但与Mythos 5(78.0%)和GPT-5.6 Sol(76.5%)相比,仍有明显差距。在ExploitGym测试中,GLM-5.3在两小时内完成105项利用任务、六小时内完成130项,而GLM-5.2的对应数字仅为29项和39项;Mythos 5则以181项和247项保持领先。

智谱表示,这些能力已延伸至真实世界的实际应用。自GLM-5.2以来,智谱与中国多个安全团队合作,针对现实代码库运行模型测试,经专家审核、筛查与去重后,在269个项目中识别出2436个漏洞,其中中高危漏洞1097个,涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web应用及网络协议等领域,部分漏洞在代码库中已存留数十年,最早可追溯至约40年前。智谱已为此建立"智谱安全披露账本",持续公开披露进展。

开源策略叠加竞争格局变化,市场空间打开

在商业层面,GLM-5.3的发布时机颇具战略意义。DeepSeek于本周四宣布将旗下V4 Flash和Pro模型价格上调最高四倍,尽管V4 Pro的综合定价仍低于GLM-5.2,但此举客观上为智谱争取用户和开发者提供了窗口。Artificial Analysis给予DeepSeek顶级模型与GLM-5.2相同的智能评分53分,两者均落后于Kimi K3以及Claude Fable 5、GPT 5.6等模型。

智谱计划以宽松许可证开放GLM-5.3的模型权重,以吸引更广泛的开发者群体。这一策略与GLM-5.2的路径一脉相承——后者发布后,智谱市值一度冲至1370亿美元,超越拼多多和网易(NetEase)等互联网巨头,此后虽回落至约800亿美元,但较今年1月在香港上市时仍增逾十倍。

据彭博此前报道,智谱已完成一座数据中心的建设,部署了至少1万枚国产芯片,用于GLM系列模型的研发与推理。其年度经常性收入(ARR)于今年7月达到10亿美元。


    24小时新闻排行榜更多>>
  1. 纽约布碌崙华人社区6203号地下室突遭搜查
  2. 交158元承诺返380万?"国家项目"骗局17人获刑
  3. 朱镕基离世 许多谜底有了答案
  4. 困扰数学圈22年的难题,被协和实习医生解决了?
  5. 被制裁几十年,伊朗咋还越来越强硬?
  6. 郭德纲暴雷仅1天,陈年旧事被扒干净
  7. 台风雨重创北京 “白海豚”浇透半个中国
  8. 美拟投5000万控芯片溯源,防对华出口管制遭规避
  9. 川习会成果卡关 美中投资委员会5月成立后未曾磋商
  10. 纽约时报:“最强”厄尔尼诺现象正如何改变世界
  11. 《十万个为什么》为何被打成大毒草?
  12. "我曾是切尼的心脏医生,川普看起来身体不太好"
  13. 三星堆最诡异的谜团是什么?
  14. 朱镕基去世时间有疑?五前常委去世 今年十将领身亡
  15. 习近平做一事惹怒41国 现代8国联军要中方给交代
  16. 知情人爆朱镕基被蔡奇人马贴身监视 旧部落马、病亡
  17. 男子将收款码贴功德箱上,3天收款900多元
  18. 伊州彩民独中$10.4亿强力球头奖
  19. 诺贝尔得主揭低生育率关键:女性怕遇“猪队友”
  20. 薄毕瓜发文悼念朱镕基 引发海外华人热议
  21. 闪迪豪言:2028-30营收中高双位数增长
  22. 高善文:最后的清醒者
  23. 市场不再完全押注美联储年内加息
  24. 美国7月PPI同比涨幅收窄至4.7%
  25. 中国多行业限制出境延至体制外 海关严查很多人被劝返
  26. 纽约要开“供销社”?美式“社会主义”能玩多久?
  27. 川普政府开发AI工具 打击“协助中国”的贸易伙伴
  28. 升糖最快的主食被揪出,是米饭的4倍
  29. 自闭少年写“光时”口号,煽动罪名成立
  30. 朱同志如何面对人生低谷?那20年他很少对外讲起…
  31. WSJ:人去了哪里?三星堆最诡异的谜团是什么?
  32. 2028年民主党总统候选人仍不明确
  33. 马斯克打开了魔盒?美国CEO开始纷纷拿天价薪酬
  34. 扎克伯格:与中国相比,美国有个明显劣势
  35. 大众电影百花奖投票结果公布,王宝强获得0票
  36. 39岁的他猝死公司马桶上 官方:没在座位不算工伤
  37. 入秋第一双鞋,就选棕色
  38. 白宫新报告《大转运骗局》 控40多国帮中国逃关税
  39. 巴拿马运河大堵船 平均等10天 有货轮花400万“插队”
  40. 中国年轻人海外求学为何降温?
  41. “最会拍姐弟恋”的传奇导演,突然去世
  42. 这次百花奖,扯下内娱遮羞布
  43. 7年亏掉2亿,邹市明45岁“听老婆的话”重返拳击场
  44. WorkBuddy上线远程控制
  45. 30年期美债标售得标利率创新高
  46. 以国防部长誓言:继续驻留黎巴嫩
  47. 谷歌推出Gemini 3.7 Flash模型
  48. 太子集团又一“幕后大佬”找到了?美检方披露身份
  49. 卢比奥上节目 爆战争部长家的猫和肯尼迪“酸菜”趣事
  50. 《我的前半生》“诈尸”翻红了
  51. DeepSeek Harness开发者预览版:一切皆插件
  52. 福建一船厂起火救援时发生爆炸 致12伤含10名消防员
  53. 暑假去了一趟天安门广场 游客:到最后快崩溃了
  54. 中国催婚新招:银行也能办结婚证
  55. 一只“白海豚”,凭什么浇透小半个中国?
  56. 朱镕基国企改革 工人失业血泪 东北、南方老哥争不休?
  57. 500美元起家致富!币圈大亨坠楼前诡异 爆粗对话曝
  58. 郭德纲被立案后,我有一个问题不敢大声问…
  59. 中国靠40国“洗产地”躲关税!白宫公布名单
  60. 战争进入第7个月 伊朗究竟还能撑多久?