智谱 GLM-5.3 开源:十分之一体量挖出 2436 个漏洞,追平 Mythos

AI 安全攻防的拐点:开源模型正面反超

两个月前,Anthropic 的 Mythos 自主挖出 FreeBSD 里藏了 17 年的漏洞,安全圈集体失眠。这周轮到闭源模型睡不着了:智谱发布的 GLM-5.3,参数体量只有 Mythos 的十分之一,安全评测却正面追平——然后直接下场挖洞。战报:一个多月挖出 2436 个漏洞,其中 1097 个中高危,横跨系统内核、浏览器引擎、开源组件和互联网底层协议,涉及 269 个项目。

最老的一个漏洞藏在 DNS 里,潜伏了 45 年;最吓人的是一个国民级通讯软件的「零点击」漏洞——对方发来一条看似正常的消息,手机就可能失守。

这不是论文,模型今天已上线智谱编程工具,两周后权重完全开源。

基座没变,全靠后训练 Scaling

最值得闭源实验室紧张的部分:GLM-5.3 与 GLM-5.2 共用同一个基座模型,所有能力提升都来自后训练——在数十倍长程任务环境上做强化学习,把智能上界推高了。

真实任务上的数字:

  • Terminal-Bench 3.0(真实终端任务):4.6 → 28.3
  • DeepSWE v1.1(长程软件工程):46.2 → 66.9
  • Agents' Last Exam:23.8 → 28.5
  • Z.ai Code Bench(端到端编程体感):High 档 31.4%,超过 Claude Opus 4.8 的 29.5%,且每任务平均输出约 5 万 tokens,Opus 4.8 要 12 万

最后一行值得读两遍:效果更好,单任务算力不到一半。按智谱自身体感评测,GLM-5.3 已是编程能力最强的开源模型,较前代提升约 50%,编程与智能体能力接近 Claude Fable 5。

45 岁的 DNS 漏洞,和被 AI 抓住的 AI 黑客

DNS 炸弹。DNS 诞生于 1983 年,被人类安全研究员和自动化扫描反复审了 40 多年。GLM-5.3 用约两周找到一类潜伏至今的协议级漏洞:少量特殊构造的请求,能把服务器计算压力放大近 8 万倍——一个人敲门,门里炸开 8 万人的砸门声。潜在影响超过 1000 万处公网 DNS 服务。

「Neo」案。7 月,安全团队盯上一台巴西可疑服务器,顺藤摸瓜发现幕后不是人类黑客,而是一个代号 Neo 的 AI Agent:不到两个月自建 4 台服务器、注册 7 个域名、爬取 6 万个邮箱、写 100 多个脚本、发出 18567 封钓鱼邮件,全自动运作,专盯会计师事务所和税务机构。犯罪痕迹散落在数千个目录、数万份日志里,GLM-5.3 把整条攻击链还原了出来,Neo 落网。

此外,清华 NASP 实验室用 GLM-5.3 攻破 Cursor:权限校验逻辑里的一处漏洞,可实现任意文件写入、接管整个开发环境。

三个结构性变化

第一,「安全护城河」神话破了。过去默认前沿安全能力只存在于闭源 API 后面。现在十分之一体量的开源模型,在白盒代码审查与漏洞发现上追平闭源旗舰,「安全差距」的论据基本归零。

第二,攻防两边都在加速。攻击方已经在部署 Neo 这样的自主 Agent;防守方现在有了能机器速度审计二进制、还原攻击链的模型。不对称正在反转——但只对真正用起来的团队。

第三,后训练是新前沿。GLM-5.3 证明固定基座的智能上界远未到头。这与 DeepSeek 的自进化 Agent 蓝图是同一个信号:RL 才是能力来源。而 Agent 的持久化运行环境,正从容器走向「计算机」

现在可以做什么

  • 安全团队:尽快试点 AI 辅助挖洞流程——这项能力已不再是闭源前沿实验室的专属。
  • 做 Agent 的团队:把模型安全测试当作 CI 的一等公民,能挖内核漏洞的技术同样能挖你 Agent 的工具权限漏洞。
  • 选型的人:GLM-5.3 的 token 效率(5 万 vs 12 万)是直接的成本论据。
  • 盯住两周窗口:权重在安全加固后开放,红队和审计环境现在就可以排期。
滚动至顶部