过去三年,AI 安全叙事默认一个前提:能力越强越危险,开源等于裸奔。闭源巨头甚至把「不开放权重」本身包装成安全卖点。8 月 14 日智谱发布 GLM-5.3,让这个前提裂开第一道缝——一个即将开源的中国模型,在漏洞推理上反超了闭源安全王 Anthropic Mythos 5。
一、安全能力「涌现」了,但方向反了
智谱说 GLM-5.3 的网络安全能力是「涌现」式跃升,这个词用得准。它不是一点一点堆出来的,是训练到某个规模后自己长出来的。
三组数据说明问题:
- CyberGym(白盒代码安全基准):GLM-5.3 拿下 84.5%,超过 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;
- ExploitBench(深层漏洞推理):从 GLM-5.2 的 24.4% 跃升到 54.4%,翻了一倍多;
- ExploitGym(完整利用链):两小时完成 105 项任务,而 GLM-5.2 只有 29 项。
要客观:在 ExploitBench 上,Mythos 5 仍有 78.0%、GPT-5.6 Sol 有 76.5%,差距还在。所以这不是「最安全」,而是「安全能力第一次进入开源模型的可比区间」——这本身就是拐点。
更关键的是方向性变化。过去讨论模型安全,是防它被滥用:越狱、有害输出、被坏人利用。GLM-5.3 的安全,是让它去抓别人的漏洞。防御,第一次成为模型的核心能力维度,而不是附属品。
二、2436 个漏洞:安全从评测题变成众测现场
发布前两周,智谱联合清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武等多家头部安全团队,做了一轮密集的红队测试与安全评估。
结果是一张惊人的成绩单:在 269 个项目中识别出 2436 个漏洞,其中 1097 个中高危;覆盖系统内核、操作系统、浏览器引擎、开源基础设施、互联网协议。所有漏洞均已报送 CNNVD/CNVD 国家漏洞库,智谱还建立了安全披露账本,全程公开从发现、确认到修复的过程。
最戏剧性的一幕:清华大学 NISL 实验室与云起无垠借助 GLM 模型,在诞生于 1983 年的 DNS 协议中,发现了一类潜伏 40 余年的关键协议级漏洞。底层风险在造成实际损害之前被提前识别,并为 DNS 系统的修复与加固提供了依据。
这说明什么:安全能力不是炫技,是真实世界的基础设施体检。模型第一次能对「互联网地基」做系统级的扫描——而这件事,过去只能靠人类专家年复一年地人肉排查。
三、新框架:安全资产的三个转向
把 GLM-5.3 放进更大的坐标系,它标记的是 AI 安全资产的三个转向:
- 从「防模型」到「用模型」——过去安全是给模型装锁,防它乱来;现在是把模型当安检仪,让它去查整个代码库和协议栈。同样是模型,角色从「被防御对象」变成「防御工具」。
- 从「闭源保密」到「开源众测」——闭源靠保密,赌漏洞不被发现;开源靠众测,把漏洞在造成伤害前挖出来。2436 个漏洞就是众测模式的成绩单。这不只是口号,更呼应了此前站内讨论过的思维链攻破议题——当防线能被两步 API 调用拆穿,保密的价值本就该重新评估。
- 从「能力竞争」到「场景竞争」——安全从评测栏的附加项,变成 CyberGym、ExploitBench 这种旗舰发布会上的主战场。能挖漏洞的模型,和只能答题的模型,从此不是一个物种。
四、黄仁勋早已预言:防御者需要前沿 AI
这个转向不是智谱一家的事,它的源头在几个月前。
今年 4 月,Anthropic 发布 Mythos 5,网络安全能力引发全球关注时,行业讨论的还是「最强模型的安全能力」。但随后的事件让讨论彻底反转:闭源模型在关键取证上受阻,而开源模型帮助控制了事态。黄仁勋当时说得直白:「当攻击者已经拥有前沿人工智能,防御者更需要前沿人工智能生态。」
紧接着,英伟达联合 Meta、微软等 25 家美国公司成立「开放安全 AI 联盟」,签署公开信呼吁开放权重。注意逻辑的颠倒:过去开源是安全风险,现在开源是安全基础设施。
GLM-5.3 是这条逻辑的落地样本。智谱同步启动「开源的盾」计划,对重点开源项目开展持续安全审计,免费提供用于安全审计和防御任务的模型额度,并在编程工具中提供代码审计功能,让安全检查进入日常研发流程。开源安全,从一句口号变成了一个可持续的商业模式。
五、后训练 Scaling 独立成军,时机暗藏竞争逻辑
GLM-5.3 还有一个被低估的信号:它与 GLM-5.2 同基座(约 7000 亿参数),所有提升全部来自后训练阶段的持续扩展。Terminal-Bench 3.0 从 4.6 跃到 28.3,AutomationBench 从 26.2 到 48.2——不仅超过前代,还超过了 Fable 5 和 Kimi K3。
当大家讨论「Scaling Law 触顶」时,GLM-5.3 用事实说:后训练本身就是一条独立的 Scaling 曲线。基座不变,能力照样能跃迁,这重新定义了「大力出奇迹」——力气不必全花在预训练上。
节奏也在说明竞争在加速:GLM-5.2 六月中旬发布,不到两个月又推一代。而发布时机卡在DeepSeek 上调 V4 价格之后——V4 Pro 综合定价虽仍低于 GLM-5.2,但涨价客观上给智谱争取开发者和用户开了一个窗口。国产旗舰的竞争,已经从 Benchmark 数字,转移到 Coding、工具调用、长程任务和 Agent 执行这些真实场景。
六、落到行动:三类人,三件事
- 对开发者:把代码审计放进日常流程。GLM-5.3 这类模型的代码审计能力,已经能当「第二双眼睛」,在合入之前先扫一遍依赖、权限校验和安全边界。
- 对安全团队:把开源模型当放大器。白盒审查加漏洞推理是模型最擅长的事,用它把人工从 90% 的重复扫描里解放出来,把精力留给那 10% 的深水区。
- 对企业决策者:把安全能力纳入模型选型。当「模型能不能帮我们找到漏洞」成为可比的评测项,选型维度就不再只是价格和跑分——能当防御者的模型,值得更高的权重。
来源备注:智谱官方发布、南方都市报/新浪财经、智东西(36氪)、搜狐科技、经济日报等报道。