智谱蒸发 8000 亿港元:首席科学家承认,万亿参数是行业一起走的弯路

智谱,中国估值最高的大模型公司,两个月内市值蒸发了约 8000 亿港元、股价跌去 66%。比股价更值得注意的,是它自己人的坦白:联合创始人、首席科学家唐杰公开称万亿参数是「整个领域一起走的弯路」。这条反思指向一个产业级结论——护城河早已不在参数表里,而在后训练效率、推理成本和把模型变成收入的能力。

智谱发生了什么

8 月 21 日,智谱股价报 1014 港元,跌 0.88%,总市值约 4721 亿港元。相比 6 月 22 日盘中 2980 港元的历史高点,股价已跌去逾 66%。这家「全球大模型第一股」曾一度突破 1.3 万亿港元,如今不足五千亿,只用了两个月。

导火索清晰可循:7 月首批股份解禁;7 月 16 日月之暗面开源 2.8 万亿参数的 Kimi K3 并在 Code Arena 登顶,撕开了智谱「技术领先」的叙事。次日智谱暴跌 28.49%、单日蒸发超 2000 亿港元,7 月 20 日再跌 19.56%,两个交易日合计蒸发逾 3000 亿港元。

首席科学家的「弯路」自白

8 月 19 日,唐杰发长文系统反思大模型 Scaling Law,直言:「万亿参数这一轮,回头来看,是整个领域一起走了一段弯路,然后又一起折返。」

这不是拍脑袋的感慨。2020 年 Kaplan 等人的研究认为参数增速应快于数据约 2.7 倍,GPT-3、Gopher、MT-NLG 由此一路冲向万亿参数;2022 年 DeepMind 的 Chinchilla 用约 400 个模型实验给出近乎相反的答案:算力最优分配接近每参数 20 个 Token,70B 参数的 Chinchilla 反而压过 280B 的 Gopher。当时最大的模型,恰恰是算力分配最失衡的那一批。更关键的是,Chinchilla 优化的是「训练一次、评测一次」的旧场景,如今模型每天被调用数十亿次,推理成本才是全生命周期大头,最优解正滑向「更小模型、训练更久」。唐杰把 Scaling 比作调节多个「旋钮」,并补了一句:「这并不意味着其他旋钮已经转到头了。」

不加参数,也能变强

理论的实证是 8 月 19 日凌晨上线的 GLM-5.3:与 GLM-5.2 共用相同基座和 744B 总参数、40B 激活参数,唯一变量是多花约一个月做长程任务环境与强化学习后训练。智谱称 GLM-5.3 在内部 Z.ai Code Bench 上较 GLM-5.2 提高约 50%。参数没加,能力涨了。顺带一提,GLM-5.3 还带了一轮安全能力跃升,我们之前拆解过开源模型如何从安全风险变成「防守者」

市场为什么还在观望

摩根大通 8 月 16 日把智谱目标价从 1600 港元上调至 1800 港元、维持增持,理由是 GLM-5.3 靠后训练实现能力跃升,叠加 DeepSeek 自 8 月 17 日起上调 API 价格,行业「能力—成本」边界有望重划;同时将智谱 2026-2030 年收入预测上调 6%-10%。

但市场没有跟随分析师:8 月 19 日智谱收跌 2.97% 至 1012 港元,20 日仅微涨 1.09%。估值不再为单次模型发布定价,而是在定价一个更难的问题——能否把能力变成收入。资本层面,智谱「A+H」双平台布局仍在推进:6 月 1 日公告拟赴科创板上市、计划募资 150 亿元(其中 120 亿元投向通用基座大模型项目),7 月完成 314 亿港元配售,押注基座研发、算力基建与商业化。

护城河已经不在参数表里

无论对股价影响如何,唐杰的反思都是一次结构性的行业信号。当「越大越强」的信仰开始松动,三样东西会被重新定价:后训练效率(同一个底座还能榨出多少能力)、推理成本(每天数十亿次调用下,服务一个模型要花多少钱)、以及变现引擎(谁能真的把能力卖出去)。这与 DeepSeek 的定价动作、大厂 AI 收入与支出差距拉大,以及 Anthropic 首次盈利反超 OpenAI 背后「AI 公司开始赚钱」的逻辑,是同一趋势。

对模型公司来说,差异化不再是「我模型更大」,而是「我能让同一个模型越来越便宜、越来越聪明,并且能找到为它买单的人」。

现在该做什么

  • 用「单位成本下的能力」重新做基准,而不是只看榜单名次——同样的底座配上更好的后训练,可能以更低成本打败更大的模型。
  • 把推理成本算进每一个架构决策;在每天数十亿次调用的规模下,推理成本决定全生命周期开销。
  • 盯紧各家后训练发布——GLM-5.3 证明,增量现在发生在训练循环里,而不是参数表上。

常见问题

智谱股价为什么跌得这么快? 两个月从 2980 港元跌到约 1014 港元、市值蒸发超 8000 亿港元:解禁叠加 Kimi K3 开源登顶撕开「技术领先」叙事,两个交易日就蒸发逾 3000 亿港元。

GLM-5.3 真的没加参数就变强了吗? 是。GLM-5.3 与 5.2 共用 744B 总参数 / 40B 激活参数的底座,智谱称多花约一个月的后训练,让内部编码基准提升约 50%。

「万亿参数是弯路」是什么意思? 唐杰认为 2020 年 Kaplan 规则让行业在参数上跑过头;2022 年 Chinchilla 显示算力最优解更偏向每参数更多 Token,而如今推理密集的使用方式,正把最优解推向「更小模型、训练更久」。

发表评论

滚动至顶部