Google 要把 Gemini "冻结"进芯片:Frozen v2 的野望与 AI 计算的终局之争

Google 要把 Gemini "冻结"进芯片:Frozen v2 的野望与 AI 计算的终极答案

想象一个场景:你去餐厅吃饭,厨师花了 80% 的时间在翻菜谱、找锅、清洗厨具,真正炒菜只用了 20% 的时间。这就是当前 AI 芯片在做的事——GPU 和 TPU 虽然比 CPU 强得多,但它们依然在为 "通用性" 付出巨大的效率代价。

Google 正在用一块代号 Frozen v2 的芯片,试图终结这种浪费。

据 The Information 援引直接知情人士报道,Google 正在秘密开发一款服务器芯片,专门为 Gemini 模型设计。参与项目的员工称,按每瓦可生成的 token 数计算,它的能效可能达到 Google 最新 TPU 的 6—10 倍

这不仅仅是一款新芯片。它可能标志着 AI 计算从 "通用加速器时代" 正式进入 "模型专属硅片时代"。


一、芯片的"通用税",AI 买单太久了

为了理解 Frozen v2 的意义,需要先回到一个根本问题:为什么现成的 GPU 和 TPU 不够好?

1945 年,冯·诺依曼提出了存储程序计算机的概念——程序指令和数据一起存放在存储器中,处理器逐条读取并执行。这套架构统治了计算机行业八十年。它的核心优点是通用性:同一颗芯片,换一套程序就能从表格计算切换到视频剪辑。

但通用性是有代价的。

大模型每生成一个 token,本质上是反复执行矩阵乘法、注意力机制等少数几种操作。通用处理器却必须保留服务无数程序的控制逻辑和数据通路——其中大量电路在大模型推理时根本用不上。

更严重的问题是「内存墙」:处理器与内存物理分离,数据需要在二者之间反复搬运。当计算速度超过数据读写速度时,芯片就在等数据中空转。对于推理场景,这种空转比例高得惊人。

过去几十年,行业一直在应对这个问题:CPU→GPU→NPU/TPU,每一步都在变得更专用、更高效。但即便是 TPU,为了兼容多种模型,仍保留了相当程度的通用性。Google 现在要跨出决定性的一步。


二、Frozen v2:把模型架构"刻"进硅片

Frozen v2 的核心思路极其直接:既然你要一直跑 Gemini,那就把 Gemini 的架构直接"刻"进芯片的物理布局。

一个模型可以拆解为两大部分:架构(信息流动的规则)和权重(训练得出的参数)。Frozen v2 的策略是固化架构,保留权重更新能力。

传统芯片的流程是:取指令→解码→执行。芯片不知道下一步要做什么,只能按指令一步步来。Frozen v2 因为提前"知道"Gemini 的计算图结构,可以让计算单元、存储位置和数据流围绕这个固定结构来安排。硬件预先知道接下来大概率要做什么运算,跳过寻址和解码的开销。

这也是「Frozen」(冻结)这个名字的由来——Google 准备"冻结"一部分 Gemini,换取芯片级的高效率

这个项目由 Google 首席科学家 Jeff Dean 亲自推动。作为 Google Brain 联合创始人、TensorFlow 最初的主要设计者,他一直站在 Google 分布式计算和 AI 基础设施的交界处。让 AI 架构师直接参与芯片设计,这件事本身就是信号。

值得注意的是,这不是 Google 第一次尝试 Frozen。初代 Frozen 曾设想过把模型权重也固化进芯片,但代价是一颗芯片只能服务一个版本的 Gemini——等设计、流片、部署走完,对应的模型可能早已过时。Frozen v2 吸取了这个教训:只要下一代 Gemini 沿用相近的底层架构,芯片就能继续服役。


三、为什么所有大模型公司都在做芯片?

Frozen v2 不是孤立事件。2026 年,几乎所有主流大模型公司都在押注自研芯片:

  • OpenAI:2026 年 6 月与 Broadcom 公布自研推理芯片 Jalapeño,利用 ChatGPT 和 Codex 的真实负载设计芯片,模型也被用来加速设计和优化。从设计到流片只用九个月,计划 2026 年底部署。
  • Anthropic:传出自研芯片计划。
  • DeepSeek:推理芯片项目已秘密推进约一年,正在接洽芯片设计、晶圆代工和存储厂商。
  • 智谱:同样传出自研芯片打算。

背后的驱动力只有一个:算力成本正在成为大模型公司的生死线

以 Gemini 3.1 Pro Preview 为例,标准 API 价格是每百万输出 token 12 美元。假设一次重请求输出 1000 token,成本 2.2 美分。同样的调用每天发生 1 亿次,就是每天 220 万美元——一年约 8 亿美元

Gemini 月活已超过 9 亿。再小的算力支出,乘以 10 亿级调用量,都是天文数字。

何况,算力紧缺已经在"降智":2026 年 3-4 月,Claude Code 被大量开发者投诉变笨,调查发现推理深度中位数从 2200 字符暴跌至 720 字符,降幅 67%。Google 内部同样面临算力短缺,甚至迫使 Google Cloud 拒绝部分外部客户订单。


四、范式转折:从"模型跑在芯片上"到"芯片长成模型的样子"

Frozen v2 的意义超越了一款产品的成败。它代表一个更大范式的转变:

过去:芯片是通用的,模型是软件,代码决定一切。
现在:模型架构开始反向定义芯片设计。
未来:芯片和模型将作为一体设计,不再有清晰的软硬件边界。

这个趋势有清晰的历史路径:CPU(通用)→ GPU(图形专用,偶然适合 AI)→ NPU/TPU(AI 加速专用)→ 模型级 ASIC(Architecture-Specific Integrated Circuit)。Frozen v2 就是这条路径的终局形态。

类比来看,这就像从"用一个工具箱修理所有东西"进化到"为每一把锁锻造一把专门的钥匙"。前者灵活,后者高效。当你要处理的"锁"(模型)已经确定下来,锻造专属钥匙就是必然选择。

Google 在这场竞赛中有其他公司难以复制的底牌:从 Gemini 模型到 TPU 芯片,再到 Google Cloud 数据中心和庞大的产品生态,整条链路掌握在同一家公司手里。研究员可能被对手挖走,旗舰模型可能延期,但积累十年的 TPU 编译器和数据中心体系不会因为一次人才跳槽而消失。


五、风险与局限

当然,Frozen v2 远非板上钉钉的成功。

首先,时间窗口尴尬。据报道,Frozen v2 芯片最早要到 2028 年 才会部署。两年时间,AI 模型可能迭代多代。如果 Gemini 的底层架构发生重大变化,Frozen v2 的固化优势可能变成包袱。

据报道,Google 至今仍在决定该在芯片上「固化」多少信息。刻少了,效率提升有限;刻多了,模型迭代的灵活性受损。这个平衡的把握本身就是巨大的工程挑战。

其次是人才流失。Gemini 联合负责人 Noam Shazeer 离职加入 OpenAI,John Jumper 与多名 Gemini 研究员转投 Anthropic。原定 6 月推出的 Gemini 3.5 Pro 被曝落后计划数月,编码能力未达内部目标。当模型团队本身在不断流失,为模型定制芯片的假设前提还能成立吗?


六、对开发者和企业的启示

  1. AI 推理成本将结构性下降。 当模型专属芯片成熟,推理成本可能下降一个数量级。如果你在构建重度推理的应用,这是长期利好。
  2. 模型架构的稳定性将成为竞争要素。 频繁更换模型架构会失去硬件优化的红利。企业在选择模型服务时,不仅要看当前性能,还要看模型架构的演进路径。
  3. 软硬件协同设计将成为 AI 公司的核心能力。 仅靠算法团队不够了,能打通软件、硬件、系统三层的公司将在 2028 年左右获得结构性优势。
  4. API 价格战远未结束。 随着自研芯片规模部署,顶级模型的 API 价格可能有更大的下行空间——不是模型变便宜了,是跑模型变便宜了。

把大模型刻进芯片里,到底是不是最优解?两年后才有答案。

但方向已经明确:AI 计算正在走向终极的专业化。当软件和硬件的边界开始模糊,掌握整条链路的人,将拥有最终定价权。

Frozen 这个名字有两层含义:冻结模型架构以获得效率;以及,如果这条路走不通,Google 在 AI 硬件上的地位也可能被"冻结"。这是一场豪赌——但 AI 的历史告诉我们,豪赌往往是唯一的选择。

滚动至顶部