Transformer专用芯片签下10亿美元大单,AI芯片的「通用时代」正在结束

流片成功、融资8亿、预售10亿美元——一个信号,不是孤立事件

"这家公司只做跑Transformer的芯片。"

这句话放在两年前,VC会礼貌地把你的名片放进碎纸机。放在昨天,它价值50亿美元。

2026年6月30日,硅谷AI芯片初创公司Etched结束隐声状态,一次性放出三张牌:Transformer专用芯片Sohu成功流片、累计完成8亿美元融资(最新一轮5亿)、签下10亿美元客户订单。投资人名单包括了Andrej Karpathy、Geoffrey Hinton、李飞飞、Peter Thiel——AI圈半壁江山。

但真正值得关注的不是融了多少钱,而是这笔钱背后揭示的结构性变化:AI芯片正在从"一个架构吃所有"走向"专用化分裂"。Etched的10亿美元订单,是这个分裂的第一个量级验证。

一、Etched赌的是什么——以及为什么这次不一样

1.1 一粒"刻死"的硅片

理解Etched,需要先理解ASIC(专用集成电路)和GPU的根本区别。

NVIDIA的GPU是通用芯片:它能跑Transformer,能跑CNN,能挖矿,甚至能跑CUDA写的俄罗斯方块。通用性的代价,是大量晶体管在跑任何特定任务时都在闲置。跑Transformer推理时,GPU上相当比例的逻辑单元和内存带宽被浪费在执行与Attention无关的计算路径上。

Etched的Sohu走的是另一条路:把Transformer的Attention计算直接"刻"进硅片,作为固定逻辑电路,而不是在可编程计算单元上跑软件。没有kernel launch延迟,没有内存分配开销,没有调度器决策——芯片里只有为Attention设计的物理电路。

代价是什么?卷积跑不了,SSM跑不了,Diffusion U-Net也跑不了。如果明年Transformer被新的架构取代,Sohu就是一块昂贵的废硅。

这是一个极端的赌注:Transformer架构已经足够稳定,值得为它放弃所有可编程性

1.2 数字不谈感情

Etched宣称的数据值得仔细看:8张Sohu组成的服务器,在Llama 70B推理上可以实现每秒50万token的吞吐量。作为对比,一张H100在同样场景下大约每秒700 token。

换算下来,一台Sohu服务器大约相当于160张H100。每美元性能——Etched声称是GPU的140倍。

这种量级的效率差距,已经不只是在"更好的GPU"维度上竞争,而是在改变推理的经济模型。当推理成本降低两个数量级,很多原本算不过来的应用场景——比如实时Agent协作、长上下文推理、全量级搜索——会从"理论上可行"变成"商业化可跑"。

这恰恰是Etched拿到10亿美元预售订单的原因。愿意在量产前签下这种规模的合同,说明客户已经在早期原型上跑通过了真实负载,而且结果足够好。

二、三岔路口——AI芯片产业链正在分裂

Etched的出现不是一个孤立事件。2026年上半年,AI芯片行业发生了一系列标志性事件:Cerebras完成55亿美元IPO,Groq融资6.5亿美元,OpenAI联合Broadcom发布首款自研芯片,Amazon、Google、Meta各自推进自研芯片路线。

这些事件指向同一个事实:AI芯片正在走向三岔路口

2.1 路线一:通用GPU——NVIDIA的"卖铲子"模式

NVIDIA卖的是通用计算铲子,不管你挖什么矿。它的优势是生态成熟(CUDA)、部署灵活、模型迁移成本为零。劣势也越来越明显:对于已确定工作负载的客户来说,GPU里浪费的晶体管和带宽,是实打实的成本。

当推理规模从万卡级别走向百万卡级别时,"通用"的效率折价不再是可忽略的摩擦——它是账本上每年数亿美元的纯支出。

2.2 路线二:云厂商自研——绑定业务的"专用但封闭"

Google TPU、AWS Trainium、Meta MTIA——这些芯片深度绑定各自云平台和业务需求。优势是成本可控、优化极致。但生态封闭,技术外溢有限。你做不了"买一张Trainium跑你自己的模型"这件事。

2.3 路线三:第三方专用ASIC——Etched们定义的"第三个选择"

Cerebras、Groq、Etched——这些公司不做通用芯片,不打入云生态,而是为特定计算模式造极致优化的芯片,然后卖给所有人。

它们的共同逻辑是:当生态足够统一时,专用芯片的成本优势可以覆盖所有通用性损失。Etched之所以能宣称"不需要客户改代码"——直接用PyTorch训练的模型就能跑——是因为Transformer的模型格式和推理接口已经足够标准化。专用芯片只需要对接这个统一层。

这在ASIC芯片历史上是少见的。以往ASIC往往意味着新的编程模型、新的软件栈、新的迁移成本。Sohu绕过了这个问题,不是因为它做得更好,而是因为Transformer生态替它做完了标准化的工作。

三、归零框架——为什么"通用溢价"在缩水

这三条路线的竞争,本质上是同一个问题的不同回答:当一件工具99%的时间只做一件事时,为剩下1%的通用性多付的代价,值不值?

这个问题的答案,取决于两个变量:

变量A:工作负载的确定性。2018年你买AI芯片,不确定Transformer会不会被别的架构取代——所以你买GPU,保留改换赛道的灵活性。2026年,Transformer统治了语言、图像、视频、代码、音乐生成——"保留灵活性"的期权价值缩水了很多。

变量B:规模带来的绝对成本。当你的推理集群是几十张卡,GPU的效率折价是"可以忍受"的。当你的推理规模是数十万卡,这个折价直接决定你能不能把产品定价降低到够覆盖市场。

这两个变量正在同时向"专用化"的方向移动。我把这个观察称为"归零框架"

当工作负载确定性趋近100%,且规模趋近无穷大时,通用性的溢价趋近于零。

这不是说NVIDIA会被取代。通用GPU仍然在研发原型、新架构探索、多任务场景里有不可替代的价值。但推理——AI行业最大、增长最快的成本中心——正在加速脱离"通用"的范畴,进入"专用优化"的战场。

四、推演——这个框架还能解释什么

归零框架不只在芯片领域适用。

在AI模型侧,我们看到同样的趋势:小型专用模型(DeepSeek的MoE变体、7B级专用模型)正在从"通用大模型"手里抢走垂直场景市场份额。不是大模型不够好,而是当你的任务域确定时,一个更小、更专用、更便宜的模型提供了更好的ROI。

在基础设施侧,专用推理服务(Together AI、Fireworks、Groq Cloud)的定价远低于通用云API,原因一样——他们在堆栈的每一层做了专用优化,而不是跑在通用云基础设施上。

在企业采用侧,"用一个模型做所有事"的思路正在被"为不同任务配置不同模型"取代。这不是倒退,这是AI技术走向成熟的标准路径:先统一,再分化。

五、落到行动——不同角色该怎么应对

如果你是AI基础模型公司:推理成本的下一个量级下降,不会来自更好的GPU,而是来自专用硬件。如果你是头部模型公司,你应该已经在和Etched、Cerebras这类公司做POC。如果还没有,你的推理成本曲线可能在18个月后落后竞争对手一个数量级。

如果你是AI应用的CTO:2027年之前,你的推理架构选择会从"唯一的NVIDIA"扩展到至少三个选项。不要等到专用芯片量产了才开始测试。现在就用API级方式对接这些新平台,跑你的真实工作负载——因为迁移成本和兼容性问题,只有跑了才知道。

如果你是投资者:AI芯片的"赢家通吃"叙事正在松动。NVIDIA不会倒下——但它可能从"唯一的基础设施"变成"基础设施之一"。这个从一到多的过程,会催生新的百亿美元公司,也会埋掉一批拿到订单却交付不了的团队。赌Etched能否兑现Sohu的承诺,比赌NVIDIA是否会增长更有意思。

如果你是技术观察者:Etched不等于"ASIC赢了",但它是一个信号——足够强到让你重新审视"GPU统治一切"这个2023年的共识在2026年还剩下多少解释力。归零框架是一个工具,用它去检验你所在领域的"通用性溢价",你会发现到处都有类似的裂缝。


来源备注:本文素材来自Etched官方公告、TechCrunch报道、Spheron.network技术分析、量子位、雷锋网等。技术参数来自Etched官方发布和第三方分析,尚未经独立验证。

参考:
- TechCrunch: Nvidia competitor Etched hits $5B valuation, $1B in sales for AI chip
- Spheron: Etched Sohu vs NVIDIA comparison

滚动至顶部