AMD 宣布收购 Taalas——一家只有 24 人的多伦多创业公司,它的芯片不"加载"模型,而是把模型直接"刻"进硅片里。其首颗验证芯片 HC1 将 Llama 3.1 8B 的推理速度推到 接近 17,000 Token/秒/用户(约 NVIDIA GPU 的 48 倍、Cerebras 的 8.5 倍),功耗约 200W,不需要 HBM、不需要液冷、不需要 CUDA 式软件栈。这笔 8 月 6 日官宣的交易,是 AI 算力竞赛从"训练规模"转向推理经济学的最明确信号。
AMD 买下的是什么
Taalas 做的是所谓 model-specific integrated circuit(模型专用芯片):通用 GPU 运行时从内存加载权重,Taalas 则把训练好的模型权重直接固化进芯片逻辑。HC1 基于台积电 6nm 工艺,53 亿晶体管、815mm²,把 Llama 3.1 8B 烧录进基于掩膜 ROM 的读取结构中,单个晶体管即可存储 4-bit 权重并就地完成乘法(存内计算),从根本上绕开 GPU 推理的"内存墙"瓶颈。
核心数字:Llama 3.1 8B 推理约 $0.0075/百万 Token(GPU 方案为 $0.20–0.49),整机架功耗 12–15kW(GPU 机架通常 120–600kW),以 PCIe 加速卡形式即插即用,且仍支持通过 LoRA 微调适配特定领域。
"一模型一芯片"如何运作
代价很直白:刻了哪个模型就只能跑哪个模型。Taalas 的解法有两条:一是批量制造约 100 层的准成品晶圆,换新模型只需改 2 层掩膜,整个周期约 2 个月;二是自研自动化工具,把模型转成 RTL 代码大约只需一周(尚未完全一键化)。路线图同样清晰:HC1 支持 8B 参数,HC2 计划支持 20B,几十颗芯片互连即可承载万亿参数级模型。
框架:从瑞士军刀到专用电器
通用 GPU 像一台万能引擎,什么都能跑,但要为灵活性付效率税;模型专用芯片则是一条为单一路线而建的专线。更有意思的是,行业现在不再二选一:AMD 计划让 Instinct GPU 负责 prefill(处理输入上下文),Taalas 芯片负责 decode(生成 Token),各干各最擅长的活。NVIDIA 下一代 Vera Rubin 平台把延迟敏感的 decode 环节交给 Groq LPX,同样是这个思路——两大阵营殊途同归,异构推理成为共识。
对 Agent 与推理定价意味着什么
这笔收购是去年 12 月 NVIDIA 约 200 亿美元授权 Groq 的镜像操作,瞄准的是同一个猎物:面向 AI Agent 与编程助手的优质低延迟推理。Agent 的商业模式本质取决于每 Token 成本,亚美分单价 + 万级 TPS 会直接改变哪些产品能够成立。
风险同样真实:模型按月迭代,而掩膜重制约需两个月,"一模型一芯片"只有在一批模型足够稳定时才成立;且性能数据均为公司自测,有待独立验证。不过反过来,对重复性强、隐私敏感的端侧场景,把固定小模型刻进芯片反而是优点——这也是前沿模型竞赛之外,创业公司走 ASIC 路线的机会所在。
可以怎么用
- 重算你的推理成本模型。如果以固定小模型(8B–20B)高并发服务 Agent/实时助手,模型专用芯片可能把单 Token 成本降一个数量级。
- 关注 AMD 的系统级方案。Instinct + Taalas 的首批产品,是验证 prefill/decode 分工能否规模化的真正试金石。
- 用 LoRA 而非全量微调做领域适配——适配器式定制正是让硬编码模型保持实用性的关键。
- 芯片创业者:Taalas 在产业链最顶端验证了专用化路线。别追通用性,挑窄而高频的负载,接受"模型固定"这个前提。
延伸阅读
- AMD 2026 深度分析:挑战英伟达的路径走到哪了——了解 AMD 在 AI 算力市场的整体布局
- 2026 AI 发展趋势盘点——推理成本崩塌是今年最重要的主线之一,Taalas 正是这条主线的硬件注脚
- 官方公告:AMD 收购 Taalas 新闻稿