OpenAI 给「等模型转圈」这件事画上了句号。今天发布的 Ultrafast 极速档位,让旗舰模型 GPT-5.6 Sol 跑到每秒 750 token,比标准处理最快快 14 倍。关键点:这不是拿个小模型装快,是同一个旗舰模型,换了一套完全不同的硬件。
750 token/s 意味着什么
到这个速度,AI 不再是「你问它答」的工具,更像一个实时盯着屏幕的同事。OpenAI 内部演示全是延迟敏感场景:系统告警还在响,工程师就能同步读日志、比对最近的代码改动;行情还在跳动,交易系统就能边扫异常边标记可疑动作;用户在购物车前犹豫,助手当场回答产品问题、查库存、给推荐。以前要跑很久的研究任务,现在压缩成一场边跑边看的实时会话。
早期用户的反馈很直接。金融研究公司 Rogo 的应用 AI 负责人 Alex Wang 说,处理复杂问题时「感觉像在跟真人实时对话」;Podium 的语音 AI 负责人 Courtland Lykins 说,客服通话再也不用因为等模型而冷场。
速度的秘密:把权重放进芯片里
提速不靠提示词技巧,靠的是 Cerebras 的晶圆级引擎。模型权重直接装进芯片上 44GB 的 SRAM,推理时不用像传统 GPU 那样反复从 HBM 里搬数据——直接绕开了卡住推理速度多年的显存带宽瓶颈。算力早就不是约束了,搬数据才是。
这也是今年初 OpenAI 与 Cerebras 那笔大单的第一次落地:多年期、部署 750MW 晶圆级系统、总价值超 100 亿美元。Ultrafast 就是这份合同交付的样子。
同场加映:Computer History
这次更新还给 ChatGPT 桌面版加了 Computer History。它记录点击、打字、快捷键、窗口切换这些交互事件,不截屏、不录音。问它「我上午做到哪了」,它从你电脑的真实操作时间线里直接回答。它脱胎于 4 月的 Chronicle 研究预览,还能把重复的工作流存成可复用的 skill。
为什么值得关注
两个结构信号:第一,速度正在成为产品竞争的主轴,而赢家的打法不是缩小模型,而是换掉模型底下的芯片;第二,记忆的边界从「你跟聊天机器人说过什么」扩展到「你在电脑上做过什么」,这重新定义了助手获取上下文的方式。两者指向同一个终局:AI 从「被召唤」变成「在场」。
可以做什么
- 如果你在做延迟敏感型 Agent(客服、交易、运维),按 750 token/s 的档位重新做一遍基准测试——以前 50 token/s 时跑不起来的流程现在可能就通了。
- 留意 Cerebras 这类晶圆级推理的定价,它不再是实验室里的稀奇玩意儿。
- 重新审视记忆产品设计:Computer History 式的交互记录会成为标配,隐私控制(不截屏、可逐条删除)才是真正的差异点。