当AI还在拼参数,有人把27B模型塞进了手机

当AI还在拼参数,有人把27B模型塞进了手机

过去两年,AI领域最牢固的共识是:模型越大越强。GPT-4、Claude 3、Llama 3,每一代都在刷新参数量的天花板。

但这个共识正在漏气。

不是Scaling Law失效了——而是它解决了一个问题后,暴露了更大的问题:模型做大了,谁跑得动它?

数据中心成本失控、端侧设备被排除在外、Agent场景要求毫秒级响应——大模型的落地瓶颈,已经从"能不能做出来"变成了"能不能用得起、跑得动"。

由加州理工学院(Caltech)教授创立的PrismML,选择了一条完全不同的路:不追求更大的模型,而是追求更高的智能密度

他们刚刚推出的Bonsai 27B,是全球首款能在手机上运行的27B级大语言模型。不是云端调用、不是网络传输——就在你的口袋里。


PrismML做了什么?不止是量化

一说模型压缩,很多人会想到量化——把FP16权重砍成INT4或INT8,精度降一点,体积小一些。

PrismML的做法和行业常规不同:它不是训练后量化部分权重,而是从底层把整个网络改造成了二值(1-bit)三值(ternary)权重系统。

什么意思?传统模型的权重像精密仪器的微调旋钮,每个都有精确数值。PrismML的做法是:让每个旋钮只告诉你"正"还是"负"(二值),或者再加一个"零"(三值)。

听起来像是暴力压缩,但关键在于两个设计:

第一,端到端原生1-bit架构。不是量化部分层留一些高精度层兜底,而是Embedding、Attention、MLP、输出层,整个语言网络全部改造成极低精度权重。每个1-bit权重只占约1.125 bit(每128个权重共享一个FP16缩放系数),三值版本约1.71 bit。

第二,专用推理内核。权重压缩后,运行时不再需要解压回FP16再计算——推理内核直接读取压缩格式运算。这不仅减少了模型体积,更关键的是降低了内存带宽消耗和数据搬运成本。在端侧,带宽瓶颈往往比算力瓶颈更致命。

成果是实打实的:

  • Bonsai 8B(基于自研架构,今年3月首发):体积仅1.15 GB,比Llama 3 8B小14倍,速度快8倍,能效高4-5倍。能在iPhone 17 Pro上跑,M4 Pro Mac上达131 tokens/秒,RTX 4090上达368 tokens/秒。
  • Bonsai 27B(基于Qwen3.6 27B,最新发布):第一款能在手机上运行的27B级模型。RTX 5090上1-bit版本163 tokens/秒,M5 Max Mac上87 tokens/秒。更关键的是,27B的参数量让它有能力处理多步推理、结构化工具调用、视觉任务和长时间Agent循环。

智能密度:评判AI的新标尺

PrismML提出了一个新概念,可能是这篇文章里最值得记住的词——智能密度(Intelligence Density)

定义很直接:单位部署体积(每GB内存、每瓦能耗)能承载多少有效智能。

过去几年,整个行业都在追逐"绝对智能"——谁的模型在排行榜上分数更高。但PrismML指出了一个被忽略的事实:一个在云端数据中心跑得飞快的模型,如果端侧塞不进去、企业本地部署不了、Agent场景延迟不达标,它的"可用智能"就是零。

智能密度衡量的不是模型的上限,而是模型在现实约束下的表现。

这个框架的意义在于:它把竞争维度从"谁的模型更大"切换成了"谁的单位资源能产出更多智能"。就像芯片行业从追求单核频率转向追求每瓦性能——不是不做大了,而是做大不再是唯一的衡量标准。

巧合的是,清华和OpenBMB团队去年底也提出了类似的概念——"能力密度",并给出了一个惊人的结论:大模型的能力密度大约每100天翻一倍。这意味着每三个多月,只需要一半大小的模型就能达到此前最强模型的水平。

两条研究线从不同方向指向了同一个判断:AI的下半场,比拼的不再是谁能做出最大的模型,而是谁能用最小的代价把智能送到最多的地方。


当27B能本地跑,Agent的逻辑全变了

Bonsai 27B的出现,不只是技术指标的提升。它解锁了一种全新的系统架构——混合部署

过去,Agent的架构选择是二元的:要么全上云端(成本高、延迟大、有隐私风险),要么全本地(能力有限)。

当27B级别的模型可以本地运行后,Agent可以这样做:

  • 日常任务(信息检索、简单推理、基础对话)→ 本地Bonsai 27B处理,零延迟、零网络成本、数据不出设备
  • 困难任务(复杂推理、长文分析、专业领域)→ 路由到云端旗舰模型

这套"本地兜底、云端补强"的架构,把Agent运行成本拉低了一个数量级。更重要的是,它让全天候在线的端侧智能体成为可能——不依赖网络、不消耗云端Token、不掉线。

延伸开来看:

  • 机器人:实时感知-决策循环不再受网络延迟影响
  • 企业Copilot:本地部署,数据不出域
  • 离线场景:飞机、偏远地区、保密环境
  • 可穿戴设备:眼镜、耳机上的全天候AI助手

不是不要Scaling,是不只有Scaling

PrismML的故事容易被误读成"Scaling Law要完了"。它没有完。大参数带来的能力跃升是真实的,Grok、GPT-5级别的模型仍然是AI能力的上限标杆。

但PrismML揭示了一个正在发生的范式转移:AI竞争正在从单线程(谁做得更大)变成双线程(谁做得更大 + 谁用得更好)。

智能密度不是Scaling的替代,而是Scaling的补充和落地通道。没有密度,Scaling的成果只能锁在数据中心里;没有Scaling,密度也没有智能可以压缩。

真正值得关注的是这条线的交汇点:当模型每100天浓缩一倍、端侧芯片算力跨过100 TOPS门槛、合规通道打开——这三条曲线同时指向了2026年。这一年,端侧AI从"能跑"变成了"跑得动、跑得起、跑得久"。

对于AI从业者和产品经理,接下来的问题不再是"你的模型有多少参数",而是:

  • 你的模型能在什么设备上跑?
  • 单位硬件成本能产出多少智能?
  • 用户的隐私数据需要离开本地吗?

答案的方向已经很清晰了:下一轮模型竞争,将由谁能以更小的资源代价,把更强的智能带入更广阔的现实世界来定义。

滚动至顶部