谷歌连发三款轻量模型,3.5 Pro继续跳票——效率优先策略能赢吗?

一场没有Pro的发布会

当地时间7月21日,谷歌DeepMind一口气放出三款新模型——Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。没有预热,没有发布会,就这么静悄悄地出现在Google AI Studio和Gemini的模型选择器里。

但只要你稍微看一眼评论区,就会发现气氛不太对。

"从未见过如此糟糕的模型。""一个本地4B模型都比它做得好。""Kimi K3团队预算不及谷歌的1/150,却拿出了更好的成绩。"

谷歌这一波操作,到底是效率革命,还是被迫交出的草稿纸?

三款模型,三个方向

先拆开来看这三款模型的定位差异。

Gemini 3.6 Flash——主力模型。编码和多模态能力提升,但最大的卖点是token效率。处理相同任务,输出token比前代减少了17%到65%。在DeepSWE基准测试中得分49%(前代3.5 Flash为37%),MLE-Bench从49.7%提升至63.9%。定价每百万输入token 1.5美元,输出7.5美元,比3.5 Flash的9美元略降。

Gemini 3.5 Flash-Lite——速度极限。每秒生成350个输出token,是3.1 Flash-Lite的两倍。定价低至输入0.3美元/输出2.5美元每百万token。但在SWE-Bench Pro上竟拿到54.2%,超过了标准版3 Flash的49.6%。

Gemini 3.5 Flash Cyber——垂直专用。针对网络安全漏洞检测微调,集成到CodeMender中,仅向政府和受信合作伙伴开放。内部测试中在V8引擎代码库找出55个问题,其中10个是其他模型未能发现的。

三款模型铺开的是一张明确的网络:效率优化层级(Flash)、速度极致(Flash-Lite)、垂直专用(Flash Cyber)。但所有人都在等的那张王牌——Gemini 3.5 Pro——依然不见踪影。

Pro去哪了?

谷歌上一次更新Pro系列还是今年2月的Gemini 3.1 Pro。此后五个月,对手们弹药充足:OpenAI推出了GPT-5.5并开始推送GPT-5.6,Anthropic推出了Claude Opus 4.8和Sonnet 5,月之暗面开源了2.8万亿参数的Kimi K3,智谱发布了GLM 5.2。

5月谷歌预告Pro版本"一个月内推出",如今已到7月末。彭博社此前报道称,谷歌因难以达到内部性能目标,3.5 Pro面临内部延迟。

谷歌DeepMind技术负责人洛根·基尔帕特里克在社交媒体上回应说,3.5 Pro正在与合作伙伴测试,但没有给出时间节点。更耐人寻味的是,谷歌首次正式提及了下一代旗舰Gemini 4,称其"已启动预训练工作,是迄今为止最雄心勃勃的预训练工作"。

跳过3.5 Pro的正式发布,直接透露4代的进展——这在产品节奏上几乎是不寻常的信号。

效率优先策略的代价

谷歌CEO皮查伊今年早些时候说过一句大实话:"有的公司5月份就花完了全年的token预算。"这套效率优先的路线,放在企业客户面前无疑是通顺的商业逻辑。

但问题在于,当模型大量"瘦身"之后,质量的牺牲是否值得?

36氪援引的开发者反馈显示,Gemini 3.6 Flash在构建3D场景时反复忽略指令,输出质量不如5个月前发布的3.1 Pro。Artificial Analysis的基准评分显示,3.6 Flash得分与3.5 Flash完全相同,排位在Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Claude Sonnet 5之后——也就是说,它没有进步。

而与此同时,Kimi K3爆发式增长引发算力熔断,上线48小时就暂停了新用户订阅。用户用脚投票的方向,说明市场在今天更重视的是模型能力上限,而非token成本。

一个关键问题摆出来:在AI这个"能力为王"的市场里,效率优先策略能否对冲能力落后带来的竞争劣势?

轻量化的战略底色

但换一个视角看,谷歌的选择并非没有道理。

把三款模型放在一起看,你会发现一个更系统的框架:

第一层(Flash Cyber):用专用模型攻克长尾高价值场景,安全这类领域不需要通用能力,需要的是精确和可信。

第二层(Flash-Lite):用极致速度覆盖高吞吐量场景——搜索、文档处理、数据提取,这些场景对延迟极其敏感,对绝对推理深度不敏感。

第三层(3.6 Flash):用效率优化覆盖多数日常任务,把token成本打下来,让企业客户敢用、能用。

这三层覆盖了企业端80%以上的使用场景。缺失的那20%——需要极致推理深度的复杂任务——确实是谷歌今天的软肋,但也恰是3.5 Pro和Gemini 4的目标市场。

换句话说,谷歌在做的是"分层覆盖、逐级突破":先用轻量模型做大规模用户覆盖和数据积累,同时暗度陈仓推进下一代大参数模型的预训练。

对开发者意味着什么

回到实际选择上。

如果你在做一个高吞吐量的搜索或文档处理应用,Gemini 3.5 Flash-Lite的价格和速度组合确实有竞争力。特别是每秒350个输出token,加上可调节的"思考层级"设计——简单任务低思考换取低延迟,复杂任务再提高层级——这套flexible架构比一味追求推理上限的模型更务实。

但如果你的应用依赖深度编程推理或复杂多步规划,Gemini 3.6 Flash可能还不够。同等价位下,Claude Sonnet 5或Kimi K3在编程基准上的表现更稳定。开发者社区"一个本地4B模型都比它做得好"的吐槽,即便带情绪,也反映了真实落差。

值得注意的是,Gemini 3.6 Flash在计算机使用(Computer Use)能力上的提升——OSWorld从78.4%到83%——对Agent工作流开发者是有价值的。这项能力已成为Gemini API和Gemini Enterprise的内置客户端工具。

三款模型从发布当天起即可在Google AI Studio、Android Studio和Gemini应用中使用,同时在Google Antigravity及Gemini Enterprise中可用。

Figma、Harvey、Hebbia和JetBrains已给出正面反馈,称其在"效率、准确性和速度之间取得了平衡"。

总结

谷歌这次发布,表象上是三款新模型,深层是一个清晰信号:AI产业正从"参数军备竞赛"走向"分层效率竞争"。不是所有场景都需要最佳模型,也不是所有公司都负担得起无限token消耗。

但效率优先策略成立的前提是,你不能在旗舰能力上掉队太久。Gemini 3.5 Pro的持续跳票,Gemini 4刚刚启动预训练,而宇宙线对面的对手已经在交付出实质性的能力升级。

这场比赛的看点是:当你把赌注压在效率上时,另一边的玩家在用规模碾压。终局到来之前,两种路线的胜负尚无定论。

不过有一点可以确定——7月这篇关于谷歌的报道,配的封面图或许该是一张还没写完的草稿纸。上面写满了效率公式,但缺了最后那道证明题。

滚动至顶部