8月11日,英伟达连发两个开源项目:30B参数的MoE模型 Nemotron 3.5 Lightning,以及模型路由库 NeMo Switchyard。表面上看是英伟达加入开源模型大战,实际上这是更深层的一盘棋——关于企业如何真正部署 AI 的战略重构。
产品定位:专才,非通才
Nemotron 3.5 Lightning 刻意不做"最强模型",而是专攻高频 Agent 任务:代码审查、工具调用、安全告警监控、账单问答——这些重复性执行工作消耗大量 API 调用,却不需要 GPT-5 级别的推理能力。
英伟达自研评测基准 PinchBench 显示:该模型在匹配 Qwen 3.6-35B 准确率的前提下,速度快约 30%。第三方 Artificial Analysis 的 Intelligence Index 评分 24,与 gpt-oss-120b 持平,虽不及最大模型,但在真实工作负载中竞争力足够。
部署范围从 RTX PC 到数据中心全覆盖。CrowdStrike 用于网络安全,Harvey 用于法律服务,CodeRabbit 用于代码审查。CodeRabbit reportedly 用 NeMo Auto 训练一个工作路由 Agent 仅需 2 小时、85 美元。
基础设施层:Switchyard 的智能调度
NeMo Switchyard 本身不跑模型,而是决定"哪个模型来跑"。它根据准确率、延迟和成本约束在模型间动态路由任务。LangChain 在 145 个多轮 Agent 任务中测试:仅 7% 的调用交给前沿模型,准确率下降 6%,成本降低 74%。
Ramp 在其 SWE-Bench 上取得与前沿模型相当的性能,成本降低 58%。Cognition 的 Devin Desktop 集成后,平均成本比全用单一前沿模型低 28%。
结论很明确:企业 AI 的制胜策略不是"所有任务都用最好的模型",而是"每个步骤用对的模型,智能切换"。
英伟达的真实动机
三周前黄仁勋公开支持开源模型,理由很直接:"免费 AI 对硬件和芯片是好事。"
这是核心。英伟达不需要 Nemotron 打败 GPT-5,它需要更多企业部署 AI——任何 AI——因为每次部署都消耗算力。模型跑得越多,GPU 卖得越多。开源模型降低准入门槛,扩大的是英伟达真正的主业:芯片和基础设施的市场总量。
但还有更长线的布局。英伟达正在构建一个生态:模型、训练数据、评测工具、开发框架、计算资源。Reflection、Cursor、Thinking Machines、Mistral 贡献训练数据和设计经验,Prime Intellect 提供模拟环境。英伟达多年期云服务承诺已达 280 亿美元,延伸至 2031 年初。
这不是要拥有最强模型,而是要拥有所有模型运行其上的基础设施。
更深层的产业信号
AI 产业正在经历结构性转型。第一阶段是模型中心:谁的模型最大最聪明?第二阶段是基础设施中心:谁能高效编排多个模型、智能路由任务、在保持能力的同时压低成本?
Nemotron + Switchyard 是对第二阶段的押注,且正中英伟达的优势——不是作为模型厂商,而是作为连接模型、工具、算力和开发者的平台。
对企业的实操启示:开始考虑"模型组合"而非"模型专一"。智能路由带来的成本节约是真实且可量化的。未来 12-24 个月的竞争优势,可能不来自用了更好的模型,而来自更好地使用了多个模型。
来源:36Kr/腾讯科技、Artificial Analysis、英伟达官方发布