Koa 发布:Salesforce 把企业知识装进了模型,SaaS 的护城河换位置了

九月中旬的 Dreamforce 大会上,Salesforce 同时发布了两款方向相反的产品。一款叫 Claudeforce,和 Anthropic 合作,让客户在 Claude 里直接调用 Salesforce;另一款叫 Koa,是和英伟达合作、基于开源权重模型后训练的自有推理模型,官方使命之一就是在部分任务上替换 Claude、GPT 这些闭源模型。

左手拥抱,右手替代。大多数报道把这当成一条产品新闻带过,但这两个动作同框出现,本身就是一个信号:企业软件公司和前沿 AI 实验室的关系,正在从「采购方」变成「竞争性合作方」。

我们的判断是:Koa 这类产品标志着一个结构性转折——垂直领域的数据积累,第一次可以被「装进」模型本身,SaaS 公司因此获得了绕开前沿实验室的路径。这件事的影响远不止于 Salesforce 一家。

一、把共识拆开:垂直模型不是「小号的通用模型」

流行叙事里有两种刻板印象。一种认为垂直模型是「小模型做简单事」,是算力不够的将就;另一种认为通用大模型终将吞掉一切垂直场景,「大模型每进一步,SaaS 就退一步」。

Koa 的技术路线恰好把两种说法都拆掉了。

它不是从头训练的小模型,而是在英伟达开源的 Nemotron 3 Super 之上做后训练:先用监督微调(SFT),再用带组相对策略优化(GRPO)的强化学习,工具链是 NeMo RL、NeMo Gym 和 NeMo AutoModel。换句话说,通用推理能力来自开源底座,垂直能力来自后训练——这是「开源底座 + 领域后训练」的完整范式,不是缩减版。

效果呢?在 Salesforce 自己的 CRM Benchmark 上,Koa 的加权平均得分 8.6,不及 Claude Opus 4.8 的 8.7 和 GPT-5.5 的 9.0,但超过了 GPT-4.1 的 8.1;官方口径是「以三分之一的错误率匹配或超过顶尖模型的 CRM 任务表现」。 Salesforce 内部测评还给出:工具调用精度提升 11%,上下文回忆可靠性提升 2.1 倍,长对话记忆提升 15%。

注意这个成绩单的含义:通用跑分上它仍落后于顶尖闭源模型,但在「更新商机、路由工单、安排跟进」这类边界明确的企业工作流里,它已经够用了。竞争的战场从「谁更聪明」移到了「谁更适配」。

还有一个容易被忽略的细节:训练数据。Salesforce 明确表示没有使用任何客户数据,训练语料完全由合成场景构成——模拟了 14 个以上行业、从愤怒的客服来电到达成交易的销售全流程。Salesforce AI 执行副总裁 Govindarajan 对 TechCrunch 解释了为什么以前不做这件事:缺一个「主权、先进、数据来源清晰」的预训练底座,直到 Nemotron 出现。

二、为什么是现在:三条动因

第一,信任成本在上升。就在同一周,另一家模型厂商被曝在后台打包用户工作区文件上传云端,客户公司公开发函追责。当模型能力差距缩小,数据边界问题就会被放大——「你的数据要出你的信任边界吗」正在成为企业采购的第一问。Koa 的答案是权重和推理都留在 Salesforce 自己的信任边界内。

第二,成本结构。前沿模型是一门高毛利生意,据报道 Anthropic 预计 2026 年毛利率达到 50%,2028 年达到 77%。同时 Salesforce 的 Agentforce + Data 360 单季度收入已接近 39 亿美元——既有动机,也有体量,去把一部分推理负载收回来。TechCrunch 报道还点出一个点:Nemotron 的推理架构对 token 更省,同样的工作任务烧更少的钱。

第三,也是最深的一条:SaaS 公司的 AI 转型焦虑。随着大模型变强,甲方完全可以绕开软件公司直接搭建自己的 Agent。SaaS 公司必须回答「如何成为甲方自研绕不开的一环」。Salesforce CEO Benioff 的说法是把话说透了:「Salesforce 积累的最有价值的东西不是平台,而是关于企业业务如何真实运转的知识。Koa 把这些知识放进了模型本身。」

三、框架:能力分层的「推理栈三层模型」

把 Koa 现象抽象成一个可复用的框架。企业 AI 的推理需求其实分三层:

底层:领域动作推理。边界明确、动作标准、上下文封闭——更新 CRM 记录、路由工单、按规则审批。这里的最优解是垂直后训练模型:更便宜、更可控、数据不出域。

中层:流程编排推理。跨系统、多步骤、需要调用工具串联任务。这里由平台层(如 Agentforce 的 AI 网关)负责,按任务特征把请求路由到不同模型——TechCrunch 提到 Koa 就是通过这种网关自动路由的。

顶层:开放域推理。开放式研究、跨领域创作、未知问题。这里前沿模型短期无可替代。

这个框架的解释力在于:它把「垂直模型会不会取代通用模型」这个伪问题,换成了「每一层任务该由谁承接」的分配问题。混合模型策略不是过渡方案,是稳态。

四、推演:这个范式会扩散吗

英伟达是这条路上最积极的推手。黄仁勋在 Dreamforce 亲自站台,并给出数据:开源模型的使用率从去年年初的 30% 增长到现在的 70% 左右。他的长期叙事是「企业主权 AI」——帮每家企业成为 AI 公司。这和 Anthropic 等实验室客户并不冲突:据报道 Anthropic 已有超过 100 万颗 AWS Trainium2 芯片在运行,并承诺十年内在 AWS 花费超 1000 亿美元——实验室在「去英伟达化」,英伟达自然要去更大的企业市场找增量。

但要冷静看到两个约束。一是人才:能做高质量后训练的人集中在顶尖实验室和大厂,多数软件公司不具备。二是性价比:Salesforce 能摊薄后训练成本,靠的是全球最大的 CRM 调用量和 39 亿美元量级的 AI 收入,多数公司没有这个体量。

不过参照移动互联网的历史,这两个约束都会随需求扩张而缓解。iPhone 刚发布时 Salesforce 组建移动团队,同样苦于没有 iOS 开发者,几年后 iOS 人才甚至过剩。开源底座成熟 + 后训练工具链(NeMo 全家桶)产品化,正在把门槛从「实验室级」降到「工程团队级」。

推演到其他行业:金融机构可以把合规审查工作流后训练成自有模型;医院可以把诊疗流程编排装进私有化模型;政府的路径更直接——Koa 的同源技术已经进入 Missionforce,支持私有云和物理隔离网络部署。美国退伍军人事务部 16 亿美元的 Missionforce 合同已经签下。每一家拥有独特流程数据的公司,都是潜在的「垂直模型公司」。

五、落到行动

  • 如果你是 SaaS 创业者或产品负责人:盘点你手里的流程数据——哪些任务的「正确动作序列」只存在于你的系统里?那就是你未来垂直模型的护城河。现在就可以用开源底座做小规模后训练验证,不要等通用模型「顺便」解决。
  • 如果你是企业 AI 采购决策者:把推理需求按三层拆开再谈供应商。领域动作层优先考虑数据不出域的垂直方案,开放域推理才值得为前沿模型付费;同时把「模型厂商能否承诺数据边界」写进合同。
  • 如果你是开发者:后训练工程能力(SFT/GRPO、NeMo 类工具链、合成数据构造)会是未来两三年需求增长最快的技能组合之一,比多学一个框架更值得投入。
  • 如果你是前沿实验室的观察者:注意前沿模型的付费场景正在被从底部蚕食——不是被更聪明的模型,而是被「够用且更可控」的模型。实验室的护城河正在从能力转向开放域的极端场景。

Claudeforce 和 Koa 同台发布,不是 Salesforce 的精神分裂,而是它对推理栈三层的清醒站位:顶层继续租用前沿能力,底层开始自有化。当「够用的垂直智能」可以被任何一家拥有流程数据的公司后训练出来,企业 AI 的权力结构才真正开始重新分配。

滚动至顶部