Jev 不写一个字,却可能改写 AI 的成本结构
当所有人都在比谁的模型更能写、更能想的时候,一个「不会聊天、不会写代码」的模型,成了开发者社区最热的东西。
它叫 Jev。原帖在 X 上拿下 3700 多万浏览量,Hacker News 全是讨论。它只做一件事:下判断。给它一组选项,它把答案和概率丢回给你——快 193.6 倍,便宜 444.6 倍,输出 token 永久免费,输入每百万 token 只要 0.042 美元。
流行解读是「又一个降本神器」。这个解读错过了重点。
Jev 真正揭示的,是 AI 成本结构里一条被所有人忽略的断层:**「判断」和「生成」是两种成本结构完全不同的工作,而我们的计价体系把它们捆在一起卖了很多年。**
一、把「嘴」砍掉之后
先看 Jev 到底是什么。
它是 OpenAI 前研究员 Diogo Almeida 创办的 TypeSafe AI 的第一个产品,官方叫法是 System One Model——借丹尼尔·卡尼曼的快慢系统:系统 1 是高速直觉判断,系统 2 是慢速推理。当前的 LLM 全在卷系统 2,Jev 回头做系统 1。
它提供三种能力:Choice(从候选项里选)、Score(按标准打分)、Noul(给出某个判断成立的概率)。你可以把它理解成一个带概率的「语义逻辑门」:接收非结构化状态和一组限定回答类型的问题,输出决策结果,交给代码接着跑。
关键在答案的产出方式。传统模型哪怕只需要输出一个「A」,也要逐 token 把解释写出来。Jev 直接输出判断结果,同一输入里的多个独立问题还能并行处理。把「写出来」这个过程整个砍掉,速度和费用就崩塌式下降:端到端响应 70~500 毫秒,比前沿模型快 20~200 倍、便宜 40~400 倍。
有人会问:生成式模型不也能做分类吗?能。但你要为生成能力的溢价买单,为逐 token 的计费方式买单,还要容忍它「顺便」编一个选项之外的第 D 答案。Jev 的「零幻觉」其实是模式保证:给 A、B、C,它绝不输出 D——但正确答案是 A 时它照样可能选 B。类型正确,事实不一定正确。
还有一个容易被忽略的细节:Jev 的输出是概率,不是硬结论。这恰恰是工程系统最需要的形态——代码拿到的不是一句要再解析的自然语言,而是一个可以直接进阈值判断的数字。调用它的上游不需要 prompt 工程,不需要解析器容错,只需要一个 if。接口从「对话」退化成「函数」,集成的摩擦成本几乎归零。
做这件事的人也值得留意。Diogo Almeida 是 OpenAI 前研究员,参与过 RLHF 和 InstructGPT 的核心研究——亲手教 AI「好好说话」的人,最后做出了一个不让 AI 说话的产品。这种从内部叛逃出来的路线修正,往往比外部批评更能说明问题:连最懂生成范式的人,都认为这条范式装不下一部分真实需求。
二、校准:判断能不能用,全看这个
光快光便宜,进不了工业流程。工业流程要的是:模型到底有多大把握?
Jev 为此提出 RLCD(Reinforcement Learning for Calibrated Decisions)——用于校准决策的强化学习。对照着看更清楚:RLHF 奖励人类偏好的回答,RLVR 奖励可验证的结果,RLCD 把优化重点放在「判断及其概率」上——让模型标 0.2 概率的结果,真实发生频率就约等于 20%。
这一步是整个产品的地基。没有校准,置信度数字没有参考价值,下游系统不敢拿它做自动决策。有了校准,一个「只会下判断」的模型才能嵌进代码里当零件用。
对照三条训练范式更有意思。RLHF 优化的是「人喜欢什么」,优化目标是主观偏好;RLVR 优化的是「答案对不对」,但只适用于有标准答案的封闭任务;RLCD 优化的是「判断和它自报的把握是否相称」——这第三条路,只有在模型专职做判断时才有意义。生成模型不需要校准自己的犹豫,因为它的输出本来就该由人来审。判断模型必须校准,因为没人审。
换句话说:**生成时代的对齐问题是「让它说人话」,判断时代的对齐问题是「让它知道自己在说什么」。这是两个不同的技术问题,也催生了不同的训练方法。**
三、判断经济学:一条被捆着卖的断层
现在可以建框架了。把 AI 的工作拆成两类:
**生成型工作**:产出文本、代码、方案。慢、贵、按 token 计费,价值在「创造内容」。
**判断型工作**:分类、打分、路由、验收。要的是快、便宜、可校准,价值在「降低不确定性」。
过去十年,两种工作被塞进同一种产品形态(聊天生成模型)和同一种计价方式(按 token)。这就像把所有运输都按「头等舱」收费——多数 AI 调用其实是判断,却一直在付生成的价钱。
Jev 们的出现是这条断层的显性化。而且判断类工作在真实系统里的占比远超想象:安全分类、内容审核、意图识别、模型路由、Agent 产出验收——这些全是毫秒级、每秒上万次的高频调用。当这类调用的单价从 0.008 美元降到 0.0001 美元以下,用量不会省下来,只会爆炸式增长——这正是 Jev 这个名字的出处:Jevons 悖论。
四、推演:三种打开方式,已经有人跑通
框架不是纸上谈兵,开发者两周内已经给出了验证。
**判断收割**。Vercel 工程师 Pranit 用 Jev 替换 fx 自动模式的安全分类器(原用 GPT-5.6 Luna),快 5~18 倍、准确性更高。Bryo AI 的 Nikhil Mudholkar 做商业邮件分类,Gemini 准确率略胜,但价格是 Jev 的 10~20 倍——性价比场景,判断模型通吃。
**LLM 验收员**。有开发者部署 Jev 追踪 Agent、防越狱;开发者 Elvis Saravia 把它接进 Agent 框架,在 Agent 宣称任务完成后低价复核一遍。系统 1 看门,系统 2 干活。
**模型路由**。最有趣的实验是 Hassan 的下棋测试:Jev 每步约 0.3 秒、不到 0.0001 美元,GLM 5.3 每步约 5.8 秒、约 0.008 美元——最后 GLM 5.3 在 29 步内将死对手。下得快,未必想得深。结论不是谁取代谁,而是混搭:Jev 负责快速明确的判断,难题才请昂贵的推理模型。
开源也跟上来了:Nimble,基于 Qwen3.5-9B 做 LoRA 微调,Apache 2.0 许可,训练数据和方法全开源。基座模型与参考标签一致率 66.36%,Nimble 提到 90.12%,Jev 是 93.21%。判断能力不再是闭源巨头的专属。
五、如果你是决策者
第一,审计你的 AI 账单。把调用分成判断型和生成型,判断型(分类、审核、路由、验收)单独拉出来测算——这部分很可能占调用量的大头,却是按生成价格在付费。
第二,别急着换模型,先补校准。Jev 的价值一半在架构,一半在 RLCD 式的概率校准。判断结果接进自动流程前,先验证:模型说 80% 把握的事,是不是真有八成发生。
第三,设计混搭架构。快慢分层不是权宜之计,是下一代 AI 应用的默认形态:判断层用 System One 模型守门和路由,生成层用大模型只在真正需要创造时出手。
第四,警惕「零幻觉」话术。判断模型保证的是类型正确,不是事实正确。选项之内不瞎编,选项之内照样可能选错——高风险决策仍要保留人工或系统 2 兜底。
生成模型的时代叙事是「AI 会说话」。Jev 提醒所有人:AI 的下一桶金,可能藏在那些不需要说一个字的地方。
来源备注:本文事实与数据来自量子位对 Jev 发布的报道、TypeSafe AI 官方文档(docs.typesafe.ai)、Nimble 开源仓库(github.com/bespokelabsai/nimble)及 TechCrunch 2026-09-18 报道。
