你有没有过这种时刻:AI写代码写砸了,第一反应就是赶紧换个更强的模型?
这一招,很多时候并不管用,甚至是在白花钱。
刚刚过去的几个月,Anthropic 的 Claude Code 经历了一场社区信任危机。开发者们发现手里的工具突然「变笨」了——该读的文件不读,该跑的测试不跑,任务干到一半反过来问你要更多信息。GitHub 上骂声一片。AMD 的 AI 负责人 Stella Laurenzo 甚至翻出 6852 个会话的日志,发现 Claude 的思考量比之前掉了 67%,撂下一句:Claude 已经没法被信任去干复杂的工程活了。
Anthropic 沉默了一个月,终于下场回应。
他们的回答出乎很多人意料:模型没变,是 Effort(努力度)的默认档位从 high 降到了 medium。一个设置项的变化,让整个社区以为模型退化了。而更深层的真相是——大多数用户根本不知道这个选项的存在,更不知道它对自己的产出有多大的影响。
Anthropic 随后发布了一篇长文,把 Model 和 Effort 的分工逻辑拆得清清楚楚。这篇文章表面上是教你怎么调参,背后揭示的,是一个正在发生的重要转向。
AI 编程的竞争,正在从「谁的模型更强」,转向「谁更会调度智能体」。
一、Model 换的是脑子,Effort 换的是态度
Anthropic 官方的拆解,可以浓缩为一句话:Model 换的是脑子,Effort 换的是态度。
先说 Model。每个模型背后是一套「冻结的权重」——它的能力和知识在训练结束那一刻就被焊死了,只读、不可改。你喂进去的提示词、CLAUDE.md、贴进上下文的代码,都改变不了这套权重。你可以引导它,却没法「训练」它。换模型,本质就是换一整套权重来接你的活,它解决的是「会不会」的问题。
再说 Effort。很多人以为高 Effort 就是「让它多想几秒」——错了。它管的是 Claude 在这次任务上到底投入多少工作量:读几个文件、跑不跑测试、要不要额外验证、是不是把多步骤任务一路推到底。低 Effort 的 Claude 倾向于快速回复,然后反过来问你要更多上下文;高 Effort 的 Claude 倾向于自己去翻信息、多调几次工具、一口气把长任务链跑完。
Anthropic 还放了一张图:同一条 prompt,高 Effort 能比低 Effort 多吐大约 7 倍的 token。多出来的那些,全花在读文件、跑验证、反复确认上。
这里藏着一个反直觉的结论:小模型开高 Effort,完全可能干翻大模型开低 Effort。
官方给了一个特别好懂的比方。Sonnet 像是一个有一整个下午的全能选手,会把你的代码从头读到尾、跑一遍、再验一遍。Opus 像是只给你五分钟的专家,它带来的是你代码库里压根没有的经验,可五分钟只够扫一眼。Fable 像是所有人都卡住了才请得动的专科大夫,哪怕只给五分钟也能一眼揪出别人看不出的毛病。问题在于,如果 Opus 只肯用低 Effort,它那五分钟可能连文件目录都没看完——而 Sonnet 开高 Effort 已经把整个项目吃透了。
二、判断框架:「不会」还是「不够努力」
Anthropic 这篇回应的价值,不只是澄清误会——它给出了一个可复用的判断框架。
Claude 干砸了,先别急着动模型选项。
第一步永远是回头查上下文:prompt 说清楚了吗?该给的工具给了吗?CLAUDE.md 配对了吗?大多数所谓「AI变笨」,根子都在这儿,不在模型选项上。
上下文确实没问题、它还是错,就问自己一句:它是不会,还是不够努力?
判断「不够努力」很简单:该读的文件跳过了、测试没跑、重构干到一半跑回来问你——它缺的不是脑子,是投入。这是 Effort 的事,往上调一档就行。
如果「不会」,则是另一种情形:你上下文给足了,它也明显尽力了,可还是错,换个说法再试一遍还是错。这时候任你怎么加 Effort 都白搭——这是模型的事,该换就换更强的。
这个框架看起来极其简单,但 3 月那场风波里,几乎没有人用这套逻辑去诊断问题。所有人都在说「模型变笨了」,没有人问「是不是模型不够努力」。因为 Effort 这个选项,在产品设计里太容易被忽略了——它在设置菜单的深层,在大多数人「不会去调」的地方。
这不是用户的问题。这是产品设计把「调度权」交给了用户,却没有让用户意识到自己手里握着开关。
三、「给 AI 派活」正在成为核心手艺
把视角拉远,这件事的意义远超一次产品 Bug。
过去两年,AI 编程领域的竞争逻辑一直很直接:谁家的模型在榜单上排名更高,谁就更强。开发者选模型就像选 CPU——挑最顶配的那款,剩下的全交给它。你现在用的 Claude Code,底层跑的是 Sonnet、Opus 还是 Fable?大多数人根本分不清,也懒得管,只要代码能生成就行。
但 Effort 这个维度的出现,打破了「一维对比」的格局。模型和能力不再是线性关系——同一个小模型,在不同 Effort 配置下,可以表现出完全不同的生产力。
这意味着开发者多了一个维度去优化自己的 AI 使用效率:
- 简单的改动,可以交给小模型挂低 Effort——秒回还省钱
- 大型重构,上强模型加高 Effort——把活干透
- 需要长时间自主执行的智能体任务,强模型配足 Effort 甚至 multi-agent 调度
Claude Code 的 Effort 菜单里多出的那档 ultracode,就是把这套「调度」做进了产品。选中它,Claude 拿到的是 xhigh 的火力,外加一项授权:遇到实质性的活儿,自己掂量要不要拉起一支智能体队伍,把任务拆下去并行干。
这不只是技术选择,这是 OpenAI、Anthropic、Google 等头部公司正在同步推进的战略转向——从「提供最强的单一模型」到「提供最灵活的多模型调度系统」。模型本身正在变成商品,真正的价值开始向调度层迁移。
四、这个框架不只适用于编程
「不会 vs 不够努力」的二分法,其实可以迁移到几乎所有 AI 使用场景。
一个产品经理用 AI 做市场分析。AI 给出的报告泛泛而谈、缺少数据支撑。这时候应该反思的不是「这个模型不行」——是你给了它足够详细的描述吗?给了它参考模板吗?给了它需要回答的具体问题清单吗?大多数时候,不是模型不会分析,是你没有给它「足够努力」的理由和工具。
一个设计师用 AI 生成配图。生成的图构图很美但风格不对。这时候也不是模型不会画——是你有没有给它风格参考图、有没有用「负面提示词」排除不想要的元素、有没有把需求拆成一两个具体约束而非一段笼统描摹。
AI 的「智力」上限确实由模型决定。但绝大多数日常使用中,你碰到的不是模型的上限——是你自己给它设的下限。你给了模糊的指令,用了默认的低 Effort 设置,然后抱怨 AI 不够聪明。这就像请了一个专家来帮忙,却只给他 5 分钟时间,然后说他水平不行。
五、所以该怎么做
如果你在用 Claude Code 或其他 AI 编程工具——
- 每次出问题,先问「不会还是不够努力」。把这个判断流程做成直觉,而不是条件反射式地换模型。
- 把 Effort 当作一个独立的资源维度来管理。它和模型选择一样重要。省 Effort 不一定省钱——低 Effort 下模型反复出错、浪费的 token 可能更多。
- 在团队里建立「AI 使用规范」。哪些场景用哪个模型、配哪个 Effort 档位、CLAUDE.md 怎么写——这些正在变成团队效率差距的来源。
如果你是管理者——
- 别再只关心「我们用哪个模型」。更应该问的是「团队知不知道怎么调度模型」。
- 投入时间做 AI 使用培训的 ROI 可能比换模型更高。一个懂得配置 Effort、写好 CLAUDE.md 的开发者,用 Sonnet 可能比一个不会配置的开发者用 Fable 产出更高。
回到 3 月那场风波。它能惊动整个社区,恰恰因为大多数人还停在「换模型」的老思路里,对手边这个更要命的 Effort 选项浑然不觉。只看模型排行的时代正在过去,调度模型,正在成为核心手艺。
谁先学会给 AI 派活,谁就能抢先一步用上那个真正肯为你卖力的 AI。否则,你手里再贵的模型,也只是一个更贵的搜索框。
来源:
- Anthropic 官方博文:Understanding Model and Effort Level in Claude Code
- Stella Laurenzo 的 GitHub 分析
- 新智元/36氪 相关报道
