学会给AI派活,比选最强的AI更重要——Claude Code「变笨」风波背后的结构性变化

你有没有过这种时刻:AI写代码写砸了,第一反应就是赶紧换个更强的模型?

这一招,很多时候并不管用,甚至是在白花钱。

刚刚过去的几个月,Anthropic 的 Claude Code 经历了一场社区信任危机。开发者们发现手里的工具突然「变笨」了——该读的文件不读,该跑的测试不跑,任务干到一半反过来问你要更多信息。GitHub 上骂声一片。AMD 的 AI 负责人 Stella Laurenzo 甚至翻出 6852 个会话的日志,发现 Claude 的思考量比之前掉了 67%,撂下一句:Claude 已经没法被信任去干复杂的工程活了。

Anthropic 沉默了一个月,终于下场回应。

他们的回答出乎很多人意料:模型没变,是 Effort(努力度)的默认档位从 high 降到了 medium。一个设置项的变化,让整个社区以为模型退化了。而更深层的真相是——大多数用户根本不知道这个选项的存在,更不知道它对自己的产出有多大的影响。

Anthropic 随后发布了一篇长文,把 Model 和 Effort 的分工逻辑拆得清清楚楚。这篇文章表面上是教你怎么调参,背后揭示的,是一个正在发生的重要转向。

AI 编程的竞争,正在从「谁的模型更强」,转向「谁更会调度智能体」。

一、Model 换的是脑子,Effort 换的是态度

Anthropic 官方的拆解,可以浓缩为一句话:Model 换的是脑子,Effort 换的是态度。

先说 Model。每个模型背后是一套「冻结的权重」——它的能力和知识在训练结束那一刻就被焊死了,只读、不可改。你喂进去的提示词、CLAUDE.md、贴进上下文的代码,都改变不了这套权重。你可以引导它,却没法「训练」它。换模型,本质就是换一整套权重来接你的活,它解决的是「会不会」的问题。

再说 Effort。很多人以为高 Effort 就是「让它多想几秒」——错了。它管的是 Claude 在这次任务上到底投入多少工作量:读几个文件、跑不跑测试、要不要额外验证、是不是把多步骤任务一路推到底。低 Effort 的 Claude 倾向于快速回复,然后反过来问你要更多上下文;高 Effort 的 Claude 倾向于自己去翻信息、多调几次工具、一口气把长任务链跑完。

Anthropic 还放了一张图:同一条 prompt,高 Effort 能比低 Effort 多吐大约 7 倍的 token。多出来的那些,全花在读文件、跑验证、反复确认上。

这里藏着一个反直觉的结论:小模型开高 Effort,完全可能干翻大模型开低 Effort。

官方给了一个特别好懂的比方。Sonnet 像是一个有一整个下午的全能选手,会把你的代码从头读到尾、跑一遍、再验一遍。Opus 像是只给你五分钟的专家,它带来的是你代码库里压根没有的经验,可五分钟只够扫一眼。Fable 像是所有人都卡住了才请得动的专科大夫,哪怕只给五分钟也能一眼揪出别人看不出的毛病。问题在于,如果 Opus 只肯用低 Effort,它那五分钟可能连文件目录都没看完——而 Sonnet 开高 Effort 已经把整个项目吃透了。

二、判断框架:「不会」还是「不够努力」

Anthropic 这篇回应的价值,不只是澄清误会——它给出了一个可复用的判断框架。

Claude 干砸了,先别急着动模型选项。

第一步永远是回头查上下文:prompt 说清楚了吗?该给的工具给了吗?CLAUDE.md 配对了吗?大多数所谓「AI变笨」,根子都在这儿,不在模型选项上。

上下文确实没问题、它还是错,就问自己一句:它是不会,还是不够努力?

判断「不够努力」很简单:该读的文件跳过了、测试没跑、重构干到一半跑回来问你——它缺的不是脑子,是投入。这是 Effort 的事,往上调一档就行。

如果「不会」,则是另一种情形:你上下文给足了,它也明显尽力了,可还是错,换个说法再试一遍还是错。这时候任你怎么加 Effort 都白搭——这是模型的事,该换就换更强的。

这个框架看起来极其简单,但 3 月那场风波里,几乎没有人用这套逻辑去诊断问题。所有人都在说「模型变笨了」,没有人问「是不是模型不够努力」。因为 Effort 这个选项,在产品设计里太容易被忽略了——它在设置菜单的深层,在大多数人「不会去调」的地方。

这不是用户的问题。这是产品设计把「调度权」交给了用户,却没有让用户意识到自己手里握着开关。

三、「给 AI 派活」正在成为核心手艺

把视角拉远,这件事的意义远超一次产品 Bug。

过去两年,AI 编程领域的竞争逻辑一直很直接:谁家的模型在榜单上排名更高,谁就更强。开发者选模型就像选 CPU——挑最顶配的那款,剩下的全交给它。你现在用的 Claude Code,底层跑的是 Sonnet、Opus 还是 Fable?大多数人根本分不清,也懒得管,只要代码能生成就行。

但 Effort 这个维度的出现,打破了「一维对比」的格局。模型和能力不再是线性关系——同一个小模型,在不同 Effort 配置下,可以表现出完全不同的生产力。

这意味着开发者多了一个维度去优化自己的 AI 使用效率:

  • 简单的改动,可以交给小模型挂低 Effort——秒回还省钱
  • 大型重构,上强模型加高 Effort——把活干透
  • 需要长时间自主执行的智能体任务,强模型配足 Effort 甚至 multi-agent 调度

Claude Code 的 Effort 菜单里多出的那档 ultracode,就是把这套「调度」做进了产品。选中它,Claude 拿到的是 xhigh 的火力,外加一项授权:遇到实质性的活儿,自己掂量要不要拉起一支智能体队伍,把任务拆下去并行干。

这不只是技术选择,这是 OpenAI、Anthropic、Google 等头部公司正在同步推进的战略转向——从「提供最强的单一模型」到「提供最灵活的多模型调度系统」。模型本身正在变成商品,真正的价值开始向调度层迁移。

四、这个框架不只适用于编程

「不会 vs 不够努力」的二分法,其实可以迁移到几乎所有 AI 使用场景。

一个产品经理用 AI 做市场分析。AI 给出的报告泛泛而谈、缺少数据支撑。这时候应该反思的不是「这个模型不行」——是你给了它足够详细的描述吗?给了它参考模板吗?给了它需要回答的具体问题清单吗?大多数时候,不是模型不会分析,是你没有给它「足够努力」的理由和工具。

一个设计师用 AI 生成配图。生成的图构图很美但风格不对。这时候也不是模型不会画——是你有没有给它风格参考图、有没有用「负面提示词」排除不想要的元素、有没有把需求拆成一两个具体约束而非一段笼统描摹。

AI 的「智力」上限确实由模型决定。但绝大多数日常使用中,你碰到的不是模型的上限——是你自己给它设的下限。你给了模糊的指令,用了默认的低 Effort 设置,然后抱怨 AI 不够聪明。这就像请了一个专家来帮忙,却只给他 5 分钟时间,然后说他水平不行。

五、所以该怎么做

如果你在用 Claude Code 或其他 AI 编程工具——

  • 每次出问题,先问「不会还是不够努力」。把这个判断流程做成直觉,而不是条件反射式地换模型。
  • 把 Effort 当作一个独立的资源维度来管理。它和模型选择一样重要。省 Effort 不一定省钱——低 Effort 下模型反复出错、浪费的 token 可能更多。
  • 在团队里建立「AI 使用规范」。哪些场景用哪个模型、配哪个 Effort 档位、CLAUDE.md 怎么写——这些正在变成团队效率差距的来源。

如果你是管理者——

  • 别再只关心「我们用哪个模型」。更应该问的是「团队知不知道怎么调度模型」。
  • 投入时间做 AI 使用培训的 ROI 可能比换模型更高。一个懂得配置 Effort、写好 CLAUDE.md 的开发者,用 Sonnet 可能比一个不会配置的开发者用 Fable 产出更高。

回到 3 月那场风波。它能惊动整个社区,恰恰因为大多数人还停在「换模型」的老思路里,对手边这个更要命的 Effort 选项浑然不觉。只看模型排行的时代正在过去,调度模型,正在成为核心手艺。

谁先学会给 AI 派活,谁就能抢先一步用上那个真正肯为你卖力的 AI。否则,你手里再贵的模型,也只是一个更贵的搜索框。

来源:

滚动至顶部