Model换脑子,Effort换态度——Anthropic亲手拆解AI编程最深的误会

Model换脑子,Effort换态度——Anthropic亲手拆解了AI编程最深的误会

你有没有过这种时刻:让AI写代码,它写砸了,你的第一反应就是赶紧换个更强的模型。

这个直觉如此自然,以至于几乎没有人怀疑过它是否正确。

但Anthropic最近发的一篇长文,亲手拆穿了这个几乎所有人都踩过的坑。

他们给出的结论不仅反直觉,而且对每一个用AI写代码的人都有实质影响:

换模型只是换了脑子;让AI"更努力"比换模型更有效——一个开高Effort的中等模型,在大量任务上能干翻一个开低Effort的顶级模型。

这不是某个博主的经验之谈。这是Anthropic官方,用一场持续数月的社区风波换来的答案。

一、一场因"默认值"引发的信任危机

今年3月,Claude Code的用户群突然炸开了锅。大量开发者发现,手里的Claude Code"变笨"了——该读的文件不读,该跑的测试不跑,任务干到一半就撂挑子,反过来问你要更多信息。

GitHub上骂声一片。最狠的攻击来自AMD的AI负责人Stella Laurenzo——她翻出6852个会话的日志,测出Claude的思考量比2月之前掉了67%,然后撂下一句:Claude已经没法被信任去干复杂的工程活了。

整个社区的反应高度一致:模型退化了,Anthropic在偷偷降级服务。

调查最终发现,真相和"模型变笨"毫无关系。

3月4日,Anthropic为了压低延迟,悄悄把Claude Code里一个叫Effort的选项从high降到了medium。官方更新日志里写得很清楚,但几乎没有人注意到这条信息。问题出自一个更根本的地方:没有人真正理解那个Effort选项在控制什么。

扛了一个月,Anthropic在4月7日把默认值调了回去,还给所有订阅用户重置了用量额度。风波过去了,但那个更深的疑问留了下来:

Model和Effort,到底分别控制着AI的什么东西?

二、两个维度,一个被彻底误解

Anthropic官方的拆解,可以简化为一句非常清晰的话:

Model换的是脑子,Effort换的是态度。

先说Model。每个模型背后是一套冻结的权重——它的能力和知识,在训练结束的那一刻就被焊死了。你在推理时喂进去的提示词、CLAUDE.md、贴进上下文的代码,全都改不了这套权重:你可以引导它,却没法训练它。

换模型,本质就是换一整套权重来接你的活。它解决的是"会不会"的问题。

但"会不会"只是问题的一半。

Effort管的,是"肯不肯干到多彻底"。

很多人以为高Effort就是"让AI多想几秒"——这个比喻也错了。Effort控制的不是思考时间,而是行为投入:读几个文件、跑不跑测试、要不要额外验证、要不要把一个多步骤任务一路推到底再回来找你。低Effort的AI倾向于快速回复,然后反过来问你要更多上下文,能不动手就不动手。高Effort的AI倾向于自己去翻信息、多调几次工具、一口气把长任务链跑完。

Anthropic放了一张直观的示意图:同一条prompt,高Effort能比低Effort多输出大约7倍的token。多出来的那些,全花在读文件、跑验证、反复确认上。

这就引出了一个反直觉的结论:小模型开高Effort,完全可能干翻大模型开低Effort。

三、"模型—Effort"四象限:一个新的智力分工框架

把Model和Effort作为两个独立维度交叉,会得到一个极其实用的分析工具:

四象限框架

第一象限:大模型 × 高Effort
这是火力全开的模式。适合大型重构、跨文件变更、长时间自主运行的agent任务。能打硬仗,但token消耗也最大。应该留给真正需要火力覆盖的场景。

第二象限:大模型 × 低Effort
专家五分钟模式。大模型带来的是你代码库里没有的经验——见过的坑、该绕的雷,全是解过一堆同类问题攒下的直觉。但低Effort意味着它只扫一眼就给出答案。适合诊断疑难杂症——一眼就能看出问题的那种。但不适合需要全面扫查的场景。

第三象限:小模型 × 高Effort
这是最被低估的组合。一个中等规模的模型配上充足的上下文和高投入,能扛下比大多数人想象中多得多的活。Anthropic官方的测试中,Sonnet(中型模型)开高Effort,在许多实际任务上确实干过了Opus(大型模型)开低Effort。性价比极高。

第四象限:小模型 × 低Effort
快速、便宜,适合简单明确的改动,比如修一个lint错误、改一段文案。秒回还不心疼钱。

这个看似简单的框架,揭示了AI编程领域一个正在发生的结构性转变:

只看模型排行榜的时代正在过去。调度模型——而不是挑选模型——正在成为核心能力。

四、这个框架不止于Claude Code

把Model和Effort拆成两个维度,能解释很多现象。

为什么同样是GPT-4,有人觉得它是自己用过最惊艳的产品,有人觉得它只是"聪明一点的聊天机器人"?差异往往不在模型本身,在投入——会不会设计Chain-of-Thought、给不给足够的上下文和验证空间、允不允许它反复检查自己。

为什么一些开源模型在特定任务上跑赢了闭源模型?不是开源模型在参数上赢了,而是使用者愿意投入更精细的prompt工程、更多次迭代验证、更长的推理路径。

为什么同一个团队、同一个模型、同一个项目,换了一个提示词工程师,效果天差地别?因为调度者不同——有人懂得给模型配足上下文和迭代空间,有人以为"模型够聪明就够了"。

这些现象的背后,都是同一个洞见:能力和投入是两个独立变量。把两者混为一谈,是AI时代最昂贵的认知错误。

五、落到行动

如果你是个体开发者:下次AI写砸了,别急着换模型。先查上下文:prompt说清楚了吗?工具给了吗?配置配到位了吗?然后问自己——它是不懂,还是没尽力?不懂换模型,不尽力提Effort。这条二分法能帮你省下大量token预算。

如果你是团队负责人:别只盯着模型账单。真正烧钱的是选错Effort档位——让Fable去干Sonnet就能干的活,让大型模型在低Effort下频繁返工。把Effort调度权交给开发者,而不是锁死在默认值上。

如果你是AI工具的产品经理:Model和Effort的认知鸿沟,是当前产品设计中最大的用户体验缺口。如果用户不知道自己调的是"脑子"还是"态度",那说明这个选项根本不该暴露给用户——或者说,暴露它的方式需要重新设计。

Anthropic用一场长达数月的风波,教会了社区一个道理:

你手里的模型不懒。是你,还不会用它。

来源:Choosing a Claude model and effort level in Claude Code — Anthropic

滚动至顶部