有一个广泛流传的误会:如果 Claude Code 写砸了,就该换一个更大的模型。
不是。至少不全是。Anthropic 最近亲自下场,拆了一个很多人没意识到的双开关系统:Model(脑子)和 Effort(态度),是两回事。
这篇文章要论证一个 thesis:AI 编程的竞争,正在从"谁的模型更强"转向"谁更会调度智能体"。而掌握 Model 和 Effort 这两个独立杠杆的人,将在效率竞争中建立结构性优势。
一、一场"AI 变笨"的误会,暴露了一个被忽略的开关
今年 3 月,Claude Code 用户群体里爆发了一场信任危机。
大量开发者发现,手里的 Claude Code 突然"变笨"了——该读的文件不读,该跑的测试不跑,任务干到一半就撂挑子,反过来问你要更多信息。GitHub 上骂声一片。AMD 的 AI 负责人 Stella Laurenzo 甚至翻出 6852 个会话的日志,实测 Claude 的思考量比 2 月之前掉了 67%,撂下一句:"Claude 已经没法被信任,去干复杂的工程活了。"
起初大家都以为是自己的提示词没写好。折腾半天才恍然大悟:问题根本不在自己身上——是 Anthropic 在 3 月 4 日,把 Claude Code 的 Effort 默认档位从 high 降到了 medium。
压延迟的代价是让模型变得"懒"了。扛了一个月,Anthropic 在 4 月 7 日才把默认档位调回去,还给所有订阅用户重置了一次用量额度。但多数人到这时才知道:这个开关一直就在手边,它暗中决定着 AI 到底肯不肯为你满血干活。
这件事暴露了一个深层问题:绝大多数用户,对 AI 工具的调控方式只有一个维度——换模型。但 Anthropic 的架构里,从来就不只有一个杠杆。
二、Model vs Effort:两个独立杠杆,管的是完全不同的事
2.1 Model — 换的是"脑子"
每个模型背后是一套冻结的权重。它的能力和知识,在训练结束那一刻就被焊死了:只读、不可改。你推理时喂进去的提示词、贴进上下文的代码,全都改变不了这套权重——你可以引导它,却没法"训练"它。
换模型,本质就是换一整套权重来接你的活。它解决的是"会不会"的问题。一个在模型训练时还不存在的库,你把文档整篇喂给它,它能现学现用,但那只对这一次请求管用,模型本身一个字都没记住,转头就忘。
模型推理的工作方式是 token 级逐字预测:你写的一行代码被切成 token,每个换成词表里的一个数字——const 是 1078,await 是 2597。模型不是一口气吐出整段答案的。一段两百个 token 的回复,就是两百次完整的运算。你等的时间、你烧的钱,大头全在这个循环里。
2.2 Effort — 换的是"态度"
很多人以为高 Effort 就是"多想几秒"——错了。
它管的是 Claude 在这次任务上到底投入多少工作量:读几个文件、跑不跑测试、要不要额外验证、要不要把一个多步骤任务一路推到底再回来找你。
低 Effort 的 Claude,倾向于快速回复,然后反过来问你要更多上下文,能不动手就不动手;高 Effort 的 Claude,倾向于自己去翻信息、多调几次工具、一口气把长任务链跑完。
Anthropic 官方放了一张示意图:同一条 prompt,高 Effort 能比低 Effort 多吐大约 7 倍的 token。多出来的那些,全花在读文件、跑验证、反复确认上了。Effort 不是一个速度调节器——它是一个"这活要干到什么程度才算完"的行为信号。
2.3 核心反直觉:小模型 + 高 Effort 能干翻大模型 + 低 Effort
这里藏着一个反直觉的结论,也是整篇文章最重要的判断:"它不会"和"它没尽力",是两种完全不同的失败,需要完全不同的解法。
Anthropic 官方给了一套判断框架,逻辑链条非常清晰:
第一步 — Claude 干砸了,别急着动模型。先回头看上下文:prompt 说清楚了吗?该给的工具给了吗?CLAUDE.md 配对了吗?大多数所谓"AI 变笨",根子都在这里。
第二步 — 上下文确实没问题,还是错。那就问自己一句:它是不会,还是不够努力?
"不够努力"很好判断:该读的文件跳过了,测试没跑,重构干到一半跑回来问你。这是 Effort 的事,往上调一档就行。
"不会"则是另一种情形:上下文给足了,它也明显尽力了,可还是错——换个说法再试一遍还是错。这时候任你怎么加 Effort 都白搭,这是 Model 的事,就要换更强的。
官方打了个比方:Sonnet 是有一整个下午的全能选手,能把你代码从头读到尾,跑一遍再验一遍;Opus 是只给你五分钟的专家,带着你没有的经验和直觉;Fable 是所有人卡住了才请得动的专科,一眼揪出别人看不出的毛病。所以才有那个反常识的结论:Sonnet 开高 Effort,在不少活儿上真能干过 Opus 开低 Effort。
三、"双杠杆"框架:从一维选模型到二维调度智能体
把上面的逻辑抽象一下,得到一个可复用的分析框架——"双杠杆"框架:任何 AI 编程工具的性能,由两个独立维度决定。
| Model:低 | Model:高 | |
|---|---|---|
| Effort:低 | 最小的投入,最小的输出。适合简单查询或调试 | 专家不愿干活——浪费资源 |
| Effort:高 | 小模型拼尽全力——能撑起 80% 的场景 | 最强组合——攻坚任务的标配 |
这个框架的洞察力不在于四象限本身,而在于它揭示了一个被大多数人忽略的事实:绝大多数 AI 编程的用户,至今仍然停留在一维选择上——只选模型,不管投入。
想象一下你有一个团队:一个是名校毕业但每天摸鱼的专家,一个是普通学校但干劲十足的应届生。在大多数项目里——不是需要诺奖级洞察的那种——应届生靠努力能覆盖 80% 的需求。你却每次因为专家名气大而选他,然后抱怨他不出活。
这就是你今天用 Claude Code 的姿势。
更值得关注的是,Claude Code 最新版本已经加入了多个 Effort 档位,包括一个新档位叫 "ultra"——把 Effort 拉满到一个新的层次。说明 Anthropic 自己也意识到:让模型花更多 token 在"验证自己的输出"上,比让模型花更多参数在"记住更多知识"上,对某些场景更有效。
四、推演:这个框架还能解释什么?
"双杠杆"框架并不局限于 Claude Code。它揭示的是 AI 应用层一个更深层的趋势:模型能力的天花板正在从"训练时的参数规模"转向"推理时的计算预算"。
在编程场景之外——考虑 AI 客服系统。同样一个 GPT-4 级别的模型,设置它"快速回复直到转人工"(低 Effort)还是"尝试理解用户深层意图并自主解决"(高 Effort),效果差距可能比换一个模型更大。
在写作场景中——一个中等模型加上"请你逐步思考、先列大纲再写、写完后自我审查"的指令体系,产出的质量常常超过一个更强模型不加约束的"一次性输出"。原因不是中等模型更聪明——是它被赋予了更高的 Effort。
在企业 Agent 部署中——31% 的企业有 Agent 在生产环境运行(2026年数据)。管理者抱怨 Agent"不靠谱"时,有多少是因为模型选错了,又有多少是因为没给 Agent 配置足够的"努力度"——即迭代次数、验证步骤和回退策略?
"双杠杆"框架的价值在这里:它把"AI 不靠谱"这个模糊的抱怨,变成了两个清晰的诊断问题——"它不会还是它没尽力?"
五、落到行动
如果你是开发者——停下来。下次 Claude 写砸了,先调 Effort,后换模型。在大多数日常任务中,Sonnet 加高 Effort 比你直接上 Opus 更省钱也更有效。把"换模型"留给真正需要它专业知识的硬骨头。
如果你是团队管理者——把你的 AI 工具预算花在哪里的优先级重新排序:上下文质量 > Effort 配置 > 模型升级。一个多发的无效投入是直接上最强模型,而忽视前两个杠杆。把省下的 token 预算分配给更多的迭代轮次,而不是更大的参数规模。
如果你是 AI 产品构建者——不要只给用户一个模型选择器。提供一个"投入度"或"严谨程度"的控制,让用户理解这两个维度是独立的。这既是对用户的教育,也是你产品体验的差异化。
最后,宏观一点看——如果 Anthropic 这篇官方解读标志着什么,那就是:AI 编程正在从"换脑子"的时代,进入"调度"的时代。模型将越来越商品化,竞争的壁垒将转移到谁更会设计 Agent 的工作流、谁更懂得在不同的任务阶段配置不同的投入度。这不是一个算法问题——这是一个工程管理问题。
本文信息来自 Anthropic 官方博客、新智元报道、Claude Code 官方文档。文章的 thesis 和框架为独立分析,不代表 Anthropic 官方立场。
