Claude Opus 5 正式发布:Fable 5 级别的智能,一半的价格,一个代际的跃迁

7月25日凌晨,Anthropic 正式发布了 Claude Opus 5——这是 Opus 家族的最新旗舰模型,也是 Anthropic 在"平价顶级智能"方向上扔出的一枚重磅炸弹。

简而言之:Claude Opus 5 以 Opus 4.8 的价格,达到了 Claude Fable 5 近 90% 的性能。这不是一次常规迭代,而是一个代际跃迁。

一、数字不会说谎

Anthropic 在官方公告中给出了一组令人印象深刻的数据:

  • Frontier-Bench v0.1:Opus 5 超越所有模型,性能是 Opus 4.8 的两倍以上,且每个任务成本更低
  • CursorBench 3.2:最高 effort 模式下,Opus 5 与 Fable 5 的峰值仅差 0.5%,成本却只有一半
  • ARC-AGI 3(新颖问题求解):Opus 5 得分是次优模型的 3 倍
  • Zapier AutomationBench:同等成本下,通过率约为次优模型的 1.5 倍
  • OSWorld 2.0:仅用 Fable 5 约三分之一成本,就超越了 Fable 5 的最佳成绩
  • 科学推理:有机化学评测高出 Opus 4.8 达 10.2 个百分点,蛋白质功能预测高出 7.7 个百分点

这些数字的核心指向一个结论:Opus 5 不是"稍微好一点的 Opus 4.8",而是在多个维度上接近 Fable 5 水准的模型,价格却回到了 Opus 的定位

二、Effort Level:Anthropic 的定价策略重构

Opus 5 引入了一个关键的机制——Effort Level(推理努力级别)。模型可以根据任务复杂度动态调整推理深度,用户可以在"智能最大化"和"Token 最小化"之间自由滑动。

这一点的重要意义被很多人低估了。传统模型定价是"一口价":购买一个固定智能水平,无论任务难易都按同一价格付费。Effort Level 让定价变得像云计算一样精细化——简单查询用低 effort,秒级出结果、耗费极少 Token;复杂工程问题切换到高 effort,调用更多推理能力解决问题。

这本质上是一种按需购买智能的模式,它改变了"一个模型一个价格"的定价范式。对开发者来说,这意味着同样的模型可以覆盖从简单分类到复杂 agent 推理的全谱系任务,不再需要在多个模型间切换。

三、Agent 能力:从"会做题"到"会做事"

公告中最值得关注的部分,可能不是基准测试分数,而是官方和早期用户在真实场景中的反馈:

  • 一个 Trading Firm 的工程师让 Opus 5 为一个新交易所构建市场数据流——没有实时 feed 可验证,Opus 5 自己写了一个测试套件来验证数据解析正确性
  • Opus 5 发现了一个流行开源包管理器中的真实 bug,并修复了社区补丁遗漏的边界情况——而竞品只修复了表面症状
  • 一个 Frontier-Bench 任务要求模型从一张机械零件图纸恢复为 3D FreeCAD 模型,Opus 5 自己写了一个 CV pipeline 从像素中提取几何信息——其他模型尝试五次全部失败
  • 在 Zapier 的评测中,Opus 5 将一个原始的健康数据工作簿转化为完整的流失预防流程:标记风险账户、通知负责人、生成留存运营摘要——此前没有模型能完整走完这个流程
  • 在基因组分析工作中,早期用户描述 Opus 5"表现得像一位严谨的科学家"——主动选择正确的统计检验、用独立方法交叉验证结果、在漫长的多步分析中保持注意力

这些案例揭示了 Opus 5 最关键的突破:它不再是"模型",而越来越像一个"员工"——会自己设计方法、主动验证、发现并纠正自己的错误。

四、对齐:Anthropic 的护城河

在安全性方面,Opus 5 在自动化行为审计中获得了"迄今为止最对齐的模型"评价。其整体不当行为评分仅为 2.3,远低于 Opus 4.8、Sonnet 5 和 Fable 5。

在关键风险能力上,Opus 5 虽然在漏洞发现方面接近 Mythos 5 的水平,但在漏洞利用(将漏洞转化为实际威胁)方面大幅落后——这正是 Anthropic 刻意训练的结果。他们选择了不在网络安全任务上对 Opus 5 进行专门训练,使其虽然更聪明了,但不易被恶意利用。

这种"能力增长,但安全可控"的路线,是 Anthropic 与 OpenAI 在路线选择上的根本分歧之一。

五、这意味着什么?

Opus 5 的发布传递了几个清晰信号:

1. 顶级模型正在"民主化"。 Fable 5 级别的能力不再需要 Fable 级别的预算。对于中小团队来说,这意味着一扇曾经昂贵的大门正在打开。

2. Agent 工作流将从实验走向生产。 Opus 5 在多步推理和自主验证能力上的显著提升,让 agent 从"偶尔成功"变成了"可以信任"。这对于从 Cursor、Devin 到企业内部 agent 平台(如 Cosmos)都是质变。

3. Effort Level 将重塑模型选择逻辑。 过去开发者需要在"买贵的智能模型"和"买便宜的速度模型"之间做选择。现在你可以在同一个模型内通过调整 effort 来覆盖多种场景,这会大幅降低 API 调用的复杂度。

4. 竞争焦点从"谁更强"转向"谁更好用"。 当多个模型接近天花板,用户选择的天平将从纯性能指标转向实际使用体验——成本、速度、易用性、安全合规。

六、给开发者的建议

如果你正在搭建 AI 产品,现在是时候:

  • 重新测试你的 Agent 工作流——替换 Opus 4.8 为 Opus 5,尤其是在多步推理和自我纠错场景下,提升可能是跨维度的
  • 尝试 Effort Level 调优——在简单任务上用低 effort 省钱,在核心推理环节用高 effort 保质量
  • 关注生产成本变化——如果你的产品依赖 Opus 4.8,迁移到 Opus 5 可能在几乎不涨成本的情况下获得巨大能力提升

Claude Opus 5 目前已在 Claude Max 上成为默认模型,API 端也已开放使用。对开发者来说,这是 2026 年最重要的模型升级之一——值得花一个周末认真评估。

滚动至顶部