概述
5月28日,Anthropic 正式发布 Claude Opus 4.8,这是其旗舰模型 Opus 系列的最新升级版本。新模型在性能基准上全面超越上一代 Opus 4.7,同时带来了多项关键新特性:更高的「诚实度」、灵活的努力控制机制,以及面向大规模代码任务的动态工作流功能。
Opus 4.8 即日起上线,定价与 Opus 4.7 保持一致,快速模式(Fast Mode)价格更降至此前版本的三分之一。
「更诚实」的 AI 模型
Anthropic 在发布中着重强调了 Opus 4.8 的「诚实性」(Honesty)提升。公司表示,虽然所有 Claude 模型都经过诚实性训练以避免做出无依据的断言,但 Opus 4.8 在这一维度上达到了新的高度:
- 更善于标记不确定性:早期测试者反馈,Opus 4.8 更倾向于对其工作中的不确定性进行标记,更少做出无依据的声明
- 代码缺陷遗漏率降低 4 倍:在 Anthropic 的内部评估中,Opus 4.8 对其编写代码中的缺陷不加评论地放过的概率比前代低约 4 倍
Anthropic 对齐团队在评估后表示,Opus 4.8「在支持用户自主性和为用户最佳利益行事等亲社会特质的测量中达到了新高」,其不当行为(如欺骗或协助恶意使用)的发生率大幅低于 Opus 4.7,与公司对齐最佳的模型 Claude Mythos Preview 相当。
努力控制(Effort Control)
Opus 4.8 引入了全新的「努力控制」功能,让用户可以灵活调节 Claude 对任务投入的计算资源:
- 高努力模式:Claude 会进行更深度的推理,提供更高质量的回答,但消耗更多 token
- 低努力模式:更快响应,消耗更少 token,适合对响应深度要求不高的场景
- 该功能在 claude.ai 和 Cowork 界面中集成于模型选择器旁
这为企业用户提供了更灵活的成本控制选项——在需要深度思考的任务上使用高努力设置,在简单问答上使用低努力设置以节省预算。
动态工作流:数百并行子代理
本次发布中,Anthropic 还预览了全新的「动态工作流」(Dynamic Workflows)功能。这一特性允许 Claude Code 自行规划和协调大规模任务:
- 并行子代理:Claude 可以在单个会话中规划工作,然后运行数百个并行子代理(Subagent)
- 更长运行时间:Opus 4.8 支持子代理运行更长时间
- 自我验证:子代理完成工作后,Claude 会验证其输出再向用户汇报
- 典型场景:大规模代码迁移——Opus 4.8 可以在 Claude Code 中完成数十万行代码的库级迁移,从启动到合并,以现有测试套件作为基准
动态工作流目前以研究预览形式提供,适用于 Claude Code Enterprise、Team 和 Max 计划用户。
基准测试表现
Opus 4.8 在各项评估中展现出全面领先的性能:
- Super-Agent 基准:Opus 4.8 是唯一一个端到端完成所有案例的模型,成本与 GPT-5.5 持平
- CursorBench:在每个努力级别上都超越了前代 Opus 模型,工具调用效率显著提升
- 法律代理基准:获得有史以来最高分,首个在 all-pass 标准上突破 10% 的模型
- Online-Mind2Web:得分 84%,大幅超越 Opus 4.7 和 GPT-5.5
- Databricks Genie:在代理推理能力上实现阶跃式提升,token 成本比 Opus 4.7 降低 61%
结语
Claude Opus 4.8 的发布标志着 Anthropic 在模型能力、安全对齐和可用性上的全面进步。诚实性对齐的提升、努力控制的灵活性、以及动态工作流的突破性能力,展现了 AI 模型从「回答问题」向「自主完成复杂工作」的演进方向。
对于关注 AI 前沿进展的开发者而言,Opus 4.8 在 Claude Code 中的动态工作流能力尤其值得关注——它正在将 AI 编程助手从辅助工具升级为自主工程代理。
标签:Anthropic, Claude, Opus 4.8, AI 模型
