Anthropic 于周二发布了 Claude Opus 5.5,这是该公司称之为 Claude 5.5 系列的首款型号。 Anthropic 表示,新型号在大多数任务上的表现与其最昂贵的旗舰产品 Claude Fable 5.1 的水平相同。

不同的是,该模型的运行成本比它所取代的 Opus 5 低 20%,而且比该公司最先进的产品 Fable 5.1 便宜 60%。

看来,这个模型非常有能力。无论是版本(5.5 对比 Fable 的 5.1)还是系列,它都是最先进的模型(Opus 是公开可用的最大模型,其次是 Sonnet,Haiku 是最小的模型)。

Anthropic 承认 Fable 和 Opus 之间的差距比其基准分数显示的要窄,但按计划公开提供,并且每个代币更便宜,这使得它成为大多数 Claude 用户的明显选择。

Opus 5 于 7 月推出,在大多数基准测试中均低于 Fable 5,但 Fable 5.1 于 9 月初推出并扭转了这一局面,在 Anthropic 发布的每个基准测试中都击败了 Opus 5。

Opus 5.5 再次缩小了差距,这次是价格而不是原始分数。 Lovable 是一个开发者平台,早在 7 月份就通过自己的编码测试运行了 Opus 5,该平台在 Anthropic 分享的一份声明中表示,早期的模型比之前的模型“更稳定,运行之间的方差要小得多”——这与 Anthropic 现在再次提出的效率主张相同。

Opus 5.5 也是 Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 发表文章呼吁行业放慢脚步以来推出的首款型号,他认为人工智能能力的提升已经超过了旨在控制其的安全测试。 “我们必须放慢改进人工智能模型能力的步伐,”阿莫代本月早些时候写道。

Anthropic 通过代理编码(由人工智能代理执行的工作)来衡量大部分进展,该模型自行采取多步骤操作,而不是只回答单个提示。

Terminal-Bench 4.0 测试代理是否可以在命令行界面内完成复杂的专业任务,并以已完成任务的百分比对结果进行评分,Opus 5.5 达到 66.4%,领先于 Fable 5.1 的 55.8% 和 GPT-6 Astra 的 57.9%。 FrontierCode 使用相同的通过率评分来检查代理的代码更改是否实际上会合并到真实的工程管道中,结果显示 Opus 5.5 的通过率为 54.4%,而 Fable 5.1 的通过率为 50.3%。

GDPval-AA v2.1 使用 Elo 对 44 个职业的现实专业工作进行评分(同样的国际象棋风格排名系统用于衡量相对技能而不是固定百分比),Opus 5.5 得分为 1846,而 Fable 5.1 为 1735,Opus 5 为 1708。

不过,Opus 5.5 并不是在所有地方都处于领先地位。 AutomationBench 是 Zapier 构建的基准测试,用于对代理是否能够在没有人工帮助的情况下从头到尾执行完整的业务工作流程进行评分,GPT-6 Astra 的得分为 41.4%,超过了 Opus 5.5 的 40.0%。

Terminal-Bench-Science 0.1 使用相同的通过率方法测试在命令行环境中进行的代理科学研究,Astra 的通过率达到 64.6%,远远超过 Opus 5.5 的 58.7%。

更大的卖点是成本。输入代币(模型读取和写入的文本块,按百万计价)现在 Opus 5.5 的价格为 4 美元,而 Opus 5 的价格为 5 美元,输出代币从 25 美元降至 20 美元。缓存读取意味着重用模型已经处理过的上下文,而不是从头开始重新处理它,这会导致长时间代理编码会话的大部分成本下降 60%,每百万代币 0.20 美元。

由于 Opus 5.5 在这两项功能上与 Anthropic 的 Mythos 级模型(该公司最受限制的级别,保留给经过审查的网络安全和生物学研究人员保留)相匹配,因此它的启动与 Fable 5.1 具有相同的保障措施。

大多数网络安全任务都会自动重新路由到旧版 Opus 4.8,这是许多开发人员和用户之前抱怨的问题。

Opus 5.5 现已在 Anthropic 的平台上上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。 Anthropic 表示,Sonnet 5.5 和 Haiku 5.5 将在未来几周内推出,其他产品也将降价。