Anthropic · 产品发布

Claude Opus 5 发布

Introducing Claude Opus 5

二〇二六年七月二十四日 · 英文原文

Claude Opus 5 今日发布,智能接近 Fable 5 前沿水准,价格为其一半。在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评估中达到新 SOTA,但网络安全任务落后于 Mythos 5。Opus 5 为 Claude Max 默认模型、Pro 最强模型,性能在 Opus 4.8 相同成本下大幅提升,每任务成本更低,性能超 Opus 4.8 两倍以上。在生命科学评估中,有机化学任务高出 10.2 个百分点,蛋白质任务高出 7.7 个百分点。对齐方面,Opus 5 是迄今为止最对齐的模型,欺骗行为率最低。定价为每百万输入 token 5 美元、输出 25 美元,提供 Fast 模式(速度约 2.5 倍)。

Claude Opus 5 今日正式发布。这是一款深思熟虑且积极主动的模型,其智能水平接近 Claude Fable 5 的前沿水准,但价格仅为后者的一半。

在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评估中,Opus 5 达到了新的 SOTA(最优水平),但在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计:它比其他模型运行效率更高。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强的模型。

Claude Opus 5 在与其前代 Opus 4.8 相同成本下,性能大幅提升。本节图表展示了模型性能如何随其 effort(努力)设置变化,客户可利用此设置优化智能水平,或节省 token 以获得更快、更便宜的结果。

Opus 5 在重要的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,且每任务成本更低,性能是 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,以最大 effort 运行时,模型性能达到 Fable 5 峰值得分的 0.5% 以内,但每任务成本减半;在 high、xhigh 和 max effort 设置下,它也能在给定成本下实现比其他所有模型更高的性能。

我们在知识工作和问题解决任务上也看到了类似结果。例如:

在多项相关评估中,它也是我们最好且最具成本效益的模型:

对于科学研究而言,Opus 5 相比 Opus 4.8 有显著改进。在我们所有的生命科学评估中——涵盖结构生物学、有机化学和生物信息学等主题——它的表现均优于 Opus 4.8。其改进在有机化学任务上最为显著,例如从光谱数据推断分子结构(在我们的内部基准上,它比 Opus 4.8 高出 10.2 个百分点),以及在与蛋白质相关的任务上,例如预测蛋白质序列变异如何影响其功能(在此项上,它高出 7.7 个百分点)。

最后,Opus 5 能够生成更强大的视觉输出:

Claude Opus 5 在验证自身工作并仔细迭代直至成功方面要强大得多。在评估和早期访问测试中,我们和用户发现了许多体现 Opus 5 主动性和彻底性的例子:

以下是我们的早期访问客户关于使用 Opus 5 体验的进一步报告:

对齐(Alignment)。 在部署前测试中,我们的自动化行为审计发现 Opus 5 是迄今为止最对齐的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更严格地遵守 Claude 的宪法;表现出最低的欺骗行为率;并且最不容易被诱导误用。在避免可能导致难以逆转副作用的鲁莽行为方面,它也是我们迄今为止最安全的模型。

安全性(Safety)。 Opus 5 并未推进高风险、双重用途能力的前沿。在与私营部门和政府合作伙伴共同进行的严格评估中,我们发现它在生物学研究和进攻性网络安全方面仍落后于 Mythos 5。有关这些评估的更多信息,请参阅我们的 System Card。

与其前代 Opus 4.8 一样,我们有意避免在网络安全任务上训练 Opus 5。然而,由于模型通用能力的提升,它在这类任务上仍有显著进步,在发现网络安全漏洞方面接近 Mythos 5。但在利用这些漏洞方面——即将漏洞转化为实质性网络威胁——它仍大幅落后于 Mythos 5。

这一点通过 Opus 5 在 OSS-Fuzz 上的表现得以说明。OSS-Fuzz 是我们开发的一项评估,用于衡量模型在无需大量人工指导的情况下发现并利用漏洞的能力。尽管 Mythos 5 和 Opus 5 在识别漏洞方面成功率相似,但 Opus 5 在漏洞利用开发方面的得分远低于 Mythos 5。

Claude Opus 5 的安全防护措施旨在允许模型在网络安全和生物学领域的有益用途。这些措施与我们应用于 Opus 4.8 的类似,但在一小部分网络安全任务上增加了更强的护栏。

网络安全。 Opus 5 的网络安全分类器限制比例低于 Fable 5。它们允许 Opus 5 在源代码中发现漏洞,但阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关的方法)、渗透测试和漏洞利用生成。

根据我们的测试,我们预计这些分类器的干预频率将比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。在 API 上也可以启用回退到 Opus 4.8。

我们的网络安全验证计划(CVP)有助于开展原本可能受模型安全措施阻碍的网络安全工作。已加入 CVP 的企业和研究人员可以立即访问安全限制较少的 Opus 5 版本。

生物学。 由于 Opus 5 拥有与 Opus 4.8 类似的安全措施套件,它现在是我们最强大的通用科学研究模型。尽管如此,该模型在长期、自主的研究任务上仍显示出重要局限性,而这正是我们预计 AI 模型会带来最重大生物学相关风险的领域。(Mythos 5 仍然是此类生物学工作的更强模型。)作为本次发布的一部分,之前在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5,而非 Opus 4.8。

Claude Opus 5 今日在所有平台上线,定价为每百万输入 token 5 美元,每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 开始使用 claude-opus-5

它还提供 Fast 模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,Fast 模式在 Claude Platform 上以 Opus 5 基础价格的两倍提供,也可通过 Claude Code 中的使用积分获得。

与 Opus 5 一同,我们还发布了两个测试版更新:

与之前的 Opus 模型一致,Opus 5 对于通用访问没有数据保留要求。

有关如何充分利用 Opus 5 的更多指导,请参阅我们的提示指南。

译自 Anthropic · 产品发布 · 录于 二〇二六年七月二十四日