Simon Willison · 博客

Claude Opus 5 发布

Introducing Claude Opus 5

二〇二六年七月二十五日 · 英文原文

Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,提供两倍费用的快速模式。该模型在 Artificial Analysis 排行榜上领先,被描述为以一半价格接近 Fable 5 的前沿智能。在 Frontier-Bench 任务中,Opus 5 自行编写计算机视觉 pipeline 从图纸像素重建 3D FreeCAD 模型。Anthropic 未对 Opus 5 进行网络任务训练,但其在发现网络安全漏洞方面接近 Mythos 5,在利用漏洞方面仍落后。

介绍 Claude Opus 5

今天大部分时间我都在和海獭一起划皮划艇,所以还没机会好好测试 Anthropic 的新模型 Claude Opus 5。目前反响不错,Anthropic 将其描述为“一款深思熟虑且主动的模型,以一半的价格接近 Claude Fable 5 的前沿智能”,听起来很有前景。它目前在 Artificial Analysis 排行榜上领先,甚至超过了 Fable 5。定价与 Opus 4.8 相同,并继续提供“快速模式”,费用为基础模型的两倍。根据发布文章中的一则轶事,它似乎具有极强的主动性:在 Frontier-Bench 的一项任务中,Opus 5 被给出一张机器零件的图纸,要求编写代码将其重建为 3D FreeCAD 模型。然而,该任务故意不提供直接查看图纸的方式。Opus 5 的回应是自行编写计算机视觉 pipeline,从原始像素中提取几何信息,然后重建了整个机器零件。

它在发现漏洞方面表现更好,但故意没有接受过如何利用漏洞的训练。希望这意味着美国政府不会将其关闭!与其前身 Opus 4.8 一样,我们有意避免对 Opus 5 进行网络任务训练。尽管如此,由于模型整体能力提升,它在这些任务上仍有显著进步,在发现网络安全漏洞方面接近 Mythos 5。然而,在利用这些漏洞方面——即将漏洞转化为实质性网络威胁——它仍远落后于 Mythos 5。

Anthropic 已发布 Claude Opus 5 的提示指南。Thariq Shihipar 也撰写了《Claude 5 代模型上下文工程的新规则》。我得到的第一个鹈鹕缺少自行车轮子;第二次尝试好一些。

标签:ai, generative-ai, llms, anthropic, claude, llm-release

译自 Simon Willison · 博客 · 录于 二〇二六年七月二十五日