Anthropic · 研究

深入了解Claude的数学能力

Learning more about Claude's mathematical capabilities

二〇二六年八月十日 · 英文原文

Anthropic 未发布的研究版 Claude 尝试解决黎曼猜想未果,但将黎曼 zeta 函数零点满足猜想的比例下界从 41.6% 提升至 67.2%。该模型结合 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 及 Bombieri 的工作,构造 Weil 诱导二次型并利用秩不等式得出结果。Anthropic 数学家 Levent Alpöge 和 Ralph Furman 验证了证明,Claude 还生成了 Lean 形式化证明。实验使用 3100 万输出 token,协调约 60 个子代理,运行 2400 个 shell 命令,下载 54 篇论文。专家 Brian Conrey 和 Dan Goldston 审阅了论文。

最近,Anthropic 的一名员工给 Claude 出了一个不合理的挑战。这关乎数学中最著名的未解问题之一:认真尝试解决黎曼猜想。

Claude 确实认真尝试了,但如果你熟悉这个任务的难度(黎曼猜想可追溯至 1859 年,且悬赏百万美元),你可能会预料到它并未成功。然而,在尝试过程中,它意外地在相关问题上取得了进展。

一个未发布的研究版 Claude 改进了黎曼 zeta 函数满足黎曼猜想的零点比例的下界,这一长期存在的下界从 41.6% 提升到了 67.2%。它借鉴了过去几十年数学家们的广泛研究,将这个已知常数比例提高了。

Anthropic 的两位数学家研究并验证了 Claude 的论文,并为专家们撰写了一份非正式说明,简洁地陈述了 Claude 的证明。Claude 还为其结果生成了形式化可验证的证明。我们感谢 Brian Conrey 和 Dan Goldston 这两位该领域的专家,他们在短时间内慷慨地审阅了论文。

我们不期望 Claude 使用的技术能证明黎曼猜想。但它的工作再次展示了 AI 模型数学能力进步的速度。在这篇文章中,我们讨论 Claude 如何应对这个问题以及它发现了什么。

黎曼 zeta 函数描述了素数的分布:函数取值为零的每个位置都为素数序列贡献了更精细的细节。黎曼猜想是决定素数的零点都存在于某条垂直线上。这已成为数学中最重要的猜想之一:许多结果假设它为真,以便为素数提供某种随机性。

至今无人能证明或反驳黎曼猜想,但数学家们在研究黎曼 zeta 函数及其零点的许多相关方向上取得了进展。如上所述,其中一个方向是量化在线上的零点最小比例:随着时间的推移,他们逐渐将这个已知常数比例提高到 41.6%。

另一个方向涉及线上零点的分布。特别是,1973 年,Montgomery 在该领域引入了许多新技术,尽管这些技术假设猜想为真。最近,几位数学家(Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh)发表了一系列工作,使 Montgomery 的技术无需该假设即可运作,这意味着它们可以支持提高线上零点下界常数的工作。Claude 的结果大量借鉴了这一研究方向,以及 Bombieri 在 2000 年的一篇论文。

Claude 发现,将 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 的结果与 Bombieri 的工作相结合,提供了一种超越先前最先进下界比例 41.6% 的方法,将其提高到 67.2%。

Claude 发现的简短技术解释如下:Claude 构造了一个由 Weil 诱导的二次型构成的合适函数空间,以及由线上(分别线下)零点产生的正定(分别负定)子空间。然后,Claude 简单地写下一个关于二次型秩的不等式,该不等式涉及一阶和二阶矩信息。(后者通过素数对偶图像或通过控制 Hilbert 变换的成功计算,在解析数论中并不令人意外。)在某种意义上,勇敢地处理整个空间,同时考虑正定性和负定性,并允许二次型非对角化,是让 Claude 基于重要的先前工作得出结论的步骤。

完整的技术解释可在论文中找到。Claude 对其如何得出结果的解释可在单独的附录中查看。

一个未发布的研究版 Claude 在 Claude Code 中通过两个会话发现了新的下界,总共使用了 3100 万个输出 token。

Anthropic 员工 Jarred Sumner(非数学家)提示 Claude 对猜想本身“认真尝试”,将数学选择留给模型。最初,Claude 生成并尝试了 650 个想法,但都没有成功。Jarred 提示 Claude 再试一次,它花了一天半时间协调约 60 个 Claude 子代理,这次深入得多:它们之间运行了 2,400 个 shell 命令,并编写了数百个 Python 脚本。¹ 子代理们对已知的 zeta 零点运行了数千次数值检查,并互相评审工作。在整个过程中,Jarred 的输入主要限于向 Claude 发送鼓励信息(大多是“继续”或“相信自己”的变体)。² 这似乎帮助 Claude 克服了最初对能否取得有意义进展的怀疑。

在尝试任务时发现这一新结果后,Claude 通过让各种子代理审查证明、寻找反例、从 arXiv 下载 54 篇论文以检查其发现是否已被提出,并从头独立重新证明其发现来测试其工作。Claude 主动提出将其发现写成论文,并建议人类数论专家验证其发现。

Anthropic 自己的两位数学家 Levent Alpöge 和 Ralph Furman 审查了 Claude 的工作,以理解新结果及其与上述先前工作的关联。与此同时,Claude 与另一位员工 Eric Easley 合作,为结果生成了 Lean 形式化,该形式化通过了标准验证工具比较器。

这一结果表明,像 Claude 这样的 AI 模型能够以新的、有时令人惊讶的方式扩展数学家思想的影响力和覆盖面。尽管它无法解决黎曼猜想本身,但这一结果是原始请求的意外副产品。

甚至 Claude 也对自己的发现感到惊讶——它起初持怀疑态度,可能是因为它从训练中了解到数学开放问题的难度以及 AI 模型的局限性。但在一些鼓励性提示后,它得出了我们描述的结果。也许 Claude,像我们许多人一样,低估了 AI 进步的速度。

以下是提供更多关于 Claude 结果信息的文档列表:

译自 Anthropic · 研究 · 录于 二〇二六年八月十日