近自主AI化学家改进药物化学中一项挑战性反应
A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry
OpenAI 与 Molecule.one 合作,将 GPT-5.4 连接到化学 AI agent Maria 及高通量实验室,用于改进 Chan–Lam 偶联反应。系统独立识别出伯磺酰胺为挑战性底物,并建议使用 TEMPO 作为温和氧化剂。经两轮共 10,080 个反应实验,平均产率从 16.6% 升至 25.2%,产率超 30% 的反应比例从 15.6% 增至 37.5%。人类化学家验证了 14 个底物对中 11 个产率提高,多数提升两倍以上。
OpenAI 在科学领域的工作源于一个简单的信念:先进的 AI 可以成为科学家的强大伙伴,帮助他们探索更多想法、连接不同概念、设计更好的实验,并加速有利于人类的发现。我们已经分享过模型在数学领域取得新颖成果的早期案例,包括单位距离问题的研究;在理论物理学方面,通过胶子振幅的新结果;以及在生物学领域,GPT‑5 在自动化实验室中帮助降低了无细胞蛋白质合成的成本。我们还推出了 GPT‑Rosalind,这是一个专为支持生命科学研究和药物发现工作流而构建的模型。
本项目将这一轨迹延伸至药物化学领域,在该领域,进展无法仅凭推理来衡量。一个假设必须在实验室中,面对真实的分子、仪器和实验噪声才能成立。我们与 Molecule.one(在新窗口中打开)合作,将 GPT‑5.4 连接到 Maria——一个集成了高通量实验室以实现自主研究的化学 AI agent——并赋予它一个开放式的目标:改进若干重要反应类别中的一种。该系统生成了研究方案、设计并运行了实验、分析了实验数据,并提出了后续实验。人类通过设计引导和评分 prompt、选择待测试的方案来保持参与。他们还对实验计划进行了有限的修正,协助了基本的实验室操作,并独立验证了最终结果。
最有前景的方案 OAI-M1-03 聚焦于 Chan–Lam 偶联反应的一个困难但有用的版本,这是化学家用来形成碳-氮键的反应。从改进 Chan–Lam 偶联反应以用于工艺化学这一开放式目标出发,GPT‑5.4 独立识别出伯磺酰胺是一个具有挑战性且高价值的底物类别,并建议使用包括 TEMPO 在内的温和氧化剂可以改善该反应。
经过 Maria Lab 的两轮实验,这个想法带来了显著的改进。在优化条件下,测试的 88% 的硼酸和 83% 的磺酰胺的测量产率得到了提高。平均产率从 16.6% 上升到 25.2%,产率超过 30% 的反应比例从 15.6% 增加到 37.5%。随后,人类化学家在实验室规模重复了代表性反应。这些实验证实了微升级别的结果,显示 14 个底物对中有 11 个产率更高,在大多数情况下提高了两倍以上。这一点很重要,因为药物化学家需要的反应不仅要在微升级筛选实验中有效,还要在药物发现过程中使用的实际实验室工作流中有效。
药物化学这一领域的改进尤其令人兴奋,因为合成往往是药物发现的主要瓶颈:科学家只能测试他们能够制造或以其他方式获得的分子。磺酰胺基团出现在涵盖广泛治疗领域的药物中,包括抗癌药、抗菌药和利尿剂,然而伯磺酰胺与硼酸的 Chan–Lam 偶联反应历来产率较低。使这种形式的反应更可靠,可以为药物化学家提供更广泛、更实用的方法来生产和探索潜在有用的分子。
虽然这仍是一个早期结果,但它为我们正在努力的更广泛方向提供了另一个具体例证:AI 系统可以成为科学家在研究循环大部分环节中的宝贵伙伴。该模型回顾了文献,提出了一个意想不到的想法,帮助设计和分析了实验,并得出了一个人类化学家可以评估的科学发现。
Maria Lab:Molecule.one 的专业高通量实验室,在 OAI-M1-03 中运行了 10,080 个反应
为什么这个化学问题很重要
有机化学是所有小分子药物,以及农业、电子和材料科学产品的基础。当一个反应能够在许多不同的起始原料上可靠地形成同一种化学键时,它就特别有用。当反应产率低或产生过多不需要的副产物时,化学家可能不得不放弃原本有前景的分子,或者花费大量时间开发不同的路线。这使得合成成为药物发现的主要瓶颈:科学家通常只能测试他们能够制造或以其他方式获得的分子。
Chan–Lam 偶联在药物化学中很有用,因为它能形成药物中常见的碳-氮键。然而,该反应并非对所有类别的分子都同样有效。特别是,伯磺酰胺与硼酸的偶联历来产率较低。磺酰胺是在肿瘤学和传染病药物中发现的一类重要分子。使这个反应更可靠,可以为药物化学家提供更广泛、更实用的方法来生产和探索潜在有用的分子。
连接 GPT‑5.4 与 Maria AI 和实验室
这个组合系统将互补的能力结合在一起。由与 Maria AI 合作的科学家编写的 prompt 与 GPT‑5.4 在一个 harness 内配合使用,以生成并对数千个可能的研究方案进行排序。人类化学家审查了根据系统排名最高的少量方案,并选择了四个进行实验室测试。然后,Maria AI 将选定的高层次计划转化为详细的实验室指令,运行了数千个高通量实验,分析了原始数据,并将结构化结果返回给 GPT‑5.4。
四个被选中的方案之一,OAI-M1-03,建议使用温和的氧化剂(如 TEMPO)来提高 Chan-Lam 反应在磺酰胺合成中的性能。化学家们发现这个建议既令人惊讶又有趣。我们将在本博客文章和论文(在新窗口中打开)中分享 OAI-M1-03 的详细发现。
随后,最终的研究方案被 Maria 用于生成实验网格,人类进行了轻微的修正。最大的人类修正是避免使用二甲基亚砜(DMSO)作为溶剂,因为化学家担心它可能与用作对照的更强氧化剂发生反应。
整个过程耗时三个月,从 3 月 4 日的第一个 prompt 到 6 月 4 日与独立专家分享 OAI-M1-03 的结果。
我们将此工作流描述为近自主,而非完全自主,因为人类化学家在整个过程中仍然做出了重要决策。模型提出了关键的研究思路,而人类化学家提供了高层次的引导和判断,修正了实验细节,帮助准备了实验室耗材和试剂,并手动重复了关键实验。
我们的发现
OAI-M1-03 确定了 TEMPO 是所研究的伯磺酰胺 Chan-Lam 偶联反应的一种有用添加剂。在优化条件下,反应在两个方面得到改善:平均产率提高,并且更多的底物组合达到了实际有用的产率。
在两轮实验中,Maria 总共运行了 10,080 个反应——这比一位化学家每天运行三个反应、持续十年所运行的数量还要多。这种规模很重要,因为当化学结果仅在少数几个例子上测试时,可能会产生误导。一个反应可能在一对起始原料上看起来很有前景,但在更广泛的分子集合中却失败。数千个反应使得在十种测试的氧化剂中识别出 TEMPO、观察其效果在多样化组合中重复出现,并发现其局限性成为可能。
在分析完第一轮数据后,系统提出了更聚焦的第二轮实验,以测试后续假设。一个有用的后续发现是,TEMPO 可以被一种更便宜的类似物 4-羟基-TEMPO 替代,而性能损失很小。
该结果在 Maria Lab 的微升级筛选格式之外也经得起考验。人类化学家在实验室规模手动重复了代表性反应,并观察到 14 个底物对中有 11 个产率提高;其中 8 个对的提高超过两倍。这种重复很重要,因为非常小规模的实验有时会引入伪影,这些伪影在更大规模下会消失。在研究成果发表在科学期刊之前,实验室规模的验证也是惯例。

四位外部化学专家审阅了描述 OAI-M1-03 的预印本。他们的评估支持了我们的观点,即该结果是新颖的,值得与科学界分享。更严格的考验将在下一步:独立实验室能否复现该结果,以及化学家是否发现它在更广泛的分子范围内有用。
在三个月期间由 GPT‑5.4 生成并由 Maria 测试的其他三个方案中,OAI-M1-02 和 OAI-M1-04 在 Maria Lab 中得到了实验验证,而 OAI-M1-01 被证伪。对这些结果的分析仍在进行中。
局限性
这项工作表明,模型可以在有机化学领域做出有用的贡献。它所做的不仅仅是总结文献或建议一次性实验:它提出了一个具体的、令人惊讶的假设并提交给人类审查,设计了实验,解释了实验数据,并设计了后续实验。
但这并不表明 AI 可以独立地从头到尾运行一个化学研究项目。人类的判断仍然至关重要,并且该工作流依赖于专业的高通量基础设施。这也不表明该方法将推广到其他偶联反应、其他底物类别或生产条件。
产率估计来自高通量平台,实验室验证涵盖了 14 个代表性底物对。需要更多的工作来表征反应机理、定义底物范围、测量不同实验室条件下的性能,并独立复现该结果。
准备工作
化学能力需要谨慎对待,因为支持医学和材料科学的相同工具也可能被滥用。我们特意将这项工作限定在一个合法的药物化学问题上:改进一种用于制造类药分子的已知偶联反应。实验不涉及毒素、化学武器或要求设计有害化合物。这些结果不应被解读为该系统能够帮助进行那些有害应用的证据。该项目并未测试或证明这一点。
我们通过我们的准备工作框架来评估和缓解来自高级模型能力的新兴风险,包括与化学和生物领域相关的风险。本工作中使用的模型已经与英国 AI 安全研究所进行了相关评估,并且该系统被设计为拒绝针对有害应用的请求。实验工作流增加了另一层控制:人类化学家选择哪些方案进入实验室,审查实验计划,并保留对物理基础设施的控制。
我们认为这是研究 AI 在实验化学中潜力的负责任方式:选择一个具有明确科学价值的问题空间,将模型级别的安全措施与专家监督相结合,并通过受约束的物理实验来评估系统。随着这些能力的提高,我们将继续评估新兴风险,加强安全措施,并具体说明一个结果意味着什么和不意味着什么。
下一步计划
接下来的直接步骤是科学性的:测试更广泛的起始原料,研究添加剂为何能改善反应,绘制效果有效和失效的范围,并支持独立复现。这些研究将共同决定该方法的应用广度及其在实际药物化学工作流中的有用程度。
我们的长期目标是使 AI 系统成为可靠的科研伙伴,帮助研究人员生成假设、设计实验、解释结果并决定下一步测试什么,同时始终立足于专家判断、可靠测量和强有力的安全措施。有机化学是一个特别高杠杆的领域,因为小分子发现和制造的进展取决于能否可靠地制造分子。科学家只能测试他们能制造的分子,而更好的合成可以扩展他们在医学、农业、电子、能源和材料科学领域可以探索的想法范围。这个结果是那个更广泛方向的一个早期例子:一个前沿模型、专门的 agent、一个自动化实验室和人类化学家协同工作,在研究循环中更快地前进,并产生科学界可以评估、复现和在此基础上发展的发现。
我们感谢 Molecule.one 团队以及审阅这项工作的独立化学家们。