OpenAI · 官方博客

推出GeneBench-Pro

Introducing GeneBench-Pro

二〇二六年六月三十日 · 英文原文

OpenAI 推出 GeneBench-Pro,一个用于评估 AI agent 在计算生物学中高阶判断能力的基准测试。该基准包含 129 个合成构建的问题,覆盖基因组学、定量生物学和转化医学等 10 个领域。每个问题提供真实杂乱的数据集与实验背景,要求模型自主探索数据、选择分析方法并迭代求解。最强模型 GPT-5.6 Sol 在最高推理水平下通过率为 28.7%(Pro 模式 31.5%),而人类专家完成单个问题需 20-40 小时。82 个问题经外部专家评审,部分问题将在 Hugging Face 开源,50 个问题子集将交由 Artificial Analysis 独立测试。

科学数据很少附带使用说明。研究人员必须判断一个模式反映的是生物学现象还是噪声,数据能否支持所提出的问题,以及每个结果应如何改变他们接下来的行动。AI agent 越来越能够执行复杂的分析,但真正的科学研究不仅依赖于回忆事实或遵循预定义的工作流程,还依赖于做出这些更高层次的判断。

今天,我们推出 GeneBench-Pro——一个具有挑战性的、研究级别的基准测试,用于检验模型能否处理现实计算生物学中需要大量判断的分析。它扩展了 GeneBench⁠(在新窗口中打开),涵盖了基因组学、定量生物学和转化医学中更困难、更现实的任务,捕捉了计算生物学科学研究的复杂性、迭代性和模糊性。

迄今为止,很少有令人信服的评估能够衡量那些使现实计算研究变得困难的系统级判断能力。这些能力包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时可以用于决策。由于这些技能难以形式化,因此也难以严格评估,即使它们的不足正日益成为整体 AI 性能的瓶颈。

GeneBench-Pro 旨在精确衡量这些更高层次的能力。在 GeneBench-Pro 中,我们将“研究品味”定义为塑造分析的一系列判断:数据能支持哪些问题,早期诊断应如何改变模型或估计量,以及何时需要修改初始计划。每个 GeneBench-Pro 问题都会给模型一个真实且杂乱的数据集、简要的实验背景,以及一个与下游决策相关的目标估计量。要正确回答,模型必须探索数据、选择合适的分析方法、进行迭代实验过程,并提供最终答案。

数据集构建

在生物学中,数据生成(例如基因组测序)的成本已大幅下降,一些研究人员现在认为⁠(在新窗口中打开) 限制因素不再是样本收集,而是下游计算和分析。GeneBench-Pro 旨在评估解决这一瓶颈的进展,包含 129 个问题,涵盖广泛的计算生物学场景和方法。

领域图谱:10 个领域、21 个子领域的 129 个问题

点击上方圆点了解一个基准问题。

此图谱提供了 GeneBench-Pro 广度的预览。请访问 案例研究页面 以更详细地探索 10 个代表性问题。

GeneBench-Pro 也旨在避免常见的基准测试失败。许多长期生物学基准测试围绕杂乱的历史数据集构建多步骤问题,其中可能没有单一正确的分析路径。一个 agent 可能选择一个合理的截断值,而另一个 agent 可能选择另一个不同但同样合理的选项,这更多地反映了基准创建者的任意选择,而非模型性能的根本差异。相反的情况也可能发生:如果一个问题在数值上不够敏感,agent 可能在分析中犯下根本性错误,但仍能得出及格的结果。

为避免这些失败模式,每个 GeneBench-Pro 问题都是合成构建的:我们知道完整的因果结构,并直接模拟数据生成过程。这使我们能够调整每个问题的复杂度,确保主观分析选择上的合理差异仍能产生可接受的数值结果,并通过消融研究验证看似合理但错误的分析会失败。然后,我们通过详细的 trace 分析来审计问题草稿,检查信息泄露和意外的解决方案路径。这让我们确信,获得正确答案取决于选择正确的分析路径,而不是利用捷径或匹配任意的作者偏好。

我们将 129 个 GeneBench-Pro 问题中的 82 个发送给了外部领域专家,包括研究生、博士后研究员、产业科学家和教授。评审员评估了每个问题的真实性、目标答案是否可识别,以及方法和估计量是否合适。反馈被用于改进问题。

评估与评分

每个 GeneBench-Pro 问题都是一个独立的科学分析。Agent 可以访问一个隔离的工作空间,其中包含简短的 prompt、数据文件以及标准的生物信息学工具栈,包括 Python、科学计算库和基础基因组学包(如 PLINK 2.0),尽管问题不需要特定领域的工具。

由于我们控制着完整的数据生成过程,我们可以根据已知目标确定性地评判正确性,避免了基于标准评分标准评估中出现的模型选择变异性和冗长效应。

每个问题还附带丰富的元数据,包括预期的分析结构、附加的数据文件、详细的多页案例研究以及专家评审结果。我们将在 Hugging Face⁠(在新窗口中打开) 上完全开源 10 个具有代表性的 GeneBench-Pro 问题,并提供一个 交互式网页界面 供浏览。最后,我们将在不久的将来向 Artificial Analysis⁠(在新窗口中打开) 提供一个包含 50 个问题的子集,用于独立的第三方基准测试。

结果

我们最强的模型 GPT‑5.6 Sol 在最高推理水平下达到了 28.7% 的通过率(启用 Pro 模式时为 31.5%)。这比我们开始构建原始 GeneBench 时有了显著提升;当时,我们最好的前沿模型 GPT‑5 得分低于 5%。在此基准测试上的进展表明,前沿模型正在快速改进,即使在不太具象的系统级科学推理方面也是如此。按照目前的速度,这个基准测试可能在今年年底前达到饱和。

结果还显示了扩展测试时计算的影响。在最低推理水平下,GPT‑5.6 Sol 的通过率仅为个位数。在最高推理水平下,GPT‑5.6 Sol 解决的问题数量几乎是 GPT‑5.2 的六倍,而使用的 token 数量仅为后者的三分之二左右。

跨模型家族的比较表明,在定量不确定性下的高层次科学推理方面,GPT 模型是最强的系统之一。GPT‑5.6、GPT‑5.5 与领先的开源模型(如 GLM 5.2)之间的性能差距,远大于我们从 编码基准测试⁠(在新窗口中打开) 外推时的预期,这表明开源模型更专注于编码,而非更广泛的推理能力。

在开发过程中,我们使用前沿 GPT 模型来评估和强化问题。因此,我们怀疑 GeneBench-Pro 可能相对于其他模型家族对 GPT 模型存在偏见。然而,竞争模型最多只能与相应 GPT 模型在发布时的性能持平,并且往往差距显著。

考虑到 GeneBench-Pro 问题的难度,这些评估结果——GPT‑5.6 Sol(Pro)高达 31.5%——是惊人的。在一项调查中,我们的评审员估计,一个典型的 GeneBench-Pro 问题需要人类专家大约 20-40 小时才能完成。按保守的每小时 200 美元计算,单个问题的人力成本高达数千美元。当前的 AI agent 仍然太不可靠,无法取代人类专家,但成本差距巨大,每个问题的推理成本仅为几美元。这意味着,即使以当前能力实现部分自动化,也能创造可观的经济和科学价值。

尽管如此,前沿模型仍然只能解决不到三分之一的问题,这表明还有很大的改进空间。模型可以在具有挑战性的问题上取得部分进展,但它们难以完成推理闭环。这种失败模式反映了人类专家和新手之间的对比。专家利用他们的经验来构建问题并调整方法,而新手则进行观察,但难以将其整合到问题的更广泛背景中。

要实现近乎完美的性能,需要既能可靠衡量进展,又能识别模型失败之处的评估。像 GeneBench-Pro 这样的基准测试有助于将模糊的能力缺陷转化为我们可以诊断和改进的东西。

如果 agent 能够可靠地自动化这类分析,它们可能会显著加速科学发现。人类遗传证据已经是靶点优先排序和转化研究跟进的核心,因为具有遗传支持的机制更有可能导致获批的治疗方法。

与此同时,测序成本已大幅下降,生物库规模的数据集现在以前所未有的广度将分子、表型和健康记录信息联系起来。限制因素正从数据生成转向将信息转化为可操作的见解。能够持续执行目前由人类专家团队处理的分析的模型,可以通过加速假设筛选、靶点跟进以及数据生成与决策之间的迭代周期,来变革工业研究。

GeneBench-Pro 代表了评估经验丰富者所具备的良好科学判断中更抽象技能的最初努力。这些技能使他们能够直觉地识别最有前景的初始分析,在数据与初始假设相矛盾时迭代和修正自己的思路,并得出下游临床、学术或商业决策可能依赖的结论。

我们预计,随着模型能力的提升,那些在更高抽象层次上探测模型能力的基准测试将变得越来越有用,其价值将超越那些仅仅测试书本知识或执行常规分析能力的测试。

译自 OpenAI · 官方博客 · 录于 二〇二六年六月三十日