推出 LifeSciBench
Introducing LifeSciBench
LifeSciBench是一个评估代理式AI系统在生命科学研究中实用性的基准,包含750项由173位博士级行业专家撰写的任务,覆盖七个工作流程和七个生物学领域。任务使用19,020个细粒度评分标准评估科学正确性与实用性,要求模型处理不完整证据、矛盾结果和不确定性。测试显示,GPT-Rosalind在科学沟通(通过率71.1%)和转化(57.7%)任务上优于GPT-5.5(分别为56.3%和36.8%),但在工件密集任务(通过率28.1%)和精确输出任务(数值任务14.8%)上表现较弱。453位独立评审员验证了任务质量,同意率超过96%。
代理式AI系统在生命科学研究中的能力评估
代理式AI系统在执行科学任务方面的能力正日益增强。然而,它们对生命科学研究者的实用价值,取决于其处理真实研究复杂性的能力。真实研究工作很少表现为单一的事实回忆问题或一个清晰的预测问题。研究者需要解读不完整的证据、调和相互矛盾的结果、设计困难的实验、排查检测方法问题、评估转化风险,并在不确定性中决定下一步行动。
当前的基准测试并未完全捕捉这些能力。许多生命科学评估聚焦于狭窄领域或孤立技能,导致问题具有结构化的提问格式和清晰的参考答案。虽然这些评估有其价值,但它们往往无法真正衡量一个模型能否在更广泛的研究级工作中做出贡献。
我们设计了LifeSciBench来帮助弥合这一差距。每项任务都基于具有博士级训练水平、并在生物技术和制药领域拥有直接推进药物发现项目经验的实践生命科学家的判断。
LifeSciBench包含750项由专家撰写的任务,涵盖七个工作流程和七个生物学领域。
1,062
任务工件
173
科学家贡献者
19,020
评分标准
453
专家评审员
LifeSciBench衡量什么
LifeSciBench衡量的是AI系统能否支持现实的生命科学研究任务,而不仅仅是回答生物学问题。为了定义基准分类法,我们调查了实践生命科学家在应用研究环境中最常使用的工作流程。然后,我们将他们的回答归纳为七个反复出现的类别:证据处理、分析、设计与优化、科学推理、验证与操作、转化以及科学沟通。
每项任务的结构都类似于科学家可能向知识渊博的合作者提出的请求:科学提示、任何相关的上下文或工件,以及一个自由回答的答案。专家编写的评分标准评估模型能否针对特定问题给出正确答案,并具备科学家所期望的适当详细程度、论证、注意事项和格式。
数据集构建
LifeSciBench在评估科学推理的同时,也评估现实世界科学应用所必需的、定义不那么明确的实践技能。其任务要求模型处理现实的研究问题:解读证据、做出基于领域的判断,并传达对专家评审员有用的结论。许多任务还要求模型处理不确定性,并基于支持性数据文件进行推理,而不仅仅依赖提示文本。
该基准旨在反映生命科学工作的复杂性。总体而言,79%的任务需要多个推理或决策步骤,平均每项任务四个步骤。LifeSciBench包含1,062个附加工件,涵盖图表、PDF、表格、序列文件、结构或化学文件以及网络参考文献。超过一半的任务(53%)要求模型解读或综合至少一个工件中的信息。
任务由173位来自不同生命科学学科的专家科学家创建。每位科学家都拥有博士级训练背景和生物技术或制药行业经验。任务在被接受前可根据需要经历任意多次修订,没有固定的轮次上限;被接受的任务平均经历了六轮自主自动化审查循环,并至少完成了两轮专家评审。评审锚定在可验证的正确答案或强烈的专家共识上,相关领域的评审员之间至少达到90%的一致率。这一过程有助于确保被接受的任务在科学上站得住脚、足够清晰以便评分,并且能代表应用研究。
评分与评分标准详解
LifeSciBench任务使用详细的、针对特定任务的评分标准进行评分,该标准将预期回答分解为具体的科学主张、计算、决策、论证等。在整个基准中,专家制定的评分标准包含19,020个标准——平均每项任务25个——以评估科学正确性和对研究决策的实用性。
这种设计反映了科学工作在实践中的评估方式:许多生命科学任务不能仅通过检查最终答案来评分。一个回答可能得出正确的高层结论,但如果它忽略了关键的检测方法局限性,或未能主动提出高度重要的生物学细微差别,仍可能被认为不完整。相反,一个部分回答即使没有完全解决任务,也可能包含高质量的推理。
细粒度的评分标准捕捉了这种细微差别。LifeSciBench不仅评估最终答案的准确性,还评估模型是否以科学有效且操作上有用的方式得出其答案。
从论文、图表、表格和实验记录中提取、调和并审计科学证据。
候选回答
底线: 就目前呈现的情况而言,这个资料包不足以支持基于微肌营养不良蛋白表达作为合理可能预测临床获益的替代终点而加速批准。一位持怀疑态度的FDA评审员很可能会认为生物标志物、功能、持久性、安全性和普适性证据在实质上缺乏支持。
| 资料包项目 | 关键失败模式 | 需要什么 |
|---|---|---|
| Western blot定量 | MANEX1A结合的是内源性全长肌营养不良蛋白和微肌营养不良蛋白转基因共有的N端表位,因此该检测无法清晰区分转基因产物与残留/回复突变肌营养不良蛋白。使用健康全长肌营养不良蛋白标准品来定量138 kDa的微肌营养不良蛋白也是无效的。 | 使用重组微肌营养不良蛋白标准品,以及一种能够区分转基因产物与内源性肌营养不良蛋白的正交方法,例如靶向质谱法或转基因特异性/表位特异性检测。 |
| 免疫荧光 | C端多克隆抗体非常不适合,因为138 kDa的构建体缺少C端结构域。许多DMD患者存在回复突变纤维,并且回复突变肌营养不良蛋白可能保留C端表位。回复突变纤维可能随年龄增长而克隆性扩增,从而偏倚IF信号,尤其是在年龄较大的男孩中。 | 使用针对转基因产物中存在但回复突变肌营养不良蛋白中不存在的表位的抗体重复IF。分别定量转基因阳性纤维和回复突变纤维。 |
| 替代终点有效性 | 该资料包将蛋白量与临床功能混为一谈。“健康对照蛋白质量的38%”并不意味着正常肌营养不良蛋白功能的38%,因为微肌营养不良蛋白在结构上是截短的。 | 在将表达视为替代终点之前,先经验性地验证微肌营养不良蛋白质量百分比、肌膜定位、下游功能恢复和临床获益之间的关系。 |
| 活检设计 | 治疗前后对侧股外侧肌活检引入了左右侧和肌肉内空间变异性。疾病进展和纤维脂肪替代也可能改变总蛋白归一化信号。 | 使用一致的解剖标志标准化活检部位,归一化到肌肉特异性蛋白,并平行测量纤维脂肪组成。 |
| NSAA比较/统计 | 外部自然史队列不是随机同期对照。试验资格、支持性护理、参与效应、基线NSAA、类固醇方案、年龄和外显子类别都可能使比较产生偏倚。非配对t检验是不够的。此外,+1.4的NSAA变化在该年龄组的重测变异性范围内。 | 进行随机同期安慰剂对照研究,或者至少使用调整分析,考虑基线NSAA、年龄、类固醇方案、外显子类别和其他混杂因素。 |
| 年龄窗口混杂 | 4-7岁的男孩处于一个发育窗口期,在此期间未经治疗的可走动DMD患者可能在功能衰退占主导之前获得运动功能。48周的NSAA变化混合了发育增益、疾病进展和可能的治疗效果。 | 使用带有年龄分层的同期随机对照,以区分发育轨迹和治疗效果。 |
| 先前临床先例 | 开放标签的微肌营养不良蛋白功能信号未能可靠地预测确证性获益;已发表的先例包括微肌营养不良蛋白基因治疗的确证性试验未能重现开放标签的NSAA改善。 | 不要依赖开放标签的NSAA变化作为决定性支持。需要对照的功能证据。 |
| 构建体的结构限制 | 138 kDa的构建体删除了包含nNOS结合位点的血影蛋白重复序列R16/17。nNOS招募的丧失可能损害运动过程中的功能性交感神经松解和缺血保护,从而在表达水平之外产生一个机制性的恢复上限。 | 增加机制研究,显示这一特定构建体是否恢复了相关的肌营养不良蛋白相关复合体功能、nNOS定位、运动生理学和肌肉保护。 |
| AAV持久性 | 12周时的载体基因组不能确立持久的表达。AAV9基因组主要是非整合的游离基因,并可能随时间推移而减少。载体基因组持久性不等于持续的蛋白表达。 | 测量超过12周的纵向转基因蛋白表达和功能生物标志物持久性。 |
| 免疫/安全性概况 | 8/12患者出现转氨酶升高,这与对AAV转导细胞的免疫反应一致,但机制尚未确定。考虑到AAV9的心脏趋向性,一例心肌炎病例令人担忧。 | 提供更深入的免疫监测、肝脏/心脏安全性表征,并加强心脏随访。 |
| 患者选择/普适性 | 排除抗AAV9中和抗体阳性患者限制了普适性。排除外显子44缺失限制了对该DMD亚组的适用性。n=12的样本量太小,无法在更广泛的DMD人群中表征安全性和有效性。 | 在可能的情况下扩大资格标准,或在利用该结果支持广泛批准之前,预先指定按抗体状态、基因型/外显子类别、年龄和基线功能进行分层分析。 |
监管结论: 该资料包可能显示出生物活性,但尚未确立所测量的微肌营养不良蛋白表达是一个可靠的、合理可能预测临床获益的替代终点。主要差距在于检测特异性、无效的定量标准、可能的回复突变纤维混杂、缺乏随机对照、与年龄相关的NSAA混杂、不确定的持久性以及未解决的安全性和普适性问题。
为了弥合差距,该计划需要一个受控的、年龄分层的临床设计,配备转基因特异性表达检测、正交蛋白定量、组织组成对照、纵向持久性数据、针对截短构建体的机制性功能检测,以及更强的安全性监测,特别是肝脏和心脏方面。
评分标准与等级
标准
分数
识别微肌营养不良蛋白定量中的检测/测量问题,包括MANEX1A表位共享、无效的全长肌营养不良蛋白标准品,以及需要重组或正交的转基因特异性测量。
+24
解释为什么微肌营养不良蛋白表达水平自动不能作为功能性临床获益的有效替代终点。
+22
指出削弱表达和NSAA解读的活检部位、组织组成和年龄窗口混杂因素。
+19
批评NSAA比较/统计,特别是依赖外部自然史对照。
+12
处理AAV持久性、免疫反应、转氨酶升高、心肌炎以及需要更长期的表达/安全性随访。
+15
指出患者选择/普适性差距,包括抗AAV9排除、外显子44排除和小样本量。
+8
验证LifeSciBench
我们通过独立的专家评审验证了LifeSciBench。反馈来自453位未参与撰写任务的评审员。在这些评审员中,97%拥有博士学位或同等学历,平均具有12年的领域经验和14篇经同行评审的出版物;88%报告获得过至少一项奖项或奖学金。
评审员对每项任务是否反映了优秀基准问题所需的品质进行评分:与现实研究工作的契合度、对科学推理和领域专业知识的适当测试、基于证据或专家共识,以及对评估模型性能的整体有用性。每个类别的同意率均超过96%。
评审员的评论强化了定量评分:
1 / 3
结果
我们报告两个互补的指标。通过率是模型达到任务级成功阈值(70%)的任务百分比。分数是平均评分标准奖励,即使整个任务未解决,也会对单个标准给予部分分数。两者都很重要,因为对科学任务的回答可能部分正确或有用,而不必满足完整答案的所有要求。
模型性能因任务类型、工作流程和回答格式而有显著差异。
AI系统早期展现的优势领域
LifeSciBench显示,前沿模型在涉及科学综合、沟通和结构化解读的任务上相对最强。绝对通过率仍然不高,因此这些基准领域远未饱和,但GPT‑Rosalind显示出比GPT‑5.5有意义的进步,将总体精确通过率从25.7%提高到36.1%。
模型能力进步最显著的方向出现在科学沟通和转化方面。例如,科学沟通的通过率从GPT‑5.5的56.3%提高到GPT‑Rosalind的71.1%;这个类别规模较小(n=9),因此应谨慎解读,但它表明前沿模型在组织证据和产生令人信服的面向专家的解释方面的能力正在迅速提高。转化(药物开发的“从实验室到临床”过程)显示出类似的模式,从GPT‑5.5的36.8%上升到GPT‑Rosalind的57.7%,表明模型在将临床前证据与临床意义联系起来的能力上正在快速改进。
评分标准层面的结果指向同一方向。在需要专家有用或可操作输出的任务上,GPT‑Rosalind得分为44.7%,而GPT‑5.5为29.1%。在需要处理不确定性和注意事项的任务上,其得分为44.8%,而GPT‑5.5为29.3%。这种模式表明,当任务具有清晰的证据边界并要求结构化的科学判断时,模型最为有用。
GPT‑Rosalind在由行业和学术专家确定的有科学价值的任务上领先性能。
GPT‑Rosalind在核心生命科学工作流程上比GPT‑5.5提高了性能,在转化和科学沟通方面增益最大。
AI系统仍然不足的领域
在工件密集、设计密集和操作受限的科学工作上,性能仍然弱得多。即,设计、优化与预测仍然是最困难的工作流程之一,GPT‑Rosalind的通过率为30.7%;分析同样困难,为30.3%。
工件使用是一个特别明显的差距。虽然GPT‑Rosalind在工件密集环境中的表现优于GPT‑5.5,但其通过率仍然从纯文本任务的45.1%下降到包含工件或URL的任务的28.1%。GPT‑5.5显示出相同的模式,从29.9%下降到21.9%。更详细的分析证实,前沿模型在从复杂图表或大型序列文件中提取信息,并将该信息整合到最终答案中方面存在困难。
当任务需要基于来源的推理或使用工件时,通过率下降
回答格式也很重要。需要精确序列、结构或构建体级别输出的任务显示出较低的通过率:GPT‑Rosalind在数值任务上仅达到14.8%,在序列或结构输出上达到24.0%。构建体生成任务也很脆弱,GPT‑Rosalind为27.3%,且相比GPT‑5.5几乎没有改进。这种差距的部分原因可能在于精确答案任务的评分表面更严格,计算或格式上的微小差异都可能导致回答低于通过阈值。尽管如此,这些失败在科学上是有意义的,因为许多生命科学工作流程需要精确到足以直接使用的输出,例如在CRISPR/HDR供体设计或siRNA设计中。
模型也常常只完成部分任务而未完全解决。在大约14%的任务中,尽管未能达到精确通过阈值,模型仍获得了可观的评分标准分数。对于GPT‑Rosalind,有109项任务的通过率低于20%,但仍获得了至少50%的评分标准奖励。在实践中,这意味着模型可能识别出相关证据或产生一个看似合理的部分答案,但仍然失败,因为它们错过了关键约束、使用了错误的证据、进行了不完整的计算,或者没有将其推理与科学上有用的最终决策联系起来。
局限性与未来方向
LifeSciBench是朝着衡量AI系统对生命科学研究有多大用处迈出的一步,但它不能替代在真实研究环境中研究模型。该基准侧重于反映行业常见工作流程的独立任务,同时将许多科学专业和任务类型排除在其当前范围之外。真实研究是迭代的:科学家收集新证据、修正假设、设计后续实验,并根据结果调整计划。
因此,在LifeSciBench上的强劲表现应被解读为现实任务级能力的证据,而不是下游研究影响的直接衡量标准。该基准基于行业工作流程,但它并未捕捉到真实研究项目的全部多样性或动态性,在这些项目中,进展取决于随时间展开的因素。
下一步是将基准性能与真实研究工作流程中的部署研究联系起来。虽然LifeSciBench是与实践科学家共同开发的,但衡量AI系统是否加速发现或改善研发成果,将需要在真实研究环境中、在更长的时间跨度内、并跨越多轮推理、反馈和实验跟进,来研究模型的使用和性能。