Talos:通过自动化迭代基因组再分析扩展罕见病诊断
Talos: Scaling rare disease diagnosis with automated, iterative genomic reanalysis
Talos 是一款开源工具,用于对罕见病基因组数据进行自动化、迭代式再分析,由人口基因组学中心、澳大利亚基因组学、Broad Institute 和微软合作开发。在近 1,100 名患者的验证集中,Talos 恢复了 90% 的范围内诊断,每名患者仅标记出 1.3 个候选变异。在近 5,000 名未确诊患者的前瞻性队列中,Talos 提供了 241 个新诊断(额外检出率 5.1%),从证据公开到确诊平均仅需 32 天。在每月迭代周期中,分析师每 200 名患者只需审查一个新变异。
一览
Talos 是一款开源工具,用于对罕见病基因组数据进行自动化、迭代式再分析。随着科学知识的演进,它能高效地重新检查已存储的测序数据,并标记出带有新可行证据的变异。Talos 针对低假阳性率进行了调优:在一个近 1,100 名患者的验证集中,它恢复了 90% 的范围内诊断,同时每名患者仅标记出 1.3 个候选变异供专家审查。这对于实现大规模可持续的再分析至关重要。在一个近 5,000 名未确诊患者的前瞻性队列中部署后,Talos 提供了 241 个新诊断(额外检出率 5.1%)。从支持性证据公开到最终确诊,平均仅需 32 天。在每月迭代周期中,分析师每 200 名患者只需审查一个新变异,这表明频繁、系统性的再分析可以可持续地运行。
为什么基因组再分析很重要
基因组检测已经改变了罕见病的诊断方式,但即使有了这一进步,超过一半的患者在首次检测后仍未得到诊断。这是因为我们对基因组的认识仍不完整。研究人员每天都在更多地了解特定基因的功能及其与疾病的关系。然而,与大多数诊断性检查不同,基因组数据具有一个独特的特性:它可以被无限期地存储和重新检查。由于我们对基因组的理解不断改进,只需在之后重新运行分析,就可能得出首次无法做出的诊断。这是因为每年都有数百个新的基因-疾病关联和数千个新的变异分类被报道。对未确诊患者基因组进行再分析是解决方案;一项针对近 9,500 名未确诊患者的荟萃分析发现,在大约两年内,再分析将诊断率提高了约 10%。
然而,问题在于目前的再分析绝大多数是手动的。它依赖于有积极性的临床医生、稀缺的实验室人员以及不稳定的报销机制,因此绝大多数存储的基因组从未被重新审视,数据不断累积。自动化长期以来被认为是答案,但自动化工具的开发者必须在灵敏度、特异性、人类必须审查的候选变异数量以及分析重新运行的频率之间做出艰难的权衡。
Talos(在新标签页中打开)由人口基因组学中心、澳大利亚基因组学、Broad Institute 和微软合作开发,旨在解决这些权衡问题,并在国际范围内证明系统性再分析既可行又有价值。我们最近发表了一篇期刊文章(在新标签页中打开),详细介绍了 Talos 的功能,并在多个罕见病队列上评估了其性能。
Talos 的工作原理
Talos 在每次运行时,都会根据最新的社区知识重新解释患者现有的变异调用。它利用两个持续更新的公共资源:PanelApp Australia(在新标签页中打开)用于基因-疾病关系和遗传模式,以及 ClinVar(在新标签页中打开)用于变异级别的致病性。然后,它应用一种变异优先级排序算法,旨在筛选出最有可能符合 ACMG/AMP 临床报告标准的变异。
图 1 – Talos 概览。Talos 分多个阶段运行,首先收集关于遗传变异及其携带者的不变信息,然后应用最新知识来过滤和优先排序可能具有临床相关性的变异,最后将这些变异连同支持性证据一起呈现给临床医生。
该流程利用新发现的信息来标记和过滤变异,然后使用家系结构(例如,遗传模式和新生状态)以及(如果可用)患者的表型来优化候选集。Talos 可用于解释来自外显子组或基因组数据的单核苷酸变异、小插入/缺失、拷贝数变异和大结构变异。
两个设计选择使 Talos 与众不同。首先,它刻意保守,优化为返回一小组高置信度变异,而不是一个长的排序列表,因为在现实世界的基因组再分析中,限制因素是人工审查时间,而不是算法召回率。其次,在重复运行时,Talos 仅返回自上一周期以来支持性证据发生变化的变异,使临床医生能够完全专注于真正的新发现。
经过专家手动分析验证
我们在两个已经过仔细手动分析的独立队列上对 Talos 进行了基准测试:澳大利亚急性护理基因组学(ACG)队列(危重婴儿和儿童)和美国的罕见基因组计划(RGP)队列(之前检测无信息的家庭)。这总共包括 1,089 名先证者。在 ACG 三人组中,Talos 恢复了 90% 的范围内诊断,同时每个家庭仅返回中位数 1.3 个候选变异。它遗漏的诊断主要是其保守策略的直接结果,例如,缺乏 ClinVar 支持、人类分析师使用反式构型或功能研究进行分类的隐性变异。
关键的是,Talos 在非常不同的 RGP 队列上保持了相同的操作点,该队列由之前临床检测无信息的家庭组成,先证者年龄最高达 82 岁。在 RGP 三人组中,它恢复了 87% 的范围内诊断(54 例中的 47 例),每个三人组的中位数候选变异为 1.3 个,显示了跨队列的泛化能力。
然后,我们与广泛使用的优先级排序工具 Exomiser 进行了直接对比基准测试。Talos 在小变异方面的整体灵敏度与 Exomiser 相当,但操作点非常不同:Exomiser 对变异进行排序并返回一个广泛的列表,而 Talos 返回一个简短、高度特异性的列表。在一项配对比较中,当审查 Exomiser 所有排序的变异时,两种工具在统计上无显著差异,但一旦将审查限制在现实预算内——前五个(p = 0.017)或前一个(p < 0.001)——Talos 就显著领先。这两种工具倾向于标记不同的变异,因此它们是互补的,理想情况下应在诊断工作流程中一起使用。
聚焦:微软研究通讯
微软研究通讯 与微软的研究社区保持联系。 立即订阅(在新标签页中打开)
在国际范围内部署
我们最兴奋的实验是一个经过检测但未确诊的队列,包含 4,735 名个体,来自澳大利亚基因组学研究项目和单一诊断实验室。大多数患者是患有神经发育、心脏、肾脏和/或神经系统适应症的独生子。Talos 在 238 名个体中产生了 241 个新诊断——额外检出率 5.1%,每个可能的致病性变异随后均被认证实验室确认为致病性或可能致病性。
这些诊断的来源说明了为什么再分析是一个如此强大的范式:32% 来自原始检测后发现的新基因-疾病关联,22% 来自新的变异级别证据(重新分类),45% 来自改进的过滤和分析——包括最初未检查的变异类型(如 CNV 和结构变异)、设置过窄的表型过滤器以及其他来源。不同临床领域的检出率一致(神经发育、心脏和肾脏适应症约为 5-6%),但原因不同:新基因关联和 CNV 主导了神经发育诊断,而变异重新分类推动了大多数心脏诊断。基因组数据优于外显子组数据(6.1% 对 4.8%),部分原因是它能够触及非编码诊断,例如 RNU4-2 和一个深内含子 MRPL39 变异。
一个反复出现的主题是传统知识库的滞后:59% 的新基因-疾病诊断在再分析时尚未被 OMIM 收录,这凸显了利用像 PanelApp Australia 这样快速更新的资源的价值。
从一次性事件到持续项目
然后,我们运行了 Talos 29 个月的迭代周期。大多数诊断(92%)出现在队列的首次通过中,但迭代设计在两个层面上证明了其价值。首先,它展示了持续再分析的可扩展性:由于后续周期仅返回新的可行证据,在整个项目中,它们平均每 200 个病例仅浮现出一个变异。其次,它展示了我们能够多快从科学发现过渡到诊断:从新知识出现在公共数据库中到患者获得诊断,平均仅需 32 天,最快的病例在一天内完成。图 2 提供了三名示例患者的时间线,展示了持续再分析如何能在新科学发现后的数周内为家庭带来答案。
整个流程成本足够低,可以持续运行:注释 1,000 个基因组花费约 11 美元,每月一次的再分析通过每个队列只需几美分。
图 2 – 三名示例患者的诊断历程。每名患者在基因测序后等待诊断多年。对于患者 1,促成其诊断的科学发现发生在其检测后一个月,但直到他们的基因数据首次使用 Talos 进行再分析时才做出诊断。对于患者 2 和 3,诊断在相关科学发现后一个月内做出,因为这些患者已经在再分析流程中。
展望未来
Talos 将基因组再分析从一种罕见、劳动密集型的事件转变为一种持续、自动化的项目,能够跟上科学发展的步伐。通过优化特异性,它尊重专家审查时间的真正瓶颈;通过利用像 PanelApp Australia 和 ClinVar 这样公开共享、频繁更新的资源,它将全球社区积累的知识转化为个体患者的诊断,通常只需数周时间。
我们相信我们已经建立了一项基础能力,并且很高兴看到社区如何在此基础上进一步发展。特别是,随着用于理解和预测遗传变异后果的更先进 AI 模型的出现,我们期待将它们用于未解决罕见病病例的再分析。
Talos 是开源的,并且易于在 Azure 等云环境中部署。我们的结果为卫生系统提供了一个实用的蓝图,旨在为仍在寻找诊断的众多患者提供频繁、可扩展的再分析。
GitHub Nature 出版物(在新标签页中打开)
文章《Talos:通过自动化、迭代式基因组再分析扩大罕见病诊断规模》最初发表于微软研究。