CARE-X:辅助监督、奖励对齐学习与工具增强测量,迈向临床实用的放射学VLM
Introducing CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement
CARE-X是一个研究性胸部X光视觉语言模型(VLM),结合生成式报告与结构化预测,基于SigLIP2视觉编码器和Phi-4-mini-instruct(3.8B)构建,采用三阶段监督微调和DAPO强化学习。在Chest ImaGenome上,辅助定位头mAP提升+28.2个百分点;ReXVQA基准达94%准确率。在Narayana Health的1,047张去标识化X光片上验证了罕见ICU病症分类,工具增强测量使五种依赖测量病症的平均F1提升43.6个百分点。该模型未获监管批准,不适用于临床使用。
研究笔记:CARE-X 是一个研究模型,并非微软的产品或医疗设备。它尚未获得任何监管机构的批准或认可,也不适用于临床诊断、筛查或患者护理。下文描述的结果为回顾性研究发现,不能证明 CARE-X 在临床使用中的安全性、有效性或适用性。文中提到的潜在工作流仅代表未来研究的方向,并非当前已具备的能力或推荐用途。
概览
挑战:胸部 X 光解读涉及多种任务,既需要表达丰富的报告生成能力,也需要校准过的诊断预测。CARE-X 是一个统一的胸部 X 光视觉语言模型(VLM),用于处理多种临床解读任务。它结合了生成与结构化预测,既能提供自由文本推理,也能给出确定性输出。CARE-X 使用强化学习(DAPO)在多任务环境中奖励临床正确性。在与 CARE-X 分开的一项研究实验中,我们将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,以评估直接计算是否能比单纯视觉近似更好地提升依赖测量的病症的诊断性能。
在 Narayana Health 的真实印度临床数据上进行了验证,包括罕见 ICU 病理和 CT 确认的扩大类病症。
放射科医生需要什么:任务多样性、灵活性和临床保真度
一个临床上有用的放射学 AI 系统必须支持广泛的任务,适应不同的工作流,并产生医学上准确的输出。放射科医生和其他临床医生使用胸部 X 光的目的多种多样。一个临床上有用的 AI 系统必须能够支持这些任务。它可能被要求为报告生成详细的发现和简洁的印象,回答关于发现存在、不存在或位置的问题,识别医疗设备并评估其放置情况,或精确定位图像中异常出现的位置。这些任务还需要不同类型的输出,从叙述性报告到校准过的诊断评分。最重要的是,它们需要临床准确性。一份报告表面上可能写得完美,但如果遗漏了某个发现、颠倒了否定表述或错误识别了位置,在临床上就是错误的。某些发现在一种情境下可能无关紧要,在另一种情境下却至关重要。
CARE-X 是作为研究模型开发的,旨在探索统一方法如何应对这些多样化需求。该系统结合了生成与判别能力、临床对齐的优化以及基于工具的推理,以支持更广泛的放射学工作流,同时保持临床保真度。
视频系列
On Second Thought
一个与 Sinead Bovell 合作的视频系列,围绕大家对 AI 提出的问题展开。我们邀请了来自微软各地的专家声音,剖析这项快速变化技术的张力与前景,探索正在演变的内容和可能的未来。
探索该系列(在新标签页中打开)
当前放射学视觉语言模型的差距
尽管近期模型的任务广度令人印象深刻,但放射科医生的需求与当前系统所能提供的之间仍存在关键差距:
- 诊断决策缺乏校准的置信度。生成式 VLM 以自由文本形式预测诊断,但通常不提供校准的置信度分数。在临床环境中,置信度很重要。临床医生无法在不同临床情境中调整灵敏度-特异性的权衡——这是实际部署的重要要求。判别模型具备这些特性,但缺乏开放式生成的灵活性。
- 交叉熵损失不优化临床保真度。标准训练方法对所有 token 级别的错误一视同仁,无论其临床后果如何。一个坐标错误可能和一个无害的措辞变化受到相同的惩罚。一个“是”可能被翻转为“否”,尽管临床意义完全不同。遗漏一个危及生命的发现可能与忽略一个次要观察受到相同的训练惩罚。因此,模型并未针对患者护理中最重要的事项进行显式优化。
- 缺乏处理依赖测量的发现的能力。一些放射学发现需要的不仅仅是视觉识别。诸如心脏肥大、纵隔增宽等放射学征象依赖于精确测量。例如,模型可能正确识别胸部 X 光片是 AP 还是 PA 位。但确定心脏肥大需要测量心脏和胸腔宽度并计算心胸比率。这些量应该被测量和计算,而不是在考虑投照体位、曝光、患者旋转等变量的情况下进行视觉近似。
总之,这些差距需要的不仅仅是一个流畅的生成模型。系统必须结合广泛的任务覆盖、结构化预测、临床对齐的优化,以及在需要直接测量时的定量工具。
CARE-X:一个模型,灵活的输出
CARE-X 将这些多样的解读能力整合到一个模型中,根据每个任务的需求使用生成或双推理模式:
| 任务类型 | CARE-X 的功能 | 推理模式 |
|---|---|---|
| 报告生成:发现 | 生成详细的发现部分 | 生成式 |
| 报告生成:印象 | 生成简洁的诊断印象 | 生成式 |
| 存在与否定评估 | 确定病理是否存在并处理否定表述 | 双模式:生成 + 辅助头 |
| 疾病位置评估 | 识别异常出现的位置 | 生成式 |
| 细粒度多标签疾病分类 | 跨多个标签对异常进行分类 | 生成式 |
| 多标签管路和线路分类 | 识别可见的医疗设备 | 生成式 |
| 管路和线路异常放置检测 | 确定设备是否放置错误 | 双模式:生成 + 辅助头 |
| 异常短语定位 | 定位所描述的病理发现 | 双模式:生成 + 辅助头 |
| 解剖结构定位 | 定位 29 个解剖区域 | 双模式:生成 + 辅助头 |
表 1:CARE-X 任务覆盖和推理模式
双推理意味着单次前向传播同时产生自回归响应和带有置信度分数的结构化辅助头预测。这提供了自由文本的灵活性,同时在需要操作点控制的任务中提供了阈值可调的输出。
CARE-X 架构和训练方法
CARE-X 基于 SigLIP2-so400M 视觉编码器和 Phi-4-mini-instruct(3.8B)语言模型构建,通过轻量级适配器连接。为了支持自由文本生成和结构化临床预测,模型在共享语言骨干上增加了任务特定的辅助头,用于分类和视觉定位。这些辅助头提供校准的诊断预测和空间定位信号,同时与生成语言模型共享表示。它们并非独立训练,而是与语言建模目标共同训练,使结构化监督能够丰富共享表示,并提高相同任务上的生成性能。
训练。CARE-X 使用三阶段监督微调流程(视觉预训练、适配器/辅助头训练和 LoRA 适配),随后进行基于 DAPO 的强化学习。DAPO 针对临床报告、诊断准确性和空间定位质量优化任务特定奖励。
图 1. CARE-X 模型。(左)使用任务特定辅助头——分类、定位和语言建模——共享相同的 Phi-4-mini-instruct 骨干进行监督微调。分类头输出校准的 P(是)/P(否) 分数;定位头输出带有置信度的边界框坐标;语言建模头生成自由文本响应。(右)DAPO 在报告生成、定位和 VQA 之间进行多任务强化对齐,使用任务特定奖励。
辅助监督:结构化预测增强生成能力
这项工作的一个核心发现是,将判别式辅助头与生成式 VLM 共同训练能够丰富共享表示,从而在相同任务上带来更强的生成性能,同时提供校准的结构化预测。
定位改进
辅助定位头始终优于生成式解码的定位性能。在解剖结构定位(Chest ImaGenome)上,mAP 和 mIoU 分别提高了 +28.2 个百分点和 +6.2 个百分点,而最大的提升出现在短语定位(PadChest)上,mAP 和 mIoU 分别提高了 +24.6 个百分点和 +14.1 个百分点。复合空间损失增强了共享表示中的几何精度。
DAPO 弥合了与专用检测头的差距
经过 DAPO 训练的生成输出接近或超过了 SFT 辅助检测头。在解剖结构定位上,CARE-X 生成模式(0.868 mAP)超过了 SFT 检测头(0.865)。这具有实际意义——它表明奖励对齐学习可以使自回归空间解码达到与结构化预测相当的水平,为临床医生提供单一的生成推理模式,而无需在测试时使用辅助头。
具有可调操作点的校准分类
除了表示丰富之外,分类头还提供了一个独特的部署优势:带有可调阈值的校准概率分数允许临床医生在单次前向传播中在高灵敏度筛查和高特异性确认之间切换——这是纯生成架构无法提供的功能。
| 模型 | 推理设置 | 灵敏度 ↑ | PPV ↑ | F1 ↑ |
|---|---|---|---|---|
| CARE-X | 生成式 | 0.932 | 0.895 | 0.913 |
| CARE-X (Th=0.5) | 辅助头 | 0.943 | 0.885 | 0.913 |
| CARE-X (Th=0.6) | 辅助头 | 0.855 | 0.927 | 0.890 |
| CheXOne | 生成式 | 0.878 | 0.854 | 0.866 |
| MedGemma | 生成式 | 0.798 | 0.886 | 0.839 |
表 2:Chest ImaGenome 上的异常分类性能。可调阈值支持操作点选择。
在四个基准测试中表现强劲的报告生成
在论文的比较集中,CARE-X 在 MIMIC-CXR、IU-Xray、CheXpert-Plus 和 ReXGradient 上的大多数报告指标上均取得了最强性能。CRIMSON 是一个保留指标,用于评估异常发现并按临床严重程度对错误进行加权,结果表明这些提升反映了临床意义上的改进,而非针对特定奖励的优化。
图 2. CARE-X 与基线报告生成模型在四个胸部 X 光数据集——ReXGradient、MIMIC-CXR、IU-Xray 和 CheXpert-Plus——上的 CRIMSON 分数(↑)对比。CARE-X(高亮显示)在每个数据集上都取得了最高的 CRIMSON 分数。
CARE-X 在 ReXVQA 上达到 94% 的准确率
截至 2026 年 8 月,CARE-X 在 ReXrank RexVQA 排行榜(在新标签页中打开)上排名第一。在 ReXVQA 基准测试(涵盖五个临床相关类别的 41,007 个问答对)上,CARE-X 达到了 94% 的总体准确率,比下一个最佳公开报告模型高出六个百分点。
图 3:ReXVQA 在五个发现质量维度——否定、存在、位置、鉴别诊断、几何信息和总体——上的准确率。CARE-X 在每个维度上都持续优于 CheXOne-R1 和 MedGemma,在鉴别诊断、位置评估和否定方面的优势最大。
工具增强测量:感知与计算的交错
一些放射学发现依赖于定量测量而非视觉模式。在与 CARE-X 分开的一项研究实验中,我们构建了一个推理时流水线,将 Qwen3-VL-4B-Instruct 与确定性测量工具相结合,使模型能够在图像理解和精确计算之间交替进行。Qwen3-VL-4B-Instruct 在整个推理过程中保留对 X 光片的视觉访问,按需调用工具来识别解剖标志、计算测量值并评估诊断阈值。这创建了一个多轮推理循环,将感知和测量交错进行,使模型能够在做出诊断前结合视觉上下文和精确的定量证据。
图 4. 工具增强的定量推理流水线。编排器协调多轮循环:VLM 对图像进行推理(感知),发出结构化工具调用,接收确定性结果,并综合最终诊断。
尽管不需要任务特定训练,但这种方法在所有评估的基于测量的病症中均显著优于仅感知推理。结果表明,对于阈值依赖的诊断,直接计算临床定义的测量值比单纯视觉近似更可靠。更广泛地说,这种测量增强方法可以通过扩展常规从胸部 X 光中得出的定量评估范围来增强临床工作流。例如,主动脉扩张通常不在 CXR 上定量,往往仅在因其他适应症进行的 CT 扫描中偶然发现。由于延迟检测可能导致不良心血管结局,可靠的基于 CXR 的筛查可以实现主动脉扩张的早期识别和随访。
| 病症 | 感知 F1 | 工具 F1 | Δ F1 |
|---|---|---|---|
| 心脏肥大 | 74.56 | 96.00 | +21.4 |
| 纵隔增宽 | 72.63 | 97.47 | +24.8 |
| 主动脉结增大 | 60.31 | 99.76 | +39.5 |
| 升主动脉增大 | 39.33 | 100.00 | +60.7 |
| 降主动脉增大† | 28.57 | 100.00 | +71.4 |
| 平均 | +43.6 |
表 3:仅感知与工具增强测量。五种病症的平均 F1 提高了 43.6 个百分点。
在印度临床数据上的验证:罕见 ICU 病症和 CT 确认的扩大类病症
研究伦理与数据使用:Narayana Health 的评估使用了去标识化的回顾性临床数据,并获得了适用的机构伦理审查和数据使用批准。Narayana Health 批准了此处所述研究结果的发表。
研究 1:住院和 ICU 病症
为了在研究环境中评估现实世界的泛化能力,我们在 Narayana Health 的 1,047 张去标识化胸部 X 光片上评估了 CARE-X,这些 X 光片标注了五种罕见、高 acuity 的病症,患病率从 2.6% 到 5.2% 不等——反映了漏诊会带来严重后果的现实临床分布。
| 骨折 | 纵隔移位 | 气腹 | 气胸 | 管路与线路异常放置 | |
|---|---|---|---|---|---|
| 模型 | 灵敏度 / 特异度 | 灵敏度 / 特异度 | 灵敏度 / 特异度 | 灵敏度 / 特异度 | 灵敏度 / 特异度 |
| CheXOne | 0.41 / 0.90 | 0.80 / 0.78 | 0.67 / 0.98 | 0.85 / 0.72 | 0.03 / 0.97 |
| MedGemma | 0.05 / 1.00 | 1.00 / 0.53 | 0.00 / 1.00 | 0.52 / 0.73 | 0.18 / 0.87 |
| CARE-X | 0.62 / 0.64 | 0.83 / 0.86 | 0.89 / 0.94 | 0.83 / 0.75 | 0.66 / 0.77 |
表 4:印度医院数据上的 ICU 病理分类。CARE-X 取得了最均衡的性能。
CARE-X 在五种病症中的三种中取得了最高灵敏度,同时保持了合理的特异性,证明了其在低患病率临床环境中的泛化能力。
研究 2:CT 确认的扩大类病症
在一项衡量纯召回效力的回顾性研究中,我们评估了依赖测量的病症,如纵隔增宽发现(包括主动脉扩大、肺门肿块和肺动脉扩大),对象是一个包含 122 例 CT 确认金标准阳性病例的门诊队列,避免了放射科医生对 CXR 上临界扩大发现达成共识的主观性。在叠加设置中,VLM 接收原始 X 光片以及一张带有病症相关解剖分割掩膜的图像——提供空间指导,而无需直接访问测量工具。工具增强变体达到了 94.26% 的召回率,比最佳仅感知基线高出 +10.65 个百分点。在 CT 或超声心动图获取受限的地方,从胸部 X 光等广泛可用的模态进行可靠分诊可以减少不必要的转诊和漏诊。
图 5:CT 确认扩大队列中仅感知、叠加辅助和工具增强推理的召回率。(研究 2)
在一项相关研究(已被 EACTS 2026 会议接收)中,对于轻度主动脉扩张,测量驱动推理方法检测到 43 例 CT 确认病例中的 40 例(93% 灵敏度),而初始放射学报告中仅识别出 43 例中的 5 例(12%),因为主动脉扩大通常不是胸部 X 光的主要适应症。这相当于额外发现了 35 例在初始 CXR 解读中被遗漏的轻度病例。这些结果表明,显式定量测量可能有助于识别通过纯视觉检查难以评估的临界扩大。
这些结果说明了什么,没有说明什么
这些数字都是召回率,即我们捕获了多少真阳性。这是初始研究的重点,因为在分诊中,漏诊通常是代价更高的失败模式,而 CT 确认的金标准为我们提供了一种干净的方法来衡量这一点,而无需依赖放射科医生对困难病例达成共识。
然而,召回率仅捕捉了诊断性能的一个维度。一个标记所有内容的模型可以达到完美召回率,但在实践中毫无用处。一项扩展研究正在进行中,其中包括 CT 确认的阴性队列。初步结果令人鼓舞,并计划进一步研究以明确评估胸部 X 光上定量主动脉测量作为主动脉扩张筛查工具的可行性。
CARE-X:迈向临床有用的放射学 AI
CARE-X 证明了判别式和生成式目标可以在统一的放射学 AI 模型中有效结合。通过联合训练分类、定位和语言能力,该模型既支持灵活的报告生成,也支持校准的、阈值可调的预测。单独的测量研究进一步突显了学习推理与确定性计算之间的实际分工:VLM 提供视觉理解并识别相关证据,而依赖测量的诊断则通过透明的、基于工具的计算得出。在具有临床挑战性的 Narayana Health 队列上的回顾性评估为该方法在现实世界放射学应用中的潜力提供了令人鼓舞的证据。这项研究的临床相关性得到了强调:基于 AI 的主动脉扩张筛查应用被选为 2026 年世界医院大会 IHF 创新中心的展示决赛入围者,认可了其在心血管护理中支持早期检测和临床决策的潜力。
展望未来,CARE-X 可以通过结构化报告生成、更丰富的鉴别诊断支持以及工具与模型本身的更紧密集成来扩展其当前能力。该框架还可以受益于纳入更广泛的临床上下文,包括实验室结果和患者病史,从而实现更全面的临床推理。
CARE-X 是一个研究模型,并非微软的产品或医疗设备。它尚未获得任何监管机构的批准或认可,也不适用于或未经临床诊断、筛查、患者护理或临床决策验证。所述结果为回顾性研究发现,不能证明其临床使用的安全性、有效性或适用性。
论文合著者:Mercy Ranjit、Anirban Porya(在新标签页中打开)、Niharika Vadlamudi(在新标签页中打开)、Nikhilesh E(在新标签页中打开)、Sathvik Joel(在新标签页中打开)、Prasanth V V(在新标签页中打开)、Tanuja Ganu、Abhyuday Swamy(在新标签页中打开)、Pranay Umredkar(在新标签页中打开)、Pradeep Narayan(在新标签页中打开)、Vivek Rajagopal(在新标签页中打开)
合作者:Medha AI(在新标签页中打开)、Narayana Health(在新标签页中打开)
在新标签页中打开
这篇题为《Introducing CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement》的文章首发于 Microsoft Research。