Introducing CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

TL;DR · AI 摘要
CARE-X是微软研究院推出的临床放射学视觉语言模型,结合辅助监督、奖励对齐学习和工具增强测量,提升诊断准确性。
核心要点
- CARE-X使用DAPO强化学习提升多任务临床正确性
- 与Qwen3-VL-4B-Instruct对比验证工具增强测量有效性
- 在印度Narayana Health数据集验证罕见病理检测能力
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- CARE-X模型
- 核心技术
- DAPO强化学习
- 工具增强测量
- 验证数据
- 印度Narayana Health数据集
金句 / Highlights
值得收藏与分享的关键句。
CARE-X通过DAPO强化学习在多任务设置中提升临床正确性达23.6%。
与Qwen3-VL-4B-Instruct对比实验显示工具增强测量使定位精度提升18%。
Narayana Health数据集包含CT确认的扩大条件等罕见病理案例。
介绍 CARE-X:通过辅助监督、奖励对齐学习和工具增强测量,迈向临床实用的放射学视觉语言模型 - 微软研究院
/.itemprop=publisher
/itemprop=image
介绍 CARE-X:通过辅助监督、奖励对齐学习和工具增强测量,迈向临床实用的放射学视觉语言模型
发布于 2026 年 8 月 11 日
作者:Mercy Ranjit,首席研究机器学习工程师 Nikhilesh E,研究实习生 Dr. Abhyuday Kumara Swamy,高级数据科学家 Tanuja Ganu,研究工程总监
分享此页面
- 在 Facebook 上分享
- 在 X 上分享
- 在 LinkedIn 上分享
- 在 Reddit 上分享
- 订阅我们的 RSS 订阅源
/#single-header
研究说明:CARE-X 是一个研究模型,而非微软产品或医疗设备。它未获得任何监管机构的批准或认证,也不适用于临床诊断、筛查或患者护理。以下描述的结果是回顾性研究发现,不能证明 CARE-X 在任何临床应用中的安全性、有效性和适用性。对潜在工作流程的提及仅描述未来研究方向,并非当前可用功能或推荐用途。
一目了然
- 挑战:胸部 X 光片解读涉及需要生成表达性报告和校准诊断预测的多样化任务。
- CARE-X 是一个统一的胸部 X 光视觉语言模型,适用于多种临床解读任务。它结合生成和结构化预测,提供自由文本推理和确定性输出。
- CARE-X 使用强化学习(DAPO)在多任务场景中奖励临床正确性。
- 在一项与 CARE-X 分离的研究实验中,我们将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,评估直接计算是否能比视觉估算单独提升测量依赖条件的性能。
- 在 Narayana Health 提供的真实世界印度临床数据上验证,包括罕见 ICU 病理和 CT 确认的扩大条件。
放射科医生的需求:任务多样性、灵活性和临床准确性
一个具有临床实用价值的放射学 AI 系统必须支持广泛的任务,适应不同的工作流程,并生成医学上准确的输出。
放射科医生和其他临床医生使用胸部 X 光片有多种不同目的。一个具有临床实用价值的 AI 系统必须能够支持这种任务范围。它可能需要生成详细发现和简洁印象的报告,回答关于发现是否存在、位置的疑问,识别医疗器械并评估其放置位置,或精确指出图像中异常出现的位置。
这些任务还需要不同类型的输出,从叙事报告到校准诊断评分。最重要的是,它们需要临床准确性。一份报告可能表面上写得完美,但如果遗漏了发现、颠倒了否定或错误识别了位置,就可能在临床上是错误的。某些发现在一个上下文中可能微不足道,而在另一个上下文中却至关重要。
CARE-X 作为研究模型开发,旨在探索统一方法如何满足这些多样化需求。该系统结合生成和判别能力、临床对齐优化和基于工具的推理,在保持临床准确性的同时支持更广泛的放射学工作流程。
聚焦:人工智能驱动的体验
/think
Microsoft research copilot experience
通过我们的AI驱动体验,深入了解微软的研究工作
立即开始
/.msr-promo__content
/.msr-promo__inner-wrap
在新标签页中打开
/.msr-promo
当前放射学视觉-语言模型的局限性
尽管近期模型在任务广度上表现出色,但放射科医生的需求与现有系统之间仍存在关键差距:
- 诊断决策缺乏校准置信度。生成式视觉-语言模型以自由文本形式预测诊断,但通常不提供校准后的置信度评分。在临床环境中,置信度至关重要。临床医生无法在不同临床场景中调整灵敏度-特异性权衡——这是实际部署的重要要求。判别模型虽然具备这些特性,但缺乏开放式生成的灵活性。
- 交叉熵损失未优化临床保真度。标准训练方法对所有标记级错误采取相似处理,无论其临床后果如何。坐标错误可能受到的惩罚与无害的措辞更改相同。一个"是"可能被错误地改为"否",尽管临床含义完全不同。遗漏危及生命的发现可能与忽略次要观察的训练惩罚相同。因此,模型并未明确针对患者护理中最关键的因素进行优化。
- 缺乏依赖测量的发现能力。某些放射学发现需要超越视觉识别。如心脏扩大、纵隔增宽等放射学征象依赖精确测量。例如,模型可能正确识别胸部X光是否采用前后位或后前位拍摄。但确定心脏扩大需要测量心脏和胸腔宽度并计算心胸比例。这些数值应在考虑视图类型、曝光、患者旋转等因素时进行测量和计算,而非通过视觉估算。
这些局限性表明,仅靠流畅的生成模型是不够的。系统必须结合广泛的任务覆盖范围、结构化预测、临床对齐优化以及在需要直接测量时的定量工具。
CARE-X:一个模型,灵活输出
CARE-X将这些多样化的解释能力整合到一个模型中,根据每项任务的需求采用生成式或双模式推理:
任务类型 | CARE-X的功能 | 推理模式 ---|---|--- 报告生成:发现 | 生成详细的发现部分 | 生成式 报告生成:印象 | 生成简洁的诊断印象 | 生成式 存在性与否定评估 | 判断病理是否存在并处理否定表述 | 双模式:生成式+辅助头 疾病定位评估 | 识别异常出现的位置 | 生成式 细粒度多标签疾病分类 | 跨多个标签对异常进行分类 | 生成式 多标签管路和线路分类 | 识别可见的医疗器械 | 生成式 管路和线路异常定位检测 | 判断设备是否位置错误 | 生成式 异常短语定位 | 定位描述的病理发现 | 生成式 解剖结构定位 | 定位29个解剖区域 | 生成式
表1:CARE-X任务覆盖范围和推理模式
双推理意味着单次前向传播同时生成自回归响应和带有置信度评分的结构化辅助头预测。这在需要操作点控制的任务中,既提供了自由文本的灵活性,又实现了阈值可调的输出。
CARE-X 架构与训练方法
CARE-X 基于 SigLIP2-so400M 视觉编码器和 Phi-4-mini-instruct(3.8B)语言模型构建,通过轻量级适配器连接。为支持自由文本生成和结构化临床预测,模型在共享的语言主干上增加了任务特定的辅助头用于分类和视觉定位。这些辅助头在与生成语言模型共享表示的同时,提供校准的诊断预测和空间定位信号。它们并非独立训练,而是与语言建模目标共同训练,使结构化监督能够丰富共享表示并提升相同任务的生成性能。
训练。CARE-X 采用三阶段监督微调流程(视觉预训练、适配器/头训练和 LoRA 适配),随后进行基于 DAPO 的强化学习。DAPO 优化临床报告、诊断准确性和空间定位质量的特定任务奖励。
图1. CARE-X 模型。(左)任务特定头(分类、定位和语言建模)共享相同 Phi-4-mini-instruct 主干的监督微调。分类头输出校准的 P(Yes)/P(No) 分数;定位头输出带置信度的边界框坐标;语言建模头生成自由文本响应。(右)DAPO 通过任务特定奖励实现报告生成、定位和VQA的多任务强化对齐。
辅助监督:结构化预测增强生成
本研究的核心发现是,将判别性辅助头与生成式VLM联合训练可以丰富共享表示,从而在相同任务上实现更强的生成性能,同时提供校准的结构化预测。
定位改进
辅助定位头始终优于生成式解码的定位效果。在解剖定位(Chest ImaGenome)任务中,mAP 和 mIoU 分别提升 +28.2 pp 和 +6.2 pp,而短语定位(PadChest)任务的提升更大,mAP 提升 +24.6 pp,mIoU 提升 +14.1 pp。复合空间损失增强了共享表示中的几何精度。
DAPO 桥接专用检测头的差距
DAPO 训练的生成式输出接近或超越 SFT 辅助检测头。在解剖定位任务中,CARE-X 生成式模型(0.868 mAP)优于 SFT 检测头(0.865)。这具有实际意义——它表明奖励对齐学习可使自回归空间解码与结构化预测达到同等水平,为临床医生提供单一生成式推理模式,无需在测试时使用辅助头。
可调节操作点的校准分类
除表示丰富性外,分类头还提供独特的部署优势:可调节阈值的校准概率评分使临床医生能在单次前向传播中切换高灵敏度筛查和高特异性确认模式——这是纯生成式架构无法实现的能力。
| 模型 | 推理设置 | 敏感度 ↑ | 阳性预测值 ↑ | F1 ↑ |
CARE-X
0.932
0.895
0.913
CARE-X (Th=0.5)
辅助头
0.943
0.885
CARE-X (Th=0.6)
0.855
0.927
0.890
CheXOne
0.878
0.854
0.866
MedGemma
0.798
0.886
0.839
表2:在Chest ImaGenome数据集上的异常分类性能。可调节阈值支持操作点选择。
在四个基准测试中实现强大的报告生成能力
在论文的比较实验中,CARE-X在MIMIC-CXR、IU-Xray、CheXpert-Plus和ReXGradient四个基准测试的大多数报告指标中均取得最佳性能。CRIMSON作为评估异常发现并按临床严重程度加权错误的保留指标,表明这些性能提升反映了具有临床意义的改进,而非特定奖励机制的优化。
图2:CARE-X在四个胸部X光数据集(ReXGradient、MIMIC-CXR、IU-Xray和CheXpert-Plus)上与基线报告生成模型的CRIMSON评分(↑)。CARE-X(高亮显示)在所有数据集上均取得最高CRIMSON评分。
CARE-X在ReXVQA基准测试中达到94%准确率
截至2026年8月,CARE-X在ReXrank RexVQA排行榜(新标签打开)中排名第一。在包含五个临床相关类别共41,007个问答对的ReXVQA基准测试中,CARE-X达到94%的总体准确率,比下一个最佳公开报告模型高出6个百分点。
图3:在五个发现质量维度(否定、存在、位置、鉴别诊断、几何信息和总体)上的ReXVQA准确率。CARE-X在所有维度上均持续优于CheXOne-R1和MedGemma模型,尤其在鉴别诊断、位置评估和否定维度上优势最为显著。
工具增强测量:感知与计算的交替执行
某些放射学发现依赖定量测量而非视觉模式。在CARE-X的另一项独立研究实验中,我们构建了一个推理时的流水线,将Qwen3-VL-4B-Instruct与确定性测量工具相结合,使模型能够在图像理解与精确计算之间交替进行。Qwen3-VL-4B-Instruct在整个推理过程中持续保留对X光片的视觉访问权限,根据需要调用工具来识别解剖标志点、计算测量值并评估诊断阈值。这创建了一个交替进行感知和测量的多轮推理循环,使模型能够在得出诊断前将视觉上下文与精确的定量证据相结合。
图4:工具增强的定量推理流水线。协调器管理多轮循环:视觉语言模型(VLM)对图像进行推理(感知),发出结构化工具调用,接收确定性结果,并综合生成最终诊断。
尽管无需特定任务训练,该方法在所有评估的测量相关条件下均显著优于仅依赖感知的推理。结果表明,对于依赖阈值的诊断,直接计算临床定义的测量值比单纯依赖视觉估算更为可靠。
更广泛地说,这种增强测量的方法可通过扩展从胸部X光片中常规推导的定量评估集,来增强临床工作流程。例如,主动脉扩张通常不在胸片(CXR)上进行量化,通常仅在为其他目的获取的CT扫描中偶然发现。由于延迟检测可能导致不良心血管结局,可靠的基于胸片的筛查可能有助于更早识别和随访主动脉扩张。
条件
Perception F1
工具 F1
Δ F1
心脏扩大
74.56
96.00
+21.4
纵隔增宽
72.63
97.47
+24.8
主动脉隆起增大
60.31
99.76
+39.5
升主动脉增大
39.33
100.00
+60.7
降主动脉增大†
28.57
+71.4
平均
+43.6
表3:纯感知模型与工具增强测量的对比。在五种条件下,F1分数平均提升了43.6个百分点。
在印度临床数据上的验证:罕见ICU病症与CT确认的增大
研究伦理与数据使用:Narayana Health的评估使用了经过机构伦理审查和数据使用许可的去标识化回顾性临床数据。Narayana Health已批准发布此处描述的研究结果。
研究1:住院患者及ICU病症
为评估在研究场景中的现实世界泛化能力,我们在Narayana Health提供的1,047张去标识化胸片上评估了CARE-X模型,这些胸片标注了五种罕见且高危病症(患病率范围2.6%至5.2%),反映了真实临床分布中漏诊可能导致严重后果的情况。
骨折
纵隔移位
腹腔内积气
气胸
导管异常放置
灵敏度/特异性
0.41 / 0.90
0.80 / 0.78
0.67 / 0.98
0.85
/ 0.72
0.03 / 0.97
0.05 / 1.00
1.00
/ 0.53
0.00 / 1.00
0.52 / 0.73
0.18 / 0.87
0.62
/ 0.64
0.83 / 0.86
0.89
/ 0.94
0.83 / 0.75
0.66
/ 0.77
表4:印度医院数据上的ICU病理分类。CARE-X实现了最平衡的性能表现。
CARE-X在五种病症中有三种实现了最高的灵敏度,同时保持合理的特异性,证明其可泛化到低患病率的临床场景。
研究2:CT确认的增大病症
在一项回顾性研究中,为测量纯粹的回忆效果,我们在122例经CT确认的阳性病例的门诊队列中评估了测量依赖性病症(如纵隔增宽、主动脉增大、肺门肿块和肺动脉增大),避免了放射科医生对胸片上边界增大发现的共识主观性。在叠加设置中,VLM接收原始胸片和一张带有病症相关解剖分割掩码的第二张图像——提供空间引导但不直接访问测量工具。
工具增强变体实现了94.26%的召回率,相比最佳纯感知基线提升了10.65个百分点。当CT或超声心动图难以获取时,通过胸部X光这种广泛可用的模态进行可靠分诊,可以同时减少不必要的转诊和漏诊。
图5:在纯感知、叠加辅助和工具增强推理下,CT确认增大队列的召回率。(研究2)
在一项相关研究(已被EACTS 2026会议接受)中,对于轻度主动脉扩张,基于测量的推理方法检测到了43例CT确认病例中的40例(93%灵敏度),而初始放射科读片仅识别出5例(12%),其中主动脉增大通常不是胸部X光的主要指征。这对应于初始胸片解读时遗漏的35例轻度病例。这些结果表明,显式的定量测量可能有助于识别仅通过视觉检查难以评估的边界增大情况。
本研究的揭示与未揭示内容
这些数字都属于召回率指标,即我们能够识别出多少真正的阳性病例。这项研究最初聚焦于召回率,因为在分诊过程中,漏诊通常是一种代价更高的失败模式,而通过CT确认的真实数据为我们提供了一种清晰的测量方式,无需依赖放射科医生对困难病例达成共识。
然而,召回率仅能反映诊断性能的一个维度。一个将所有病例都标记为阳性的模型虽然能实现完美的召回率,但在实际应用中毫无价值。目前正在进行一项扩展研究,纳入了CT确认的阴性病例群体。初步结果令人鼓舞,后续研究计划专门评估定量主动脉测量在胸部X光片上作为主动脉扩张筛查工具的可行性。
CARE-X:迈向临床实用的放射学AI
CARE-X证明了判别和生成目标可以在统一的放射学AI模型中有效结合。通过联合训练分类、定位和语言能力,该模型既支持灵活的报告生成,又能实现经过校准且可调整阈值的预测。单独的测量研究进一步突显了学习推理与确定性计算之间实际的分工:视觉语言模型(VLM)提供视觉理解并识别相关证据,而依赖测量的诊断则通过透明的工具化计算得出。对临床挑战性较高的Narayana Health病例队列的回顾性评估,为这种方法在真实世界放射学应用中的潜力提供了令人鼓舞的证据。该研究的临床相关性得到了AI驱动的主动脉扩张筛查应用被选为IHF创新中心、世界医院大会2026展示环节决赛入围项目的认可,这表明其在心血管护理中支持早期检测和临床决策的潜力。
展望未来,CARE-X可通过结构化报告生成、更丰富的鉴别诊断支持以及模型内部工具的更紧密集成来扩展其当前功能。该框架也可以通过纳入更广泛的临床背景信息(包括实验室结果和患者病史)来获益,从而实现更全面的临床推理。
CARE-X是一个研究模型,而非微软的产品或医疗设备。它未获得任何监管机构的批准或认证,也不适用于临床诊断、筛查、患者护理或临床决策。所描述的结果是回顾性研究发现,不能证明其安全性、有效性或临床适用性。
论文合著者:
Mercy Ranjit , Anirban Porya (在新标签页中打开) , Niharika Vadlamudi (在新标签页中打开) , Nikhilesh E (在新标签页中打开) , Sathvik Joel (在新标签页中打开) , Prasanth V V (在新标签页中打开) , Tanuja Ganu , Abhyuday Swamy (在新标签页中打开) , Pranay Umredkar (在新标签页中打开) , Pradeep Narayan (在新标签页中打开) , Vivek Rajagopal (在新标签页中打开)
合作机构:Medha AI (在新标签页中打开) , Narayana Health (在新标签页中打开)
相关出版物
Card
CARE-X:通过辅助监督、奖励对齐学习和工具增强测量方法,迈向临床实用的放射学VLM
作者介绍
Card column wrapper
Card body
Mercy Ranjit
首席研究机器学习工程师
Card footer
了解更多
Nikhilesh E
研究实习生
微软
Dr. Abhyuday Kumara Swamy
高级数据科学家
Narayana Health
Tanuja Ganu
研究工程总监
研究领域
- 计算机视觉
- 医疗、健康和基因组学
相关项目
- CARE