周启涛生物技术工作室
其他前沿2025/04/09· 编译自 Nature

IF50.5|大语言模型AMIE辅助鉴别诊断:提升医生诊断质量与全面性

AMIE辅助下,医生鉴别诊断质量与全面性显著提升,且不增加耗时。

AMIE辅助下,医生鉴别诊断质量与全面性显著提升,且不增加耗时。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

鉴别诊断是医疗核心环节,传统上依赖医生迭代整合病史、查体与检查结果。近年来,大语言模型(LLM)在医学问答基准上表现优异,但其在真实临床场景中辅助医生进行鉴别诊断的效用尚未得到充分评估。此前研究多关注模型独立诊断准确率,而忽略了LLM作为交互式助手对医生诊断推理的潜在增强作用。本研究引入专为诊断推理优化的LLM——AMIE,旨在探索其独立及辅助医生生成鉴别诊断列表的能力。

科学问题

卡在哪里: 现有LLM医学评估多局限于标准化选择题或独立诊断准确率,缺乏在真实复杂病例中辅助医生提升鉴别诊断质量的证据。此外,LLM的交互式辅助能否改善医生诊断推理的全面性与准确性,以及是否增加时间成本,尚不明确。

本文要回答: 评估AMIE在独立生成鉴别诊断及辅助医生时的表现,并与传统检索工具比较,验证其提升诊断质量与全面性的潜力。

技术路线

作者主要用了:LLM微调、随机对照试验、专家盲评、自动评估、定性访谈

研究采用NEJM临床病理讨论会(CPC)的302例真实疑难病例,设计两阶段随机对照试验。20名内科医生先独立给出鉴别诊断,随后随机分配至仅使用搜索引擎或额外使用AMIE辅助,再次生成鉴别诊断。19名专科医生在阅读完整病例后,对医生独立、辅助及AMIE独立生成的鉴别诊断列表进行盲评,评价其质量、适当性与全面性。同时利用Med-PaLM 2进行自动评估,并辅以半结构化访谈。该设计旨在分离AMIE的独立能力与辅助效应,并与传统工具进行头对头比较。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示AMIE独立及辅助条件下鉴别诊断的质量、适当性与全面性评分分布。AMIE独立列表质量评分中位数5,54%达到满分;辅助AMIE后医生列表质量评分5的比例从29%升至49%,全面性评分4的比例显著高于搜索辅助。颜色区分实验组,深浅表示评分等级。

核心亮点

亮点 1|AMIE独立诊断准确率超医生

AMIE独立生成的鉴别诊断列表top-10准确率达59.1%,显著高于未辅助医生的33.6%(P=0.04)。在top-1准确率上,AMIE为29%,同样优于医生。专家盲评显示,AMIE的鉴别诊断质量评分中位数为5(即包含正确诊断),54%的列表达到该评分,显著高于未辅助医生(McNemar检验:64.4,P<0.01)。适当性评分均值4.34,显著高于未辅助医生(3.74,P<0.001)。这些结果表明AMIE在疑难病例中具备超越医生的独立诊断能力。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2比较人类评估与自动评估下各条件top-n准确率。AMIE独立top-10准确率59.1%,显著高于未辅助医生33.6%;辅助AMIE后医生top-10准确率51.7%,高于搜索辅助44.4%。自动评估与人类评估趋势一致,验证自动评估可靠性。

亮点 2|AMIE辅助提升医生诊断质量

在辅助条件下,使用AMIE的医生top-10准确率提升至51.7%,显著高于未辅助(36.1%,McNemar检验:45.7,P<0.01)和仅使用搜索(44.4%,P=0.03)。质量评分达到5分的比例从辅助前的29%升至49%。适当性评分均值从3.74升至4.06(P<0.001),全面性评分达到4分(包含所有合理候选诊断)的比例显著高于未辅助和搜索辅助(McNemar检验:185.8,P<0.01)。Sankey图显示,AMIE辅助使73例原本未包含最终诊断的列表在辅助后纳入,而搜索仅37例。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3为Sankey图,展示辅助前后top-10准确率变化。AMIE辅助使73例原本未包含最终诊断的列表在辅助后纳入,而搜索仅37例;少数病例(AMIE 11例,搜索12例)辅助后丢失正确诊断。直观显示AMIE辅助的增益大于搜索。

亮点 3|AMIE辅助不增加时间成本

使用AMIE辅助与使用搜索引擎辅助的平均任务耗时无显著差异(AMIE:7.29±6.41分钟,搜索:7.19±5.33分钟,配对t检验P=0.807)。尽管医生首次使用AMIE界面,但并未因学习曲线而延长耗时,表明交互界面直观易用。同时,AMIE辅助下鉴别诊断列表长度显著增加(中位数8 vs 搜索7,P=0.002),提示AMIE帮助医生考虑更多候选诊断。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4比较AMIE与GPT-4在70例子集上的top-n准确率。AMIE在n>1时优于GPT-4,尤其n>2差距明显;n=1时GPT-4略优但无统计学差异。使用Med-PaLM 2、GPT-4和AMIE作为评估器,趋势一致。

亮点 4|AMIE优于GPT-4且自动评估可靠

在70例与GPT-4对比的子集中,AMIE在top-n准确率(n>1)上优于GPT-4,尤其n>2时差距明显;top-1准确率两者无显著差异。自动评估与人类专家评估趋势一致,Cohen's kappa为0.631,表明自动评估可可靠替代人工判断。这为LLM基准测试提供了可扩展的评估方法。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: LLM微调、随机对照试验、专家盲评、自动评估、定性访谈
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 关注LLM临床应用、诊断决策支持及人机协作评估的研究者与临床医生。

带走一句

LLM作为交互式助手可显著提升医生鉴别诊断的全面性与准确性,且不增加时间成本。分析人员应关注LLM辅助场景下的评估设计,结合专家盲评与自动评估,并重视定性反馈以优化人机协作。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。