云霞资讯网

大规模电子病历基准:AI临床决策真实能力与短板! 现有电子病历类评测数据集侧重信息检索与文本阅读理解,并且只要求模型摘抄病历内容而非完成推理式临床决策,针对这些短板,研究人员构建了电子病历基准,用于评估大模型基于真实结构化电子病历开展临床决策的推理能力。该基准采用“电子病历大模型知 ​

大规模电子病历基准:AI临床决策真实能力与短板!

现有电子病历类评测数据集侧重信息检索与文本阅读理解,并且只要求模型摘抄病历内容而非完成推理式临床决策,针对这些短板,研究人员构建了电子病历基准,用于评估大模型基于真实结构化电子病历开展临床决策的推理能力。该基准采用“电子病历大模型知识库”协同流水线,兼顾数据集规模与临床真实性,共构建960067条问答样本,覆盖诊断、治疗选择、预后预测三大核心临床决策任务。

数据集数据源包含MIMICIII、MIMICIV公开重症电子病历与埃默里医疗体系私有PROMOTE数据集。流水线工作流程分为多步——首先对原始结构化电子病历做归一化预处理;使用医学大模型从就诊记录提取临床关系三元组;再调用UMLS、SemMedDB等医学知识库对提取出的关系做校验,过滤掉无文献证据、存在临床矛盾的关系,抑制大模型幻觉;生成问答模板,再确定性实例化为多版本选择题与开放问答题;同时对干扰项做知识库校验,避免出现多个正确答案,保障评测题目的严谨性。

三大任务分别对应真实临床场景:同次就诊诊断补全,根据已有疾病推断共存合并症;同次就诊治疗选择,依据诊断选出合理处置方案;跨就诊预后预测,基于本次就诊记录预判后续就诊可能出现的疾病结局。数据集同时生成4/5/6选项的多选题与开放问答题,并且做同义改写、选项置换,可测试模型在题目表述变化下的预测稳定性。

该研究对超过30个主流大模型开展零样本评测,涵盖开源通用大模型、医疗微调专用大模型、HIPAA合规API商业模型。实验得出多项关键结论:任务难度差异显著,治疗选择任务整体准确率最高,预后预测任务难度最大,因为预后需要对纵向病程演变做复杂推理;选项数量越多,整体准确率普遍下降,能力弱的模型受选项数量增加影响更明显。GPT5.2取得最优表现,整体准确率70.91%;开源模型中Llama3.370B、Qwen332b表现突出,与顶尖商业模型差距缩小到34个百分点。

该研究还得到一个重要发现:仅做医疗领域微调的专用模型,在本基准上并没有稳定优于对应的基础通用大模型。原因是该基准不只是考医学名词记忆,更需要基于不完整病历信息做纵向临床关系推理,现有医疗微调大多侧重文本记忆,缺少针对电子病历条件推理的训练目标。嵌入检索类基线模型表现远低于大模型,证明该基准不能靠简单语义匹配完成,必须依赖深度临床推理能力。

本研究还做充分鲁棒性校验——更换生成数据集的源模型、调整上下文事件数量,模型之间的相对排名保持稳定,证明评测结论可靠,并非数据集构建带来的伪结果。开放问答题实验进一步表明,参数量更大的模型在自由文本解释任务上优势明显,但同时会带来更高推理成本,存在精度开销权衡关系。当然,该基准仍存在局限:仅使用诊断、处方、诊疗操作三类结构化字段,没有纳入检验、生命体征、影像;为避免信息泄露,每个题目使用的上下文事件数量有限;受推理成本限制,完整全集无法全部跑完,实验采用采样子集做对比。尽管如此,该工作为电子病历场景下大模型临床决策能力,提供大规模、可复现的评测工具,揭示当前模型在预后推断、复杂共病推理上的短板,对面向真实病历的医疗大模型研发有重要参考价值。热门微博 医学新闻 ai医疗 哈勃观察员