← 行业趋势

急诊AI临床决策支持为何越用越没人用?SHAKED多LLM系统4周前瞻评估揭示采纳率从68%跌至30%

一、研究背景

急诊科是医院里最紧绷的场所:患者来去匆匆,病情急、决策时间短,医生要在几分钟内完成分诊、检查、会诊、用药等一系列判断。正因如此,急诊被普遍视为人工智能临床决策支持(CDSS)最有价值的落地场景之一——但「有价值」和「真的被医生用起来」之间,一直隔着一道很少有人量化的鸿沟 DOI: 10.1001/jama.2023.22295

过去几年,急诊AI研究大多停留在回顾性验证或离线模拟任务上,真正把系统装进急诊、让真实医生在真实班次里用的前瞻性证据少之又少。而即便系统被部署,医生用不用、愿意在什么场景用、越用越少还是越用越多,这些「人」的问题往往被算法指标的漂亮数字盖了过去。

2026 年 8 月 19 日,以色列海法 Rambam 医疗中心神经科联合以色列理工学院、美国波士顿贝斯以色列女执事医疗中心、梅奥诊所团队,在 Nature Medicine 发表研究,对基于多个大语言模型的急诊决策支持系统 SHAKED 做了 DECIDE-AI 第 1 阶段前瞻评估,第一次把「医生到底愿不愿意用」这个问题摆到了台面上 DOI: 10.1038/s41591-026-04601-5

急诊LLM临床决策支持系统前瞻评估

二、研究创新点

这项工作的价值不在算法有多新,而在于它在真实世界里问了一个真问题,有三点鲜明设计:

第一,采用 DECIDE-AI 第 1 阶段前瞻评估框架。 该框架是专门为临床AI早期评估制定的报告指南 DOI: 10.1038/s41591-022-01772-9,要求系统在真实临床环境中接受检验,而非只在离线数据集上打分。研究把 SHAKED 真正部署到三级急诊科,在 4 周、两个平行单元中真实运行。

第二,把「医生采纳行为」当核心结局。 以往研究盯着准确率、灵敏度,这项研究却把医生在真实工作流里「用还是不用」「在哪个环节用」「随班次时间怎么变化」作为主线索,直接测量临床AI落地的头号障碍——人。

第三,多 LLM 架构加事件驱动管道。 SHAKED 由多个大语言模型构成,通过事件驱动管道自动从电子病历抓取数据、生成结构化病史与临床洞察,再经带检索增强生成(RAG)的聊天界面供医生调用。

三、技术原理

SHAKED事件驱动管道与RAG知识模块架构

SHAKED 的整体架构围绕「临床事件触发—数据加工—知识增强—对话交互」四段展开:

  • 事件驱动管道:临床事件从电子病历(EMR)触发一条由事件服务器(Event Server)与调度器(Scheduler)协调的流水线,自动拉取患者数据,生成结构化病史摘要与自动化临床洞察,写入中央的 SHAKED 数据库;
  • RAG 知识模块:临床医生通过聊天界面与系统交互,背后的检索增强生成模块实时从知识库调取证据,为回答背书、抑制大模型幻觉;
  • 多 LLM 支撑:系统并非单一模型,而是基于多个大语言模型协同工作,部署在安全的医院级基础设施(AWS Bedrock)上。

这套设计把「病历数据」和「医学知识」拧成一股绳,让医生在急诊的紧张节奏里,用自然语言就能追问决策依据。

四、实验结果

采纳率随时间下降与工作负荷相关脱离

研究在 4 周内共分析 1,138 名患者,分成两个平行单元:干预单元(Wing A,n=584)使用 SHAKED,对照单元(Wing B)沿用常规轮转。核心结果一栏表:

指标 结果 统计量
临床采纳率 从 68% 降至 30% 4 周内持续下滑
工作量相关脱离 每增加一个班次小时,使用概率下降 OR=0.72(95% CI 0.62–0.83)
放射会诊使用偏好 医生更倾向在放射会诊中使用 OR=2.98(95% CI 1.58–5.63)
输出质量 100 份抽样中 99 份临床恰当 99/100
不良事件 未检出
急诊住院时长 两翼无差异,均 4.9 小时 P=0.99
会诊周期时间 缩短趋势但不显著,−9.4 分钟 P=0.077

这几个数字拼出的图景耐人寻味:系统的「质量」其实很好——100 份抽样输出里 99 份被专家评为临床恰当,且没有检出任何不良事件;但「用量」却在持续萎缩,采纳率从最初的 68% 一路掉到 30%。更关键的是,脱离的诱因指向工作负荷——每多上一个班次的小时,医生使用系统的概率就显著下降(OR=0.72)。而医生也并非一律排斥:在放射会诊这类信息检索密集型场景里,他们反而更愿意用(OR=2.98)。

也就是说,算法没问题、输出没问题,卡住的是「人有没有余力和意愿去用」。

五、应用前景

这项研究对临床AI落地给出的启示,比一份漂亮的准确率更有分量:

其一,落地难题从「算不准」转向「用不动」。 急诊医生在高峰班次里连喝口水的时间都紧张,再好的决策支持,若每次调用都要额外点几下、读一段,就很容易被搁置。AI 系统要做的不是「更聪明」,而是「更省事、更顺滑地嵌进工作流」。

其二,场景选择比全面铺开更重要。 医生在放射会诊等特定环节明显更愿意用 SHAKED,说明急诊AI应当「有的放矢」,先在医生真正需要、且能即时获益的高频场景扎根,而不是一上来就追求全流程覆盖。

其三,为后续随机试验提供了设计依据。 作者明确指出,这些发现可用于指导随机试验设计,但尚不足以支撑 AI 决策支持在急诊的临床部署——这是一份诚实的、克制的前瞻性结论。

需要客观指出,本研究是第 1 阶段的早期前瞻评估,主要结局聚焦采纳行为而非患者层面的硬终点,会诊周期时间的缩短也未达统计学显著。但它把「持续临床参与」这个此前被低估的变量,正式写进了急诊AI落地的账本里。

六、结论

急诊不缺聪明的AI,缺的是「能持续用下去」的AI。SHAKED 的这项 DECIDE-AI 第 1 阶段前瞻评估,用 1,138 名患者、4 周真实部署的数据,说清了一个反直觉的事实:在算法精度之外,医生的持续参与意愿,才是决定临床AI能否真正落地的关键变量 DOI: 10.1038/s41591-026-04601-5

它没有宣称AI改变了患者结局,却为「AI该以何种姿态进入急诊」提供了一个更清醒的起点——先解决「愿不愿用」,再谈「准不准」。

论文标题Prospective evaluation of a large language model clinical decision support system in the emergency department
作者Leibovitch L、Ahituv A、Gorenshtein A、Aran D、Sorka M、Miron K、Shelly S
机构以色列海法 Rambam 医疗中心神经科、以色列理工学院、美国波士顿贝斯以色列女执事医疗中心、梅奥诊所
期刊Nature Medicine,2026
发表时间在线发表 2026 年 8 月 19 日
DOI10.1038/s41591-026-04601-5
PubMedPMID: 42618632

论文原文信息地址:https://www.simoagent.com/blog/2026-08-22-shaked-emergency-llm-cds/

参考文献

  1. Leibovitch L, Ahituv A, Gorenshtein A, et al. Prospective evaluation of a large language model clinical decision support system in the emergency department. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04601-5
  2. Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nature Medicine, 2022;28(5):924–933. DOI: 10.1038/s41591-022-01772-9
  3. Jabbour S, Fouhey D, Shepard S, et al. Measuring the impact of AI in the diagnosis of hospitalized patients: a randomized clinical vignette survey study. JAMA, 2023;330(23):2275–2284. DOI: 10.1001/jama.2023.22295