急诊AI临床决策支持为何越用越没人用?SHAKED多LLM系统4周前瞻评估:采纳率从68%跌至30%,班次每多1小时使用概率降28%
一套由多个大语言模型驱动的急诊临床决策支持系统,算法评分近乎满分,医生却越用越少。以色列Rambam医疗中心与梅奥诊所团队在《Nature Medicine》用DECIDE-AI第1阶段框架做了4周前瞻评估,发现采纳率从68%跌到30%,班次负荷每增加1小时使用概率就下降28%。
研究背景:急诊AI临床决策支持为何一直缺前瞻证据?
急诊科是全球医院里最忙、也最容易「堵」的地方之一。病人挤在走廊,等待专科会诊的时间越长,滞留时间(length of stay)就拖得越久。多年来,不少研究想用 AI 帮医生更快地分诊、判断、决定要不要请专科会诊,但一个尴尬的现实是:急诊领域的 AI 临床决策支持,几乎一直停留在「事后回溯」和「基准测试」里。
所谓「基准测试」,就是把精心整理好的病例丢给模型,看它答得准不准。可真实急诊是完全另一回事——医生在嘈杂、连续、被反复打断的班次里,一边要处理突发状况,一边还要决定要不要再点开一个 AI 界面。算法在榜单上考高分,和在真实急诊里被医生持续使用,是两码事。
正因为缺少「真实部署」的前瞻证据,以色列海法 Rambam 医疗中心(三级医院)联合梅奥诊所(Mayo Clinic)团队,把一套叫 SHAKED 的多 LLM 决策支持系统真正投进了急诊,做了一次罕见的前瞻评估。
创新点:把多LLM决策支持系统真正投进真实急诊
这项研究的价值,不在算法有多新,而在评价方式。它用的是 DECIDE-AI 第 1 阶段框架——一个专门为「AI 决策支持系统的早期临床评估」设计的报告指南(2022 年发表于 Nature Medicine),重点考察的是系统在真实临床环境里被医生「怎么用、愿不愿用」,而不是模型在测试集上的准确率。
研究设计很克制、也很务实:
- 选取一家三级急诊科,设两个平行单元(wing);
- Wing A(干预组,584 例)使用 SHAKED,Wing B(对照组)照常轮转;
- 一共纳入 1,138 名需要专科会诊的成人患者,跑了 4 周。
这也是当前少有的、把 LLM 决策支持系统放在真实急诊、用真实患者数据、让真实医生连续用上一个月的研究。
技术原理:一套事件驱动+检索增强的「临床决策智能体」
要理解结果,先看 SHAKED 是怎么转起来的。它本质是一套临床决策智能体——由多个大语言模型协作,通过事件驱动管线自动运转:
- 临床事件从电子病历(EMR)触发,由「事件服务器 + 调度器(Event Server + Scheduler)」协调;
- 系统从临床数据库拉取患者数据,自动生成结构化病史和临床洞察,存进中心数据库;
- 医生通过聊天界面访问,后台配了一个**检索增强生成(RAG)**知识模块,用于调取循证证据支撑回答。
简单说,医生点开它,就能拿到一份自动整理好的病史摘要 + 初步诊断与检查建议,还能追问一句「为什么这么判断」。这正是「临床决策智能体」区别于普通聊天机器人的地方:它不等人问,而是主动读病历、做汇总、给建议。
数据说话:算法没翻车,医生却越用越少
先把「好消息」摆出来:SHAKED 的算法表现几乎挑不出毛病。
- 4 周内没有检测到任何不良事件;
- 专家盲审抽样的 100 份输出里,99 份被评为「临床适当」。
如果只看这张成绩单,你会以为它会大受欢迎。可真实数据讲了一个完全相反的故事:
| 关键指标 | 数据 |
|---|---|
| 医生采纳率(第 1 周 → 第 4 周) | 68% → 30% |
| 班次负荷每增 1 小时,使用概率 | 下降 28%(OR=0.72,95%CI 0.62–0.83) |
| 放射科会诊使用偏好 | OR=2.98(95%CI 1.58–5.63) |
| 急诊滞留时间(两组) | 均 4.9 小时(P=0.99) |
| 会诊周期时间(意向性分析) | 缩短 9.4 分钟(P=0.077,未达显著) |
几个数字值得单独点破:
- 采纳率一个月内从 68% 跌到 30%,整体只有约 44.3% 的合格就诊真正用上了它;
- 更关键的机制是**「负荷敏感」的弃用**:班次每往后多 1 小时,医生使用它的概率就下降 28%——越忙越不用,而不是越忙越依赖;
- 唯一一个「越用越喜欢」的场景是放射科会诊(偏好提升近 3 倍),因为那是一个边界清晰、能省下检索与汇总时间的窄任务;
- 而硬终点上,两组急诊滞留时间一模一样(4.9 小时),会诊周期缩短的 9.4 分钟也没达到统计显著。
换句话说:算法精度不是问题,医生的持续参与意愿才是。
应用前景与局限
这项研究的价值,是把一个此前被严重低估的变量——「持续临床参与」——正式写进了急诊 AI 落地的账本。
- 它提醒所有做医疗 AI 的团队:「准」只是入场券,「被持续用起来」才是及格线;
- 它给了一个清醒的落点:AI 的用武之地,可能不在「替医生拍板」,而在边界清晰的窄任务(如放射会诊里的检索与汇总);
- 它也为下一步的随机对照试验(RCT)提供了设计依据——要不要做、怎么做,都更有谱了。
但局限也必须讲透:这是单中心、只有 4 周的早期评估,处于 DECIDE-AI 第 1 阶段,主要结局是「采纳行为」而非患者层面的硬终点;它没检验疗效,也没能力捕捉罕见但严重的安全事件;会诊时间的缩短未达显著。作者自己在文末明确写道:这些发现「用于指导随机试验设计,但现阶段并不足以支持 AI 临床决策支持在急诊的临床部署」。
结论
这项研究最值得记住的一句话是:急诊不缺聪明的 AI,缺的是「能持续用下去」的 AI。
SHAKED 用 1,138 名患者、4 周真实部署的数据,说清了一个反直觉的事实——在算法精度之外,医生的持续参与意愿才是决定临床 AI 能否真正落地的关键变量。它没有宣称 AI 改变了患者结局,却为「AI 该以何种姿态进入急诊」提供了一个更清醒的起点:先解决「愿不愿用」,再谈「准不准」。
| 论文标题 | Prospective evaluation of a large language model clinical decision support system in the emergency department(急诊科大语言模型临床决策支持系统的前瞻评估) |
| 作者 | Liron Leibovitch、Adi Ahituv(共同第一作者)、Alon Gorenshtein、Dvir Aran、Moran Sorka、Keren Miron、Shahar Shelly(通讯作者) |
| 机构 | 以色列海法 Rambam 医疗中心(Rambam Health Care Campus)、以色列理工学院(Technion)、波士顿贝斯以色列女执事医疗中心(BIDMC)、梅奥诊所(Mayo Clinic) |
| 期刊 | Nature Medicine(《自然·医学》) |
| 发表时间 | 2026 年 8 月 19 日在线发表(2026-03-01 投稿、2026-07-22 接收) |
| DOI | 10.1038/s41591-026-04601-5 |
| PubMed | PMID 42618632 |
论文原文信息地址:https://www.simoagent.com/blog/2026-10-05-shaked-ed-llm-clinical-decision-support/
参考文献
- Leibovitch L, Ahituv A, Gorenshtein A, et al. Prospective evaluation of a large language model clinical decision support system in the emergency department. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04601-5
- Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nature Medicine, 2022;28(5):924–933. DOI: 10.1038/s41591-022-01772-9
相关问题
什么是临床决策智能体?
临床决策智能体(clinical decision agent)是一种能「主动干活」的医疗 AI——它不只回答提问,还会连接电子病历等外部系统,自动读取病史、生成结构化摘要、给出诊断与检查建议,并在需要专业判断时把医生拉回来。它和普通聊天机器人的区别在于:前者「不等人问」就主动读病历、做汇总;后者只在你提问后才给出文字回答。本次研究的 SHAKED 就是典型一例——由多个大语言模型协作、事件驱动管线自动运转,还带检索增强模块供医生溯源。
急诊AI为什么「越用越没人用」?
不是算法不准,而是医生「用不动」。SHAKED 的算法在专家盲审里近乎满分(100 份抽样 99 份临床适当),但医生的采纳率一个月内从 68% 跌到 30%。核心机制是「负荷敏感」的弃用:班次每往后多 1 小时,医生使用它的概率就下降 28%——越忙越顾不上点开它,而不是越忙越依赖它。唯一例外的窄任务是放射科会诊(偏好提升近 3 倍),因为那里边界清晰、省时明显。这说明决定急诊 AI 落地的关键变量是「医生的持续参与意愿」,而非单纯的算法精度。
SHAKED 能替代医生吗?
不能。作者明确把 SHAKED 定位为「辅助决策支持」而非替代者,并强调这些 4 周单中心的前瞻数据「用于指导随机试验设计,但现阶段并不足以支持临床部署」。它没有检验疗效,也把握不住罕见但严重的安全事件,急诊滞留时间和会诊周期也未见显著改善。这项研究的价值在于提醒行业:先把「医生愿不愿持续用」这个前提解决,再谈 AI 能否改变结局。