急诊分诊如何在没有生命体征时先排危重队列?ED-Triage-Agent 双阶段多智能体协作方案
一、研究背景
急诊分诊是急诊科最前置、也最关键的决策点:护士要在极短时间内判断一名患者的病情急迫程度,决定谁需要立刻抢救、谁可以安全等待。这个判断发生在认知资源最紧张的场景——患者高峰、人手短缺、时间压力叠加,却直接关系到危重患者能否被及时识别。
以美国为例,急诊年就诊量超过 1.43 亿人次,急诊拥挤已成为全球性难题,与之相伴的是可预防的不良事件与死亡风险上升 DOI: 10.1016/j.ijmedinf.2026.106652。北美主流的急诊严重度指数(Emergency Severity Index,ESI)把患者按病情与预期资源需求分成五个急迫等级,应用广泛,却面临三重结构性难题 DOI: 10.1097/pec.0b013e3182621813:
其一,单人评估存在瓶颈与一致性偏差。 有研究显示临床医生在标准化病例上的正确分级率仅约 59%,且存在系统性经验偏差——高年资医生倾向「不足分诊」(可能延误危重救治),低年资医生倾向「过度分诊」(浪费有限资源)。
其二,分诊是一次性判断,难以随病情演变调整。 心肌梗死、脓毒症等危重患者在初到时分往往生命体征尚「正常」,一旦被定为低危,就可能在高危队列里被延误。
其三,也是最被忽视的一点——生命体征采集之前的排队环节无人处理。 现实中的分诊是「序贯信息收集」:患者先挂号登记,此时只有主诉症状,生命体征要等护士逐个测量。在拥挤的高峰期,危重患者可能已经排在队伍里,却因为「数据还没测齐」,AI 帮不上忙。绝大多数现有 AI 分诊系统都要求输入完整临床数据(含生命体征)才能给出预测,恰恰绕开了这个最危险的窗口。
二、研究创新点
澳大利亚迪肯大学 Sandeep Reddy 团队正是瞄准这第三个缺口,在 International Journal of Medical Informatics 发表 ED-Triage-Agent(ETA),把「没有生命体征时,谁该先看」这一此前无人正式解决的问题,第一次拎到了台面上。这项工作有三处鲜明设计:
第一,把「生命体征前的队列优先级排序」确立为独立问题。 在体征缺失的情况下,仅凭症状就先给出一版 ESI 量表的初步急迫信号,用于排队排序;待体征到位后再升级为正式分级推荐。这切中了真实急诊的时序逻辑。
第二,坚持「人在环中」(human-in-the-loop)而非完全自主。 ETA 被明确设计为协作系统,AI 在每个分诊阶段给出建议与推理,最终判断始终保留给临床医生——这与近期诸多「自主替代医生」的智能体路线形成了明确分野。
第三,用官方标准锚定推理、以开源姿态公开。 系统通过检索增强生成(RAG)锚定 ESI 实施手册第 4 版,让每条推荐都可追溯、可解释,代码与评测框架已开源。
三、技术原理
ETA 的核心思路是「顺着分诊的真实节奏走」,用一个由 5 个专业智能体组成、经 LangGraph 编排的多智能体架构,把分诊拆成与工作流对齐的两阶段:
- Phase 1(症状先行优先级排序):仅凭挂号时获得的症状主诉,生成一版 ESI 量表的初步急迫信号,用于在生命体征采集之前就对排队顺序做出安排;
- Phase 2(体征后分级推荐):一旦生命体征与临床发现到位,生成与 ESI 标准逐条挂钩的正式分级推荐,并附上明确临床推理。
为保证输出不「跑偏」,ETA 用 RAG 把 ESI 实施手册第 4 版作为知识底座,每个智能体的判断都锚定在官方标准上;置信度权重与决策阈值先在 30 个标准化 ESI 实践病例上完成校准,再上外部基准检验。系统还配有审计日志与临床医生仪表盘,让「AI 说了什么、为什么这么说」全程可回看。
四、实验结果
团队在外部 TRIAGEAGENT 基准上,用精确匹配准确率、二次加权 Cohen’s κw、F1、过度/不足分诊率与高危灵敏度等指标,给出了 95% 置信区间下的结果 DOI: 10.18653/v1/2024.findings-emnlp.329:
| 阶段 | 指标 | 结果 |
|---|---|---|
| Phase 1 症状先行 | 精确匹配准确率 | 76.39%(κw=0.8787) |
| Phase 1 症状先行 | 高危灵敏度 | 95.52% |
| Phase 2 体征后分级 | 精确匹配准确率 | 87.04%(κw=0.9090) |
| Phase 2 体征后分级 | 显著过度分诊 / 不足分诊 | 0.00% / 0.46% |
| 全阶段 | 误分类落在相邻级别(±1)内 | 97.22% |
几个数字值得细看。Phase 1 在没有生命体征的情况下,仅凭症状就能达到 76.39% 的精确匹配准确率、κw 0.8787,且高危灵敏度高达 95.52%——这意味着系统对「必须优先看」的危重患者几乎不会漏排。Phase 2 体征到位后,准确率进一步提升到 87.04%、κw 0.9090。
更具临床价值的是安全性:显著过度分诊为 0.00%、显著不足分诊仅 0.46%,且 97.22% 的误分类都发生在相邻级别(±1 级)内——即便出错,也极少出现「危重当轻症」这类致命性跨越。作为对照,链式思维(CoT)基线在胜任力病例上出现了 10.00% 的显著不足分诊,而 ETA 为 0.00%。
五、应用前景
这项研究对「AI 该如何进入急诊分诊」提供了一个相当克制的样本,三点启示值得关注:
其一,AI 的正确位置是「协作支持」而非「替代判断」。 ETA 把「保留医生自主权」写进了架构本身,这是它区别于单纯追求准确率的单模型预测系统的关键。在高风险、高时间压力的急诊场景,「可解释 + 可回看 + 人在环中」往往比再高几个百分点的准确率更接近真实落地。
其二,先解决最痛的窗口,比追求全流程更务实。 生命体征采集之前的排队环节,是分诊安全网里最薄弱、也最被 AI 忽视的一环。ETA 用「症状先行」补上了这块拼图,为后续更完整的系统铺路。
其三,诚实是稀缺品质。 作者明确指出,本研究验证的是标准化病例上的技术可行性,临床效用、安全性与工作流整合,仍必须通过真实急诊数据与临床医生用户的前瞻验证来确认。团队已透露下一步将在澳大利亚及全球急诊科开展真实部署试验。这一定位,与近段时间「先落地再说」的浮躁叙事形成了鲜明反差。
六、结论
急诊分诊最难的地方,往往不是「算出正确的分级」,而是在信息尚未齐全、时间又极度紧迫时,先给危重患者一个靠前的位置。ED-Triage-Agent 用双阶段多智能体架构给出了一条务实的路径:症状先行排危重队列、体征到位再出正式分级,并以「人在环中」的协作姿态守住安全底线——外部基准上症状先行排序准确率 76.39%、高危灵敏度 95.52%,体征后分级 87.04%,显著不足分诊仅 0.46% DOI: 10.1016/j.ijmedinf.2026.106652。
它没有宣称 AI 能替代分诊护士,却为「AI 智能体如何真正嵌入急诊工作流」提供了一个清醒的起点:不是取代人,而是在最危险的窗口,帮人把该优先的人看清楚。
| 论文标题 | ED-triage-agent: a multi-agent framework for human-in-the-loop emergency triage |
| 作者 | Sharma K、Sivadas H、Edwards C、Gunja N、Reddy S |
| 机构 | 澳大利亚迪肯大学(Deakin University,通讯作者 Sandeep Reddy)等 |
| 期刊 | International Journal of Medical Informatics,2026 |
| 发表时间 | 在线发表 2026 年 8 月 18 日 |
| DOI | 10.1016/j.ijmedinf.2026.106652 |
| PubMed | PMID: 42612553 |
论文原文信息地址:https://www.simoagent.com/blog/2026-08-24-ed-triage-agent-human-in-the-loop/
参考文献
- Sharma K, Sivadas H, Edwards C, Gunja N, Reddy S. ED-triage-agent: a multi-agent framework for human-in-the-loop emergency triage. International Journal of Medical Informatics, 2026. DOI: 10.1016/j.ijmedinf.2026.106652
- Gilboy N, Tanabe P, Travers D, Rosenau AM. Emergency Severity Index (ESI): A Triage Tool for Emergency Department Care, Version 4. Pediatric Emergency Care, 2012. DOI: 10.1097/pec.0b013e3182621813
- Wang Y, et al. TriageAgent: Towards Better Multi-Agents Collaborations for Large Language Model-Based Clinical Decision Making. Findings of ACL: EMNLP 2024. DOI: 10.18653/v1/2024.findings-emnlp.329