【今日医疗AI速递】Nature重磅:自主AI智能体MIRA在急诊诊断中全面超越医生,零安全事故
海德堡大学等团队在Nature发表MIRA系统,在沙盒EHR环境中实现自主诊疗全流程,诊断准确率达88.9%,处方安全零事故。

一、研究背景
大语言模型(LLM)在临床问答、影像报告生成等单点任务上已展现出不俗的表现,但这类应用本质上仍是"聊天机器人"——它们能给出建议,却无法像真正的医生那样,进入电子健康记录(EHR)系统、查看患者数据、下一个检查医嘱、开一张处方。真正的临床工作不是一问一答,而是一连串需要持续推理、判断和行动的复杂流程。
2026年6月17日,德国海德堡大学医院、德累斯顿工业大学等联合团队在 Nature 发表里程碑式研究,推出了 MIRA(Medical Intelligence for Reasoning and Action)——一个在沙盒化EHR环境中运行的自主AI智能体。MIRA不仅可以"看病历",还能主动采集病史、开具检查、解读结果、制定治疗方案,甚至安排手术和住院,完整模拟了急诊科医生从接诊到处置的整个临床闭环。
二、研究创新点
本研究的突破性体现在三个维度:
| 创新维度 | 具体优势 |
|---|---|
| 架构创新 | 首个端到端急诊科自主AI智能体,集成11个FHIR标准医疗工具,覆盖超过85,000个临床决策选项 |
| 安全创新 | 通过token掩码强制约束工具参数有效性,从程序层面杜绝幻觉产生不可操作指令的可能性 |
| 评估创新 | 双医生队列对照设计(认证专科医生 + 混合资历组),在574例真实MIMIC-IV患者病例上全面比较 |
与以往的LLM临床研究不同,MIRA不是一个被动的问答系统。它具有"智能体"(Agent)的核心特征——感知环境(读取EHR数据)、制定计划(o1-preview驱动的推理)、执行动作(调用FHIR工具)、评估结果(解读检查报告),形成一个完整的感知-推理-行动闭环。
三、技术原理
MIRA的技术架构分为三层:
1. 环境层(EHR沙盒):基于HL7 FHIR标准搭建的HAPI-FHIR服务器,患者数据来自MIMIC-IV数据库。底层编码涵盖ICD(诊断)、LOINC(检验)、ATC/NDC/RxNorm(药物)、SNOMED-CT(临床术语),由医学专家逐条审核代码映射的准确性。
2. 工具层(11个医疗工具):包括PatientHistory(病史采集)、PhysicalExaminationRequest(体格检查)、LabRequest/UrineRequest/MicrobiologyRequest/RadiologyRequest(检验检查请求)、MedicationRequest(药物处方)、ProcedureSearch/ProcedureRequest(手术查找与安排)、Plan(治疗方案)、Admission(入院决策)。每个工具的参数选项都经过严格约束,确保AI只能选择真实存在的检查项目和药物。
3. 推理层(双模型协作):核心执行由GPT-4o(温度0.01)负责,通过结构化JSON调用工具;复杂推理任务由o1-preview通过Plan工具完成,用于分析鉴别诊断和多步骤治疗规划。这种双模型架构将"快速执行"和"深度推理"分离,兼顾了效率与准确性。
值得注意的是,MIRA的患者交互是通过一个独立的"患者智能体"进行的——该系统根据出院小结中的病史(HPI)文本扮演患者回答问题。在所有933次对话中,患者智能体实现了零诊断信息泄露,即使面对11种对抗性提示攻击也保持稳健。
四、实验结果
诊断准确率对比
| 评估对象 | 诊断准确率 | 统计显著性 |
|---|---|---|
| MIRA | 88.9% | — |
| 认证专科医生(4人,7-11年经验) | 78.1% | P < 0.001 |
| 混合资历医生组(6人) | 71.1% | P < 0.001 |
MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)诊断上表现最优,肺炎(72.4%)是唯一准确率相对较低的病种,主要受限于胸部影像学判读的复杂性。
药物安全性(核心亮点)
在574例真实病例中,MIRA实现了零药物安全事故:零严重药物相互作用、零肾功能剂量禁忌、零过敏-药物不匹配、零QT间期风险处方、零不安全阿片类药物处方。处方正确性达到99.8%(自由文本剂量说明)、97.6%(数值剂量)、98.3%(单位正确)。
指南依从性
MIRA的整体指南依从性显著优于两个医生队列,平均配对联接差异超过+35个百分点。在胰腺炎液体复苏和镇痛治疗等关键环节,MIRA的表现尤为突出。入院决策实现了召回率1.00(零应入院而未入院的遗漏)。
五、应用前景
-
急诊分诊与初筛:MIRA可接管常规的病史采集、初步检查申请和用药调和任务,释放医生精力用于复杂病例的判断和患者沟通。研究中MIRA完成体格检查的比例(97.1%)显著高于医生(87.8%),体现了AI在标准化流程执行上的优势。
-
基层医疗赋能:在缺乏专科医生的基层机构,MIRA类系统可提供符合三甲医院指南水平的诊断和治疗建议,缩短城乡医疗差距。
-
医学教育与规培:AI智能体的诊疗过程全程可追溯、可回放,可作为住院医师规范化培训的"虚拟标准化病人+带教老师",提供即时反馈和对比学习。
-
商业化路径清晰:MIRA使用GPT-4o作为核心模型,无需自研基座模型,这为国内医疗IT企业提供了可复制的技术路线——在已有HIS/EMR系统基础上,通过中间件层接入LLM和FHIR工具,即可构建面向特定科室的AI临床智能体。
六、结论
MIRA标志着医疗AI从"聊天助手"到"临床智能体"的关键跨越。它不仅证明了自主AI智能体在受控环境中可以安全地完成端到端诊疗任务,更重要的是展示了正确的安全架构设计——通过严格的工具约束和参数验证,将AI的"幻觉"风险从程序层面加以控制。
对于思陌智能体定制的业务方向,MIRA的架构思路提供了重要参考:构建医疗AI智能体的核心竞争力,不在于选择哪个大模型,而在于设计安全可控的工具层、精准的医学知识映射以及与现有医院信息系统的无缝对接能力。这恰恰是我们团队的核心积累所在。
参考文献
Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents. Nature. 2026. doi:10.1038/s41586-026-10675-5. PMID: 42310457.