← 行业趋势

罕见病为何平均超过5年才能确诊?DeepRare多智能体系统以可追溯推理诊断2919种疾病,纯表型首检召回率超次优23.79个百分点

罕见病患者平均要经历超过5年的「诊断苦旅」,全球超3亿人深受其苦。上海交大与新华医院团队在《自然》发表DeepRare——一个由大语言模型驱动的多智能体罕见病诊断系统,每下结论都附带可追溯的完整证据链。系统覆盖2919种罕见病,纯表型首检召回率达57.18%,比次优方法高23.79个百分点,并在新华医院真实病例中超越资深罕见病专家。

DeepRare多智能体罕见病诊断系统概念示意

研究背景:罕见病诊断为什么平均要拖5年以上?

罕见病,指患病率低于 1/2000 的疾病。单看每一种都很少见,但把它们加起来,全球已发现超过 7000 种、约 80% 由遗传因素导致,累计影响超过 3 亿人——这比很多常见病的总盘子还大。

真正难的地方在「确诊」这一步。因为单病种发病少、表现异质、基层医生一辈子可能都没见过几例,患者往往要经历一场平均超过 5 年的「诊断苦旅(diagnostic odyssey)」:反复转诊、被误诊、做一堆不必要的检查,既延误了治疗,也带来沉重的身心与经济负担。

长期以来,医疗 AI 在罕见病上的尝试不少,但普遍存在四个硬伤:多学科知识融合不足、训练病例太少、知识更新滞后、推理过程像「黑盒」不可追溯。医生不敢信一个「只给结论、不给依据」的 AI。这正是 DeepRare 要攻克的点。

创新点:一个「医疗多智能体工作流」如何让诊断有据可查?

上海交通大学人工智能学院(张娅、谢伟迪团队)与医学院附属新华医院(孙锟、余永国团队)联合研发的 DeepRare,是首个「推理过程可追溯」的罕见病智能医生。它的核心创新,是把诊断从「一个模型拍板」改造成一条医疗多智能体工作流:

  • 由大语言模型(LLM)驱动的多智能体系统,整合了 40 余种专业工具与实时更新的医学知识源;
  • 能同时处理**自由文本病历、结构化表型术语(HPO)、基因检测结果(VCF)**等多种输入;
  • 最关键的差异:它每给出一个诊断,都附带一条完整、可回溯到权威医学证据的推理链——像老医生查房时,一步步讲清楚「为什么这么判断」。

一句话概括它的定位:不止告诉你「是什么」,更讲明白「为什么」。这直接回应了医疗 AI 最大的信任危机。

技术原理:临床决策智能体如何「假设—验证—反思」?

DeepRare 本质是一套临床决策智能体,采用「中枢—分身」三层架构:

  • 第一层·中央主机:默认基于 DeepSeek-V3,配记忆库,负责统筹整个诊断流程、整合各类证据做最终决策;
  • 第二层·专用智能体服务器:多个子智能体各管一套工具,分别执行表型/基因型分析、术语标准化、知识检索、相似病例检索等专项任务;
  • 第三层·网络级医疗资源层:集成 PubMed、Orphanet、OMIM 等权威数据库,为诊断提供可溯源的证据底座。

工作流大致是:分解任务 → 检索证据 → 生成初步假设 → 自反思循环反复验证、修正甚至推翻 → 输出排序后的候选疾病列表。这个「假设—验证—自我反思」的迭代,让它具备了类似人类医生的「慢思考」能力,能主动追问缺失信息、修补逻辑漏洞。

数据说话:2919种疾病上的成绩单

团队在 9 个数据集、6401 例临床病例上做了迄今最全面的罕见病诊断评估之一,覆盖14 个医学专科、2919 种罕见病,病例来自亚洲、北美、欧洲多地。

评估维度 DeepRare 结果 对比基线
纯表型首检召回率(Recall@1) 57.18% 次优方法高 23.79 个百分点
前三检召回率(Recall@3) 65.25% 大幅领先推理型 LLM 与传统工具
多模态(168 例)Recall@1 69.1% 经典工具 Exomiser 仅 55.9%
推理链专家评审一致率 95.4% 由 10 位副主任医师盲法评估

几个结果值得单独点破:

  • 纯表型就能筛:不测基因、只看临床症状,首检命中率就有 57.18%——意味着缺基因检测设备的基层医院也能做初筛;
  • 超越人类专家:在新华医院 163 例真实罕见病病例中,DeepRare 的 Recall@1 达 64.4%、Recall@5 达 78.5%,超过了 5 位资深罕见病专家的平均水平,成为首个在该指标上优于医生的计算模型;
  • 加基因更准:整合基因数据后,新华医院病例 Recall@1 升到 69.1%、湖南医院病例升到 63.6%;
  • 架构才是关键:消融实验显示,换成别的底层 LLM 几乎不影响性能,而「智能体架构」相对裸大模型平均带来 28% 以上的 Recall@1 提升;
  • 专科有分化:肾脏/泌尿系统最强(66%),肺/呼吸系统较弱(31%),提示不同专科仍需针对性打磨。

失败案例分析显示,最常见的错误是推理权重出错,其次是表型模拟诊断;而「推理事实错误」「证据关联错误」各只占 2.5%——再次印证它的可追溯设计是有效的。

应用前景与局限

DeepRare 已不只是论文:它自 2025 年 7 月上线在线诊断平台,半年内全球 600 多家医疗机构注册使用,并在新华医院内部部署、即将正式上岗协助医生「查漏补缺」。团队下一步计划发起全球罕见病诊疗联盟,并在未来半年用两万个真实病例进一步验证。

但局限也要讲透:这是一项回顾性/基准评估为主的研究,真实世界的前瞻部署效果仍需验证;不同专科性能差异明显(肺/呼吸仅 31%);系统定位是决策支持,作者反复强调是「辅助医生」而非替代医生,最终诊断与治疗责任仍在医生肩上。

结论

DeepRare 最值得记住的一点是:它把罕见病诊断 AI 从「只给结论的黑盒」推进到「结论 + 完整证据链」的可追溯阶段。

对「医疗多智能体工作流」这个方向,它给出了一份来自顶级期刊《自然》的强证据——多智能体协同 + 可追溯推理,能在真实病例上超越资深人类专家。对患者而言,它意味着「平均 5 年」的诊断苦旅有望被大幅缩短;对行业而言,它证明「让 AI 讲清楚为什么」不是可选项,而是走进临床的入场券。

论文标题An agentic system for rare disease diagnosis with traceable reasoning(面向罕见病诊断的、推理可追溯的智能体系统)
作者Weike Zhao、Chaoyi Wu、Yanjie Fan(共同第一作者);Ya Zhang(张娅)、Yongguo Yu(余永国)、Kun Sun(孙锟)、Weidi Xie(谢伟迪)(通讯作者)
机构上海交通大学(人工智能学院)、上海交通大学医学院附属新华医院
期刊Nature(《自然》)2026;651(8106):775-784
发表时间2026 年 2 月 18 日在线发表(2025-06-30 投稿、2025-12-30 接收)
DOI10.1038/s41586-025-10097-9
PubMedPMID 41708847

论文原文信息地址:https://www.simoagent.com/blog/2026-10-07-deeprare-multiagent-rare-disease-diagnosis/

参考文献

  1. Zhao W, Wu C, Fan Y, et al. An agentic system for rare disease diagnosis with traceable reasoning. Nature, 2026;651(8106):775–784. DOI: 10.1038/s41586-025-10097-9

相关问题

什么是临床决策智能体?

临床决策智能体(clinical decision agent)是一种能「主动干活」的医疗 AI——它不只回答提问,还会连接外部数据库和工具,自动分解任务、检索证据、生成假设,并反复自我验证后再给出结论,同时把每一步推理的依据留痕下来。它和普通聊天机器人的区别在于:前者「主动跑流程、可溯源」,后者只在你提问后给一段文字答案。DeepRare 就是典型一例——一个由大语言模型驱动、整合 40 余种专业工具的多智能体系统,每下诊断都附带可追溯到 PubMed、Orphanet、OMIM 等权威来源的证据链。

罕见病为什么这么难确诊?

三个原因叠加:一是罕见——单病种患病率低于 1/2000,基层医生一辈子可能没见过几例;二是表现杂——罕见病常有多系统、异质性的复杂症状,容易和常见病混淆;三是缺手段——约 80% 由遗传因素导致,精确诊断往往依赖基因检测,而很多基层医院没有相应设备。这些因素叠加,让患者平均要经历超过 5 年的「诊断苦旅」:反复转诊、被误诊、做不必要的检查。DeepRare 的意义正在于:即使没有基因检测、只靠临床表型,也能给出 57.18% 的首检命中率,帮基层先把「该往哪个方向查」筛出来。

DeepRare 能替代医生吗?

不能。DeepRare 的定位是决策支持——帮医生「查漏补缺」、缩小鉴别诊断范围,而不是替代医生做最终判断。作者在论文里反复强调其辅助属性,诊断与治疗责任始终在医生身上。而且它本身也有短板:不同专科性能差异大(肺/呼吸系统仅 31%),评估以回顾性/基准为主,真实世界的前瞻效果仍需进一步验证。它最有价值的,是把「结论 + 完整证据链」的透明诊断范式带进了罕见病这个最难啃的领域。