← 行业趋势

【今日医疗AI速递】Nature子刊:中科院DxDirector-7B仅70亿参数实现自主全流程临床诊断,准确率超越百倍参数大模型

中科院计算所联合北医三院在Nature Communications发表DxDirector-7B,基于深度思考智能体架构,从患者模糊主诉出发自主驱动完整诊断流程,在罕见病和真实世界病例评估中准确率超GPT-4o、Deepseek-R1等数百亿参数模型,医生介入仅为基线模型的1/3。

DxDirector全流程临床诊断智能体封面

一、研究背景

临床诊断的本质从来不是一道"给定全部信息后二选一"的选择题。真实世界里,医生面对的是患者模糊的主诉——“我最近总觉得累”、“肚子偶尔疼”——然后通过反复问诊、安排检查、解读结果,逐步缩小鉴别诊断范围,最终锁定病因。这个"全流程诊断"过程,需要的不只是医学知识储备,更是高级的临床推理能力。

尽管大语言模型(LLM)在医学问答、影像判读等"信息完备场景"中表现亮眼,但它们始终被定位为医生的"工具"——只能回答某一环节的具体问题,而非自主推动整个诊断链条。临床误诊率仍徘徊在20%左右,医生工作负荷持续加重,迫切需要真正能"扛起诊断全流程"的AI系统。

2026年4月,中国科学院计算技术研究所庞亮团队联合北京大学第三医院,在 Nature Communications 发表DxDirector-7B——一个仅70亿参数、却能自主驱动全流程临床诊断的智能体LLM,首次实现了从"AI辅助医生"到"AI主导推理、医生负责执行"的范式逆转。

二、研究创新点

本研究的核心突破在于重新定义了AI在临床诊断中的角色:

创新维度 具体内容
范式创新 全球首次实现LLM自主驱动完整诊断流程,从模糊主诉到最终诊断,无须人类预设诊断路径
架构创新 三阶段训练体系:医学数据继续预训练 → 全流程诊断指令微调 → 步骤级策略偏好优化
效率创新 仅70亿参数,平均每例仅需请求约3次临床操作,医生工作量降低至基线模型的1/3
问责创新 结构化输出将AI推理与医生操作的贡献明确分离,建立可追溯的问责机制

与先前报道的MIRA系统(需要与模拟患者AI智能体对话获取信息)不同,DxDirector-7B的创新在于其"慢思考"设计——模型在每个诊断步骤中显式生成深度推理内容,自主判定下一步需要什么信息、安排什么检查,仅在医生必须实际操作的环节(如体格检查、实验室检测)才请求介入。

三、技术原理

DxDirector-7B基于Llama-2-7B基座模型,通过三阶段训练构建:

第一阶段:医学知识注入。 使用3.5万份临床指南、1610万PubMed/PubMed Central摘要及500万全文论文进行继续预训练,辅以50万通用领域数据通过经验重放策略防止灾难性遗忘。

第二阶段:全流程诊断指令微调。 基于MedQA(USMLE)数据集的10,178条题目,使用GPT-4o将其转化为全流程诊断格式(患者模糊主诉 → 逐步问诊推理 → 设计检查 → 解释结果 → 最终诊断),并由o1-preview注入步骤级"深度思考"内容。训练采用解耦策略——交替优化推理能力(仅在深度思考和提问环节计算损失)和知识回忆能力(仅在回答和最终输出环节计算损失)。

第三阶段:步骤级策略偏好优化。 将每个诊断步骤的策略选择(下一步该问什么、该安排什么检查)建模为强化学习问题,以"诊断正确性"和"医生工作量最小化"作为双重奖励信号,确保每步策略既准确又高效。

最终模型以仅70亿参数,在诊断准确率上超越了参数量为其25至100倍的商业和医学专用LLM。

四、实验结果

诊断准确率

数据集 DxDirector-7B 最强商业LLM 最强医学LLM 领先优势
RareArena(罕见病22,901例) 36.23% o3-mini: 32.96% MedFound-176B: 23.98% +3.27%
NEJM CPC(复杂病例344例) 38.4% GPT-4o: 30.8% +5.9%
ClinicalBench(真实世界1,500例) 63.46% Deepseek-R1-671B: 47.28% MedFound-176B: 35.76% +16.18%
USMLE开放问答 50.88% MedFound-176B: ~39% +11.85%

在NEJM CPC复杂病例集上,DxDirector-7B的38.4%准确率不仅超越了GPT-4o(30.8%),甚至超过了人类医生的平均水平(32.5%)。

医生工作量

DxDirector-7B平均每例仅请求约3次临床操作,而基线模型需4-10次。这些请求的手术有效性高达97%-98%(即与专家病历记录一致的操作)。在真实世界评估中,心血管内科75%、感染科和消化科各66.7%的病例可由DxDirector-7B的诊断替代专科医生判断。

科室覆盖

在ClinicalBench的17个科室中,DxDirector-7B在14个科室准确率最高;在RareArena的19个科室中,16个科室领先。短板出现在皮肤科和整形外科——这些科室高度依赖视诊和触诊,对纯文本推理的AI构成天然挑战。

五、应用前景

  1. 基层医疗诊断增强: 中国基层医疗机构面临严重的医生短缺和诊断能力不均,DxDirector-7B以70亿参数即可在本地服务器部署,有望作为"AI诊断合伙人"嵌入基层HIS系统,辅助全科医生完成从初诊到确诊的全流程。

  2. 三甲医院效率提升: 在大型医院门诊场景中,DxDirector-7B可负责常见病的自动化初筛和诊断路径规划,将专家医生的精力集中于复杂疑难病例。按心血管内科75%可替代率估算,每位心内科专家每天可多处理2-3倍的患者。

  3. 罕见病筛查加速: 罕见病诊断平均耗时4.8年,DxDirector-7B在RareArena罕见病基准上的36%准确率(远超商业和医学专用LLM)提示,AI驱动的全流程推理有望大幅缩短罕见病确诊周期。

  4. 商业落地可行性: DxDirector基于开源Llama-2-7B构建,三阶段训练流程已在论文中完整公开。思陌智能体定制的技术团队可直接复现该架构,针对国内临床场景进行指令微调和科室适配,快速形成可商用的全流程诊断智能体产品。

六、结论

DxDirector-7B标志着临床诊断AI从"辅助工具"向"自主推理主体"的关键跃迁。它不追求参数量竞赛——仅70亿参数便超越了数百亿甚至数千亿参数的对标模型——而是在诊断策略的自主性和效率上实现了范式突破。

当然,正如研究团队坦诚指出的,DxDirector-7B在基础科学知识广度上仍弱于Deepseek-V3/R1等大参数模型,在患者沟通能力上也弱于GPT-4o。皮肤科、精神科等依赖频繁医患实际接触的科室,仍然是AI全流程诊断的"硬骨头"。但这恰恰指明了"人机协同"的合理边界——AI主导推理,医生负责执行与人文关怀——而非追求不切实际的"全自动诊疗"。

参考文献

Xu S, Huang X, Wei Z, Pang L, Shen H, Cheng X. DxDirector: an agentic large language model driving the full-process clinical diagnosis. Nature Communications. 2026;17:5614. doi:10.1038/s41467-026-71928-5. PMID: 42026083.