← 行业趋势

眼科问诊前的病史谁来采集?双智能体LLM问诊智能体随机对照试验:问诊质量超住院医师17.7分、诊断F1达0.85

门诊问诊前的病史采集,能不能交给大模型智能体?中山大学中山眼科中心团队研发双智能体问诊智能体,在广州三级眼科医院开展随机对照试验:172名患者中,智能体问诊质量比住院医师高17.7分(MedHistory评分)、诊断F1达0.85,但交互时间更长、眼部体征仍需医生把关——为「人机协同」的混合工作流提供实证。

双智能体LLM眼科问诊智能体概念示意图

研究背景:门诊问诊前的病史采集为什么是个瓶颈?

病史采集是临床工作的第一步,也是后续诊断与用药决策的根基。但在真实门诊里,这一步常常是资源最紧张、最容易「缩水」的环节:医生时间有限,患者又多,问诊往往被压缩成几分钟的快速问答,漏问、错问在所难免。

更现实的问题是,病史采集的质量高度依赖医生的经验。资深医生知道该顺着哪条线索追问、该排除哪些「危险信号」,而年轻住院医师往往还在练这个基本功。于是「问诊质量」成了制约诊断准确率的隐性短板。

大语言模型(LLM)恰好擅长对话与追问——那么,它能不能接手「问诊前」这段病史采集,把医生从重复劳动里解放出来?中山大学中山眼科中心团队用一个真实的随机对照试验(RCT)给出了答案。

创新点:双智能体 + 症状导向逻辑树,把问诊标准化

团队研发的问诊前 LLM 智能体,核心是双智能体架构 + 技能化症状导向逻辑树。它不是让一个模型「自由发挥」,而是把问诊拆成一条条结构化的追问路径:

  • 一个智能体负责「问」:按患者主诉的症状,沿逻辑树逐层追问病史细节;
  • 另一个智能体负责「整理」:把对话实时归纳成结构化、可复用的病史记录。

这套设计的价值,在于把「资深医生脑子里那套追问思路」固化成可复制的流程,让每一位患者都能得到标准化、不缩水的问诊。

技术原理:这个「医院AI助手」怎么工作?

从功能上看,这个问诊智能体就是一个面向门诊的医院 AI 助手,工作方式可以概括为三步:

  • 接诊:患者进入诊室前,先与智能体完成一段问诊对话;
  • 追问:智能体依据「症状导向逻辑树」,围绕主诉主动追问关键病史与危险信号;
  • 输出:生成一份结构化病史摘要,交给医生作为诊断的起点。

试验在广州一家三级眼科医院开展。2025 年 5 月 10 日至 6 月 10 日,共 175 例问诊患者中,172 例非急诊预约患者按 1:1 随机分配到「LLM 智能体组」或「眼科住院医师组」。

数据说话:RCT 里它比住院医师好在哪、差在哪?

试验结果相当清晰,智能体在「问诊质量」上全面领先:

指标 智能体组 住院医师组 结论
MedHistory 评分(0–100) 更高 — 校正后均值差 17.7 分(95%CI 14.1–21.3,P<0.001)
耐心评分 5 分 4 分 P<0.001,智能体更高
共情评分 5 分 3 分 P<0.001,智能体更高
交互时间(中位) 11.2 分钟 3.1 分钟 P<0.001,智能体更长

几个关键结论值得拆开看:

  • 问诊质量显著更优:以 MedHistory 评分(0–100 分)衡量,智能体组的校正后均值高出住院医师 17.7 分;
  • 更耐心、更有同理心:患者对智能体的耐心与共情评分(均为 5 分)都高于住院医师(4 分、3 分);
  • 交互时间反而更长:智能体中位交互 11.2 分钟,是住院医师 3.1 分钟的 3 倍多——它愿意慢慢问,患者也愿意慢慢说;
  • 检查推荐无显著差异:各阶段的检查推荐性能两组相当。

最亮眼的还是探索性结果:仅凭病史采集,智能体的诊断准确性 F1 达 0.85,显著高于住院医师的 0.68(P<0.001)。但要注意另一面——眼部体征带来的提升在住院医师中更显著(交互效应 −0.19,P=0.003),也就是说一旦加上「看眼睛」这一步,两者差距被明显缩小。这恰恰点出了智能体的边界:它擅长「问」和「归纳」,但「查体」仍需医生。

应用前景与局限

这项研究的价值,不在于「AI 又一次赢了医生」,而在于它给出了一种更务实的分工思路:让智能体承担标准化、可复制的病史采集,把医生最宝贵的精力留给体格检查与诊断综合——即所谓的混合工作流(hybrid workflow)。

局限也要讲透:这是单中心研究,样本仅 172 例,且是眼科这一相对专科化的场景;交互时间更长虽然换来了更细的问诊,但在门诊量大的现实压力下,「11 分钟 vs 3 分钟」的效率代价如何消化仍需评估;诊断准确率目前只来自病史这一单一信息源,加入影像与体征后的整体表现还需验证。

结论

这项随机对照试验证明了一件具体的事:经过工程化设计(双智能体 + 症状导向逻辑树)的 LLM 智能体,能把「问诊前病史采集」做得比住院医师更标准、更耐心、更完整,并据此拿到更高的诊断准确率。

它也划清了边界:智能体的强项是「问得全、归纳得清」,而「看得准(查体)」仍是医生的不可替代之处。两者叠加,才是一个站得住的「医院 AI 助手」落地路径——AI 把数据采标准,医生把判断做扎实。

论文标题Standardized pre-consultation by a large language model agent vs ophthalmology residents: a randomized clinical trial(大语言模型智能体 vs 眼科住院医师的标准化问诊前采集:一项随机对照临床试验)
作者Ming-Jie Luo、Yunxi Lai、Wenyu Wang 等,通讯作者 Haotian Lin(林浩添)
机构中山大学中山眼科中心(眼科学国家重点实验室,广州)
期刊npj Digital Medicine(《npj 数字医学》)2026
发表时间2026 年 10 月 5 日在线发表
DOI10.1038/s41746-026-03232-x
临床试验注册ClinicalTrials.gov NCT06824389(2025 年 5 月 2 日注册)
PubMedPubMed 检索(2026-10-05 刚发表,暂未索引,无 PMID)

论文原文信息地址:https://www.simoagent.com/blog/2026-10-12-llm-agent-preconsultation-ophthalmology-rct/

参考文献

  1. Luo MJ, Lai Y, Wang W, et al. Standardized pre-consultation by a large language model agent vs ophthalmology residents: a randomized clinical trial. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-03232-x

相关问题

什么是临床决策智能体?

临床决策智能体(clinical decision agent)是一种嵌入临床工作流的医疗 AI——它不只回答提问,还会主动采集信息、按结构化流程追问、归纳输出,并据此辅助诊断决策,全程把最终判断留给医生。它和普通聊天机器人的区别在于:前者「贴着真实问诊流程跑、有追问有归纳、可结构化输出」,后者只在你提问后给一段文字答案。本文这个眼科问诊智能体就是典型一例——双智能体架构 + 症状导向逻辑树,先把病史采标准,再帮医生做诊断综合。

为什么智能体问诊更细,诊断 F1 却仍被医生靠查体追上?

因为两者擅长的事不同。智能体「问得全、归纳得清」——仅凭病史,它的诊断准确性 F1 达 0.85,显著高于住院医师的 0.68(P<0.001)。但「看眼睛」这类查体信息是智能体拿不到的:一旦加入眼部体征,住院医师的诊断提升更显著(交互效应 −0.19,P=0.003),差距被明显缩小。这说明智能体的边界在「采集与归纳」,而「体格检查」仍是医生不可替代的环节——两者叠加才是完整的人机协同。

这个问诊智能体会替代眼科医生吗?

不会。它的定位是「问诊前」的标准化病史采集助手,属于混合工作流里的一环:智能体把病史采全、采标准,医生把精力集中在体格检查与诊断综合。研究也显示,检查推荐性能两组无显著差异,最终诊疗责任仍在医生。它更像一位「耐心十足的问诊前助手」,替医生做完最费时的重复劳动,而不是替代医生的判断。