← 行业趋势

医生与AI评估LLM临床能力存在系统性分歧:400+医生7专科多中心研究揭示评估标准不可互换

封面

一、研究背景

大语言模型(LLM)在医疗领域的应用正从实验室走向临床一线,然而一个根本性问题始终悬而未决:谁来评估AI的临床能力?如何评估?

当前主流的评估范式存在三重偏差。其一,多数基准测试依赖选择题或合成病例(synthetic vignettes),将复杂的临床推理压缩为单一正确选项,这种"考试思维"与实际床旁决策之间存在深刻鸿沟。其二,评估者往往是少数几位临床专家,其判断未必能代表更广泛医生群体的观点。其三,随着AI智能体技术的兴起,越来越多研究开始用AI评估AI——但这种方式是否可靠,此前从未被系统验证。

2026年7月2日,首都医科大学附属北京友谊医院放射介入科金龙/栗荐团队联合北京同仁医院王宁利团队、复旦大学附属中山医院葛均波/李晨光团队,以及英国帝国理工学院、伦敦大学学院、香港中文大学、香港科技大学等17家国内外机构,在Nature旗下数字医学顶刊npj Digital Medicine(IF=15.1)发表了一项里程碑式研究DOI: 10.1038/s41746-026-02942-6,首次以大规模实证数据揭示了医生与AI智能体在评估LLM时存在的系统性认知分歧。

二、研究创新点

这项研究的突破性体现在三个层面:

第一,规模空前。 研究纳入超过400名执业医生,跨越7个医学专科(心内科、神经内科、肝胆外科、眼科、放射科、介入放射科等),覆盖中国从东部沿海到西部高原的多个地理区域,是迄今为止规模最大的LLM临床评估研究。

第二,真枪实弹。 不同于选择题或合成病例,研究使用的是2024年多中心收集的真实、去标识化临床病例。5个通用LLM(GPT-4o、Claude 3.5、Qwen-Max、DeepSeek-R1、OpenAI o1)需要对病例生成自然语言解读,医生再从全面性、连贯性、准确性、有用性、无害性和结构性六个维度进行盲法评分。

第三,人机对账。 研究部署了与医生数量相等的AI评估智能体作为平行对照组,使用完全相同的病例材料和评估维度。这种配对设计使得人机评估差异得以被精确量化,这在既往文献中尚无先例。

三、技术原理

本研究的核心设计是"双轨评估框架",其架构如下图所示。

技术原理

人类评估轨(Human Evaluation Track):

  • 400余位医生按年资分为初级、中级、高级三组
  • 按执业地域分为平原地区组和高原地区组
  • 每位医生对LLM输出在6个维度上进行Likert量表评分
  • 采用盲法设计,医生不知晓输出来自哪个模型

AI评估轨(Agentic Evaluation Track):

  • 部署等量的AI评估智能体
  • 智能体被配置为模拟特定医生特征(年资、专科等)
  • 使用相同的评估提示词和评分标准
  • 所有评估输出被记录用于一致性分析

数据分析层:

  • 组内一致性采用Kendall’s W系数
  • 人机一致性采用跨组比较
  • 排名稳定性通过Bootstrap重采样验证
  • 亚组分析按年资、地域、专科分层

该设计的精妙之处在于:它不仅回答了"哪个LLM最好"的问题,更追问了"谁的标准才算数"——这一通常被AI评估研究所忽视的元问题。

四、实验结果

研究结果呈现出一幅远比"AI赢"或"人类赢"更为复杂的图景。

实验结果

发现一:年资塑造评估偏好。 初级医生最青睐Qwen-Max,而高年资专家在连贯性、准确性和临床有用性维度上对GPT-4o和DeepSeek-R1给予更高评价。最受青睐的模型在不同年资组之间并不稳定,提示临床经验的积累深刻改变了医生对AI输出的判断标准。

发现二:地域导致排名逆转。 高原地区与平原地区医生的评估模式存在显著差异——部分模型的相对排名甚至出现方向性逆转。这一发现表明,临床实践环境(资源可及性、疾病谱差异、转诊模式等)可能深刻影响医生对LLM生成内容的判断标准,未来LLM评估研究应将执业环境作为重要的分层变量。

发现三:AI评估者高度"自洽"但与人不同。 在平行评估中,AI智能体在所有六个维度上均将OpenAI o1视为最优解,而人类医生则更青睐DeepSeek-R1和GPT-4o。虽然人机之间存在中等程度的整体一致性(Kendall’s W=0.798),但AI智能体在不同模拟经验水平下产生的排名高度一致(76.7%),而人类医生中这一比例仅为3.3%。

发现四:AI评估者无法捕获人类判断的异质性。 人类医生的评估呈现出丰富的异质性——不同年资、不同地域、不同专科的医生有着不同的判断标准。这种异质性不是"噪声",而是临床多样性的真实反映。AI智能体虽然高效,但输出的"整齐划一"恰恰暴露了其无法模拟人类临床判断结构化差异的根本局限。

五、应用前景

这项研究的结论对医疗AI产业有三个直接启示:

对AI开发者而言,评估标准不可"一刀切"。一个在选择题基准上表现优异的模型,可能在真实临床环境中被不同医生群体给出截然不同的评价。未来的医疗LLM评测应纳入多中心、多专科、多年资的医生评估,而非仅依赖自动化基准测试。

对医院采购决策者而言,AI评估工具不应替代医生试用。本研究明确显示,AI评估者与人类医生的偏好存在系统性偏差——如果医院仅凭自动化评测选择LLM产品,可能选到一个"AI认为好"但临床医生实际用不上的系统。

对AI智能体研究者而言,这项研究提示了一个深层问题:我们究竟希望AI评估者模拟"人类平均判断",还是"人类判断的多样性"?从临床安全角度看,后者才是正确答案——但当前技术显然还做不到。这也为下一代专科AI智能体的开发指明了方向:不是追求一个"万能评估器",而是开发能够适配不同临床场景的分层评估体系DOI: 10.1038/s41746-026-02942-6

六、结论

当医疗AI从"能不能用"走向"好不好用"的阶段,评估问题就不再是技术问题,而是认识论问题。金龙/栗荐团队的这项研究用超过400位医生的真实声音告诉我们:LLM的临床价值不存在唯一答案,它取决于谁来问、在哪里问、为谁而问。

AI智能体可以作为高效的辅助筛选工具,帮助在数以千计的LLM输出中初步分诊——但临床相关性、安全性和实用性的最终判断,仍必须锚定于真实医生的多样化视角。临床评估需要的不是一个"标准答案裁判",而是一个能够包容并反映临床异质性的多维框架。

论文原文信息
论文标题Physicians and artificial intelligence diverge in evaluating large language models on real clinical cases
作者Shi P, Li J, Yang Z, Cao Y, Ju L, Bao H, Xu H, et al.
机构北京友谊医院 · 帝国理工 · UCL · 港中文 · 港科大 · 复旦中山医院 等 17 机构
期刊npj Digital Medicine(Nature 子刊,IF = 15.1)
发表时间2026 年 7 月 2 日
DOI10.1038/s41746-026-02942-6
PubMedPMID: 42393197

参考文献

  1. Shi P, Li J, Yang Z, et al. Physicians and artificial intelligence diverge in evaluating large language models on real clinical cases. npj Digital Medicine, 2026. PMID: 42393197 DOI: 10.1038/s41746-026-02942-6

  2. Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents. Nature, 2026. PMID: 42310457 DOI: 10.1038/s41586-026-10675-5

  3. Liu Y, Carrero ZI, Jiang X, et al. Benchmarking large language model-based agent systems for clinical decision tasks. npj Digital Medicine, 2026. PMID: 41708802 DOI: 10.1038/s41746-026-02443-6