← 行业趋势

【今日医疗AI速递】Pathology-CoT:从专家阅片行为中学习"视觉思维链",病理AI智能体自主诊断性能超越GPT-o3

封面

一、研究背景

数字病理学是AI辅助诊断最早也最成熟的领域之一。从2017年Google的淋巴结转移检测算法登上JAMA,到近年自监督病理基础模型(如UNI、CONCH、Prov-GigaPath)将千兆像素全切片图像(WSI)的视觉理解推向新高度,AI在病理图像分类、分割、预后预测等任务上已展现出超越人类的潜力 PMID: 28534893

然而,一个根本性鸿沟始终未能跨越:病理医生的诊断不是一个"看一眼就判断"的分类任务,而是一个"边看边想"的多步骤交互过程。面对一张千兆像素的切片,医生先在低倍镜下扫视全局锁定可疑区域,再逐级放大到高倍细看,反复穿梭于不同视野之间,最终整合所有线索形成诊断 DOI: 10.1038/s41568-021-00372-6。这种"看哪里、为什么看"的隐性经验是病理科最宝贵的财富,却从未进入过AI的训练数据。

2026年7月24日,宾夕法尼亚大学黄治(Zhi Huang)教授团队联合斯坦福大学、加州大学旧金山分校,在 Nature Biomedical Engineering 发表重磅研究,提出了 Pathology-CoT 框架——首次将病理专家的阅片行为转化为可规模化的AI训练监督信号,并据此开发出人类对齐的病理AI智能体 Pathology-o3 PMID: 42498734 DOI: 10.1038/s41551-026-01739-y

二、研究创新点

Pathology-CoT的核心突破可概括为"三步走"创新链条:

1. 将"数字尾气"炼成金:现代数字病理系统每秒约10次采样率记录医生的平移、缩放等导航事件。一张切片平均产生257次以上视野变更,若直接输入视觉语言模型(VLM),单病例将产生超50万视觉token——远超模型上下文极限。团队开发的AI阅片记录仪(AI Session Recorder) 可在标准WSI阅片软件中无感知运行,将混乱的事件流压缩为离散行为指令(inspect低倍巡视/peek高倍细看),并为每条指令配对一个标准化ROI边界框。

2. 人机协同6倍速标注:由VLM根据专家标定的ROI起草"为何查看该区域、可见哪些关键发现"的临床推理文本,再由两位病理医生核验修改。这种人在环审校(human-in-the-loop)流水线将标注效率提升了约6倍。

3. 两阶段智能体架构:Pathology-o3第一阶段(候选ROI提议器)在低倍镜下扫描全切片,输出值得关注的候选区域列表;第二阶段(行为引导推理器)按照专家视觉思维链的节奏,逐步查看每个ROI并累积诊断证据。这种"先扫后看"的设计精确复现了病理医生的实际阅片流程。

三、技术原理

技术原理

Pathology-CoT的技术架构围绕三个核心模块展开:

行为数据采集层:AI Session Recorder是在标准WSI阅片软件nuclei.io中运行的插件式工具。它被动监听用户的鼠标事件(平移、缩放、停留),将连续、高噪的原始日志转化为离散的行为指令序列。每条指令包含一个行为标签(inspect/peek)、一个标准化ROI边界框坐标、和视野对应的倍率。关键是,采集过程完全透明——病理医生按日常习惯阅片即可,无需额外操作。

监督信号生成层:行为指令生成后,系统用ROI的坐标裁剪对应区域的图像块(统一缩放到1024×1024像素),送入VLM要求其描述该区域的病理特征并解释"为什么医生要看这里"。VLM的输出草案再由至少两名病理医生逐条审核修正,形成"看哪里—为什么看—看到什么"的三元组监督数据。研究数据采集了斯坦福医学中心8位病理医生(4位主治、2位专科培训医师、2位住院医师),共25例结直肠癌、137张切片、累计10.6小时阅片,最终形成5,222轮对话的Pathology-CoT训练集。

两阶段推理层:Pathology-o3的第一阶段(ROI Proposer)在低倍率(通常2.5×)下对整张WSI进行全局扫描,利用视觉语言模型识别可疑形态学特征并生成候选ROI坐标列表,按优先级排序——这复现了医生"先在低倍下建立全局印象"的习惯。第二阶段(Behavior-guided Reasoner)依次进入每个候选ROI的高倍视图,执行与训练时行为指令一致的inspect/peek操作,逐步积累证据,最终通过综合所有ROI的发现给出诊断结论和置信度。

这一设计的精妙之处在于:它不是简单地让AI"看图片然后分类",而是让AI学会"像病理医生一样看片子"——先扫描全局→标记可疑区域→逐一深入→综合判断。

四、实验结果

实验结果

Pathology-o3在多项评测中展现出令人瞩目的性能:

核心任务——胃肠道淋巴结转移检测:在斯坦福医学中心内部验证集上,Pathology-o3以 84.5%的精确率和100%的召回率 完成淋巴结转移识别。这意味着它没有漏掉任何一例转移灶——这在临床场景中至关重要,因为"漏诊"的代价远高于"假阳性"。对比来看,OpenAI推理模型GPT-o3在同一任务上表现逊色,Pathology-o3显著超越GPT-4.1、Gemini 2.5 Pro等最先进VLM PMID: 42498734

外部独立验证:在来自瑞典的LNCO2外部队列上,Pathology-o3的召回率依然维持在 97.6%,证明了框架的跨机构泛化能力——不依赖于特定医院的扫描仪、染色流程或人群分布。

阅片路径与人类医生对齐度:团队将Pathology-o3的ROI导航序列与12年资深主治医生的实际阅片轨迹进行对比。Pathology-o3的路径完整度达61.3、效率得分56.2——远超随机基线和其他VLM基线。随着推理步数增加,诊断准确率持续提升,说明它的"边看边想"策略是有效的,而不是盲目试错。

成本与效率分析:使用Gemini 2.5 Flash(轻量级模型)作为VLM backbone时,Pathology-o3的每张切片推理成本可控,且延迟与推理步数呈正相关——这为不同预算下的临床部署提供了弹性选择。

多backbone迁移性:无论是用Gemini 2.5 Pro、Gemini 2.5 Flash还是其他VLM作为底层视觉引擎,Pathology-o3的性能均显著优于无行为引导的baseline,证明框架的增益不依赖于特定模型架构。

五、应用前景

Pathology-CoT的开创性在于它解决了一个此前被忽视的根本问题:AI诊断的"教学数据"应该包含专家的诊断行为,而不仅仅是诊断结果。这一思路的临床转化前景十分广阔:

  • 病理质控与第二意见:Pathology-o3可作为"永不疲倦的第二阅片人",在初诊病理医生阅片后自动复核,标记可能被遗漏的微小转移灶。其100%召回率意味着它可以成为一道坚实的安全网。

  • 低资源地区赋能:全球病理医生严重短缺,非洲部分地区每百万人仅有不到1名病理医生。Pathology-CoT框架的技术路线——将专家行为转化为可迁移的AI能力——有望让AI智能体携带顶尖医学中心的阅片经验,服务于医疗资源匮乏地区。

  • 可解释性诊断报告:不同于传统AI给一个"黑箱分数",Pathology-o3自带行为推理链——它看过的每一个ROI、每一步推理都可以回溯追溯。这种透明度是获得监管批准和临床信任的关键前提。

  • 方法跨域迁移潜力:虽然本研究聚焦于结直肠癌淋巴结转移,但Pathology-CoT的方法学框架不限于特定癌种或器官。只要存在"多步视觉搜索"的临床场景——如放射学影像解读、内镜视频分析、眼科OCT筛查——该框架的理论基础均适用。

六、结论

Pathology-CoT代表了AI智能体在临床诊断中的一次范式级跨越:从"给AI看结果让它学"转变为"让AI看专家的行为过程让它学"。通过将病理医生日常阅片的"数字尾气"炼成高价值训练数据,该研究不仅开发出了性能超越GPT-o3的病理AI智能体,更为整个医学影像AI领域提供了一条可复制的技术路线——把隐性的专家行为转化为显性的智能体能力。

当然,从实验室到临床还有距离。研究仅在结直肠癌一个任务上验证,需在更多癌种和病理任务上测试稳健性。此外,真实临床环境中切片质量差异、罕见肿瘤类型、共病复杂病例等因素仍需前瞻性研究评估。

无论如何,这项来自宾大、斯坦福和UCSF联合团队的工作,已经为"AI像医生一样思考"这个愿景提供了一份沉甸甸的技术答卷 DOI: 10.1038/s41551-026-01739-y

参考文献

  1. Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents. Nature. 2026. PMID: 42310457 DOI: 10.1038/s41586-026-10675-5

  2. Wang S, Wu R, Herndon C, et al. Pathology-CoT: learning visual chain-of-thought agents from expert whole-slide image diagnosis behaviour. Nature Biomedical Engineering. 2026. PMID: 42498734 DOI: 10.1038/s41551-026-01739-y

  3. Echle A, et al. Deep learning in cancer pathology: a new generation of clinical biomarkers. Nature Reviews Cancer. 2021;21:747-762. PMID: 34504388 DOI: 10.1038/s41568-021-00372-6

  4. Bejnordi BE, et al. Diagnostic assessment of deep learning algorithms for detection of lymph node metastases in women with breast cancer. JAMA. 2017;318:2199-2210. PMID: 28534893 DOI: 10.1001/jama.2017.14585