← 行业趋势

AI 智能体进病理科到底该干什么?UPMC 用 94 例活检验证『受约束报告智能体』:出报告耗时近乎减半、未见诊断幻觉

一、研究背景

关于医疗 AI 智能体,过去一年出现了大量令人兴奋的论文:能自主问诊的、能推理罕见病的、能模拟移植委员会的。但把这些成果放到医院信息科的视角下看,会发现一个共同的尴尬——它们几乎都跑在实验环境里

论文里的智能体,往往运行在研究者自建的沙盒中,用的是脱敏后的历史数据,评价靠回顾性打分。而真实医院要的是另一套东西:系统必须部署在医院已经审批通过、符合数据合规要求的环境内;必须嵌进医生每天真实使用的工作流;必须能说清楚出了错谁负责。

病理科尤其典型。一份外科病理报告,医生真正的专业判断可能只占几秒钟——看完切片,心里已经有了结论。剩下的大量时间花在把结论变成一份格式规范的报告上:标本部位要对应、器官和取材方式要写全、科室内部的速记缩写要展开成规范术语、多个标本块要保持结构一致。这部分是纯粹的文书劳动,却实实在在地拖慢了签发(sign-out)速度。

UPMC 受约束病理报告智能体

2026 年 7 月 29 日,美国匹兹堡大学 / 匹兹堡大学医学中心(University of Pittsburgh / UPMC)的 Ibrahim Abukhiran、Liron Pantanowitz 等人在病理学权威期刊 《Modern Pathology》(美国与加拿大病理学会 USCAP 官方期刊)在线发表研究,做了一件此前少有人做的事:把一个 LLM 智能体真正塞进医院生产环境,然后用前瞻性临床验证去测它的边界

二、研究创新点

这项研究最值得关注的地方,不是它让智能体做了多少事,而是它刻意让智能体少做事

其一,跑在企业合规环境里,不是实验沙盒。 智能体基于 Microsoft 365 Copilot 构建,运行于医院已批准、符合 HIPAA 要求的 Microsoft 365 环境内。这意味着患者数据不出合规边界,IT 与信息安全部门可以审计——这是很多研究型智能体拿不到的"入场券"。

其二,用规则把能力"往下压"。 系统通过一段固定的规则型系统配置提示词(rule-based system configuration prompt)加一个速记知识库(quick-text knowledge base)来约束行为:只允许做报告结构化、格式化和受控的速记扩写,明令禁止任何诊断推断。诊断权完整保留在病理医生手里。

其三,端到端验证,一直测到签发。 研究不是只测模型输出质量,而是做了三层评估:前瞻性病例验证、重复性(repeatability)压力测试、以及贯穿完整工作流直到 sign-out 的耗时对照。这种验证密度在 LLM 医疗应用中相当罕见。

三、技术原理

整个系统的设计哲学可以概括为一句话:把智能体锁在文书层,不让它碰诊断层。

受约束报告智能体的技术架构与工作流

输入端有两路。 一路是从实验室信息系统(LIS)中提取的标本容器标签(specimen container label)——上面写着标本来自哪个器官、哪个亚部位、用什么方式取的;另一路是病理医生手工敲入的速记诊断,通常是几个缩写或短语。

约束层是核心。 固定的系统提示词规定了智能体能做的四件事:

  1. 保持标本分部结构——多个标本块的顺序与对应关系不能乱;
  2. 识别器官、亚器官与操作方式——从容器标签里解析出规范的解剖学与操作描述;
  3. 受控速记扩写——依据科室速记知识库,把医生输入的缩写展开成规范诊断术语;
  4. 空诊断强制留白(blank diagnosis enforcement)——医生没写诊断的地方,智能体必须留空,不允许自行填补。

第 4 条是整个设计里最关键的安全阀:它从机制上堵死了"模型看到空缺就想补全"这一 LLM 最典型的幻觉入口。

输出端有人守着。 智能体产出的是一份格式规范的报告草稿,病理医生必须逐字复核后才能签发。研究者反复强调:所有输出在 sign-out 前都需要病理医生仔细审阅。

四、实验结果

94 例前瞻验证的准确性、重复性与效率结果

团队开展了一项前瞻性验证,纳入 94 例消化道(GI)活检病例,由消化专科病理医生逐例评估。

结构与识别:全对。 智能体在 100% 的病例中正确保持了标本分部结构,并准确识别出器官、亚器官及操作方式上下文。所有适用病例的速记扩写全部正确。

格式偏差:8 例(8.5%),不影响诊断含义。 这些是排版层面的小瑕疵,不改变临床语义。

诊断误读:2 例(2%),未见幻觉。 这 2 例中,智能体把容器标签上的描述性词汇(如 “ulcer” 溃疡、“erosion” 糜烂)写进了诊断正文。注意,这些词本来就在输入标签里,不是模型凭空生成的——研究明确报告未发现任何幻觉诊断。但它揭示了一个真实风险:智能体分不清"标本标签上的描述"和"病理医生下的诊断",会把前者当后者。

重复性:81% 完全一致,3% 语义泄漏。 这可能是全文最有价值的一组数据。团队挑出富含描述性标签的困难病例,重复运行 105 次,结果只有 81% 的输出完全相同19% 存在差异,其中 3% 的运行出现了不可复现的语义泄漏。对医疗系统而言,这个数字比准确率更值得警惕——同一份输入,两次跑出不同结果

效率:耗时近乎减半。 时间对照研究覆盖从录入到签发的完整流程:AI 辅助平均 39 秒,语音转录 72 秒,手工录入 76 秒,节省约 33–37 秒(p < 0.05),且耗时波动更小、更可预测。

五、应用前景

对正在为医院做智能体定制的团队,这篇论文的参考价值可能高于那些指标更漂亮的研究。

第一,能力约束本身就是安全设计。 这个智能体的准确性不是靠更强的模型堆出来的,而是靠"禁止它做什么"换来的。规则提示词 + 领域知识库 + 空值强制留白,三招把幻觉入口封死。在医疗场景里,可控性的优先级高于能力上限

第二,文书增强是当下最稳的落地面。 报告结构化、术语规范化、模板填充这类工作,价值明确(省时约一半)、风险可控(不涉及诊断判断)、合规友好。相比追求"AI 自主诊断",从文书层切入更容易通过医院的审批与验证。

第三,重复性应当成为医疗智能体的一级指标。 19% 的输出波动提醒我们:LLM 的随机性不会因为约束严格就消失。在评估医疗智能体时,除了准确率,还应常规报告多次运行的一致性——这直接关系到质控与可追溯性。

第四,合规环境不是加分项而是前提。 能在医院已批准的合规环境内部署,往往决定了一个智能体项目能不能真正上线。

边界同样要说清。 本研究为单中心、单一病种(消化道活检)、样本量 94 例,且智能体的角色被严格限定在非诊断性文书工作上。作者的结论毫不含糊:低频随机误差与输出波动是 LLM 的固有属性,即便约束严格也无法根除;这类系统适合做非诊断性的文书增强,而非自主使用

六、结论

这篇论文给出的答案,和多数医疗 AI 论文的方向相反:它不是在证明智能体能做更多,而是在证明——当你明确告诉智能体不许做什么时,它才真正可用

在 94 例真实消化道活检上,一个被规则严格约束、运行在 HIPAA 合规环境内的报告智能体,做到了 100% 的结构与器官识别准确率、零幻觉诊断,并把出报告全流程从 72–76 秒压缩到 39 秒。同时,81% 的重复一致率和 2% 的描述词误入诊断,清楚划出了它的能力边界。

对做医疗智能体定制的人,这项工作提供的不是一套算法,而是一份可复用的落地范式:选一个价值明确、风险可控的文书环节切入,用规则和知识库把能力压到安全区间,在医院合规环境内部署,做前瞻性验证,并把人留在签发环节。 让智能体提速,让医生负责——这大概是当前阶段最现实、也最靠得住的分工。

论文标题End-to-End Clinical Validation of a Human-Supervised Large Language Model Agent for Enterprise Surgical Pathology Reporting
作者Abukhiran I, Mansour A, Caicedo ML, Minkowitz JM, Pantanowitz L(Ibrahim Abukhiran 为通讯作者)
机构美国匹兹堡大学 / 匹兹堡大学医学中心(University of Pittsburgh / UPMC),宾夕法尼亚州匹兹堡
期刊Modern Pathology(美国与加拿大病理学会 USCAP 官方期刊,Elsevier 出版)
发表时间2026 年 7 月 29 日(在线发表),文章编号 101049
DOI10.1016/j.modpat.2026.101049
PubMedPMID: 42526601

论文原文信息地址:https://www.simoagent.com/blog/2026-08-11-upmc-constrained-pathology-reporting-agent/

参考文献

  1. Abukhiran I, Mansour A, Caicedo ML, Minkowitz JM, Pantanowitz L. End-to-End Clinical Validation of a Human-Supervised Large Language Model Agent for Enterprise Surgical Pathology Reporting. Modern Pathology, 2026;101049. DOI: 10.1016/j.modpat.2026.101049 | PMID: 42526601
  2. Klang E, Omar M, Raut G, Agbareia R, Timsina P, Freeman R, Gavin N, Stump L, Charney AW, Glicksberg BS, Nadkarni GN. Orchestrated multi agents sustain accuracy under clinical-scale workloads compared to a single agent. npj Health Systems, 2026. DOI: 10.1038/s44401-026-00077-0 | PMID: 42527531
  3. Breithaupt AG, Weiner M, Tang A, Possin KL, Sirota M, Lah J, Levey AI, et al. Agentic AI for scaling diagnosis and care in neurodegenerative disease. Nature Aging, 2026. DOI: 10.1038/s43587-026-01186-z | PMID: 42533108
  4. Trost F, Zhang B, Aring I, et al. An agentic framework for autonomous scientific discovery in cancer pathology. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04357-y | PMID: 42056496