医疗AI智能体如何判断自己的诊断是否可信?用「行为一致性」替代模型置信度,筛出49.4%可自主处理的低风险病例
研究背景:医疗 AI 智能体为何迟迟进不了医院?
大语言模型(LLM)驱动的自主临床 AI 智能体,如今已经能独立走完一条诊断工作流:多轮问诊、调用检查工具、收集证据、给出带推理的诊断结论,全程不需要人一步步盯着。德累斯顿工业大学 Kather 团队的 MIRA 系统,早在 2026 年 6 月就在沙盒电子健康记录(EHR)环境里跑通了整套急诊流程,诊断准确率达 88.9%。
可「能诊断」离「能进医院」之间,还隔着两堵墙。
第一堵墙是数据主权:患者的病历、化验、影像都属于敏感数据,医院不允许把它们传到外部云服务,模型和数据必须留在机构自己的服务器里。第二堵墙是可信度判断:医生凭什么相信 AI 这一次的判断是对的?一个平均准确率很高的系统,仍然可能在证据薄弱时给出「稳定而错误」的诊断——错误并不是均匀分布的,平均分会把危险悄悄抹平。
这两堵墙,正是德累斯顿团队这篇 2026 年 9 月 15 日发表在《Nature Medicine》的论文要拆掉的东西。
创新点:把「部署在哪」和「何时放行」拆成两个问题
这篇研究的核心洞见是:医疗 AI 的「信任」其实是两件事,需要用不同的证据分别支撑。
运行层面的信任,关乎数据控制、模型版本、审计与部署治理,这由**本地部署(on-premise)**来解决——模型、工具调用、数据处理全部跑在医院自己的服务器上,机构对数据流向和模型选型有完全掌控。
决策层面的信任,关乎单次输出是否可靠,这由一套多视角可靠性框架来解决——在「决策时刻」,从系统自身的可观测输出中算出一个信号,把「有把握」的病例和「需要复核」的病例分开。
两者合起来,构成了论文的核心主张——「选择性自主(selective autonomy)」:AI 既不是「全自动」,也不是「纯辅助」,而是只自主处理它自己信号显示可靠的低风险病例,其余一律转交医生复核。用资深作者 Kather 的话说,目标是「一个有选择自主权的智能体,支持而非取代医生」。
技术原理:同一病例多跑几遍,看诊断稳不稳
系统是一个「双智能体」框架:一个医生智能体负责追问病情、调用体检、化验、影像等工具,最后提交诊断和理由;一个患者智能体扮演病人,按给定事实回答问题。整场「虚拟就诊」最多十轮,产出单个最终诊断。
判断「可不可信」的方法,出人意料地朴素——把同一个病例独立地重复完整就诊多次(默认五次),看诊断结论稳不稳。
之所以要重复「整个流程」而不是只重问一遍,是因为多轮智能体存在路径分叉:早期的一次采样差异,会改变后续的追问内容和检查选择,上下文随之越走越远。所以团队比较的是「完整流程的重复结果」,而不是固定提示下最后一句答案的置信度。
具体地,团队量化了四类信号,分别作用于「诊断」和「理由」两个输出流,共得到八个分数:
| 信号 | 测什么 | 局限 |
|---|---|---|
| 内部似然(词元概率) | 模型自己认为的「生成把握」 | 一个常见而错误的诊断也能拿高分 |
| 语言确定性 | 输出里有多少「可能、也许」 | 表面措辞,不代表证据强度 |
| 概念密度 | 临床实体覆盖比例 | 概念多不等于诊断对 |
| 行为一致性 | 各次输出语义向量的相似度 | 最接近「稳定正确」 |
数据说话:行为一致性是最可靠的「可信度」信号
在两项源自 MIMIC-IV 的基准上,本地部署的智能体在七疾病任务上拿下 90.04% 准确率、四疾病任务 83.8%,已经接近云端基线(GPT-5.2 的 90.7%)——这说明把模型搬到院内,性能并没有明显缩水 DOI: 10.1038/s41591-026-04609-x。
更关键的发现来自可靠性指标。在所有信号里,诊断行为一致性对「正确/错误」的区分能力最强(AUC=0.860),压力测试下仍保持信息量(AUC=0.875);而模型自身的词元概率(内部似然)几乎靠不住。
一组压力测试把这个结论钉死了:当团队删掉患者信息里的主诉和完整病史,模型准确率从 90.6% 一路跌到 70.2%,但它的概率置信度分数却毫无反应——AI 嘴上说着「很确定」,其实已经错得一塌糊涂。
基于此,团队设计了一道可落地的闸门:以行为一致性阈值 0.90 为界,49.4% 的病例被保留为「可自主处理」,这批病例的诊断准确率达到 98.9%;其余病例一律转交医生。此外,自动裁判与医生对 181 个病例的复核共识一致率达 92.3%,说明评分标准本身也站得住脚。
应用前景与局限
这套框架最有价值的地方,是给「AI 何时能自主」提供了一个可量化、可审计的闸门,而不是一句含糊的「请医生酌情判断」。对医院和监管者而言,保留率、准确率、剩余错误数都摆得出具体数字,可以被写进明确的放行门槛。
但它离「临床可用」还有明显距离:
- 结论来自 MIMIC-IV 的回顾性基准,不是真实前瞻临床,也没有实现 FHIR 等真实病历系统互操作;
- 老年人群是短板:18–39 岁组准确率 91.8%,65 岁以上降到 79.7%,提示训练数据的年龄代表性不足;
- 「多跑几遍」意味着每例要做多次完整推理,算力与延迟成本不低,团队也承认正在优化效率;
- 两个主基准共享单院数据来源,跨机构泛化尚未验证。
结论
这篇论文给出的,不是又一个「准确率刷新纪录」,而是一个更清醒的答案:医疗 AI 智能体进医院的正确姿势,不是追求「全自动」,而是「选择性自主」——用行为一致性当闸门,把低风险病例交给 AI,把不确定病例留给人。
它同时戳破了一个流行误区:模型嘴上的「置信度」并不可信,真正的可信度,藏在「多跑几遍是否还是同一个结论」里。诊断与治疗的最终责任,始终在医生手中。
| 论文标题 | On-premise medical AI agents for reliable clinical decision-making(本地部署的医疗 AI 智能体用于可靠临床决策) |
| 作者 | Li Zhang(第一作者)、Georg Wölflein、Dyke Ferber、Junhao Liang、Zunamys I. Carrero 等;资深(通讯)作者:Jakob Nikolas Kather |
| 机构 | 德国德累斯顿工业大学 Else Kröner Fresenius 数字健康中心(EKFZ)、德累斯顿大学医院;海德堡大学医院国家肿瘤疾病中心、暨南大学附属第一医院、Gustave Roussy/巴黎萨克雷大学、利兹大学等 |
| 期刊 | Nature Medicine |
| 发表时间 | 2026 年 9 月 15 日在线发表 |
| DOI | 10.1038/s41591-026-04609-x |
| PubMed | PubMed 检索(暂未索引) |
论文原文信息地址:https://www.simoagent.com/blog/2026-09-18-onpremise-agent-reliability-selective-autonomy/
参考文献
- Zhang L, Wölflein G, Ferber D, Liang J, Carrero ZI, et al. On-premise medical AI agents for reliable clinical decision-making. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04609-x
- Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents. Nature, 2026. DOI: 10.1038/s41586-026-10675-5
相关问题
为什么不直接相信模型自带的「置信度」分数?
因为 LLM 的概率是「生成概率」,不是「正确概率」。一个常见但错误的诊断,照样能拿到很高的生成概率。压力测试里模型准确率大跌 20 个百分点、置信度却纹丝不动,就是最直接的证据。
「重复就诊多次」会不会太慢、太贵?
会,这正是它目前最大的成本瓶颈,也是它仍停留在回顾性验证、而非实时临床的原因之一。可行做法是只对接近阈值或高风险场景做多次推理,团队也在优化推理效率,逐步压缩这部分开销。