← 行业趋势

医疗AI智能体如何从单次诊断走向长期疾病管理?谷歌AMIE双智能体架构在100例多访诊场景中治疗与检查精准度超越基层医生

一、研究背景

给一段病史,让模型吐出几个可能的诊断——这是过去几年医疗大模型最擅长的「考试」。但把镜头拉回真实诊室,诊断从来不是终点:医生要判断疾病接下来会怎么走,开出的药起没起效,什么时候该复查、该减量、该换方案,哪些检查该做、哪些纯属过度医疗。这套横跨时间、兼顾疗效与安全处方的认知过程,医学上有个专门的名字——管理推理(management reasoning)

它恰恰是医疗 AI 一直没啃下来的硬骨头。诊断推理有成熟的量表、有大量的人机对照研究;而管理推理因为高度「情境化」——两个医生面对同一个病人,都可能做出不同选择——既难定义,更难评估。于是我们看到一个尴尬的局面:AI 在「会答题」上越走越远,在「会管病」上却几乎空白。

Google DeepMind 与 Google Research 团队要补的正是这一课。他们把此前在诊断对话中一战成名的 Articulate Medical Intelligence Explorer(AMIE),从「单次就诊的诊断」推进到「跨多次就诊的疾病管理」。2026 年 6 月 17 日,这项题为《Towards conversational artificial intelligence for disease management》的研究在线发表于 Nature(2026;655:1292–1299)DOI: 10.1038/s41586-026-10764-5

二、研究创新点

这项工作不是把诊断模型换个场景再刷一遍分,而是围绕「疾病管理到底需要 AI 会什么」做了三处实打实的推进:

第一,把「对话」与「推理」拆成两个智能体。 系统由对话智能体(Dialogue Agent)与管理推理智能体(Mx Agent)协同组成:前者负责与患者实时文字交流、维护跨访诊的对话状态,后者在后台做更重、更慢的结构化临床推理。两者职责解耦,可以各自用不同的模型、独立伸缩与调优。

第二,用长上下文检索把推理「钉」在权威指南上。 AMIE 借助 Gemini 的长上下文能力,在约 1050 万 token 的临床语料(527 份 NICE 指南 + 100 份 BMJ 最佳实践文档)上做 in-context 检索,配合结构化推理,让输出与最新的临床实践指南和药物处方集对齐——这一点在「开什么药、多大剂量」的关键时刻尤其重要。

第三,首次提出可复用的用药推理基准 RxQA。 为量化「安全处方」这一能力,团队从美英两国药典(OpenFDA 与英国国家处方集 BNF)中提炼出 600 道选择题,由执业药师校验,覆盖不同难度,为整个领域提供了一把可以横向比较的尺子。

三、技术原理

AMIE双智能体架构与长上下文检索

AMIE 的疾病管理版本,核心是「快慢分离」的双智能体设计。

对话智能体构建在 Gemini 1.5 Flash 之上,经过监督微调与强化学习(RLHF/RLAIF)训练。它的职责很「窄」:保持同理心、低延迟的对话,并让患者多次复诊时的对话状态前后一致。它不承担重活。

**管理推理智能体(Mx Agent)**才是真正做决策的大脑。每一轮推理,它先对约 1050 万 token 的指南语料做一次粗检索,把命中结果(约 6 份相关指南文档)装进 256,000 token 的外部知识窗口,再迭代草拟、合并候选管理方案,并施加结构约束,使最终方案与分配的指南子集、处方集对齐。这意味着 AI 的推荐来自「当下权威证据」,而不是训练时背下来的可能过时的内容。

团队还引入了一种叫 Ensemble Refinement(集成精化) 的技巧:让系统并行草拟最多 4 套治疗方案,再综合成一份共识。这有点像把「多专家会诊」的机制搬进模型内部,用以压低单次生成中的幻觉。作者特别强调,长上下文在这里不是「装饰」——正是它让规划环节能够基于完整指南推理,而非只看被截断的片段。

四、实验结果

AMIE与基层医生在多访诊管理推理上的盲评对比

评估采用随机、盲法、虚拟 OSCE(客观结构化临床考试)设计,由专科医生独立评分,评分者不知答案来自 AI 还是真人 DOI: 10.1038/s41586-026-10764-5

  • 管理推理:在由专科医生评估的整体管理推理能力上,AMIE 不劣于(non-inferior)21 名基层医生;
  • 精准度:治疗与检查推荐的精准度、以及整体方案的适当性,在三次就诊中均显著优于医生——首诊整体方案适当性 88% 对 74%(p=0.019);
  • 指南遵循:两者在「选出适用指南」上得分相当,但 AMIE 在「推荐与指南一致的治疗与检查」「显式引用指南作为依据」上显著更高;
  • 用药推理(RxQA):无论「开卷」还是「闭卷」,AMIE 在高难度题上都超越医生——而在「小错可能致命」的用药环节,这一表现尤为关键。

患者演员的评分同样值得玩味:AMIE 在同理心、倾听、解释清晰度等维度得分更高。这与早前诊断版 AMIE 引发的「AI 反而更有同理心」的讨论一脉相承。

五、应用前景

疾病管理,而不是一次性诊断,才是基层医疗真正花时间、花成本的地方。一个能在多次复诊中持续跟踪病情、判断疗效、并按指南安全开药的智能体,触达的是临床工作量最大的一块。

从系统设计角度看,这项研究给出的信号很明确:「把状态化对话与结构化领域推理拆开」,是值得复用的架构原语。一个便宜、快速的模型可以负责聊天回路,一个更重、更慢的推理模型在检索到的权威语境里负责正确性,两者各自为「响应速度」和「有据可依」调优。这一模式可以推广到任何「实时交互 + 受约束的规则推理」并存的高风险领域。

但论文作者把边界讲得很克制:这仍是模拟文字问诊下的虚拟考试,病例构成不代表常规基层医疗,也未验证对患者真实结局的影响。AMIE 尚未达到可临床使用的程度,从虚拟 OSCE 到真实诊所,还隔着安全监管、责任归属与前瞻性可行性研究等一长段路。

六、结论

从「会诊断」到「会管病」,AMIE 的这步跨越,把医疗 AI 的能力评估从单次问答推进到了纵向照护——这是更难量化、却更贴近临床日常的地带 DOI: 10.1038/s41586-026-10764-5

它的价值不在于宣称「AI 可以接管慢病管理」,而在于标定了一个方向:把模型输出「钉」在命名指南与处方集上,正在成为 AI 靠近处方决策时的标准设计范式。当药物剂量、疗效判断都压在一条建议上时,「有据可依」远比「答得漂亮」重要得多。路还长,但方向已经清晰。

论文标题Towards conversational artificial intelligence for disease management
作者Valentin Liévin、Anil Palepu(共同第一作者)、Wei-Hung Weng、Khaled Saab、David Stutz、Yong Cheng、Kavita Kulkarni、S. Sara Mahdavi、Joëlle Barral、Dale R. Webster、Katherine Chou、Avinatan Hassidim、Yossi Matias、James Manyika、Ryutaro Tanno、Vivek Natarajan、Adam Rodman、Tao Tu;通讯作者 Alan Karthikesalingam、Mike Schaekermann
机构Google Research / Google DeepMind(美国加州山景城)
期刊Nature,2026;655:1292–1299
发表时间2026 年 6 月 17 日(在线发表)
DOI10.1038/s41586-026-10764-5
PubMedPMID: 42310463

论文原文信息地址:https://www.simoagent.com/blog/2026-09-04-amie-disease-management-agent/

参考文献

  1. Liévin V, Palepu A, Weng WH, Saab K, Stutz D, Cheng Y, et al. Towards conversational artificial intelligence for disease management. Nature, 2026;655:1292–1299. DOI: 10.1038/s41586-026-10764-5
  2. Tu T, Palepu A, Schaekermann M, Saab K, Freyberg J, Tanno R, et al. Towards conversational diagnostic AI. arXiv, 2024. DOI: 10.48550/arXiv.2401.05654
  3. McDuff D, Schaekermann M, Tu T, Palepu A, Wang A, Garrison J, et al. Towards accurate differential diagnosis with large language models. Nature, 2025;642(8067):451-457. DOI: 10.1038/s41586-025-08869-4