远程问诊AI如何像医生一样看图问诊?谷歌多模态AMIE以状态感知框架在105场模拟会诊中29/32维度超越基层医生
一、研究背景
远程问诊里,患者发来的从来不只是文字。可能是一张皮疹照片,一张心电图截图,一份体检报告、化验单,甚至几页出院记录。现实中医生问诊本就是多模态的:一边问病史,一边看图、看检查、看既往资料,再决定下一步该怎么追问、该开什么检查。
但过去几年,医疗大模型的能力评估几乎都困在「文字问、文字答」里。以谷歌早前的 Articulate Medical Intelligence Explorer(AMIE)为例,它在纯文本诊断对话中一度以盲评成绩「压过」基层医生而引发热议——可反对者一句话就戳中了要害:真实的医学不是一场文字聊天。患者带着手机拍的皮疹照片、心电图、血常规走进来的那一刻,一个看不见图像的诊断智能体,就只能停留在「研究玩具」的层面。
这正是 Google DeepMind 与 Google Research 团队要补上的缺口:让诊断对话 AI 也具备「看图、问诊、推理」的综合能力。2026 年 5 月 14 日,这项题为《Advancing conversational diagnostic AI with multimodal reasoning》的研究发表在 Nature Medicine DOI: 10.1038/s41591-026-04371-0。
二、研究创新点
这项工作不是又刷了一个更高分的考试,而是在「远程问诊到底需要 AI 会什么」这个真问题上做了三处实打实的推进:
第一,把多模态数据真正接进诊断对话。 团队开发了多模态版 AMIE,让系统能在问诊过程中主动请求、读取并整合皮肤照片、心电图(ECG)和临床文档,模拟现代远程医疗「图文并茂」的真实交互。
第二,提出「状态感知对话框架」。 与传统「一问一答」不同,系统会持续维护一份内部患者状态——包括主诉、现病史和「认知缺口」(还缺哪些关键信息),再根据诊断不确定性与不断演变的患者状态动态调整问诊策略,复刻资深医生的结构化推理路径。
第三,用严格范式检验,而非自说自话。 研究采用随机、盲法、OSCE(客观结构化临床考试)风格的模拟远程会诊设计,共 105 个多模态临床场景、210 次模拟咨询,由 18 名专科医生盲评——把「谁更像好医生」交给独立的专科评审。
三、技术原理
多模态 AMIE 构建在 Gemini 2.0 Flash 基础模型之上,核心不是重新训练一个更大的模型,而是在推理时精心设计一套「状态感知」框架。
具体而言,系统内部维护着一个动态的患者状态表示,随对话推进持续更新;每个回合它都要回答「我现在知道了什么、还不知道什么」,并据此决定下一步:是继续追问症状,还是向患者请求一张皮肤照片、一份心电图、一页化验单,还是已经可以收敛到鉴别诊断。这种「按需索取 + 动态整合」的方式,把零散的多模态信息编织进一个连贯的诊断推理链条,而非简单地把图片丢给模型做一次性分类。
团队还做了一组关键的消融实验:把「来回对话」这一环节去掉、只让模型单独对着图像判断,系统表现会显著恶化。这说明即便 AI「能看」,主动问诊与病史采集依然不可替代——它不是一个可有可无的流程包装,而是诊断质量的核心来源。此外,作者也验证了仅在狭窄医疗任务上微调基础模型,可能提升某些技能却损害另一些技能,因此更倾向在成熟基础模型之上精心设计推理流程,而非动辄微调。
四、实验结果
在 105 个多模态场景、210 次模拟远程咨询的随机盲法评估中,多模态 AMIE 交出了一份相当扎实的成绩单 DOI: 10.1038/s41591-026-04371-0:
- 诊断准确性:无论只看首选诊断,还是看更宽泛的鉴别诊断清单,多模态 AMIE 都整体优于基层医生;
- 多模态推理:在 9 项评估多模态推理的指标中,7 项更优或相当;
- 综合表现:32 个评价维度中 29 项达到或超过基层医生,涵盖病史采集、管理建议、沟通质量与共情;
- 鲁棒性:当上传图片质量下降时,AI 与医生表现都会下滑,但 AI 的准确率下滑幅度更小。
更值得注意的是来自「患者」一侧的声音:由患者演员从礼貌、清晰度、同理心、「是否愿意再次就诊」等维度评分,AI 至少与医生持平,且在「处理和解释所上传图像」上被评价为做得更好。这与早前纯文本 AMIE 引发的那场关于「AI 反而更有同理心」的讨论一脉相承。
五、应用前景
多模态 AMIE 最直接的价值场景,是医生短缺与老龄化压力叠加的远程医疗与基层首诊。在日本的老龄化社会、印度这样临床医生严重不足的地区,一个能看懂照片、心电图、化验单并保持高质量对话的诊断智能体,是最先可能规模化落地的地方。
但论文作者把边界讲得很克制:这仍是模拟远程会诊场景下的探索性研究,不是随机临床试验,也远未证明 AI 可以独立接诊。要走向临床,还需回答安全性、公平性、在真实日常实践中的影响,以及责任归属与监管框架等一系列问题。
对医疗 AI 从业者而言,这项研究给出的前瞻信号很明确:下一代临床智能系统的核心竞争力,正在从「会答题」转向「会看、会问、会推理」的闭环,而「状态感知推理 + 多模态融合」很可能是通往这一目标的关键技术路径。
六、结论
多模态 AMIE 用一次严谨的盲法评估证明了一件事:把「看」和「说」接起来,能让诊断对话 AI 逼近、并在多数维度上超过基层医生的表现,同时守住沟通与共情 DOI: 10.1038/s41591-026-04371-0。
它的价值不在于宣称「AI 可以取代医生」,而在于标定了一个方向:医疗 AI 的下一程,是从「文字问答」走向「图文并茂的临床对话」,而状态感知的推理框架,是把两者缝起来的那根线。路还很长,但方向已经清晰。
| 论文标题 | Advancing conversational diagnostic AI with multimodal reasoning |
| 作者 | Khaled Saab、Chunjong Park、Tim Strother、Jan Freyberg、David G.T. Barrett、Ryutaro Tanno、Tao Tu、Alan Karthikesalingam、Vivek Natarajan、Adam Rodman 等 |
| 机构 | Google Research / Google DeepMind(合作机构含美国波士顿 Beth Israel Deaconess Medical Center) |
| 期刊 | Nature Medicine,2026;32(5):1726-1736 |
| 发表时间 | 2026 年 5 月 14 日(在线发表) |
| DOI | 10.1038/s41591-026-04371-0 |
| PubMed | PMID: 42135531 |
论文原文信息地址:https://www.simoagent.com/blog/2026-09-02-multimodal-amie-telehealth-diagnosis/
参考文献
- Saab K, Park C, Strother T, Freyberg J, Barrett DGT, Tanno R, et al. Advancing conversational diagnostic AI with multimodal reasoning. Nature Medicine, 2026;32(5):1726-1736. DOI: 10.1038/s41591-026-04371-0
- McDuff D, Schaekermann M, Tu T, Palepu A, Wang A, Garrison J, et al. Towards accurate differential diagnosis with large language models. Nature, 2025;642(8067):451-457. DOI: 10.1038/s41586-025-08869-4
- Tu T, Palepu A, Schaekermann M, Saab K, Freyberg J, Tanno R, et al. Towards conversational diagnostic AI. arXiv, 2024. DOI: 10.48550/arXiv.2401.05654