医疗影像智能体该让大模型直接看图吗?AgentEYE 用专科工具加循证检索把眼科诊断正确性从 36.5 分提到 71.9 分
一、研究背景
做医疗影像智能体的团队,几乎都会在某个节点面对同一个诱惑:既然多模态大模型已经能"看图说话",那把片子直接喂给它、让它输出诊断报告,是不是最省事的架构?
一到眼科,这个诱惑就撞上了现实的墙。
眼科的临床诊断从来不是一张图的分类题。医生要同时看眼底照相和眼部 B 超,B 超看到玻璃体腔内一团中高回声,眼底照相却因为屈光间质混浊几乎拍不清——这时候要判断是玻璃体积血、视网膜脱离,还是更凶险的脉络膜黑色素瘤,靠的是把两种模态的信息交叉验证,再结合病史、指南和鉴别诊断逻辑收敛出一个判断。更麻烦的是,医生做完判断还要能说清楚"我为什么这么想",因为下一步可能就是手术决策。
而现有的眼科 AI,大部分停在三种形态:
单任务分类模型。 一个模型判断糖网分级,另一个模型筛青光眼,第三个做视网膜分层。性能可能很好,但每个都只回答一个封闭问题,凑不成一份能给临床看的报告。
通用大模型直接看图。 GPT-4o 这类多模态模型确实能对眼底照片说出一段话,但在专科影像上的识别错误率相当高,而且推理依据不透明——它说"符合视网膜脱离表现",你无从知道它究竟看到了什么。
弱循证的报告生成。 有些系统会在报告里附上参考文献,但引用是模型自己"想"出来的。医生一查,链接打不开、文献不存在,或者内容和结论根本对不上。
这三种形态共同缺失的东西是:可审计性。真实临床里,一份不能被追查依据的诊断报告,是没法进入决策链条的。
2026 年 8 月 5 日,浙江大学医学院附属第二医院眼科中心金凯团队,联合浙江大学生物医学工程学系、浙大医学院附属儿童医院、皖南医学院第一附属医院、中国矿业大学,以及新加坡国立健康集团眼科研究所、宾夕法尼亚大学佩雷尔曼医学院、波兰眼科研究基金会等国内外机构,在 Cell Press 旗下 Cell Reports Medicine 发表研究,给出了他们的答案:AgentEYE——一个自主的多模态眼科智能体。
二、研究创新点
AgentEYE 的设计取向,可以概括成一句话:不让大模型去做它不擅长的事,而让它去做只有它能做的事。
具体拆成三个创新点。
第一,把"看图"和"推理"彻底解耦。 大模型不负责判读影像,它负责规划:识别这是眼底照片还是 B 超、该调哪个专科工具、工具结果之间有没有冲突、要不要去查指南、证据够不够、最后怎么把这些拼成一份报告。真正的影像判读交给专门训练过的本地视觉语言模型。这是典型的"编排层而非替代层"思路,但在眼科多模态场景下是第一次被系统验证。
第二,让证据检索的目标从"提分"改成"可查"。 这是本研究最反直觉、也最有价值的发现。团队做了消融实验,把检索模块整个拿掉——诊断正确性和完整性评分几乎没变。按常规逻辑,这会被解读为"检索没用"。但作者的结论正相反:检索的价值本来就不在提高诊断准确率,而在于让报告里的每一条结论都能挂上一条可核查的证据链。评价一个医疗智能体,不能只看准确率这一个数。
第三,主动报告能力边界,而不是只报喜。 论文同时给出了三类"不好看"的结果:波兰外部队列上 AgentEYE 相对基线没有优势;对超出专科工具标签范围的未见疾病,只改善了报告完整性、没提高诊断正确性;检索虽然大幅减少了虚构文献,但没有消灭不相关和弱支持的引用。作者在讨论部分明确写道,AgentEYE 现阶段是"需要前瞻性多中心验证的可追溯决策支持原型",不是自主诊断系统。
三、技术原理
AgentEYE 把一次诊断拆成四个相互衔接的环节,每个环节都留下可检查的中间状态。
环节一:多模态识别与路由。 系统接收同一患者同日采集的一组眼科影像,自动区分眼底照相与眼部 B 超,分发到对应的专科分析通道。这一步看似简单,但在真实数据里图像命名混乱、模态标注缺失是常态,自动路由省掉了大量人工预处理。
环节二:专科影像工具调用。 眼底和 B 超各有一个本地视觉语言模型工具,基于开源基座做 LoRA 参数高效微调训练而成(代码库中的 vlm_training 模块,依赖 PyTorch 2.8 与 Hugging Face PEFT 0.17)。训练数据来自浙大二院真实临床队列:9,049 名患者、31,393 张眼底图像、43,266 张眼部 B 超图像、15,244 份参考报告与 PDF 记录。这是整个系统里唯一"真正看图"的部件,也是后面消融实验证明的性能主来源。
环节三:循证检索与充分性判断。 当影像工具输出存在不确定性,或两个模态的结论互相矛盾时,智能体触发检索。检索有两路:一路查本地构建的临床指南语料索引(代码库 diagnosis_guidelines 模块,从清洗后的指南 Markdown 语料建立),一路查权威网络医学证据。检索回来之后不是直接塞进上下文,而是先做一次充分性判断——现有证据够不够支撑结论?不够就重写检索问题再查一轮。这个"自我评估—重新检索"的闭环,是它区别于普通 RAG 的地方。
环节四:诊断整合与报告生成。 大模型推理核心把三样东西合到一起:专科工具的影像判读、检索到的指南与文献证据、临床鉴别诊断逻辑。输出的报告包含诊断结论、诊断解释、鉴别诊断、处理建议和带来源的参考文献。
评估方法本身也值得一提。团队在 302 例基准上跑了五种方法对比(完整 AgentEYE、去掉专科工具的消融、去掉检索的消融、通用大模型直接看图、能自行生成引用的大模型基线),并采用三个不同大模型作为评委独立打分,避免单一评委的偏好污染结论。
四、实验结果
内部基准:302 例同日双模态病例。
自动评分结果对比鲜明:
| 方法 | 诊断正确性 | 诊断完整性 |
|---|---|---|
| 完整 AgentEYE | 71.93 | 75.59 |
| 去掉专科影像工具 | 39.40 | — |
| 通用大模型直接看图 | 36.52 | 48.57 |
完整系统的诊断正确性 71.93 分、完整性 75.59 分,而通用大模型直接分析图像只有 36.52 分和 48.57 分——差距接近一倍。
消融实验给出了归因:移除专科影像工具后,诊断正确性从 71.93 骤降至 39.40 分,几乎回落到通用大模型基线水平。而移除检索模块,正确性和完整性评分变化都很小。结论非常清楚:在这套智能体里,专科影像工具贡献了绝大部分诊断能力,检索模块的贡献在别处。
眼科医生盲法评价:200 例、3 名医生、1,200 次独立评分。
团队从 302 例中抽取 200 例,让 3 名眼科医生在不知道报告来源的情况下,对 AgentEYE 与"能自行生成引用的大模型基线"两组共 400 份报告打分。按多数投票汇总:
| 评价维度 | AgentEYE | 大模型基线 |
|---|---|---|
| 诊断正确率 | 83.0% | 42.0% |
| 报告完整率 | 82.5% | 41.5% |
| 潜在有害输出率 | 3.5% | 29.0% |
| 引用被判为正确 | 86.5% | 46.5% |
其中两个数字最值得注意。
一是潜在有害输出率 3.5% vs 29.0%。基线组接近三成的报告被医生判定为可能造成临床伤害,这个比例足以否决任何落地方案;AgentEYE 降到 3.5%,虽然仍不为零,但已经进入"人工复核可控"的范围。
二是无法核实或疑似虚构的文献,只出现在基线组,AgentEYE 的报告中一例未见。这正好印证了前面那个反直觉的消融结果——检索模块不提高诊断分数,但它把"幻觉引用"这个类别整个消灭了。对需要过合规审查的医疗产品来说,这比多几分准确率更要紧。
外部验证:优势存在,但边界也清晰。
在皖南医学院第一附属医院的外部队列上,对既定疾病类别,AgentEYE 相对通用大模型基线把诊断正确性提高 18.53 分、完整性提高 11.17 分,跨中心优势成立。
但在规模较小的波兰队列上,两种方法总体表现接近。对于超出专科工具标签范围的未见疾病,AgentEYE 主要改善了报告完整性,并未显著提高诊断正确性。
作者对局限的交代相当坦诚:主要基准只覆盖七个诊断类别,其中脉络膜黑色素瘤和视网膜母细胞瘤各只有 1 例,未见疾病分析应被理解为边界条件测试而非开放世界诊断能力的证据;症状、视力、眼压、既往眼病史、结构化电子病历变量以及 OCT 等模态均未纳入本次运行时评估;形式化生成与大模型评委打分都是单次运行,运行间波动性尚未解决。
五、应用前景
对做医疗智能体定制的团队来说,AgentEYE 提供了三条可以直接迁移的工程经验。
其一,别让通用大模型碰专科影像的判读环节。 36.52 → 71.93 这个数字差,本质上是在告诉你:多模态大模型的图像理解能力,距离专科影像判读的要求还有一个数量级的差距。正确的做法是把它放在编排位置——识别模态、调度工具、检查冲突、整合结论,这些是它真正擅长的。任何"把片子直接喂给大模型"的方案,在专科场景下大概率是不合格的。
其二,检索模块的 KPI 应该单独设,不要和准确率绑在一起。 这是本研究最容易被忽略的启示。很多团队评估 RAG 时只看"加了检索准确率涨了几个点",涨得少就砍掉。AgentEYE 的消融告诉你:检索的产出是可审计性,不是准确率。 在医疗场景,一份带真实可查引用的报告和一份带虚构引用的报告,即使诊断结论完全一样,也是两种性质完全不同的产品——后者过不了任何一道合规审查。评估指标应该包含"引用正确率"“不可核实文献占比"这类维度。
其三,“证据充分性判断 + 重写检索"值得抄。 普通 RAG 是"检索一次、拼进上下文、生成”,AgentEYE 多了一步自我评估:证据够不够?不够就换个问法再查。这一步在工程上不复杂,但对减少"证据和结论对不上"的情况效果明显。
同时也要看清它还不能做什么。
论文本身把话说得很明白:这是一个需要前瞻性多中心验证的原型。当前版本没有接入 OCT、视力、眼压、病史和结构化电子病历,也就是说它并不构成完整的临床决策;跨中心性能受疾病谱、图像采集规范、报告习惯和专科工具覆盖范围的共同影响,在波兰队列上就没有复现出优势;后验的敏感度、特异度估计依赖从自由文本报告中抽取诊断,只能作为辅助指标。
团队给出的下一步计划也很务实:开展前瞻性多中心临床验证,比较眼科医生用与不用 AgentEYE 时的诊断准确性、决策时间、转诊合理性、治疗方案变化和安全性;系统层面则要整合 OCT、视力、眼压、病史与电子病历,扩大专科工具的疾病覆盖,并重点完善逐条结论与证据之间的核验机制。
代码已按 MIT 协议开源在 GitHub(含基准运行、评委打分、消融分析脚本与指南语料索引构建工具),但不含模型权重与原始影像数据。研究由国家自然科学基金(82201195)资助。
六、结论
AgentEYE 回答了本文开头那个问题:医疗影像智能体不该让大模型直接看图。
把影像判读交给专科工具、把流程规划交给大模型、把证据链交给检索,三者各归其位——在 302 例内部基准上把诊断正确性从 36.52 分推到 71.93 分,在 200 例医生盲评中把潜在有害输出率从 29.0% 压到 3.5%,把引用正确率从 46.5% 提到 86.5%,并且彻底消除了虚构文献。
但更值得记住的,是那个"没提分"的消融结果。当团队发现去掉检索模块后诊断分数几乎不变时,他们没有把检索砍掉,而是重新定义了它的价值:检索不是用来提分的,是用来让报告可以被查的。 在医疗这个行业,“能被查"本身就是一项刚性功能,它决定了一个系统能不能从演示走进诊室。
对正在做医疗智能体的团队,这项研究留下的最实用的一句话可能是:先想清楚每个模块的 KPI 是什么,再决定它该不该留在架构里。
| 论文标题 | An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis |
| 作者 | Zhao K, Sun Q, Kang D, Yu T, Han W, Yao R, Agrawal R, Ying GS, Grzybowski A, Jin K(赵凯凯为第一作者,金凯为通讯作者) |
| 机构 | 浙江大学医学院附属第二医院眼科中心、浙江省眼科学重点实验室、浙江大学生物医学工程学系、浙江大学医学院附属儿童医院、中国矿业大学计算机科学与技术学院/人工智能学院、皖南医学院第一附属医院、新加坡国立健康集团眼科研究所(陈笃生医院)、南洋理工大学李光前医学院、新加坡眼科研究院、宾夕法尼亚大学佩雷尔曼医学院、波兰眼科发展基金会眼科研究所、瓦尔米亚-马祖里大学 |
| 期刊 | Cell Reports Medicine(Cell Press 旗下) |
| 发表时间 | 2026 年 8 月 5 日(在线发表) |
| DOI | 10.1016/j.xcrm.2026.102969 |
| PubMed | PMID: 42556343 |
论文原文信息地址:https://www.simoagent.com/blog/2026-08-09-agenteye-multimodal-ophthalmic-agent/
参考文献
- Zhao K, Sun Q, Kang D, Yu T, Han W, Yao R, Agrawal R, Ying GS, Grzybowski A, Jin K. An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis. Cell Reports Medicine, 2026. DOI: 10.1016/j.xcrm.2026.102969 | PMID: 42556343
- Chen W, Dong Y, Ding Z, et al. Interpretable agentic AI system with localized reasoning for radiology. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02994-8 | PMID: 42457975
- Everett SS, Bunning BJ, Jain P, et al. From tool to teammate in a randomized controlled trial of clinician-AI collaborative workflows for diagnosis. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02545-1 | PMID: 41851268
- Chen M, Wu Y, Ma J, Jia X, Gao C, Zhao F, Qiao Y. Independent and collaborative performance of large language models and healthcare professionals in diagnosis and triage. npj Digital Medicine, 2026;9(1):222. DOI: 10.1038/s41746-026-02409-8
- Abukhiran I, Mansour A, Caicedo ML, Minkowitz JM, Pantanowitz L. End-to-end clinical validation of a human-supervised large language model agent for enterprise surgical pathology reporting. Modern Pathology, 2026. DOI: 10.1016/j.modpat.2026.101049 | PMID: 42526601