← 行业趋势

医疗AI智能体如何真正进入医院门诊?清华AI-TEC六类多智能体重构眼科诊疗全流程,真实世界落地揭示数据质量比模型更关键

一、研究背景

过去十年,医疗 AI 的「热战」大多打在一个地方:机器能不能认出这张图。糖尿病视网膜病变分级、青光眼诊断、肺结节检测,论文一年比一年多,榜单准确率一路刷到超过人类专家均值。

可一个尴尬的事实是:患者来医院,是为了「看病」,不是为了「被识别」。真实临床从来不是一连串孤立任务的简单叠加,而是由患者、医生、检查设备、临床数据、诊疗流程共同构成的一个复杂系统。于是医疗 AI 的核心命题,正在从「AI 能否准确完成某项任务」,转向一个更难、也更有价值的问题——「AI 能否真正融入临床工作流,创造可衡量的临床价值」。

眼科,恰恰是这块「试验田」。一方面,眼科五大类疾病贡献了 71.1% 的致盲病例,病种相对有限、以门诊为主,天生适合 AI 落地;另一方面,中国眼科医师资源长期紧张——每十万人口仅约 5.21 名眼科执业(助理)医师,远低于发达国家,而对面是超 7.2 亿近视人口、约 1.7 亿 60 岁以上白内障患者、超 4000 万糖尿病视网膜病变患者和 2180 万青光眼患者。在这种「人多医少」的结构里,把单任务模型的准确率再提高一个百分点,对医生周二上午的门诊其实毫无帮助。

这正是清华大学团队把「整间门诊」当作改造对象的起点。

二、研究创新点

这篇论文的创新,不在于某个模型的精度又涨了几个点,而在于它提出并实践了一个新范式——「AI 原生医疗系统(AI-native health system)」。

传统医疗 AI 大多是「AI 辅助(AI-assisted)」:不同模型各管一摊——一个做影像分析、一个做疾病识别、一个做风险预测,最终还得医生自己把这些输出拼起来。这种方式非但没解决信息碎片化、流程衔接、资源配置这些系统性问题,有时反而给医生添了新的信息负担。

AI 原生则反其道而行:AI 不再是被「外挂」到既有流程上的工具,而是贯穿诊疗全流程的「智能协调层」,持续组织信息、支持决策、协调诊疗。它的目标不是「多部署几个模型」,而是「重新思考 AI 在医疗系统中的角色」。

围绕这一理念,团队构建了 AI-TEC(AI-Agent Augmented Tsinghua Eye Clinic,清华大学人工智能眼科诊所),并在 2025 年 11 月把第一阶段原型系统真正接进了北京清华长庚医院的医院信息系统(HIS)——这让它成为全球范围内屈指可数的、真正跑在真实临床里的「AI 原生」系统之一,而不是又一个仿真实验或离线基准。

更难能可贵的是,这篇论文选择「诚实」:它如实记录了落地过程中的失败和教训,包括模型曾被自家医院的数据「打回原形」。

三、技术原理

AI-TEC 六类智能体协同诊疗全流程示意

AI-TEC 的核心,是六类分工明确、又彼此衔接的智能体,覆盖患者「诊前—诊中—诊后」的完整旅程:

  • 预问诊智能体(Pre-consultation):在患者就诊前,先完成病史、症状等基本信息采集;
  • 智能分诊智能体(Triaging):根据采集到的信息做风险分层,判断该去哪个亚专业、需要哪些检查;
  • 多模态诊断智能体(Multimodal Diagnosis):综合眼底影像、病史等多模态数据做初步分析;
  • 临床决策支持智能体(Clinical Decision Support):在医生诊疗时,提供有据可依的辅助参考;
  • 患者支持智能体(Patient Support):把照护延伸到健康宣教、随访和长期管理;
  • 自适应学习协调智能体(Adaptive Learning Coordination):负责整个系统的自我迭代与学习。

比「有六个智能体」更重要的是它们之间的「信息流」:每个环节产生的信息,都会持续传递到后续决策,让 AI 从一堆互不相干的单点工具,进化成一条连接患者、医生、临床数据和诊疗流程的智能协调层。

落地方式也很务实:患者通过智能问诊系统完成信息采集后,相关病史和眼科影像会自动进入 AI 实时分析,结果直接显示在医生工作站,供门诊诊疗参考。论文反复强调,现阶段 AI 始终只做医生的「辅助工具」,而非替代医生做医疗决策。

四、实验结果

专家复核的高质量数据显著提升 AI-TEC 性能

这篇论文最「炸」的,不是某个漂亮的榜单,而是一组真实世界的「翻车」与「翻盘」数据 DOI: 10.1038/s41591-026-04631-z

团队先收集了北京清华长庚医院 26839 张眼底照片及对应诊断记录——全部来自 2025 年 11 月之前的真实临床,用于微调视网膜基础模型 RETFound。这个数据规模在同类研究中已经算头部。可一到真实世界验证,结果却近乎灾难:在 472 张连续前瞻图像上,模型对健康眼底的辨别能力只有 0.66,对老年黄斑变性只有 0.61,对青光眼只有 0.73——接近「抛硬币」。

转机来自一次「人工返工」:四位眼科医生从海量数据里,手工筛出 1426 张标签可靠的高质量图像重新训练。结果,宏观平均 AUROC 从 0.7996 一路升到 0.9383,其中糖尿病视网膜病变 0.98、病理性近视 0.98、白内障 0.94、青光眼 0.93。

数据少了 18 倍,性能反而大幅上升。原因藏在医院数据本身:不同设备型号、不同采集协议、病历记录里掺杂着医保报销的动机、每位医生的诊断口径也不尽相同——研究数据集是「清洗过的高考题」,而真实医院数据是「穿插着补考、缺考和判分争议的日常测验」。原始数据看着家底雄厚,实际是噪声。

这一组数据,把论文最想说的话钉死了:医疗 AI 落地,从来不是「模型驱动」,而是「系统驱动」——数据质量、工作流整合、医生参与、持续迭代,比模型本身更能决定成败。

五、应用前景

AI-TEC 的价值,是一张清晰的「落地路线图」,对正在评估医疗 AI 智能体的医院和研发团队尤其有借鉴意义。

其一,AI 落地是系统工程,不是算法竞赛。 团队总结的第一条经验就是:实际部署中影响 AI 性能的,不只是模型,还有临床数据质量、影像采集标准、数据异质性和医院工作流。与其继续堆更大的模型,不如先把数据采集标准化、把专家复核的高质量标注做扎实。

其二,医生和工程师的深度协作不可替代。 AI 能不能真正用起来,取决于医生的使用意愿。优化系统设计与操作流程,能让医生更愿意用;持续收集医生反馈,又能反过来驱动智能体迭代——这是一个人机协同的正循环。

其三,评价范式必须转向。 论文指出,一旦 AI 进入真实临床,准确率、灵敏度、特异度这些传统指标就不再够用——一个模型技术上很强,也可能因为工作流衔接差、信息呈现方式不对、责任不清、或「筛查—转诊—治疗」链路断裂而毫无临床价值。医疗 AI 的评价,要从「模型有多准」,转向「AI 是否真的改善了医疗」。

对思陌这样的医疗 AI 智能体定制团队而言,这篇论文几乎是一份「需求说明书」:客户要的从来不是一个裸模型,而是把智能体真正嵌进 HIS、把数据治理和多智能体协同一起做好的完整落地能力。

六、结论

AI-TEC 的意义,不在于它又刷新了某个技术榜单,而在于它提供了一份罕见的、诚实到近乎「自曝其短」的真实世界样本:医疗 AI 从「AI 辅助」走向「AI 原生」,拼的不是模型参数,而是数据质量、工作流整合与医生的真实参与 DOI: 10.1038/s41591-026-04631-z

26839 张原始数据败给 1426 张高质量标注,这一组数字比任何「准确率 99%」的宣传图都更接近医疗 AI 的真相。当越来越多医院想上「AI 智能体」时,也许该先问一句:你的数据够干净吗?你的智能体,真的嵌进工作流了吗?

论文标题Initial lessons from real-world implementation of an AI-agent eye clinic in China(AI 智能体眼科诊所在中国的真实世界落地初探)
作者严涛(Tao Yan)、张迪(Di Zhang,共同第一作者);通讯作者:吴嘉敏(Jiamin Wu)、王亚星(Ya Xing Wang)、戴琼海(Qionghai Dai)、黄天荫(Tien Yin Wong)
机构清华大学自动化系、清华医学·北京清华长庚医院视觉科学与转化眼科研所(BERI)、临床医学院、生物医学工程学院、脑与认知科学研究院、北京信息科学与技术国家研究中心;新加坡眼科研究所(SERI)
期刊Nature Medicine
发表时间2026 年 9 月 10 日在线发表
DOI10.1038/s41591-026-04631-z
PubMedPubMed 检索(暂未索引)

论文原文信息地址:https://www.simoagent.com/blog/2026-09-14-tsinghua-ai-tec-agent-eye-clinic/

参考文献

  1. Yan T, Zhang D, Chen L, et al. Initial lessons from real-world implementation of an AI-agent eye clinic in China. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04631-z
  2. Zhou Y, Chia MA, Wagner SK, et al. A foundation model for generalizable disease detection from retinal images. Nature, 2023, 622: 156–163. DOI: 10.1038/s41586-023-06555-x
  3. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nature Medicine, 2022, 28: 31–38. DOI: 10.1038/s41591-021-01614-0