五位AI专家组成虚拟科研团队:多智能体协作将临床试验设计从数周压缩至数分钟
一、研究背景
随机对照试验(RCT)是评估医疗干预安全性与有效性的金标准,但设计一份完整的临床试验方案,往往需要临床医生、统计学家、医学信息学专家和研究协调员持续数周甚至数月的协同工作。传统的目标试验模拟(Target Trial Emulation, TTE)试图用真实世界数据来模拟RCT,但实施过程面临三大障碍:自然语言的试验方案需与结构化数据库标准(如OMOP)进行精确映射;方案中部分信息在真实世界数据中缺失,需要领域专家判断取舍;观察性数据的混杂偏倚需要合理的协变量平衡与因果推断方法。每一步都依赖跨学科专家的反复沟通,效率极低。
2026年7月7日,美国威尔康奈尔医学院(Weill Cornell Medicine)的王飞教授团队在《Nature Communications》发表了一项突破性研究,推出了EmulatRx——一个基于大语言模型的多智能体框架,用五个AI专家角色组成"虚拟科研团队",将这一耗时数月的工作压缩至平均不到6分钟。
二、研究创新点
EmulatRx的核心创新在于首次将临床试验设计的完整跨学科协作流程转化为自主多智能体管道。与以往只能输出文字建议的单一AI模型不同,EmulatRx模拟了真实科研团队的分工与交互方式:五个AI智能体各司其职,相互讨论、验证、修正,最终输出包含完整试验方案的标准化报告。
特别值得注意的是,系统在所有环节嵌入了可控性与可追溯性:每一条诊断、每一次数据查询和统计分析都留下完整日志,人类专家可以在任何节点暂停流程、纠正决策或引导系统重新考虑方案。这一"人在环路"(Human-in-the-Loop)设计确保了AI自动化的同时不失人类专家的最终控制权。
三、技术原理
EmulatRx基于LangGraph构建,采用图控制流(Graph-Based Control Flow)强制执行工作流。系统由五大智能体组成:
- Supervisor(监督者):中央决策者,规划任务流程,协调各智能体交互,决定迭代或终止。
- Trialist(试验专家):从ClinicalTrials.gov和PubMed检索历史试验信息,构建临床试验知识图谱(Neo4j图数据库),提取纳入排除标准、治疗方案和结局指标,生成标准化目标试验协议。
- Informatician(信息学专家):将试验规格映射到EHR数据。使用Criteria2Query3.0框架将资格标准编译为可执行SQL查询,同时利用NLP分析非结构化临床笔记。所有患者数据在本地防火墙内执行,仅发送数据库schema和试验方案给LLM,保护患者隐私。
- Clinician(临床专家):通过RAG模块检索PubMed等生物医学文献,验证试验设计的临床合理性,在数据稀疏时建议替代变量,并通过RLHF迭代提高响应质量。
- Statistician(统计学家):执行倾向性评分匹配(PSM)、逆概率治疗加权(IPTW)等协变量平衡方法,运用Cox比例风险模型和Kaplan-Meier估计进行结局分析,支持基于Shapley值的资格标准优化和自适应样本量计算。
智能体支持动态交互而非简单顺序执行:当Informatician发现数据稀疏时,可主动向Clinician请求替代方案;Statistician在协变量平衡不理想时,可回退与Clinician讨论调整策略。
四、实验结果
研究团队在20个临床试验上对EmulatRx进行了全面评估——10个急性疾病试验(脓毒性休克、急性心衰、急性肺水肿、急性肾损伤)使用MIMIC-IV数据,10个慢性疾病试验(阿尔茨海默病、帕金森病)使用覆盖纽约市五大医疗系统的INSIGHT网络数据。
Trialist评估:基于266个人工标注的临床概念,GPT-4o驱动的Trialist达到精确率96.7%、召回率98.9%、F1值95.4%,显著优于其他基线模型。
Informatician评估:GPT-4o在逻辑准确性、模式引用和完整性约束处理方面表现最优。NLP增强的临床笔记分析额外识别了仅凭结构化数据无法发现的合格患者。
Statistician评估:在所有因果效应估计场景中,估计值与真实值高度一致。在一个急性心衰案例中,系统构建了13,942名患者的队列,自动选择了89个协变量,使用IPTW加双重稳健估计得出风险比HR=0.59(95% CI: 0.46–0.76)。
端到端效率:GPT-4o驱动的EmulatRx中位运行时间仅5.75分钟,而手动执行可比工作流通常需要数天至数周。临床专家以5点Likert量表评估输出报告质量,GPT-4o在可读性、正确性、连贯性和实用性四个维度均接近满分(4.97–5.00)。
五、应用前景
EmulatRx的意义远远超出了效率提升本身。在药物研发领域,临床试验失败的一个核心原因正是试验设计缺陷——目标人群定义不当、终点选择不合理、样本量估计不足。EmulatRx可以在试验启动前,通过真实世界数据模拟不同设计方案的可能结果,帮助研究者提前淘汰劣质方案,将资源集中在最有希望的方向。
对于精准医学,EmulatRx的亚组分析能力尤为珍贵。在脓毒性休克案例中,系统自动识别出SOFA评分分层下的异质性治疗效果——低SOFA组风险比1.38,高SOFA组风险比0.73——揭示了总体人群中可能被掩盖的治疗效果差异。这种能力有望帮助设计更具包容性和精准性的临床试验。
研究团队正积极推进商业化开发,并计划面向大学研究者发起者试验(Investigator-Initiated Trials)提供该工具。王飞教授强调:“我们仍然需要随机对照试验,问题在于如何让它们设计得更高效、成功率更高。”
六、结论
EmulatRx首次证明了多智能体AI系统可以端到端地完成临床试验设计这一高度复杂、多学科协作的任务,在约6分钟内完成人工需要数周的工作,同时保持方法学严谨性和临床可解释性。随着真实世界数据的日益丰富和大语言模型的持续进化,Agentic AI有望从根本上重塑药物研发的效率和成功率,加速新疗法从实验室走向临床的进程。
📋 论文信息卡片
| 论文标题 | Empowering clinical trial design with agentic intelligence and real-world data |
| 作者 | Haoyang Li, Weishen Pan, Suraj Rajendran, Chengxi Zang, Fei Wang |
| 机构 | Department of Population Health Sciences, Weill Cornell Medicine, New York, NY; Tri-Institutional Computational Biology & Medicine Program, Cornell University, New York, NY |
| 期刊 | Nature Communications, Volume 17, Article 5501 (2026) |
| 发表时间 | 2026年7月7日 |
| DOI | 10.1038/s41467-026-74501-2 |
| PubMed | PMID: 42414290 |
论文原文信息地址:https://www.simoagent.com/blog/2026-08-02-emulatrx-agentic-trial-design/
参考文献
- Li H, Pan W, Rajendran S, Zang C, Wang F. Empowering clinical trial design with agentic intelligence and real-world data. Nat Commun. 2026;17:5501. doi: 10.1038/s41467-026-74501-2
- Hernán MA, Robins JM. Using big data to emulate a target trial when a randomized trial is not available. Am J Epidemiol. 2016;183(8):758-764. doi: 10.1093/aje/kwv254
- Wang SV, Sreedhara SK, Schneeweiss S. Reproducibility of real-world evidence studies using clinical practice data to inform regulatory and coverage decisions. Nat Commun. 2022;13:5126. doi: 10.1038/s41467-022-32310-3
- Orcutt X, Chen K, Mamtani R, Long Q, Parikh RB. Evaluating generalizability of oncology trial results to real-world patients using machine learning-based trial emulations. Nat Med. 2025;31:457-465. doi: 10.1038/s41591-024-03352-5
- Feuerriegel S, et al. Causal machine learning for predicting treatment outcomes. Nat Med. 2024;30:958-968. doi: 10.1038/s41591-024-02902-1