← 行业趋势

医疗 AI 智能体扛得住医院高峰期的混合任务洪峰吗?轻量编排多智能体靠任务级隔离守住 65.3% 准确率、省下 65 倍 token

一、研究背景

医疗 AI 的评测,大多建立在一次只做一件事的假设上:给模型一个病例让它诊断,给一段病历让它抽取字段。就连 AMIE 这样发表在 Nature 上的标杆研究,虽然证明了单个对话优化大模型能在模拟问诊中比肩医生,同样是「一次一例」的设定 DOI: 10.1038/s41586-023-06696-1。可真实医院并不是这样运转的——同一时刻,系统可能既要检索文献、又要从出院记录里抽取字段、还要计算用药剂量,几十上百个任务并发涌入。当负载真正达到「临床规模」时,智能体的准确率会不会崩、成本会不会失控?此前几乎没有人系统回答过。

2026 年 3 月 9 日,西奈山伊坎医学院(Icahn School of Medicine at Mount Sinai)团队在 npj Health Systems 发表研究,第一次把这个问题摆上台面 DOI: 10.1038/s44401-026-00077-0。通讯作者 Mahmud Omar、资深作者 Girish N. Nadkarni(西奈山医疗系统首席 AI 官)领衔,用两个截然不同的架构在持续混合任务负载下做了严格对照。

医疗智能体临床负载测试

二、研究创新点

这项工作的价值不在提出新模型,而在回答一个被行业集体忽略的架构问题,有三点鲜明设计:

第一,首次在持续、混合任务负载下评测智能体架构。 既往研究要么评估单例诊断,要么评估固定基准,没人测试过当几十个不同类型的任务并发到达时,智能体架构本身会怎样。这篇论文把负载当成自变量,把架构当成被检验的对象。

第二,单智能体与编排多智能体的干净对照。 基线是「一个智能体吃下整批异构任务」;实验组是「一个轻量编排器(orchestrator)把每个任务分派给专职 worker 智能体,各调用一个领域工具后汇总」。两者用同一批模型、同一批任务、同一种评分,差异只来自架构。

第三,跨四个差异悬殊的模型验证结论稳健性。 GPT-4.1-mini、GPT-4.1-nano、Llama-2-70B、Qwen-3-8B 覆盖了闭源与开源、大参数与小参数、不同预训练路线,结论一致,说明收益来自任务划分本身,而非某个模型的特性。

三、技术原理

单智能体与编排多智能体架构对比

架构的差别,一句话就能讲清:

单智能体模式下,一个 agent 收到整批任务,把检索、抽取、剂量计算全部塞进同一段上下文里一次处理。任务一多,不同任务的信息彼此干扰(论文称之为上下文干扰),出错率随之上升。

编排多智能体模式下,一个轻量编排器先把批次拆成单工具子任务,再分派给各自专职的 worker,每个 worker 只调一个领域工具,返回结果后由编排器汇总。任务之间天然隔离,每一步调用了哪个工具、返回了什么,全程可记录、可审计。

任务分为三类:检索(从 23 万余条 PubMed 肿瘤学记录里找摘要)、抽取(从 33 万余条 MIMIC-IV 电子病历摘要中抽字段)、用药计算(基于剂量计算模板做数学题)。批次规模从 5 一直压到 80,模拟真实临床流量。

四、实验结果

准确率与成本随负载变化对比

结果的分化,在任务量超过 10 之后变得异常清晰:

  • 多智能体:5 个任务时准确率 90.6%,压到 80 个任务仍有 65.3%(95% CI 56–74%);
  • 单智能体:5 个任务时 73.1%,80 个任务时崩到 16.6%;
  • 超过 10 个任务后,两种拓扑的所有差异均显著(Welch t 检验,FDR 校正后 p<0.01)。

以 GPT-4.1-mini 为例更直观:多智能体准确率从 96% 到 91.4% 几乎不衰减,单智能体则从 96% 一路跌到 33.9%。

更关键的是成本。80 个任务时,多智能体消耗约 6 万 token,单智能体却烧掉约 390 万 token——相差约 65 倍。延迟上,多智能体的增长明显更平缓,而单智能体在压到大批次时频繁失败,部分开源模型直接不返回有效结果。四个模型方向一致,开源小模型 Qwen-3-8B 衰减最快,进一步印证这是架构问题而非模型问题。

五、应用前景

对正在规划临床智能体的医院与厂商,这项研究给出几条硬启示:

其一,规模化之前先想架构。 医院的高峰负载不是一次一例,而是混合任务并发。把希望寄托在「一个超级模型扛下所有」,在临床规模下会崩,而且崩了无从追溯。

其二,编排带来可审计性。 单智能体出错时,你无法定位错在哪一步;编排模式下每一步的工具调用与返回都被记录。在医疗这种必须追责的场景,这层透明不是可选,是前提。

其三,成本与延迟是规模化的生死线。 65 倍的 token 差距意味着同样的算力能多服务几十倍请求,也意味着延迟更可控。对要真正上生产的系统,这是比跑分更实在的指标。

需要客观指出,本研究是自动化基准评测,任务集中在检索、抽取、剂量计算等相对结构化的场景,尚未在真实临床前瞻试验中验证;其对「真实临床流量」的模拟仍是有界抽象。但作为第一份在持续混合负载下检验智能体架构的工作,它的结论方向明确。

六、结论

当智能体 AI 从研究概念变成 OpenAI operator、Claude Cowork 这类直接交到医生手里的工具时,架构的可审计性与可扩展性,就必须从第一天起被认真对待。西奈山团队的这项研究,用一个朴素但有力的对照证明:决定医疗 AI 能否规模化的,往往不是更大的模型,而是任务的划分与编排 DOI: 10.1038/s44401-026-00077-0

轻量编排多智能体用任务级隔离守住了准确率、省下了 65 倍 token,也守住了医疗场景最看重的那条底线——每一步都看得见、查得清。对还在纠结「选哪个模型」的团队来说,也许更该先问一句:我的架构,扛得住医院的高峰吗?

论文标题Orchestrated multi agents sustain accuracy under clinical-scale workloads compared to a single agent
作者Klang E、Omar M、Raut G、Agbareia R、Timsina P、Freeman R、Gavin N、Stump L、Charney AW、Glicksberg BS、Nadkarni GN
机构西奈山伊坎医学院 Windreich 人工智能与人类健康系(纽约)、哈达萨医学中心眼科(耶路撒冷)等
期刊npj Health Systems,2026
发表时间在线发表 2026 年 3 月 9 日
DOI10.1038/s44401-026-00077-0
PubMedPMID: 42527531

论文原文信息地址:https://www.simoagent.com/blog/2026-08-20-orchestrated-multi-agent-clinical-workload/

参考文献

  1. Klang E, Omar M, Raut G, Agbareia R, Timsina P, Freeman R, Gavin N, Stump L, Charney AW, Glicksberg BS, Nadkarni GN. Orchestrated multi agents sustain accuracy under clinical-scale workloads compared to a single agent. npj Health Systems, 2026;3(1):23. DOI: 10.1038/s44401-026-00077-0
  2. Tu T, Azizi S, Driess D, Schaekermann M, Amin M, et al. Towards conversational diagnostic AI. Nature, 2024;638:297-306. DOI: 10.1038/s41586-023-06696-1