医疗AI智能体真比裸大模型更会看病吗?OpenManus 与 Manus 临床决策基准评测的审慎结论
一、研究背景
“智能体(Agent)“是当下医疗 AI 最热的关键词之一。它的卖点很诱人:大模型不再只是"一问一答”,而是能自己拆解任务、调用工具(联网检索、跑代码、读文件)、分步规划、验证再迭代,像一位会主动干活的小团队。厂商的宣传里,这几乎成了"AI 真正能进临床"的入场券。
但一个更基本的问题很少有人系统回答:加上工具和规划,临床决策能力到底提升了多少? 软件工程里,编码智能体能跑测试、读报错、改代码,确实比一次性生成强。可医学不同——临床任务在决策过程中往往缺少"测试通过/不通过"那样干净的验证信号。
2026 年 2 月,中国医学科学院/北京协和医学院肿瘤医院联合德国德累斯顿工业大学 Else Kroener Fresenius 数字健康中心、海德堡大学医院国家肿瘤疾病中心等团队,在 npj Digital Medicine 发表了这篇题为《Benchmarking large language model-based agent systems for clinical decision tasks》的基准评测 DOI: 10.1038/s41746-026-02443-6。它用一套严格、可复现的评估,把"智能体到底值不值"这个问题摆上了台面。
二、研究创新点
这篇工作的价值不在提出新模型,而在于第一次系统、公开地把"智能体 vs 裸大模型"的性价比做成可量化的对照实验。
它有三个鲜明的设计:
1. 同时覆盖开源与闭源两条技术路线。 既测了开源的 OpenManus(基于 Meta Llama-4,MIT 许可),并做了三档医学定制(加医师助手提示词、鼓励工具调用、配备医学视觉工具),也测了闭源商用智能体 Manus 的多步 planner-executor-verifier 架构,避免了"只测自家系统"的偏颇。
2. 用三大基准覆盖不同临床认知层次。 从逐步对话式诊断模拟(AgentClinic)、知识密集型医学问答(MedAgentsBench),到最难的通用能力考试(Humanity’s Last Exam),既有文本也有多模态,梯度分明。
3. 把"性能"与"成本"同时纳入账本。 不只报准确率,还统计了 token 消耗、响应延迟、幻觉拦截率与工作流复杂度,回答了临床落地最关心的效率问题。
三、技术原理
评测的两类系统,代表了当前医疗智能体的主流构造思路:
OpenManus 系列(开源,Llama-4 为骨干)。 研究者在其上叠加了逐步强化的定制:OpenManus_MedAssist 注入医师助手提示词与 few-shot 示例以抑制幻觉,OpenManus_MedAssist_Tool 进一步鼓励工具调用,vOpenManus 再配备医学视觉工具用于多模态任务。这一设计恰好能回答"提示工程和工具到底能救多少”。
Manus(闭源商用)。 采用多步 planner-executor-verifier 架构——先规划、再执行、后验证,是当下"多智能体协作"思路的代表实现。
评估基准则分三档:AgentClinic 模拟真实问诊对话(MedQA 214 例、MIMIC-IV 200 例、NEJM 120 例多模态);MedAgentsBench 的 HARD 子集 862 道知识密集选择题;以及 Humanity’s Last Exam 的 222 道文本题与 58 道多模态题。智能体被允许使用联网浏览、代码编写与执行、文本文件编辑等高级工具。
四、实验结果
结果相当克制,甚至有些"泼冷水":
在诊断模拟上,智能体在 AgentClinic MedQA 最高达 60.3%、MIMIC-IV 最高 28.0%;知识问答 MedAgentsBench 最高 30.3%(对比 GPT-4.1 的 28.8%);最难的 HLE 文本题仅 8.6%、多模态 15.5%,AgentClinic NEJM 多模态 29.2%。多模态任务上,智能体并未一致优于基线,原因是医学图像分析工具尚不成熟、且存在工具间竞争。
把这些数字放进对照里,结论更清晰:相比最佳基线 LLM,智能体的准确率优势只有 0.5%–8.9%,且大部分提升未达到统计学显著。诊断对话场景里绝对提升约 7.0%–8.9%,已是最亮眼的一档。
而代价是扎眼的:token 消耗是骨干模型的 10 倍以上,在 MedAgentsBench 上甚至接近 100 倍;响应延迟至少 翻倍,常见 2–3 倍。幻觉方面,内置安全机制拦截了 89.9%,但仍有约 30% 的临床场景受幻觉影响——不过研究也发现,有无幻觉影响的场景之间诊断准确率并无显著差异。一个值得注意的细节:GPT-4.1 在 AgentClinic 任务上表现极差(准确率仅 1.4%–3.3%,空答案率超 93%),主因是内部安全限制。
五、应用前景
对医疗 AI 从业者,这篇论文的启示不是"智能体没用",而是"不能只看能力、不看账本"。
它至少划出了三条清晰的工程边界:其一,先量化再上马——在把智能体写进产品路线图之前,应像本文一样跑一套标准基准,量出真实增量,而不是凭"加工具总比不加强"的直觉;其二,任务定制能降复杂度——MedAssist 系列提示工程确实降低了内部工作流的图复杂度(节点度、圈复杂度显著下降)并提升了工具使用一致性,说明"精调提示"比"堆工具"更划算;其三,多模态是当前的软肋——影像工具不成熟、工具间互相干扰,是智能体最需要补齐的短板。
研究也坦诚了局限:基准与现实临床仍有距离,缺少更大规模真实世界数据验证;闭源 Manus 的内部细节不透明,结论的外推需谨慎。但恰恰因为它是"诚实阴性结果",在满屏"智能体即将取代医生"的叙事里,显得尤为珍贵。
六、结论
当医疗 AI 的聚光灯都打在"自主智能体"上时,这项基准评测提醒我们:当前智能体架构在临床决策上的性能收益温和且多数不显著,却要付出 10–100 倍 token 与 2 倍以上延迟的代价,幻觉也远未根除 DOI: 10.1038/s41746-026-02443-6。
它的结论不是否定,而是校准:在准确性、效率、幻觉控制与医学知识基础取得实质性突破之前,医疗智能体还不适合在常规临床场景可靠部署。对团队而言,把"值不值"算清楚,可能比再刷一个 SOTA 更重要。
| 论文标题 | Benchmarking large language model-based agent systems for clinical decision tasks |
| 作者 | Liu Y、Carrero ZI、Jiang X、Ferber D、Wölflein G、Zhang L、Jayabalan S、Lenz T;通讯作者 Hui Z、Kather JN |
| 机构 | 中国医学科学院/北京协和医学院肿瘤医院、德国德累斯顿工业大学 Else Kroener Fresenius 数字健康中心、海德堡大学医院国家肿瘤疾病中心(NCT)、电子科技大学四川省肿瘤医院、圣安德鲁斯大学、利兹大学 |
| 期刊 | npj Digital Medicine(npj 数字医学),2026,Vol. 9, no. 1 |
| 发表时间 | 在线发表 2026 年 2 月 18 日 |
| DOI | 10.1038/s41746-026-02443-6 |
| PubMed | PMID: 41708802 |
论文原文信息地址:https://www.simoagent.com/blog/2026-08-17-agentic-benchmark-clinical-decision/
参考文献
- Liu Y, Carrero ZI, Jiang X, et al. Benchmarking large language model-based agent systems for clinical decision tasks. npj Digital Medicine, 2026, 9(1). DOI: 10.1038/s41746-026-02443-6