医疗AI智能体真比裸大模型更会看病吗?npj基准评测OpenManus/Manus发现准确率提升有限、成本却高出一个数量级
一、研究背景
「智能体(Agent)」是这两年医疗 AI 最热的关键词。它的卖点很诱人:大模型不再是一问一答的「聊天工具」,而能自己拆解任务、调用工具、联网检索、跑代码、读文件、分步规划、验证后再迭代,像一位会主动干活的小团队。厂商的宣传里,这几乎成了 AI 真正能进临床的入场券。
但一个更基本的问题,很少有人系统回答:加上规划和工具之后,临床决策能力到底提升了多少?在软件工程里,编码智能体能跑测试、读报错、改代码,确实比一次性生成强得多。可医学不一样——临床任务在决策过程中,往往缺少「测试通过 / 不通过」那样干净的验证信号。一个诊断对不对、一套治疗方案合不合理,本身就充满不确定性。
过去几年的数据已经给乐观情绪泼了几盆冷水:零样本的 GPT-4 在美国执业医师考试(USMLE)上能拿到 86.1%,Med-PaLM 2 经过医学微调后也达到 86.5%;但一旦进入真实场景,表现就断崖式下滑——一项覆盖 83 项诊断研究的荟萃分析显示,生成式 AI 的平均准确率只有 52%;在虚拟电子病历环境里,12 个最强的大模型中表现最好的任务成功率也只有 69.7%;在模拟对话式诊断场景里,连 GPT-4o 也只有 34.2% 的准确率,面对难题时零样本准确率更跌到 18.0%。
于是行业开始把希望寄托在「智能体架构」上:既然单次提问不够,那就让 AI 自主地、目标导向地去「做事」。问题来了——这条被寄予厚望的路线,到底值不值?2026 年 2 月,中国医学科学院/北京协和医学院肿瘤医院联合德国德累斯顿工业大学 Else Kroener Fresenius 数字健康中心、海德堡大学医院国家肿瘤疾病中心等团队,在 npj Digital Medicine 发表了题为《Benchmarking large language model-based agent systems for clinical decision tasks》的基准评测,用一套严格、可复现的「记账式」对照实验,把这个尖锐的问题摆上了台面 DOI: 10.1038/s41746-026-02443-6。
二、研究创新点
这篇工作的价值不在提出新模型,而在于第一次系统、公开地把「智能体 vs 裸大模型」的性价比做成可量化的对照实验。它有三个鲜明的设计:
第一,同时覆盖开源与闭源两条技术路线。 既测了开源的 OpenManus(基于 Meta Llama-4、MIT 许可,并做了三档医学定制),也测了闭源商用智能体 Manus(采用多步 planner-executor-verifier 架构),避免了「只测自家系统」的偏颇。
第二,用三大基准覆盖不同临床认知层次。 从逐步对话式诊断模拟(AgentClinic)、知识密集型医学问答(MedAgentsBench),到最难的通用能力考试(Humanity’s Last Exam,HLE),既有文本也有多模态,梯度分明,能够看清智能体在不同难度任务上的真实收益。
第三,把性能与成本同时纳入账本。 不只报准确率,还统计了 token 消耗、响应延迟、幻觉拦截率与工作流复杂度——这恰恰是临床落地时最关心、却最容易被「刷分」论文忽略的效率问题。
三、技术原理
评测的两类系统,代表了当前医疗智能体的主流构造思路。
OpenManus 系列:开源可定制路线。 它以 Meta 的 Llama-4 为骨干模型,开源且允许自由改造。研究团队做了三档「医学定制」来观察定制是否真能带来增益:加医师助手提示词、鼓励工具调用、配备医学视觉工具。换句话说,这是一套「你可以在自家服务器上搭、随临床场景调」的智能体骨架。
Manus:闭源商用、多步规划路线。 它采用 planner(规划)— executor(执行)— verifier(验证)的多步架构:先由规划器拆解任务,再交给执行器调用工具落地,最后让验证器检查结果、必要时回退重来。这代表的是「把复杂临床任务交给一个编排得当的智能体流水线」的思路。
两类系统都拿到了相当强的「武器库」:网页浏览、代码开发与执行、文本文件编辑等工具一应俱全。评估则统一通过三大基准完成——AgentClinic 用逐轮对话模拟「问诊—检查—诊断」的完整过程,MedAgentsBench 考的是需要检索和综合的海量医学知识问答,HLE 则是「人类最后一道考题」级别的通用难题,其中包含纯文本与多模态两类题目。
四、实验结果
结果冷静得近乎残酷 DOI: 10.1038/s41746-026-02443-6:
- AgentClinic 的 MedQA 子集:60.3%;MIMIC 子集:仅 28.0%;
- MedAgentsBench:30.3%;
- HLE 纯文本:仅 8.6%;
- 多模态任务:HLE 多模态 15.5%,AgentClinic 的 NEJM 图像题 29.2%。
关键在于「提升」而非「绝对分」:即便手握高级工具,智能体相对裸大模型的准确率增益大多只有零点几到几个百分点,且相当一部分在统计上并不显著。而代价却实打实地飙高——token 消耗激增 10 倍以上,响应延迟翻倍以上。
更值得警惕的是幻觉问题:虽然智能体内置的安全护栏过滤掉了 89.9% 的幻觉输出,但幻觉仍然普遍存在。换句话说,护栏能「拦下一大部分」,却没能根治——在临床场景里,残留的那一小部分幻觉,恰恰是最危险的。
研究还引出了一个更深的结构性判断:软件工程里「编码—跑测试—改代码」的闭环,给了智能体一个清晰的验证信号,所以智能体在编程上收益显著;而临床决策缺少这种「干净的正确性信号」,智能体反复规划、调用工具的动作,很多时候是在「空转」,而非「更接近正确答案」。
五、应用前景
这篇评测最重要的现实意义,是给「智能体热」标定了一个诚实的锚点:当前的智能体设计,带来的性能提升是「温和」的,付出的计算与工作流成本却是「一个数量级」的。 它并不意味着智能体路线走不通,而是明确指出了三个亟待突破的方向。
其一,效率。10 倍 token 消耗、2 倍延迟,在资源紧张、医生等不起的临床环境里是难以接受的。如何在保留多步推理收益的同时把开销压下来,是工程上的硬骨头。其二,准确性。当智能体在最难的 HLE 文本题上只有 8.6%、多模态 HLE 只有 15.5% 时,距离「可靠的临床部署」还有很长的路。其三,幻觉治理。89.9% 的拦截率说明护栏有用,但「残留幻觉」必须被进一步压到可接受的水平,否则它会在医生最疲惫、最依赖辅助的那一刻趁虚而入。
对于正在选型的医院和企业,这篇论文提供了一条可操作的判断标准:别只看谁的分高,要看「增益 / 成本」的比值,以及幻觉在真实工作流里的残留率。 一个涨了 1 个百分点却贵了 10 倍的智能体,未必比一个更稳、更快、更便宜的裸模型更适合落地。
六、结论
当行业里铺天盖地都是「智能体将重塑医疗」的叙事时,这项研究做了一件难得的事:它没有喊口号,而是把智能体拆开、放在同一把尺子下,和裸大模型算了一笔清清楚楚的账。结论是:方向有希望,但现阶段的「智能体溢价」被明显高估了——性能提升温和、成本激增一个数量级、幻觉仍存 DOI: 10.1038/s41746-026-02443-6。
这也提示我们:医疗 AI 智能体的下一程,拼的不是「谁能把流程做得更花哨」,而是「谁能在准确、高效、可控三者之间找到平衡」。在智能体真正走进诊室之前,这样冷静的基准评测,比任何一张漂亮的宣传图都更值得被认真对待。
| 论文标题 | Benchmarking large language model-based agent systems for clinical decision tasks |
| 作者 | Yunsong Liu, Zunamys I. Carrero, Xiaofeng Jiang, Dyke Ferber, Georg Wölflein, Li Zhang, Sanddhya Jayabalan, Tim Lenz, Zhouguang Hui, Jakob Nikolas Kather(通讯作者:Zhouguang Hui、Jakob Nikolas Kather) |
| 机构 | 中国医学科学院/北京协和医学院肿瘤医院(国家癌症中心);德国德累斯顿工业大学 Else Kroener Fresenius 数字健康中心;四川省肿瘤医院(电子科技大学);海德堡大学医院国家肿瘤疾病中心(NCT);英国圣安德鲁斯大学;英国利兹大学等 |
| 期刊 | npj Digital Medicine(2026 年) |
| 发表时间 | 2025-09-09 投稿,2026-02-06 接收,2026 年在线发表 |
| DOI | 10.1038/s41746-026-02443-6 |
| PubMed | PMID 41708802 |
论文原文信息地址:https://www.simoagent.com/blog/2026-09-09-benchmarking-llm-agent-clinical-decision/
参考文献
- Liu Y, Carrero ZI, Jiang X, Ferber D, Wölflein G, Zhang L, et al. Benchmarking large language model-based agent systems for clinical decision tasks. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02443-6
- Ferber D, Wölflein G, Wiest IC, Ligero M, Jaiswal S, Wang W, et al. Towards autonomous medical artificial intelligence agents. Nature, 2026. DOI: 10.1038/s41586-026-10675-5