← 行业趋势

罕见神经内分泌肿瘤该用什么药?ARTEMIS 对比基础GPT、定制GPT与检索增强RAG三种配置,检索增强与定制GPT以70%专家一致率通过非劣效初探

一、研究背景

神经内分泌肿瘤(Neuroendocrine Neoplasms,NENs)是一类「少而杂」的恶性肿瘤:发病率不高,却异质性极强——按分化程度、增殖指数 Ki-67、原发部位、受体表达和转移模式的不同,治疗方案可以天差地别。美国 SEER 数据库显示,其发病率从 1975 年的每 10 万人 1.64 例,飙升到 2021 年的 8.52 例,5 倍增长,正成为一种「不那么罕见」的疾病。

正因为复杂,NENs 的治疗高度依赖多学科会诊(MDT):欧洲 ENETS、ESMO、北美 NANETS 等指南都明确要求综合评估,治疗手段横跨生长抑素类似物、靶向药物、肽受体放射性核素治疗(PRRT)直到细胞毒化疗。一套方案对不对,往往连专家之间都各有主张——这也意味着,「治疗决策」是 AI 最难替代、也最值得被严格检验的环节。

然而现实是:AI 在 NENs 领域的研究,几乎全部集中在「诊断端」——PET/CT 肿瘤负荷分割、影像组学分级预测、数字 Ki-67 评分、内镜超声分级、数字病理亚型分型。而「治疗决策支持」几乎一片空白,更没有人用预设的非劣效边界,把 AI 开出的方案和专家共识放到同一把尺子下比过。

二、研究创新点

ARTEMIS 研究的价值,正在于补上了这块空白,而且做得相当规范。它的设计有三个鲜明之处:

第一,用「非劣效」而非「谁分高」来评判。 过去很多 AI 医疗研究只报「AI 答对了多少」,却不回答一个更关键的问题:AI 的方案,够不够格「不比专家差」?ARTEMIS 预设了两条边界——探索性的 -10% 和更严格的 -5%,只要 AI 与专家基准的一致率跌幅不超过边界,就算「非劣效」。这是一套远比「刷准确率」更诚实的临床评价框架。

第二,同时测三种配置,看清「知识注入」到底值不值。 研究对比了基础 GPT、灌入静态领域知识的定制 GPT(GPTs),以及检索增强生成(RAG)三种方案,直接回答了行业里一个长期争论:到底是「多喂资料」有用,还是「装个检索器」更划算。

第三,把「不确定性表达」和「资源节制」当成硬指标。 除了方案对不对,研究还量化了 AI 会不会主动说「我不确定」、会不会少开不必要的检查、会花多少钱——这些恰恰是临床落地时决定生死、却最常被论文忽略的维度。

三、技术原理

ARTEMIS 三种大模型配置与专家多学科会诊对照流程

ARTEMIS 是一场「人机会诊」式的横断面试点。研究团队先构造了 20 例经过多学科验证、非手术的神经内分泌肿瘤模拟病例,覆盖不同分级、分期和治疗线数;再以九位意大利 NEN 专家给出的「集体决策」作为黄金参照。

对照的三条 AI 路线,代表了当下临床大模型的主流用法:

基础 GPT:裸模型直接出方案,什么都不加。

定制 GPT(GPTs):给模型预置 NEN 领域的静态知识,相当于「把教科书和指南背给它」。

检索增强 RAG:在出方案前,先从构建好的语料库里检索相关证据再生成,相当于「现场翻书、引经据典」。

评估围绕一个主要终点展开——系统治疗方案的「非劣效性」,并辅以方案完整性、不确定性表达、附加检查的节制性、成本与变异度等多个次要终点。所有 AI 系统统一用固定提示模板和配置跑,保证可复现。

四、实验结果

三种 AI 配置与专家基准的一致率、非劣效边界及不确定性表现

结果可以用一句话概括:AI 逼近了专家,但还没跨过严格的门槛 DOI: 10.1038/s41746-025-02274-x

在主终点上,专家小组内部的平均一致率是 63.8%——这本身就说明 NEN 治疗决策有多难,连专家自己都分歧不小。以此为基准:

  • 基础 GPT:60.0% 一致率,未达到非劣效;
  • 定制 GPT(GPTs)与检索增强 RAG:均为 70.0% 一致率,通过了 -10% 的探索性非劣效边界,但没有通过更严格的 -5% 边界。

也就是说,经过知识注入或检索增强之后,AI 确实「够得着」专家水平的下限,但距离「与专家等效」还差一口气。

次要终点则呈现出一些耐人寻味的细节:所有 AI 系统都能产出结构完整的方案(完整性 3/3),且比专家更频繁地主动表达不确定性——定制 GPT 的内部一致性甚至达到完美的 AC1 = 1.000。在资源节制上,RAG 与专家基准的一致性最高(AC1 = 0.946),倾向于少开附加检查、费用也更低。

最值得注意的,是「谁在分歧」这个反直觉的发现:专家之间的变异度反而比 AI 更大。 亚组分析进一步锁定分歧来源——Ki-67 增殖指数越高,一致率越低(r = -0.573,p = 0.010),说明肿瘤越「凶」,越难达成共识;而肺来源的 NENs 在多个模型里都预测了分歧(RAG 中 OR 高达 19.50,p = 0.032)。

五、应用前景

ARTEMIS 给出的,不是「AI 能取代专家」的胜利宣言,而是一张清晰的「能力与差距地图」,对临床落地有直接指导意义。

一方面,RAG 与定制 GPT 的 70% 一致率,已经足以支撑它们作为「第二意见」和「会诊前的预演」。在专家资源稀缺、基层医院难得 MDT 的现实中,一个能把方案完整列出、主动标注不确定性、还倾向于少花钱少开检查的 AI,完全可以帮年轻医生先整理思路、补齐遗漏,再交给人类把关。

另一方面,研究也划出了红线:肺来源、高 Ki-67 这类「高不确定性」病例,恰恰是 AI 最容易与专家跑偏的地方——而这些正是临床上最需要谨慎的复杂情况。这提示我们,AI 辅助治疗决策的落地,绝不能「一刀切」,而应当按肿瘤生物学特征设置分级的使用边界。

更重要的是,这项研究把「非劣效 + 不确定性 + 资源节制」这套评价范式立了起来。当越来越多医院想上「AI 会诊」时,也许应该先问一句:它的方案,过的是哪条线?它敢不敢承认自己不确定?

六、结论

罕见肿瘤的治疗决策,是医学里「正确与稳妥」最难两全的高地。ARTEMIS 用一场规范的人机对照给出了诚实的答案:检索增强与定制化的 AI,已经能把方案做到与专家 70% 一致、通过探索性非劣效线,但距离更严格的等效门槛仍有距离;它在表达不确定性和节制资源上甚至比专家更自觉,却也最容易在肺来源、高增殖指数的复杂病例上走偏 DOI: 10.1038/s41746-025-02274-x

这提醒我们:医疗 AI 智能体进临床的下一程,拼的不是「谁的方案更漂亮」,而是「谁更清楚自己何时该闭嘴、该把决定权交还给人类」。在这一点上,ARTEMIS 比任何一张宣称「AI 超越专家」的宣传图,都更接近真实的临床。

论文标题ARTEMIS: a pilot study comparing AI-based and expert therapeutic decisions in simulated clinical cases of neuroendocrine neoplasms
作者Giuseppe Lamberti, Francesco Panzuto(通讯), Sara Massironi, Mauro Cives, Anna La Salvia, Francesca Spada, Antongiulio Faggiano, Sara Pusceddu, Manuela Albertelli, Salvatore Tafuto, Elisa Andrini, Claudio Ricci, Davide Campana
机构意大利博洛尼亚大学医学与外科学院;罗马大学 Sapienza;米兰-比可卡大学 San Gerardo 医院;巴里大学;欧洲肿瘤研究所(IEO);意大利国家肿瘤研究所等多家医学中心组成的神经内分泌肿瘤多学科专家组
期刊npj Digital Medicine,2026 年,第 9 卷,文章编号 89
发表时间2026 年在线发表
DOI10.1038/s41746-025-02274-x
PubMedPMID 41436590

论文原文信息地址:https://www.simoagent.com/blog/2026-09-11-artemis-llm-therapeutic-decision-nen/

参考文献

  1. Lamberti G, Panzuto F, Massironi S, Cives M, La Salvia A, Spada F, et al. ARTEMIS: a pilot study comparing AI-based and expert therapeutic decisions in simulated clinical cases of neuroendocrine neoplasms. npj Digital Medicine, 2026. DOI: 10.1038/s41746-025-02274-x
  2. Dasari A, et al. Epidemiology of neuroendocrine neoplasms in the US. JAMA Network Open, 2025. DOI: 10.1001/jamanetworkopen.2025.15798