← 行业趋势

外科共管患者筛选能否自动化?斯坦福 SCM Navigator 用大模型嵌入 EHR 实现 94% 敏感度的人机协同分诊

一、研究背景

外科共管(Surgical Comanagement,SCM)是过去十余年兴起的循证照护模式:由内科医生(hospitalist)与外科、麻醉团队共同管理那些合并多种慢性病的围手术期患者,在术前、术中、术后持续处理内科问题。大量证据表明,SCM 能降低术后并发症、院内死亡率与住院时长,兼具临床与财务价值 DOI: 10.1001/jamanetworkopen.2026.29579

但这一模式长期被一个看似不起眼的环节卡住——患者筛选靠手工。医院要安排 SCM 会诊,就得有专人在电子健康记录(EHR)里逐一翻查术前文书、合并症与手术风险,判断「哪些患者该转给内科共管」。这个过程高度依赖医生个人经验,既造成医生间差异,又大量占用 EHR 时间。有研究早已指出,EHR 时间过长是医生职业倦怠的重要推手,反过来又会拉低患者满意度与临床结局。

而大语言模型(LLM)的独特之处,恰恰在于它能直接「读懂」临床自然语言。问题由此浮现:这种高频、高认知负荷的筛选工作,能不能交给 AI 自动化?斯坦福团队用一个真实部署的答案回应了这个疑问。

二、研究创新点

斯坦福大学医学院 Jonathan H. Chen 与 Kevin Schulman 团队在 JAMA Network Open 发表的研究中,构建并部署了 SCM Navigator——一个嵌入 EHR、人在环中的大语言模型分诊工具。这项工作有三处值得关注的设计:

第一,把「能否自动化」落到真实临床流程里检验。 与多数停留在离线数据集上的研究不同,这是一项前瞻性、非盲法的质量改进研究,于 2025 年 9 月至 2026 年 2 月在斯坦福医疗真实运行,16 名 SCM 主治医生中的 14 名实际参与使用。

第二,用「人在环中」而非「全自动替代」定位 AI。 SCM Navigator 输出的是推荐而非决定:它把患者分为「适合」「不适合」「可能适合」三档,由医生逐一复核并给出最终判断。医生可以不采纳——数据显示他们确实频繁否决了工具建议(否决了 37.5% 的「适合」和 76.9% 的「可能」标记),这正是把临床主权留给人的体现。

第三,把「不一致」当研究对象而非瑕疵。 团队对全部假阴性病例做了人工病历复核,追问的不仅是「AI 错没错」,更是「差异到底来自哪里」。

三、技术原理

SCM Navigator 人机协同分诊工作流

SCM Navigator 的思路朴素而实用:让 LLM 扮演一个「会读病历的筛分助手」,把最费眼的初筛环节自动化。它的输入是三类信息——术前文书(临床自然语言)、结构化数据(如诊断编码、手术类型)以及一套围手术期并发症的临床判定标准。LLM 综合这三者,把每名手术患者归入「适合」「不适合」「可能适合」SCM 三档之一,推荐转诊或留观。

关键在闭环:工具给出建议后,SCM 主治医生在其临床工作流内复核,标记自己的最终判断;当医生不同意时,还能留下自由文本反馈。这些反馈连同病历复核一起,成为评估工具、也是迭代工具的依据。这种设计让 AI 不是「黑盒出结果」,而是嵌进人机协作的反馈循环——每一例分歧都能被追溯、被解释、被用于修正临床标准本身。

四、实验结果

SCM Navigator 敏感度与特异度结果

在真实部署期间,SCM Navigator 共分诊 6193 例手术病例(中位年龄 60.2 岁,49.0% 为女性),其中 1582 例(25.5%)被推荐转诊内科会诊 DOI: 10.1001/jamanetworkopen.2026.29579

以主治医生的最终判断为金标准,工具表现如下:

指标 结果 95% CI
敏感性(Sensitivity) 0.94 0.91–0.96
特异性(Specificity) 0.74 0.71–0.77

敏感性 0.94 意味着真正适合 SCM 的患者里,有 94% 被工具正确圈出——对一个「宁肯多筛、不可漏筛」的安全网型场景,这是核心价值所在。特异性 0.74 相对温和,对应着工具在三档分类里预留了「可能适合」的缓冲地带,把模糊病例交给医生裁决,而非硬性自动化。

更有价值的发现来自事后病历复核:绝大多数不一致,源于临床标准本身的缺口、机构工作流差异或医生实践习惯,而非大模型误判——在 19 例假阴性中,真正可归因于 LLM 误判的只有 2 例(11%)。也就是说,AI 的「错误」大部分其实暴露了既有流程与标准的模糊地带。

五、应用前景

SCM Navigator 给「AI 该以什么姿态进入临床工作流」提供了一个清醒而可复制的样本,三点启示:

其一,AI 的正确战场是高认知负荷的筛选,而非替代决策。 手工翻病历筛选 SCM 患者,是典型的「AI 擅长、医生厌烦」的任务。把这块自动化,既省时间又减倦怠,且风险可控——因为最终判断始终留在医生手里。

其二,人机分歧是优化信号,不是失败证据。 团队把每一例「医生否决」都变成了改进临床判定标准的线索。这种把 AI 当作「暴露工作流盲点」工具的思路,比单纯追求准确率更接近真正的持续改进。

其三,诚实的边界同样重要。 作者明确这是一项单中心、非盲法的质量改进研究,结论是「AI 筛查工具能精准增强外科分诊、并有望自动化高耗时流程」,而非宣称「AI 能替代会诊医生」。要证明患者层面的临床结局改善,仍需更大规模、多中心、对照设计的进一步验证。

六、结论

外科共管模式的价值被「手工筛选」这道门槛拖了后腿,而 SCM Navigator 用一个真实部署给出了答案:嵌入 EHR 的大语言模型工具,以人在环中的方式,把这项高频筛选工作做到敏感性 0.94、特异性 0.74,且事后复核证明绝大多数不一致来自流程与标准、而非模型误判 DOI: 10.1001/jamanetworkopen.2026.29579

它没有宣称 AI 能替代医生,却为「大模型如何安全地嵌入临床工作流、把最费时的工作自动化」提供了一个务实的范本:AI 负责把该看的人圈出来,人负责做最后的判断。

论文标题An Electronic Health Record–Integrated, Large Language Model–Powered Tool to Triage Surgical Patients
作者Wang J、Keyes T、Liang AS、Ma SP、Shen J、Liu J、Ambers N、Pandya A、Pandya R、Hom J、Steele N、Chen JH、Schulman K
机构斯坦福大学医学院 / 斯坦福医疗(Stanford University School of Medicine / Stanford Health Care,美国加州帕洛阿尔托)
期刊JAMA Network Open,2026;9(8):e2629579
发表时间2026 年 8 月(在线发表)
DOI10.1001/jamanetworkopen.2026.29579
PubMedPMID: 42623072

论文原文信息地址:https://www.simoagent.com/blog/2026-08-25-scm-navigator-llm-surgical-triage/

参考文献

  1. Wang J, Keyes T, Liang AS, Ma SP, Shen J, Liu J, et al. An Electronic Health Record–Integrated, Large Language Model–Powered Tool to Triage Surgical Patients. JAMA Network Open, 2026;9(8):e2629579. DOI: 10.1001/jamanetworkopen.2026.29579
  2. Goh E, Gallo R, Hom J, Strong E, Weng Y, Kerman H, et al. Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial. JAMA Network Open, 2024;7(10):e2440969. DOI: 10.1001/jamanetworkopen.2024.40969
  3. Wang J, Keyes T, Liang AS, Ma SP, Shen J, Liu J, et al. Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients. arXiv, 2026. DOI: 10.48550/arXiv.2603.17234