外科共管患者筛选能否自动化?斯坦福 SCM Navigator 用大模型嵌入 EHR 实现 94% 敏感度的人机协同分诊
一、研究背景
外科共管(Surgical Comanagement,SCM)是过去十余年兴起的循证照护模式:由内科医生(hospitalist)与外科、麻醉团队共同管理那些合并多种慢性病的围手术期患者,在术前、术中、术后持续处理内科问题。大量证据表明,SCM 能降低术后并发症、院内死亡率与住院时长,兼具临床与财务价值 DOI: 10.1001/jamanetworkopen.2026.29579。
但这一模式长期被一个看似不起眼的环节卡住——患者筛选靠手工。医院要安排 SCM 会诊,就得有专人在电子健康记录(EHR)里逐一翻查术前文书、合并症与手术风险,判断「哪些患者该转给内科共管」。这个过程高度依赖医生个人经验,既造成医生间差异,又大量占用 EHR 时间。有研究早已指出,EHR 时间过长是医生职业倦怠的重要推手,反过来又会拉低患者满意度与临床结局。
而大语言模型(LLM)的独特之处,恰恰在于它能直接「读懂」临床自然语言。问题由此浮现:这种高频、高认知负荷的筛选工作,能不能交给 AI 自动化?斯坦福团队用一个真实部署的答案回应了这个疑问。
二、研究创新点
斯坦福大学医学院 Jonathan H. Chen 与 Kevin Schulman 团队在 JAMA Network Open 发表的研究中,构建并部署了 SCM Navigator——一个嵌入 EHR、人在环中的大语言模型分诊工具。这项工作有三处值得关注的设计:
第一,把「能否自动化」落到真实临床流程里检验。 与多数停留在离线数据集上的研究不同,这是一项前瞻性、非盲法的质量改进研究,于 2025 年 9 月至 2026 年 2 月在斯坦福医疗真实运行,16 名 SCM 主治医生中的 14 名实际参与使用。
第二,用「人在环中」而非「全自动替代」定位 AI。 SCM Navigator 输出的是推荐而非决定:它把患者分为「适合」「不适合」「可能适合」三档,由医生逐一复核并给出最终判断。医生可以不采纳——数据显示他们确实频繁否决了工具建议(否决了 37.5% 的「适合」和 76.9% 的「可能」标记),这正是把临床主权留给人的体现。
第三,把「不一致」当研究对象而非瑕疵。 团队对全部假阴性病例做了人工病历复核,追问的不仅是「AI 错没错」,更是「差异到底来自哪里」。
三、技术原理
SCM Navigator 的思路朴素而实用:让 LLM 扮演一个「会读病历的筛分助手」,把最费眼的初筛环节自动化。它的输入是三类信息——术前文书(临床自然语言)、结构化数据(如诊断编码、手术类型)以及一套围手术期并发症的临床判定标准。LLM 综合这三者,把每名手术患者归入「适合」「不适合」「可能适合」SCM 三档之一,推荐转诊或留观。
关键在闭环:工具给出建议后,SCM 主治医生在其临床工作流内复核,标记自己的最终判断;当医生不同意时,还能留下自由文本反馈。这些反馈连同病历复核一起,成为评估工具、也是迭代工具的依据。这种设计让 AI 不是「黑盒出结果」,而是嵌进人机协作的反馈循环——每一例分歧都能被追溯、被解释、被用于修正临床标准本身。
四、实验结果
在真实部署期间,SCM Navigator 共分诊 6193 例手术病例(中位年龄 60.2 岁,49.0% 为女性),其中 1582 例(25.5%)被推荐转诊内科会诊 DOI: 10.1001/jamanetworkopen.2026.29579。
以主治医生的最终判断为金标准,工具表现如下:
| 指标 | 结果 | 95% CI |
|---|---|---|
| 敏感性(Sensitivity) | 0.94 | 0.91–0.96 |
| 特异性(Specificity) | 0.74 | 0.71–0.77 |
敏感性 0.94 意味着真正适合 SCM 的患者里,有 94% 被工具正确圈出——对一个「宁肯多筛、不可漏筛」的安全网型场景,这是核心价值所在。特异性 0.74 相对温和,对应着工具在三档分类里预留了「可能适合」的缓冲地带,把模糊病例交给医生裁决,而非硬性自动化。
更有价值的发现来自事后病历复核:绝大多数不一致,源于临床标准本身的缺口、机构工作流差异或医生实践习惯,而非大模型误判——在 19 例假阴性中,真正可归因于 LLM 误判的只有 2 例(11%)。也就是说,AI 的「错误」大部分其实暴露了既有流程与标准的模糊地带。
五、应用前景
SCM Navigator 给「AI 该以什么姿态进入临床工作流」提供了一个清醒而可复制的样本,三点启示:
其一,AI 的正确战场是高认知负荷的筛选,而非替代决策。 手工翻病历筛选 SCM 患者,是典型的「AI 擅长、医生厌烦」的任务。把这块自动化,既省时间又减倦怠,且风险可控——因为最终判断始终留在医生手里。
其二,人机分歧是优化信号,不是失败证据。 团队把每一例「医生否决」都变成了改进临床判定标准的线索。这种把 AI 当作「暴露工作流盲点」工具的思路,比单纯追求准确率更接近真正的持续改进。
其三,诚实的边界同样重要。 作者明确这是一项单中心、非盲法的质量改进研究,结论是「AI 筛查工具能精准增强外科分诊、并有望自动化高耗时流程」,而非宣称「AI 能替代会诊医生」。要证明患者层面的临床结局改善,仍需更大规模、多中心、对照设计的进一步验证。
六、结论
外科共管模式的价值被「手工筛选」这道门槛拖了后腿,而 SCM Navigator 用一个真实部署给出了答案:嵌入 EHR 的大语言模型工具,以人在环中的方式,把这项高频筛选工作做到敏感性 0.94、特异性 0.74,且事后复核证明绝大多数不一致来自流程与标准、而非模型误判 DOI: 10.1001/jamanetworkopen.2026.29579。
它没有宣称 AI 能替代医生,却为「大模型如何安全地嵌入临床工作流、把最费时的工作自动化」提供了一个务实的范本:AI 负责把该看的人圈出来,人负责做最后的判断。
| 论文标题 | An Electronic Health Record–Integrated, Large Language Model–Powered Tool to Triage Surgical Patients |
| 作者 | Wang J、Keyes T、Liang AS、Ma SP、Shen J、Liu J、Ambers N、Pandya A、Pandya R、Hom J、Steele N、Chen JH、Schulman K |
| 机构 | 斯坦福大学医学院 / 斯坦福医疗(Stanford University School of Medicine / Stanford Health Care,美国加州帕洛阿尔托) |
| 期刊 | JAMA Network Open,2026;9(8):e2629579 |
| 发表时间 | 2026 年 8 月(在线发表) |
| DOI | 10.1001/jamanetworkopen.2026.29579 |
| PubMed | PMID: 42623072 |
论文原文信息地址:https://www.simoagent.com/blog/2026-08-25-scm-navigator-llm-surgical-triage/
参考文献
- Wang J, Keyes T, Liang AS, Ma SP, Shen J, Liu J, et al. An Electronic Health Record–Integrated, Large Language Model–Powered Tool to Triage Surgical Patients. JAMA Network Open, 2026;9(8):e2629579. DOI: 10.1001/jamanetworkopen.2026.29579
- Goh E, Gallo R, Hom J, Strong E, Weng Y, Kerman H, et al. Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial. JAMA Network Open, 2024;7(10):e2440969. DOI: 10.1001/jamanetworkopen.2024.40969
- Wang J, Keyes T, Liang AS, Ma SP, Shen J, Liu J, et al. Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients. arXiv, 2026. DOI: 10.48550/arXiv.2603.17234