← 行业趋势

医疗智能体的知识库怎么建、怎么持续更新?MedKGent 双智能体框架从1000万篇文献生成297万条三元组

一、研究背景

做过医疗 AI 智能体项目的团队大多在同一个地方卡过壳:知识库

模型可以调 API,提示词可以反复打磨,工作流可以画得很漂亮,但只要智能体一被问到具体的药物相互作用、基因—疾病关联、某个新疗法的证据强度,它就开始编。RAG 是标准解法,可 RAG 的上限取决于你喂给它什么。喂原始文献片段,检索噪声大、上下文冗长;喂结构化知识图谱,检索精准、可追溯——但知识图谱本身从哪来?

现有的医学知识图谱构建路线,各有各的难处。

规则与监督式流水线(如早期的命名实体识别 + 关系抽取管线)依赖固定 schema 和大量标注数据,遇到新出现的关系类型就得重新标注、重新训练,迁移成本极高。SemMedDB 这类经典资源虽然覆盖广,但基于语义谓词逻辑构建,关系粒度较粗。而近两年直接用大模型批量抽取三元组的做法,则普遍存在两个被忽视的缺陷:

第一,把文献语料当成静态快照。1998 年的一篇论文说 A 抑制 B,2019 年的研究推翻了它——如果只是把所有抽取结果堆在一起,图谱里就同时躺着互相矛盾的两条边,谁也不知道该信哪个。医学知识是演化的,而多数图谱是扁平的。

第二,没有置信度概念。大模型抽出来的三元组,有的是论文明确论证的核心结论,有的只是摘要里一句"可能相关"的推测,还有的干脆是幻觉。全部等权重入库,等于把噪声一并写进了智能体的"记忆"。

2026 年 8 月 4 日,穆罕默德·本·扎耶德人工智能大学(MBZUAI)联合中国科学院大学、清华大学、京都大学、华东师范大学、中科院脑智卓越中心、哈佛医学院布莱根妇女医院与 GenBio AI 的团队,在 npj Digital Medicine(Nature 旗下,IF=15.1)发表研究,提出 MedKGent——一个用大模型智能体逐日增量构建时序演化医学知识图谱的框架。

二、研究创新点

MedKGent 的核心不是"再抽一遍三元组",而是重新设计了知识入库的方式。三个关键创新:

第一,把静态语料还原成时间序列。 团队从 PubMed 收集 2000 万余篇摘要,经长度与年份质控后保留 10,014,314 篇,按发表日期组织成 1975 年 1 月 1 日至 2023 年 12 月 31 日的逐日时间序列。框架严格按时间顺序处理,模拟生物医学知识真实"涌现"的过程。这个设计带来两个直接好处:图谱天然带时间戳,可以做时间切片;框架本身是增量式的,新论文来了继续往后跑即可,不需要全量重建。

第二,用采样一致性给每条三元组打置信分。 这是对"大模型会编"的直接回应。同一段抽取提示词,Extractor Agent 会并行多次调用大模型,统计每条三元组在多次输出中出现的频率作为初始置信度——若三元组(NPPA,负相关,Water)在 90% 的输出中出现,置信度即 0.9。置信度低于 0.6 的直接丢弃。这本质上是用 self-consistency 做了一层廉价而有效的幻觉过滤。

第三,让证据随时间累积,让冲突被显式裁决。 Constructor Agent 不是简单去重。同一条三元组在后续文献中反复出现时,置信度会按公式递增(例:原有 0.7 的边遇到新的 0.9 证据,更新为 0.97),并把新的 PubMed ID 追加进溯源列表。而当同一实体对出现不同关系时(已有"关联"、新来"负相关"),Constructor Agent 会调用大模型,结合双方的置信度与时间戳做裁决,只保留更合适的那一条。

一句话概括这套设计的价值:它让知识图谱从"一堆事实"变成"一份带证据强度和时间线的档案"。

三、技术原理

MedKGent 由两个智能体串联组成,底座模型是开源的 Qwen2.5-32B-Instruct(自建 API 部署,非闭源模型)。

Extractor Agent(抽取智能体) 分两步走:

  1. 实体识别与归一化:先调用 PubTator3 工具识别六类实体——Gene(基因)、Disease(疾病)、Chemical(化学物质)、Variant(变异)、Species(物种)、CellLine(细胞系)。这一步给出稳定标识符(如 NPPA → NCBI Gene ID 4878),解决同义词消歧。随后为每个实体补充 Exact Keywords(小写别名表,如 anp / atrial np / nppa)与 Semantic Embedding(由 BiomedBERT 生成的语义向量)。三重定位机制——标识符精确匹配、别名匹配、语义相似度匹配——保证后续检索时实体能被稳定链接。
  2. 关系推断与置信度估计:把摘要与实体列表送入大模型,推断实体对之间的语义关系。框架预定义 12 种核心生物医学关系:七种双向(关联、负相关、正相关、比较、联合治疗、相互作用、药物相互作用)与五种单向(导致、抑制、治疗、刺激、预防)。关键在于这套关系集合可通过提示词扩展——要加新关系类型,改提示词即可,不需要像监督式管线那样重新标注和训练。

Constructor Agent(构建智能体) 负责入库:对每条保留的三元组,检查图谱中是否已存在。不存在则插入;已存在则强化置信度、追加 PubMed ID、更新时间戳;实体对相同但关系冲突则调用大模型裁决。

最终图谱中,节点带六个属性(标识符、实体类型、术语体系、页面链接、精确关键词、语义嵌入),带三个属性(置信度、PubMed ID 列表、时间戳)。这意味着智能体检索到任何一条知识,都能一路回溯到原始文献。

四、实验结果

图谱规模。 从 10,014,314 篇摘要中,有 3,472,524 篇(34.68%) 产出了可用三元组,共抽出 8,922,152 条有效三元组。经 Constructor Agent 按时间顺序合并去重与冲突消解后,最终图谱包含 156,275 个实体节点2,971,384 条三元组——据作者所知,这是目前规模最大的由大模型构建的医学知识图谱

需要说明,34.68% 这个抽取率并不高,原因有三:部分摘要本身缺乏结构化信息;置信度低于 0.6 的被过滤;少量抽取结果存在格式问题被丢弃。作者对此坦诚说明,这也是"宁缺毋滥"策略的代价。

质量评估(双轨验证)。

评估方式 样本量 有效率
GPT-4.1 自动评估 34,725 篇摘要 / 83,438 条三元组 85.44%
DeepSeek-v3 自动评估 同上 88.10%
两位博士级专家人工复核 1,000 篇摘要 / 2,767 条三元组 接近 90%

关键的交叉验证:以专家标注为金标准,GPT-4.1 与 DeepSeek-v3 的精确率、召回率、F1 均达到约 95%,说明自动评估本身是可信的。全部评估者(2 位专家 + 2 个模型)两两之间的 Cohen’s kappa 多数高于 0.6(实质性一致),少数略低但仍处中等一致区间。

值得注意的是,评估用的模型(GPT-4.1、DeepSeek-v3)与构建用的模型(Qwen2.5-32B)刻意不同,避免了"自己批改自己作业"的自证循环。

下游效用:七个医学问答基准。 团队在 MMLU-Med、MedQA-US、PubMedQA*、BioASQ-Y/N 四个通用基准,加上 MedDDx 鉴别诊断基准的三个难度分层(Basic / Intermediate / Expert),共七个数据集上测试。参评模型五款:GPT-4-turbo、GPT-3.5-turbo、DeepSeek-v3、Qwen-Max、Qwen-Plus。全部零样本、不做微调,三种设置对比:

  • 直接作答(无检索)
  • SemMedDB 检索增强(经典医学知识库对照)
  • MedKGent 图谱检索增强

结果是稳定的三级台阶:MedKGent > SemMedDB > 直接作答,在所有基准、所有模型上一致成立。其中 MedQA-US 上提升最显著,最高达 8.4 个百分点(GPT-3.5-turbo:0.599 → 0.683)。在 MedDDx 鉴别诊断套件上,Expert 难度子集提升幅度最大——这恰恰是语义歧义最强、最难靠模型内部记忆蒙对的部分。在 MMLU-Med、BioASQ-Y/N 这类知识密集但歧义较小的任务上,提升幅度较小但方向一致。

五、应用前景

对做医疗智能体定制的团队来说,MedKGent 的价值不在于那 297 万条三元组本身,而在于它把"知识库怎么建"这件事拆成了可复用的工程范式

其一,置信度阈值是可调的产品旋钮。 0.6 是论文的选择,但在实际项目里,用药安全类问答可以把阈值提到 0.9 只保留高共识知识,而科研假设生成场景可以放宽到 0.5 换取更大召回。这比"要么全信要么不信"的二元设计务实得多。

其二,时间戳与 PubMed ID 溯源是合规刚需。 医疗场景下,智能体给出任何结论都必须能回答"依据是哪篇文献、什么时候发表的"。MedKGent 的边属性设计天然满足这一点,且时间戳还能支撑"只用 2020 年后证据"这类时间切片查询。

其三,开源底座 + 关系可扩展意味着可私有化。 全流程基于 Qwen2.5-32B 自建 API,不依赖闭源模型,医院内网部署没有数据出境问题。12 类关系通过提示词定义,专科项目要加"手术适应证"“检验指标异常提示"这类领域特有关系,改提示词即可。

但必须说清楚局限。

作者自己在论文中明确定位:这是一项方法与基础设施贡献,不是临床验证研究。 具体限制有四:

  • 仅用摘要,未用全文。 剂量信息、亚组分析、表格图片中的数据都不在图谱里。团队坦承这是为可复现性与成本做的权衡,PMC 全文接入被列为后续工作。
  • 未做临床对齐。 图谱概念与 SNOMED CT、RxNorm、LOINC 等电子病历术语体系尚未打通,直接接入 HIS/EMR 还有一段工程距离。
  • 与 SemMedDB 的对比只是下游检索效用对比,不等于图谱构建质量的完整比较——真正的图谱对图谱评测需要用同一份千万级语料重跑其他管线,成本极高。
  • 药物重定位等预测性应用尚属设想。 论文将其列为需要严格设定文献截止时间、排除未来证据的后续研究方向,并给出了实验设计清单,而非已完成的结果。

换言之,这是一份高质量的文献级知识基础设施,可以直接用于知识增强问答与假设生成,但不能替代临床证据,也没有经过前瞻性验证。

六、结论

MedKGent 回答了一个此前被含糊带过的问题:医学知识图谱不应该是文献的扁平快照,而应该是带证据强度、带时间线、带溯源的演化档案

通过 Extractor Agent 的采样置信度估计过滤幻觉、Constructor Agent 的时序累积与冲突裁决整合证据,团队从 1000 万篇 PubMed 摘要中构建出 156,275 个实体、2,971,384 条三元组的图谱,三元组有效率接近 90%,并在七个医学问答基准、五款主流大模型上稳定超越 SemMedDB 检索增强与直接作答两种基线,MedQA-US 上最高提升 8.4 个百分点。

对行业的启示是清晰的:当大家都在比拼模型和智能体编排时,真正决定医疗 AI 上限的,往往是那个没人愿意谈的脏活——知识库的构建质量。 置信度、时间戳、溯源链,这三样东西听起来不性感,却是智能体从"能聊"走到"敢用"之间那道门槛。

论文标题MedKGent: a large language model agent framework for constructing temporally evolving medical knowledge graph
作者Zhang D, Wang Z, Li ZZ, Yu Y, Jia S, Dong J, Xu H, Wu X, Zhang Y, Zhang T, Yang J, Chen X, Song L(张笃振、王子潇、李中志为共同第一作者;陈秀颖、宋乐为通讯作者)
机构穆罕默德·本·扎耶德人工智能大学(阿布扎比)、中国科学院大学、京都大学、清华大学、华东师范大学、中科院脑科学与智能技术卓越创新中心、哈佛医学院布莱根妇女医院、GenBio AI(旧金山)
期刊npj Digital Medicine(Nature旗下,IF=15.1)
发表时间2026年8月4日(2025年9月30日投稿,2026年7月20日接收)
DOI10.1038/s41746-026-03058-7
PubMedPubMed 收录中(截至 2026-08-08 尚未分配 PMID,可经 DOI 或 arXiv:2508.12393 获取全文)

论文原文信息地址:https://www.simoagent.com/blog/2026-08-08-medkgent-temporal-medical-knowledge-graph/

参考文献

  1. Zhang D, Wang Z, Li ZZ, Yu Y, Jia S, Dong J, Xu H, Wu X, Zhang Y, Zhang T, Yang J, Chen X, Song L. MedKGent: a large language model agent framework for constructing temporally evolving medical knowledge graph. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-03058-7 | arXiv: 10.48550/arXiv.2508.12393
  2. Wei CH, Allot A, Lai PT, et al. PubTator 3.0: an AI-powered literature resource for unlocking biomedical knowledge. Nucleic Acids Research, 2024;52(W1):W540-W546. DOI: 10.1093/nar/gkae235 | PMID: 38572754
  3. Kilicoglu H, Shin D, Fiszman M, Rosemblat G, Rindflesch TC. SemMedDB: a PubMed-scale repository of biomedical semantic predications. Bioinformatics, 2012;28(23):3158-3160. DOI: 10.1093/bioinformatics/bts591 | PMID: 23044550
  4. Gu Y, Tinn R, Cheng H, et al. Domain-specific language model pretraining for biomedical natural language processing (BiomedBERT/PubMedBERT). ACM Transactions on Computing for Healthcare, 2021;3(1):1-23. DOI: 10.1145/3458754
  5. Chen W, Dong Y, Ding Z, et al. Interpretable agentic AI system with localized reasoning for radiology. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02994-8 | PMID: 42457975