医疗智能体的知识库怎么建、怎么持续更新?MedKGent 双智能体框架从1000万篇文献生成297万条三元组
一、研究背景
做过医疗 AI 智能体项目的团队大多在同一个地方卡过壳:知识库。
模型可以调 API,提示词可以反复打磨,工作流可以画得很漂亮,但只要智能体一被问到具体的药物相互作用、基因—疾病关联、某个新疗法的证据强度,它就开始编。RAG 是标准解法,可 RAG 的上限取决于你喂给它什么。喂原始文献片段,检索噪声大、上下文冗长;喂结构化知识图谱,检索精准、可追溯——但知识图谱本身从哪来?
现有的医学知识图谱构建路线,各有各的难处。
规则与监督式流水线(如早期的命名实体识别 + 关系抽取管线)依赖固定 schema 和大量标注数据,遇到新出现的关系类型就得重新标注、重新训练,迁移成本极高。SemMedDB 这类经典资源虽然覆盖广,但基于语义谓词逻辑构建,关系粒度较粗。而近两年直接用大模型批量抽取三元组的做法,则普遍存在两个被忽视的缺陷:
第一,把文献语料当成静态快照。1998 年的一篇论文说 A 抑制 B,2019 年的研究推翻了它——如果只是把所有抽取结果堆在一起,图谱里就同时躺着互相矛盾的两条边,谁也不知道该信哪个。医学知识是演化的,而多数图谱是扁平的。
第二,没有置信度概念。大模型抽出来的三元组,有的是论文明确论证的核心结论,有的只是摘要里一句"可能相关"的推测,还有的干脆是幻觉。全部等权重入库,等于把噪声一并写进了智能体的"记忆"。
2026 年 8 月 4 日,穆罕默德·本·扎耶德人工智能大学(MBZUAI)联合中国科学院大学、清华大学、京都大学、华东师范大学、中科院脑智卓越中心、哈佛医学院布莱根妇女医院与 GenBio AI 的团队,在 npj Digital Medicine(Nature 旗下,IF=15.1)发表研究,提出 MedKGent——一个用大模型智能体逐日增量构建时序演化医学知识图谱的框架。
二、研究创新点
MedKGent 的核心不是"再抽一遍三元组",而是重新设计了知识入库的方式。三个关键创新:
第一,把静态语料还原成时间序列。 团队从 PubMed 收集 2000 万余篇摘要,经长度与年份质控后保留 10,014,314 篇,按发表日期组织成 1975 年 1 月 1 日至 2023 年 12 月 31 日的逐日时间序列。框架严格按时间顺序处理,模拟生物医学知识真实"涌现"的过程。这个设计带来两个直接好处:图谱天然带时间戳,可以做时间切片;框架本身是增量式的,新论文来了继续往后跑即可,不需要全量重建。
第二,用采样一致性给每条三元组打置信分。 这是对"大模型会编"的直接回应。同一段抽取提示词,Extractor Agent 会并行多次调用大模型,统计每条三元组在多次输出中出现的频率作为初始置信度——若三元组(NPPA,负相关,Water)在 90% 的输出中出现,置信度即 0.9。置信度低于 0.6 的直接丢弃。这本质上是用 self-consistency 做了一层廉价而有效的幻觉过滤。
第三,让证据随时间累积,让冲突被显式裁决。 Constructor Agent 不是简单去重。同一条三元组在后续文献中反复出现时,置信度会按公式递增(例:原有 0.7 的边遇到新的 0.9 证据,更新为 0.97),并把新的 PubMed ID 追加进溯源列表。而当同一实体对出现不同关系时(已有"关联"、新来"负相关"),Constructor Agent 会调用大模型,结合双方的置信度与时间戳做裁决,只保留更合适的那一条。
一句话概括这套设计的价值:它让知识图谱从"一堆事实"变成"一份带证据强度和时间线的档案"。
三、技术原理
MedKGent 由两个智能体串联组成,底座模型是开源的 Qwen2.5-32B-Instruct(自建 API 部署,非闭源模型)。
Extractor Agent(抽取智能体) 分两步走:
- 实体识别与归一化:先调用 PubTator3 工具识别六类实体——Gene(基因)、Disease(疾病)、Chemical(化学物质)、Variant(变异)、Species(物种)、CellLine(细胞系)。这一步给出稳定标识符(如 NPPA → NCBI Gene ID 4878),解决同义词消歧。随后为每个实体补充 Exact Keywords(小写别名表,如 anp / atrial np / nppa)与 Semantic Embedding(由 BiomedBERT 生成的语义向量)。三重定位机制——标识符精确匹配、别名匹配、语义相似度匹配——保证后续检索时实体能被稳定链接。
- 关系推断与置信度估计:把摘要与实体列表送入大模型,推断实体对之间的语义关系。框架预定义 12 种核心生物医学关系:七种双向(关联、负相关、正相关、比较、联合治疗、相互作用、药物相互作用)与五种单向(导致、抑制、治疗、刺激、预防)。关键在于这套关系集合可通过提示词扩展——要加新关系类型,改提示词即可,不需要像监督式管线那样重新标注和训练。
Constructor Agent(构建智能体) 负责入库:对每条保留的三元组,检查图谱中是否已存在。不存在则插入;已存在则强化置信度、追加 PubMed ID、更新时间戳;实体对相同但关系冲突则调用大模型裁决。
最终图谱中,节点带六个属性(标识符、实体类型、术语体系、页面链接、精确关键词、语义嵌入),边带三个属性(置信度、PubMed ID 列表、时间戳)。这意味着智能体检索到任何一条知识,都能一路回溯到原始文献。
四、实验结果
图谱规模。 从 10,014,314 篇摘要中,有 3,472,524 篇(34.68%) 产出了可用三元组,共抽出 8,922,152 条有效三元组。经 Constructor Agent 按时间顺序合并去重与冲突消解后,最终图谱包含 156,275 个实体节点与 2,971,384 条三元组——据作者所知,这是目前规模最大的由大模型构建的医学知识图谱。
需要说明,34.68% 这个抽取率并不高,原因有三:部分摘要本身缺乏结构化信息;置信度低于 0.6 的被过滤;少量抽取结果存在格式问题被丢弃。作者对此坦诚说明,这也是"宁缺毋滥"策略的代价。
质量评估(双轨验证)。
| 评估方式 | 样本量 | 有效率 |
|---|---|---|
| GPT-4.1 自动评估 | 34,725 篇摘要 / 83,438 条三元组 | 85.44% |
| DeepSeek-v3 自动评估 | 同上 | 88.10% |
| 两位博士级专家人工复核 | 1,000 篇摘要 / 2,767 条三元组 | 接近 90% |
关键的交叉验证:以专家标注为金标准,GPT-4.1 与 DeepSeek-v3 的精确率、召回率、F1 均达到约 95%,说明自动评估本身是可信的。全部评估者(2 位专家 + 2 个模型)两两之间的 Cohen’s kappa 多数高于 0.6(实质性一致),少数略低但仍处中等一致区间。
值得注意的是,评估用的模型(GPT-4.1、DeepSeek-v3)与构建用的模型(Qwen2.5-32B)刻意不同,避免了"自己批改自己作业"的自证循环。
下游效用:七个医学问答基准。 团队在 MMLU-Med、MedQA-US、PubMedQA*、BioASQ-Y/N 四个通用基准,加上 MedDDx 鉴别诊断基准的三个难度分层(Basic / Intermediate / Expert),共七个数据集上测试。参评模型五款:GPT-4-turbo、GPT-3.5-turbo、DeepSeek-v3、Qwen-Max、Qwen-Plus。全部零样本、不做微调,三种设置对比:
- 直接作答(无检索)
- SemMedDB 检索增强(经典医学知识库对照)
- MedKGent 图谱检索增强
结果是稳定的三级台阶:MedKGent > SemMedDB > 直接作答,在所有基准、所有模型上一致成立。其中 MedQA-US 上提升最显著,最高达 8.4 个百分点(GPT-3.5-turbo:0.599 → 0.683)。在 MedDDx 鉴别诊断套件上,Expert 难度子集提升幅度最大——这恰恰是语义歧义最强、最难靠模型内部记忆蒙对的部分。在 MMLU-Med、BioASQ-Y/N 这类知识密集但歧义较小的任务上,提升幅度较小但方向一致。
五、应用前景
对做医疗智能体定制的团队来说,MedKGent 的价值不在于那 297 万条三元组本身,而在于它把"知识库怎么建"这件事拆成了可复用的工程范式。
其一,置信度阈值是可调的产品旋钮。 0.6 是论文的选择,但在实际项目里,用药安全类问答可以把阈值提到 0.9 只保留高共识知识,而科研假设生成场景可以放宽到 0.5 换取更大召回。这比"要么全信要么不信"的二元设计务实得多。
其二,时间戳与 PubMed ID 溯源是合规刚需。 医疗场景下,智能体给出任何结论都必须能回答"依据是哪篇文献、什么时候发表的"。MedKGent 的边属性设计天然满足这一点,且时间戳还能支撑"只用 2020 年后证据"这类时间切片查询。
其三,开源底座 + 关系可扩展意味着可私有化。 全流程基于 Qwen2.5-32B 自建 API,不依赖闭源模型,医院内网部署没有数据出境问题。12 类关系通过提示词定义,专科项目要加"手术适应证"“检验指标异常提示"这类领域特有关系,改提示词即可。
但必须说清楚局限。
作者自己在论文中明确定位:这是一项方法与基础设施贡献,不是临床验证研究。 具体限制有四:
- 仅用摘要,未用全文。 剂量信息、亚组分析、表格图片中的数据都不在图谱里。团队坦承这是为可复现性与成本做的权衡,PMC 全文接入被列为后续工作。
- 未做临床对齐。 图谱概念与 SNOMED CT、RxNorm、LOINC 等电子病历术语体系尚未打通,直接接入 HIS/EMR 还有一段工程距离。
- 与 SemMedDB 的对比只是下游检索效用对比,不等于图谱构建质量的完整比较——真正的图谱对图谱评测需要用同一份千万级语料重跑其他管线,成本极高。
- 药物重定位等预测性应用尚属设想。 论文将其列为需要严格设定文献截止时间、排除未来证据的后续研究方向,并给出了实验设计清单,而非已完成的结果。
换言之,这是一份高质量的文献级知识基础设施,可以直接用于知识增强问答与假设生成,但不能替代临床证据,也没有经过前瞻性验证。
六、结论
MedKGent 回答了一个此前被含糊带过的问题:医学知识图谱不应该是文献的扁平快照,而应该是带证据强度、带时间线、带溯源的演化档案。
通过 Extractor Agent 的采样置信度估计过滤幻觉、Constructor Agent 的时序累积与冲突裁决整合证据,团队从 1000 万篇 PubMed 摘要中构建出 156,275 个实体、2,971,384 条三元组的图谱,三元组有效率接近 90%,并在七个医学问答基准、五款主流大模型上稳定超越 SemMedDB 检索增强与直接作答两种基线,MedQA-US 上最高提升 8.4 个百分点。
对行业的启示是清晰的:当大家都在比拼模型和智能体编排时,真正决定医疗 AI 上限的,往往是那个没人愿意谈的脏活——知识库的构建质量。 置信度、时间戳、溯源链,这三样东西听起来不性感,却是智能体从"能聊"走到"敢用"之间那道门槛。
| 论文标题 | MedKGent: a large language model agent framework for constructing temporally evolving medical knowledge graph |
| 作者 | Zhang D, Wang Z, Li ZZ, Yu Y, Jia S, Dong J, Xu H, Wu X, Zhang Y, Zhang T, Yang J, Chen X, Song L(张笃振、王子潇、李中志为共同第一作者;陈秀颖、宋乐为通讯作者) |
| 机构 | 穆罕默德·本·扎耶德人工智能大学(阿布扎比)、中国科学院大学、京都大学、清华大学、华东师范大学、中科院脑科学与智能技术卓越创新中心、哈佛医学院布莱根妇女医院、GenBio AI(旧金山) |
| 期刊 | npj Digital Medicine(Nature旗下,IF=15.1) |
| 发表时间 | 2026年8月4日(2025年9月30日投稿,2026年7月20日接收) |
| DOI | 10.1038/s41746-026-03058-7 |
| PubMed | PubMed 收录中(截至 2026-08-08 尚未分配 PMID,可经 DOI 或 arXiv:2508.12393 获取全文) |
论文原文信息地址:https://www.simoagent.com/blog/2026-08-08-medkgent-temporal-medical-knowledge-graph/
参考文献
- Zhang D, Wang Z, Li ZZ, Yu Y, Jia S, Dong J, Xu H, Wu X, Zhang Y, Zhang T, Yang J, Chen X, Song L. MedKGent: a large language model agent framework for constructing temporally evolving medical knowledge graph. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-03058-7 | arXiv: 10.48550/arXiv.2508.12393
- Wei CH, Allot A, Lai PT, et al. PubTator 3.0: an AI-powered literature resource for unlocking biomedical knowledge. Nucleic Acids Research, 2024;52(W1):W540-W546. DOI: 10.1093/nar/gkae235 | PMID: 38572754
- Kilicoglu H, Shin D, Fiszman M, Rosemblat G, Rindflesch TC. SemMedDB: a PubMed-scale repository of biomedical semantic predications. Bioinformatics, 2012;28(23):3158-3160. DOI: 10.1093/bioinformatics/bts591 | PMID: 23044550
- Gu Y, Tinn R, Cheng H, et al. Domain-specific language model pretraining for biomedical natural language processing (BiomedBERT/PubMedBERT). ACM Transactions on Computing for Healthcare, 2021;3(1):1-23. DOI: 10.1145/3458754
- Chen W, Dong Y, Ding Z, et al. Interpretable agentic AI system with localized reasoning for radiology. npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02994-8 | PMID: 42457975