← 返回内容列表

PubMind:LLM 从 4100 万篇文献里,挖出 130 万条基因变异知识

分享本文
PubMind:LLM 从 4100 万篇文献里,挖出 130 万条基因变异知识

Nature Communications 报道 PubMind:用 LLM 从生物医学文本中抽取「变异—功能—疾病」关联,变异识别准确率超 90%,建成约 130 万条唯一变异的数据库,仅 10% 与 ClinVar 重叠。

④ PubMind:LLM 从 4100 万篇文献里,挖出 130 万条基因变异知识

生物医学文献里藏着海量「哪个基因变异导致哪种病」的知识,但它们大多躺在非结构化文本里,既难检索也无法被程序直接引用。ClinVarHGMD 等数据库受限于提交偏倚、更新慢、注释稀疏。PubMind 想做的事很直接:LLM 替我们把这些知识「读」出来、结构化、还能溯源

PubMind 是一个 AI 框架,用大语言模型对生物医学文本做筛选与抽取,识别变异—功能—疾病关联及其证据。它能处理单核苷酸变异(SNV)、拷贝数变异、结构变异与基因融合,并把记录归一化到基因组/转录组坐标——这一步是关键,它让散落各处的表述变成可比对、可去重的结构化知识。

流程图:PubMind 抽取—归一化—建库 三步管线

图1:PubMind 把海量文献转化为坐标化的变异知识库

基准测试显示,PubMind 的变异识别准确率 超过 90%,疾病抽取精确率达 99%。应用于超过 4100 万篇 PubMed 摘要与 500 万篇全文后,它生成了 PubMind-DB——约 130 万条唯一变异及其上下文注释。

示意图:PubMind 与 ClinVar 重叠仅 10%,展示两者互补覆盖

图2:PubMind 补上了 ClinVar 覆盖不到的变异,且重叠部分标注高度一致

PubMind 与 ClinVar 的重叠仅约 10%,而其中 >80% 的致病性标注相互一致——说明它既补上了现有数据库的覆盖盲区,又在新发现上与权威库高度吻合。这对精准医学的变异解读是直接助力。

关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…