AlphaGenome:一个模型预测百万碱基对 DNA 的功能与变异影响

DeepMind 的 AlphaGenome 在《自然》发布,可预测长达百万碱基对的 DNA 序列功能,并估算变异如何影响多种生物过程,尤其擅长非编码区。
谷歌 DeepMind 发布的 AlphaGenome 把「读 DNA」的能力往前推了一大步:它可以处理长达 100 万碱基对的 DNA 序列,并即时预测该序列的功能信号,以及其中某处变异会如何影响不同的生物过程。在 26 项变异效果预测评估中,有 25 项达到或超越现有顶尖模型。
它的难点与价值都集中在非编码区。约 98% 的遗传变异发生在不编码蛋白质、但调控基因表达的「非编码」区域,理解这些变异如何改变功能一直是难题——传统方法常在「序列长度」与「预测强度」之间二选一。AlphaGenome 通过人类和小鼠基因组训练,能同时对数千种遗传信号(如基因表达、剪接、蛋白质修饰)做多重预测,且能在长上下文中保持高分辨率。
图1:从百万碱基对输入到多重功能信号输出的端到端预测
对非编码区的重视,使 AlphaGenome 有望深化我们对「DNA 序列变化如何引发复杂生物学结果」的理解,进而改进基因检测、理解遗传疾病,并为开发新疗法提供信息。它也与当下「把 AI 带进实验室」的浪潮同频——无论是用语言模型读基因的群体遗传学工具,还是自主完成科研任务的生物医学 Agent,都指向同一个方向:AI 正在成为生命科学的基础工具。
图2:非编码区占变异绝大多数,却是传统预测的盲区
关联推荐
- Biomni 登上 Science:通用生物医学 AI Agent — AI 成为生命科学基础工具的另一例证
- 脑电波揭示双语音流同时编码 — 同样是关于「序列与编码」的神经机制
- 生物信息学中的 Rust:rust-bio 高性能序列计算 — 支撑这类模型的工程底座
评论 (0)
加载评论中…