群体遗传学遇上语言模型:GPT-2 架构几分钟追溯基因共同祖先

俄勒冈大学团队用改进版 GPT-2 架构训练「遗传语言」模型,学习 DNA 中的突变规律,几分钟即可追溯基因对共同祖先,速度较传统方法提升数十倍。
美国俄勒冈大学团队发表了一项有趣的跨界成果:他们用受大语言模型启发的改进版 GPT-2 架构,训练出一个面向群体遗传学的模型。训练数据不是自然语言,而是基于细菌、啮齿类、蚊媒、灵长类等多物种进化模拟生成的 DNA 序列——也就是把 A/T/C/G 组成的「遗传语言」喂给语言模型。
模型要做的事,本质和「读文章找错别字」类似:DNA 序列中随世代累积的突变,就像文本里的拼写错误;而这些错误的模式恰好是追溯血缘关系的分子路标。传统群体遗传学依赖概率统计推断,面对大规模基因组时,解析单个染色体可能耗时数日,且难以处理片段缺失的不完整序列。新模型把繁重的统计运算前置到训练阶段,实际应用时只需数分钟,速度提升达数十倍,并在推算基因「认祖」这一核心指标上媲美现有最优统计方法。
图1:DNA 序列与语言文本的同构性,是该方法成立的前提
这项技术的现实价值直接指向公共卫生:团队正将其用于疟疾防控,分析蚊虫种群中抗药性基因的演化轨迹,揭示杀虫剂选择压力下抗性基因「何时出现、如何扩散」。理解这一点,正是制定可持续防控策略的关键。从双谱系分析走向多谱系全基因树重建,是下一步方向——而这恰是跨物种基因树重建中最大似然等概率模型的用武之地。
图2:把统计推断的算力成本从推理转移到训练
关联推荐
- Biomni 登上 Science:通用生物医学 AI Agent — AI 深入生命科学的另一标杆
- 生物信息学中的 Rust:rust-bio 高性能序列计算 — 序列计算的工程实现
- Rust 进入 CPython:系统语言与数据科学的融合 — 性能语言赋能数据科学
评论 (0)
加载评论中…