合成生物学:从读基因到写生命
合成生物学把"生命"当作可设计的工程系统:先读懂基因组(1977 Sanger 测序),再编辑基因(CRISPR),如今已能从头"写"出基因组(2026 Evo-2 大模型)。本文梳理这条"读—编—写"主线,看生物学如何从观察自然走向设计自然。
本节你将能
读完本文,你将能说清合成生物学的"读—编—写"三阶段各自解决了什么核心问题,理解 Evo-2 这类大模型为何被称为生物学的"ChatGPT 时刻",并判断"从头写生命"目前的能力边界与风险。
一个朴素的问题:生命能被"写"出来吗?
1990 年代,人类启动人类基因组计划(HGP),用了十三年、约 30 亿美元才读出一个人的全部基因字母。那时的生物学,本质是"读"——把自然界已经写好的生命说明书抄录下来。而今天,科学家关心的早已不只是读,而是编辑与写入:能不能像改文档、写程序一样,改写甚至创造生命的代码?
图1:合成生物学的"读—编—写"三阶段演进
第一阶段:读——把生命字母抄下来
1977 年,弗雷德里克·桑格发明链式终止法,第一次完整测定了 ΦX174 噬菌体(约 5400 个碱基)的全基因组。这意味着人类第一次拥有了"生命的完整文本"。此后测序成本一路指数下降,到今天测一个人基因组只需几百美元、一天之内。读,是写的前提——你先得懂自然语言,才能学会创作。
第二阶段:编——像查找替换一样改基因
2012 年,杜德娜与卡彭蒂耶在《科学》发表 CRISPR-Cas9,让"精准剪切并替换 DNA 片段"成为实验室日常。它像文字处理器的"查找替换":用一段引导 sgRNA 定位目标序列,Cas9 蛋白像剪刀一样剪开,细胞自己的修复机制完成改写。2020 年两人因此获诺贝尔化学奖。如今体内基因编辑疗法已获批上市,基因治疗从"体外操作"迈入"体内编辑"时代。
第三阶段:写——让 AI 从头生成基因组
2026 年 3 月,Arc 研究所联合斯坦福、UC 伯克利、英伟达在《自然》发表 Evo-2——迄今最大的生物学 基础模型。它在涵盖 12.8 万个基因组、约 9.3 万亿个核苷酸的 OpenGenome2 上训练,参数达 400 亿,用全新的 StripedHyena 2 架构把上下文窗口扩展到 100 万碱基对。它具备两项跨越式能力:
- 零样本预测:不针对具体任务训练,就能判断 BRCA1、BRCA2 等致病基因的突变后果(准确率超 90%)。
- 从头生成:可直接"写"出线粒体基因组、最小细菌基因组、乃至长达 33 万碱基对的酵母染色体;还能在表观基因组上"写"出 EVO2、ARC 的摩斯电码式图案。
图2:Evo-2 的"生成—验证"闭环(以 ΦX174 噬菌体为例)
核心要点
- 合成生物学的主线是"读—编—写":测序让我们读懂生命,CRISPR 让我们改写生命,Evo-2 这类基础模型让我们从头设计生命。
- Evo-2 的突破在于把上下文窗口拉到 100 万碱基对,能理解整条"基因组小说",而非只分析片段。
- "写生命"已不只是比喻:AI 生成的基因组被化学合成后,确有部分能在活细胞中存活、复制。
- 能力越大责任越大——Evo-2 在训练数据中主动排除可感染人的病原体,体现了对生物安全的克制。
- 对学习者而言,合成生物学是把编程思维、信息论与分子生物学熔于一炉的绝佳入口。