← 返回内容列表

给细胞做一门通用语言:1.12 亿个细胞训出的基础模型

分享本文
RSS 订阅
给细胞做一门通用语言:1.12 亿个细胞训出的基础模型

单细胞数据已积累到数亿个细胞,跨实验室、跨物种的统一理解超出人力。斯坦福与 CZI 团队背靠背发表 UCE 与 TranscriptFormer,一个建立统一坐标,一个学习基因协同的通用规律。

每个细胞携带同一套基因组,却只打开其中一部分。胰腺 β 细胞开启胰岛素相关基因,B 细胞开启抗体基因,正是「打开哪些基因」决定了细胞的身份和状态。过去十几年,单细胞测序积累了数亿个细胞的表达数据,但把这些来自不同实验室、不同组织、不同物种的数据放到一起理解,已经超出了人力所及。

两个模型,两件事

2026 年 9 月,斯坦福大学 Stephen Quake 与 Jure Leskovec 团队联合CZI在《自然》和《科学》上背靠背发表两项成果,分工很清晰。

第一个是通用细胞嵌入(UCE)。它做的事情是建立坐标系:把各种来源的细胞映射进同一个数学空间,在这个空间里「相似」和「不同」可以直接度量。原本拼不到一起的图谱因此有了统一的底图。

图示:来自不同实验室与物种的细胞被映射进同一个潜空间,同类型自然聚拢

图示:来自不同实验室与物种的细胞被映射进同一个潜空间,同类型自然聚拢

第二个是 TranscriptFormer,一个生成式细胞图谱模型。它的训练方式类似语言模型,只不过预测的不是缺失的词,而是缺失的基因表达值。训练集覆盖 12 个物种、1.12 亿个细胞,跨越约 15.3 亿年的进化距离,从单细胞酵母一直延伸到人类,最大跨物种进化距离 6.85 亿年。所有细胞被映射到一个 1280 维的潜空间。

跨物种这件事成立吗

物种之间差异巨大,凭什么放进同一个空间?模型给出的答案是:不同物种的细胞遵循相似的基因协同规则。哪些基因倾向于一起开启、哪些倾向于互相抑制,这套规律在进化中被保留下来,模型学到的正是这一层,而不是某个物种的表面特征。

因此它展现出几项能力:对训练中没见过的物种完成细胞类型鉴定;零样本区分人类的健康细胞与病变细胞;还能生成当前自然界并不存在的功能细胞状态,为细胞治疗和再生医学的设计提供搜索空间。

图示:训练数据覆盖的物种跨度,从单细胞酵母延伸到人类

图示:训练数据覆盖的物种跨度,从单细胞酵母延伸到人类

接下来要看什么

两项成果的意义在于把细胞生物学从「每个实验室各自建图谱」推进到「共用一张底图」。研究团队把这一进展描述为一个新领域的开端。

需要保持清醒的是,模型的输出仍然是预测。跨物种推断在进化距离较远时可靠性如何,生成的虚拟细胞状态在真实实验里能否被诱导出来,这些都需要 Wet lab 的验证。工具已经就位,检验才刚开始。

关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…

给细胞做一门通用语言:1.12 亿个细胞训出的基础模型 | 必学必会