← 返回内容列表

生物信息学自学地图:从零基础到跑通 RNA-seq

分享本文
生物信息学自学地图:从零基础到跑通 RNA-seq

六个阶段、一套 RNA-seq 工具链、七类数据库与免费平台清单,把生物信息学自学路径一次说清。

学生物的人,迟早会撞上一堵墙:导师甩来一句「把这个 RNA-seq 数据跑一下」,你打开电脑,发现连第一步下载数据都不会。这堵墙叫生物信息学

好消息是,它已经是一条被成千上万人走过的路——教材、工具、数据库、免费课程全部现成,你不需要重新发明轮子,只需要知道先学什么、再学什么、每一步用什么。这篇地图就干这件事。

一、六个阶段,从零到能跑通一条分析

生物信息学自学有一个被反复验证的顺序,核心逻辑是:先会操作系统和编程,再懂测序原理,最后才是分析本身。跳过任何一步,后面都会回来补课。

阶段 1 · 命令行与 Linux:绝大多数生信工具只在 Linux / macOS 终端里跑。学会 cd、ls、管道、grep、awk、sed,以及用 conda 装软件。这是地基。

阶段 2 · Python 或 R,选一个先精通:处理数据、画图、写脚本都靠它。建议主攻一个(生物学背景选 R 更快上手,想深入算法选 Python),另一个会读即可。

阶段 3 · 统计基础:假设检验、p 值、多重检验校正、分布。不懂统计,你只会「跑出结果」而看不懂结果靠不靠谱。

阶段 4 · 测序原理:Illumina 短读长测序怎么工作、reads 是什么、FASTQ/BAM 格式长什么样。知其所以然,才能排错。

阶段 5 · 核心流程:质控 → 比对 → 定量 → 差异表达 → 富集分析。这是 RNA-seq 的主干,也是大多数人的第一个完整项目。

阶段 6 · 可重复性与工作流:用 Snakemake / Nextflow 把流程固化,用 Git 管代码、留随机种子。让结果「可复现」而非「跑通了就行」。

二、几本值得放在案头的书

以下书目作者与出版信息已核对,都是该领域被长期推荐的主流入门书:

《Bioinformatics Data Skills》——Vince Buffalo,O'Reilly Media,2015(第一版)。公认最适合「生物背景转生信」的实战书:Unix 工具、Git、数据管道,手把手,偏工程而非纯理论。

《Bioinformatics: Sequence and Genome Analysis》——David W. Mount,冷泉港实验室出版社(CSHL Press)。偏算法与序列分析原理,适合想弄懂「工具背后在算什么」的人。

《Modern Statistics for Modern Biology》——Susan Holmes & Wolfgang Huber,剑桥大学出版社,有官方免费在线版。用现代统计视角讲生物数据分析,DESeq2 作者之一 Huber 亲自写的,含金量高。

《R for Data Science》——Hadley Wickham & Garrett Grolemund,O'Reilly。R 与 tidyverse 的最佳入门,画图、清洗数据一条龙。

中文方面:目前没有一本被普遍视为「生信标准教材」的中文书能完全替代上述英文原著,更实际的做法是英文书 + 中文博客/视频辅助理解。

三、RNA-seq 一条龙,每步用什么

以最经典的转录组分析为例,主流工具链如下(这些名字十几年来一直是事实标准,仍在广泛使用):

质控:FastQC 看测序质量,MultiQC 把多份报告汇总成一张总览。

比对:STAR(速度快、内存大,RNA-seq 首选)或 HISAT2(资源更省)。

免比对定量:Salmon 或 kallisto——不做全序列比对,直接估计转录本丰度,快一个数量级,现在很多标准流程已默认走这条。

计数:featureCounts(subread 套件)或 HTSeq,把比对结果汇总成每个基因的 read 数。

差异表达:DESeq2 是事实标准;edgeR、limma-voom 也是经典之选,方法学上各有侧重。

富集分析:clusterProfiler(R)做 GO / KEGG 富集;GSEA(含 MSigDB 基因集数据库)做基因集富集。

环境管理:conda / bioconda 统一装版本,避免依赖地狱。

工作流:Snakemake 或 Nextflow,把整条流程写成可复现的脚本。

四、几个必须认识的公共数据库

NCBI(美国国家生物技术信息中心):Gene 查基因、SRA 存原始测序数据、GEO 存表达谱数据,是数据的「中央仓库」。

Ensembl / UCSC Genome Browser:两大基因组浏览器,查基因结构、转录本、注释。

UniProt:蛋白质序列与功能注释权威库。

KEGG / GO / Reactome:通路与功能注释,做富集分析时天天用到。

STRING:蛋白-蛋白互作网络。

PDB / AlphaFold 数据库:蛋白质结构(PDB 是实验结构,AlphaFold DB 是 AI 预测结构,后者由 EMBL-EBI 托管)。

gnomAD / GTEx / TCGA / DepMap:人类变异频率、组织表达、癌症组学、癌细胞系依赖图谱——做人类遗传与癌症方向必会碰到。

五、免费就能学:平台与课程

Rosalind(rosalind.info):加州大学圣迭戈分校与圣彼得堡学术大学、俄罗斯科学院联合项目,通过「解题」学生信算法,纪念 Rosalind Franklin 命名,免费。

Coursera · 约翰斯·霍普金斯大学生物信息学专项(Genomic Data Science 系列):生物信息学最著名的 MOOC 之一。

EMBL-EBI Training:欧洲生物信息学研究所的官方培训,课件免费开放,内容权威。

Galaxy(galaxyproject.org):无需编程、拖拽式的生信分析平台,适合先「看懂流程」再学代码。

Bioconductor:R 语言的生信包生态,DESeq2、edgeR、clusterProfiler 都在这里,文档齐全。

Biostars:生信问答社区,遇到报错先来这里搜,大概率已经有人踩过。

六、一条最小可跑流程(示意)

不保证逐字可运行,但顺序和工具是标准做法:

1. 从 SRA 下载数据(SRA Toolkit)→ 转成 FASTQ
2. FastQC 质控 → MultiQC 汇总
3. STAR 比对到参考基因组 → 得到 BAM
4. featureCounts 计数 → 得到基因计数矩阵
5. R 里用 DESeq2 做差异表达 → 得到差异基因表
6. clusterProfiler 做 GO/KEGG 富集 → 解释差异基因的生物学意义

七、新手最容易踩的五个坑

① 先纠结「学 Python 还是 R」,结果两个都没学:选一个动手,一个月后再决定补哪个。

② 不质控就往下跑:低质量数据会让后面所有结论失真,先看 FastQC。

③ 忽略批次效应:不同批次/日期测的样本会引入系统偏差,DESeq2 里要纳入设计矩阵。

④ 不看 p 值校正:几千个基因一起检验,必须用 FDR 校正(DESeq2 默认 padj),否则假阳性遍地。

⑤ 结果不可复现:不留随机种子、不记软件版本、不写脚本——三个月后连自己都跑不出同样的数。用 Snakemake/Nextflow 固化流程,用 Git 管代码。

本文列出的教材版次、平台归属均已核对公开资料;工具与数据库为领域内长期主流,若有个别工具在你使用时已被更新版本取代,以最新文档为准。

延伸阅读

生物学本科必读书单:从核心教材到科研神作地图

神经科学自学地图:从零基础到读懂前沿论文

模式生物图鉴:6 种撑起现代生物学的小生命

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…

生物信息学自学地图:从零基础到跑通 RNA-seq | 必学必会