公共数据从哪里来
NCBI、UniProt、Ensembl 入口直觉
本节你将能
指出至少三个常用数据库及其典型用途。
直觉模型
数据库是「图书馆」:NCBI 偏核酸/综合检索,UniProt 偏蛋白质,Ensembl 偏基因组注释。
核心要点
- 检索标识符:accession、Gene ID、UniProt AC
- 下载格式:FASTA、GenBank、GFF/GTF
- API/Entrez 适合批量,网页适合探索
常见误区
下载全库却只需要一条序列——先明确最小数据集。
动手
在 NCBI 找到一条基因的 FASTA 并保存。
互动
测验:蛋白质功能注释常查哪里。
本节小结
下一节搭好 Python 与 Biopython 环境。