gene ID / Gene Symbol / Ensembl

作者: 期待未来 | 来源:发表于2022-02-25 10:23 被阅读0次

    1. 各种ID名称介绍

    • Gene ID 也称Entrez ID/EntrezGene ID ,是 NCBI 使用的能够对众多数据库进行联合搜索的搜索引擎, 其对不同的 Gene 进行了编号, 每个 gene 的编号就是 entrez gene id,就是一串数字,比如:TP53 的Gene ID是:7157。因为entrez ID相对稳定, 所以也被其他数据库, 如 KEGG 等采用。不同物种的同一个基因的Gene ID是不同的。NCBI的RefSeq数据库ID,一般是两个大写首字母,加下划线,后面为数字。两个首字母 ”NC”、”NM”、”NP_”分别代表DNA、mRNA、Protein。

    • Gene Symbol ,是HGNC数据库为基因提供的官方名称,HGNC是人类基因命名委员会(HUGO Gene Nomenclature Committee);人类基因组命名委员会。有专门的数据库:https://www.genenames.org/。主要是按基因的功能起的名字,字母一般为英文全称的缩写,由大写字母和数字组成,如TP53基因的Official Symbol就是由HGNC所提供。

    • Ensembl ID,是在Ensembl数据库中对基因的命名,常见的物种前缀:“ENS“表示Homo sapiens (Human),”ENSMUS“表示Mus musculus (Mouse),”ENSDAR“表示Danio rerio (Zebrafish);而常见的序列类型用G、P、T、分别表示gene、protein和transcript。

    2. 什么时候需要进行gene转换:

    • Ensembl ID---转换为---gene symbol: 如TCGA数据库,进行差异基因分析以及后续分析时需要gene symbol,需要通过ensembl网站上的ensmbol与gene symbol对应的文件“Homo_sapiens.GRCh38.84.chr.gtf”,然后通过“perl”软件进行转换。

    • gene symbol---转换为---gene ID: 进行后续的KEGG,GO分析需要,用R语言中的“org.Hs.eg.db”包,进行数据库中的一一搜索,运行脚本即可。

    • gene probe---转换为---gene symbol: 表达芯片数据集需要后续分析时,尤其是GEO数据库。

    相关文章

      网友评论

        本文标题:gene ID / Gene Symbol / Ensembl

        本文链接:https://www.haomeiwen.com/subject/fovzlrtx.html