使用gdc-client批量下载TCGA数据

网友投稿 547 2022-09-25

使用gdc-client批量下载TCGA数据

欢迎关注”生信修炼手册”!

GDC的在线下载功能只适用于下载小的数据集,当需要下载数据量较大的TCGA数据时,必须借助于GDC官方提供的客户端工具gdc-client。网址如下

​​linux, mac OS多种操作系统,可以通过以下两种方法来下载文件

1. Manifest

首先通过GDC在线数据库筛选自己感兴趣的数据集,然后通过购物车图标将数据集添加到购物车中,示意如下

该文件内容如下所示

第一列为文件的​​uuid​​​, 在GDC数据库中,所有的信息都用一个​​uuid​​​唯一标识。利用​​manifest​​文件批量下载的用法如下

gdc-client download -m gdc_manifest_20190610_105445.txt

结果下载到当前目录,每个文件保存在​​uuid​​对应的文件夹下,示意如下

这里我下载的是​​FPKM​​的基因表达量,文件内容如下

可以看到没有表头信息,而且每个样本是分开的,在实际使用中,我们通常需要整合到一张表中,得到一个行为基因,列为样本的基因表达量的表格。通过这种方式下载的数据,没有文件对应的样本信息,这个信息可以通过下载​​SampleSheet​​得到,该文件的内容如下

保存了每个样本对应的样本等信息,通过结合这个数据,可以整理得到基因表达量的表格。

2. UUID

通过uuid下载文件的用法如下

gdc-client download cadfedcc-2742-42ad-9fd3-733d01086392

这两种方式本质上是一样的,都是通过文件的​​uuid​​来对应到唯一的一个文件,并进行下载。需要注意的是,这种方式只能够下载得到原始文件,如果需要下游分析,需要自己调整文件格式。

·end·

—如果喜欢,快分享给你的朋友们吧—

版权声明:本文内容由网络用户投稿,版权归原作者所有,本站不拥有其著作权,亦不承担相应法律责任。如果您发现本站中有涉嫌抄袭或描述失实的内容,请联系我们jiasou666@gmail.com 处理,核实后本网站将在24小时内删除侵权内容。

上一篇:通过GDC Legacy Archive下载TCGA原始数据
下一篇:人间清醒!阎鹤祥称相声是“虚假繁荣”,盛赞郭德纲是天才!
相关文章

 发表评论

暂时没有评论,来抢沙发吧~