踩坑日志 | kingfisher 公共测序数据 SRA/Fastq 下载神器!

导言

前几天看到基因课的东哥提了一下kingfisher,一个看起来就是极度便利的公共测序数据下载工具。我非常感兴趣,但也确实没时间折腾,于是继续丢给师弟去看看(事实上,他肯定也有类似需求....)。结果如下,感觉不错。帮大伙踩坑测试,与大伙分享。- CJ - 陈程杰

写在前面

一般在进行公共测序数据挖掘的时候,需要从公共数据库中(SRA、ENA、DDBJ等)下载自己所需的测序数据。下载数据时,往往会遇到网速限制或下载链接不可用等因素,当某个数据库的目标数据下载不来时,可以去其他公共数据库下载,因为这三者的数据是共享的。

问题来了,手动在不同的数据库中检索与下载目标数据确实较为繁琐。这时可以试试使用Kingfisher来自动下载数据。


Kingfisher简介

Kingfisher是一个高通量测序数据下载工具,用户提供Run accessions或者BioProject accessions,即可在ENA、SRA、Amazon AWS以及Google Cloud等数据库中下载目标数据。Kingfisher会尝试从一系列的数据源进行数据下载,直到某个源能够work。

此外,还能根据用户的需求将下载数据直接输出为SRA、Fastq、Fasta或Gzip等格式,非常方便,不需要自己再对SRA数据通过fasterq-dump进行拆分转换。

Kingfisher安装与使用

安装

    conda create -c conda-forge -c bioconda -n kingfisher pigz python extern curl sra-tools pandas requests aria2conda activate kingfisher#使用conda activate不能成功激活环境时可以尝试使用:source activate kingfisherpip install bird_tool_utils'>='0.2.17git clone https://github.com/wwood/kingfisher-downloadcd kingfisher-download/binexport PATH=$PWD:$PATHkingfisher -h#弹出帮助文档即安装成功

    下载数据

    注意:如果只想下载某个确定的SRA数据,则使用-r参数,提供SRR Number即可,如 SRR12042866 ;若是想批量下载某个BioProject中的所有数据,则可以使用-p参数,提供BioProject Number,如PRJNA640275或SRP267791。

      kingfisher get -r SRP267791 -m ena-ascp ena-ftp prefetch aws-http#-r Run number(s) to download/extract e.g. ERR1739691#-p BioProject IDs number(s) to download/extract from e.g. PRJNA621514 or SRP260223# -m ena-ascp、ena-ftp、prefetch、aws-http、aws-cp、gcp-cp# --download-threads 线程数

      数据下载源介绍(-m参数)

      ena-ascp,调用Aspera从ENA中下载.fastq.gz数据
      ena-ftp,调用curl从ENA中下载.fastq.gz数据
      prefetch,调用prefetch从NCBI SRA数据库中下载SRA数据,然后默认使用fasterq-dump对其进行拆分转换
      aws-http,调用aria2c从AWS Open Data Program中下载SRA数据,然后默认使用fasterq-dump对其进行拆分转换
      也就是说,如果是用的ENA源 直接下载的就是fastq,如果用的SRA或其他,那就是下载SRA数据  然后kingfisher再自动调用fasterq-dump转换成fastq

      SRA格式转换成fastq格式,调用fasterq-dump

        kingfisher extract --sra SRR1574780.sra -t 20 -f fastq.gz#-f,指定转换输出的文件格式,支持fastq,fastq.gz,fasta,fasta.gz#-t,指定线程数

        写在最后(by-CJ)

        Emmm,按照我的习惯,公众号推文上来一定是三段式:

        1.写在前面 - 主要写为啥搞这个

        2.内容

        3.写在后面 - 主要是随意抒发感悟,可能与推文相关,常常与推文主题无关

        李博士的这个稿件少了最后一段,于是我来补充一下。昨天在朋友圈推过一遍,希望大伙有时间有机会可以投稿生信相关的稿件,也可以投稿与TBtools相关的。稿件原创归属于公众号,作者名字仍然是你。同时你一定能拿到稿酬,RMB100起步。一周内阅读过万补到1000,达10万+直接补到 RMB10000(当然,10万+在生信/植物学领域基本不可能,尤其是在这个公众号)。

        (0)

        相关推荐

        • SRA数据库不仅仅是可以存放fastq原始数据

          最近刷单细胞文章看到了一个很有意思数据存放细节,这个文献的标题是:<Single-cell sequencing links multiregional immune landscapes an ...

        • 看优秀本科生如何一周内学会Linux进而搞定RNA-seq上游分析

          距离公布要带500个优秀本科生入门生物信息学的活动不到一个月,虽然真正入选不到一百,但是培养成绩喜人,出勤率接近百分之百,大部分人在短短两个星期就完成了R基础知识学习,Linux认知,甚至看完了转录组 ...

        • 什么,ENA和SRA数据库存放的单细胞转录组测序数据并不一致啊?

          是时候把生信技能树的舞台交给后辈! 粉丝来稿 作者:黑川五郎 写在前面 单细胞转录组以10X公司为主流,单细胞天地公众号详细介绍了cellranger流程,大家可以自行前往学习,如下: 单细胞实战(一 ...

        • 侠之大者,为老数据接盘

          粉丝来稿 写在前面 在几乎所有模式植物转录组测序技术都做烂的今天,始终有一些植物因为种种原因鲜有问津.例如小麦,就像是开在奢侈品商场的黄焖鸡:有钱的人未必瞧得上,没钱的也压根就不会去光顾.不过这么多年 ...

        • 北京基因组所数据库介绍(类似sra和ebi)

          基因组学在生物学科的发展中,具有划时代的意义.同时,很多人在刚进入生物信息学领域时,最先接触的也往往是组装基因组,注释基因组.这在我们生信技能树的公号里有详细的教程,需要者可去公号get资源.前面ji ...

        • 初步尝试从AWS下载SRA原始数据

          希望所有学员都可以站在生信技能树的舞台上发光发热! 下面是粉丝随机投稿 追随生信技能树的脚步,学习生信已经有半年多了.看了哔哩哔哩上的视频,也跑了健明老师的代码.以为自己起码入门了,但是真正分析感兴趣 ...

        • 明码标价之免疫组库

          前面我带领大家通过IMGT数据库认知免疫组库,而且也一起从IMGT数据库下载免疫组库相关fasta序列,免疫组库重要的研究对象就是分成BCR的IGH,IGK,IGL这3类,以及TCR的TRA,TRB, ...

        • 不止是NCBI的SRA可以下载测序数据

          大家看我在生信技能树发布的各个NGS组学的视频教程, 基本都是随手找到一篇文章,就去查询其原始数据,通常是在NCBI的SRA,然后使用prefetch下载sra文件,有的时候还好使用aspera进行加 ...

        • fasterq快速转换sra文件到fastq测序数据

          SRA文件的解压主要是用sratools中的fastq,但是这个软件不能多线程运行,随着测序数据越来越大,fastq的解压速度可能成为整个流程的瓶颈(其实并不会:P,不过没有多线程就是不爽). 不过s ...

        • sra数据库的fastq测序数据已经同步到亚马逊云了

          四年前我写过介绍GEO和SRA数据库的推文 : 解读GEO数据存放规律及下载,一文就够 解读SRA数据库规律一文就够 其实就是耗费一点时间去摸索如何在这两个数据库里面查询下载自己感兴趣的文章的数据.注 ...

        • 什么,SRA测序数据要收费了

          可以发现,这些三年前的视频教程里面都是从SRA(Sequence Read Archive)数据库下载文献的测序数据,我也在五年前详细解读过SRA数据库的结构: 层级结构是:SRP(项目)->S ...

        • 挖掘SRA的辅助小工具(NCBI高通量测序数据收录库)

          写在前面 伴随高通量测序技术的普及,海量的测序数据被产生并上传到网络数据库,如NCBI SRA.我们每个人都可以很轻易地获得这些数据,并用于有生物学问题针对性地分析.数据容易获取,但数据具体来源和信息 ...

        • 省事地获取已公开测序数据的下载链接(.sra|.fastq.gz)

          写在前面 课题需要,前述,在TBtools中开放了一个SraExperimentXML2InfoTable的功能.在这个功能的辅助下,我们较快的完成了阶段任务.筛选数据完成了,但是下载数据却出现了问题 ...

        • 踩坑记录之csv数据导入MySQL

          可能采坑的操作 将excel表格转换成csv 逗号分隔,然后notepad检查文件是否是utf8编码,保存. 打开 phpMyAdmin , 选择要导入的表格,然后点击导入: 导入设置 点击执行之后, ...

        • 游览北京故宫不踩坑,这三种人千万别花钱买门票,黄牛看了都恨我

          游览北京故宫不踩坑,这三种人千万别花钱买门票,黄牛看了都恨我