基因组所开发国际首个基于Spark的大数据系统发育建树工具CloudPhylo
构建系统发育树是分子进化钻研中分析物种间进化关系的基础步骤与重要环节。随着生物大数据时期的到来,传统的建树工具在使用大数据集构建系统发育树时必要亏损更多的推算资源且运行功夫超长,使得科研工作者无法急剧高效地进行分子进化分析。为此,性命与健全大数据中心(BIG Data Center;http://bigd.big.ac.cn)利用Spark云推算技术,于近期开发了一款合用于大数据集的系统发育树构建工具——CloudPhylo。Spark是一种新的散布式云推算框架,它实现了MapReduce散布式并行算法;赟park框架的法式在运算过程中可高效地将中央输出了局保留在内存中,大大降低了由于频仍读写文件造成的损耗。因而,与传统的Hadoop框架相比,Spark能更好地利用于必要反复迭代的大数据分析工作。
CloudPhylo是目前国际上首款针对大数据集开发的系统发育建树工具,同时也是国内首个使用Spark云推算技术开发的生物信息学分析软件。在利用于仿照和真实的大数据集构建系统发育树时,CloudPhylo均阐发出了比传统建树软件更高的运行效能和更大的并行加快比(图1)。
该工具已经部署在BIGD云平台Qomo(https://cloud.big.ac.cn/users/bigd/tools/clouldphylo)上,毋庸本地装置,用户可在线提交数据并进行分析。同时本项工作的有关具体内容已经颁发在Bioinformatics杂志中(http://bioinformatics.oxfordjournals.org/content/early/2016/10/14/bioinformatics.btw645)。
该项钻研工作获得了国度高技术钻研发展打算(2014AA021503和2015AA020108)和亚星游戏国际合作局国际大科学打算(153F11KYSB2016008)等基金赞助。
论文链接:http://bioinformatics.oxfordjournals.org/content/early/2016/10/14/bioinformatics.btw645
图1 CloudPhylo在分歧前提下的并行加快比






