GMTC全球大前端技术大会(北京站)门票9折特惠截至本周五,点击立减¥480 了解详情
写点什么

一条“老咸鱼”与生物学家的 Battle 之旅

2021 年 3 月 17 日

一条“老咸鱼”与生物学家的 Battle 之旅

从上帝捏土为人,到女娲造人,东西方似乎达成了神奇的共识:人是泥土做的。经历过十余年综合教育的“五好青年”知道,人是从大海里来的。


然而,陆生迁徙说一直没得到确切的理论支持。


直到人们发现了一种既长着鳃又长着肺的鱼——“肺鱼”,并将其带进实验室测序。


一测吓一跳。以澳洲肺鱼为例,其基因组居然包含约 430 亿个 DNA 碱基对,是人类 14 倍,身体 1 亿多年没变化!


作为可能的“脊椎动物登陆”见证者,这条“老咸鱼”仿佛在对生物学家炫耀地摇着尾巴。



基因测序没那么简单


肺鱼没想到的是,基因测序技术的进步竟然如此之快。肺鱼基因秘密很快就被大量揭开。

2021 年 1 月 18 日,Axel Meyer 等人在 《Nature》 发表了论文,确定了最大的染色体质量的动物基因组。十多天后,著名刊物 《Cell》 发表了两篇论文,分别解析了原始辐鳍鱼类,以及非洲肺鱼共五个物种的基因组。

二者背后都有一个“神秘”的中国公司在提供基因测序技术支持:三代测序企业——武汉希望组

一个有机体 DNA 的完整序列称为一个基因组,以人为例,对基因组测序,解读遗传物质,能大大降低遗传疾病发生率,实现对疾病预防以及个体化诊疗。好莱坞女星安吉丽娜·朱莉发现自己带有家族遗传癌症基因,于是预防性地切除了乳腺。

基因测序并不简单。人体有 23 对染色体,31.6 亿个碱基对,一次 30 倍的全基因组测序的数据量约 90Gb,质控、拼接、比对、注释等流程,用一台高性能服务器需要运行 30 多个小时才能完成。

这对存储、算力、网络以及数据安全性都提出了极高的要求:


1、数据容量巨大。数十 TB 的原始数据,要求测序公司提供超大容量的数据存储以及大容量单文件存储的支持。且原始数据通常来自于珍贵样本,数据安全性要求极高。


2、高并发读写能力要求高。原始数据导入到系统之后,需要通过各种类型生物信息学 Pipeline 分析,海量数据的传输需求对用户数据交付是极大的挑战。


3、对数据挖掘和机器学习的需求高。基因比对、组装、变异分析需要使用深度学习或机器学习,通过数据挖掘发现更多成果。


4、对计算存储的连续性要求高。一次测序耗时长,需要存储系统满足 7*24h 连续无故障作业的要求。


比起给人类测序,肺鱼测序明显更难,它的基因组是迄今为止报道的最大的动物基因组(约 40Gb),基因组中>60%的重复序列进一步增加了组装难度。



针对以上的需求,希望组首席生信技术官、联合创始人胡江带领团队历时 2 年自主研发了 NextDenovo/NextPolish 系列三代测序组装软件。这套软件集比对、矫正、组装功能于一体,不但解决了现有三代测序数据组装工具资源占用大、运行时间长、组装质量不稳定的瓶颈,还实现了单 Contig 一条染色体和超大型基因组组装的突破,为利用三代数据组装基因组扫清了组装算法的障碍。


目前该系列软件已在 GitHub 上开源。其中 NextDenovo 一开源就引起国内外广泛使用和报道,截止 2021 年 3 月,下载次数超过 4000 次。


自主研发软件的背后


如今的生命科学研究竞赛,已经变成了一场“算力”的比拼。


基因测序行业动辄 PB 级别的数据,需要极高的带宽需求,及快速扩缩容能力。同时,对 PB 级别数据存储还包含规划、分配、回收、归档等过程。安全、运维和成本都面临巨大的挑战。目前基因测序行业普遍采用定制化的云计算服务,华为云鲲鹏云服务,满足了希望组对多元算力需求,助力测序软件与方案落地。


此外,华为云联创营提供的技术共创服务。对于创新业务,成果不等于简单的技术服务累加,深度共创往往更能解决问题。


例如,在技术层面,希望组采用了华为云基因容器服务 GCS,将基因测序和容器技术结合在一起,通过综合运用华为云提供的 Docker、ARM 等技术,将部分应用性能提升 5-10 倍,同时大大降低了运维压力,整体运维成本下降 30%。另外还基于华为云鲲鹏云的 HPC 解决方案 ,将内存带宽使用率提升了 40%,算力提升了 25%。



数字背后,是双方力出一孔的合作。单是基因测序流程在华为云鲲鹏云上的国产化适配,希望组核心技术骨干李净净、秦建虎等就与华为云的技术专家召开了 12 次会议。双方团队紧密协作两个多月,保障了整个项目提前顺利上线。


现在,NextDenovo 即将上架华为云严选商城,面向全球基因测序行业从业者以及学术研究机构开放,以期推动整个基因行业的进步。


作为华为云联创营会员,希望组还会深度参与后续的合作。双方将在基因测序场景下,继续孵化改变行业的解决方案。


2021,华为云联创营还在继续,与智者同行,共创美好新未来。




2021 年 3 月 17 日 17:12711

评论

发布
暂无评论
发现更多内容

准备两个月,面试五分钟,Java中高级岗面试为何越来越难?

周老师

Java 编程 架构 面试 程序猿

arXiv | 如何更好地理解自然语言?自训练+预训练

Machine Gun

网络安全 信息安全 渗透测试 语言

NFT赛道科普,NFTB作为黑马或弯道超车

区块链小八歌

比特币 区块链 NFT

大话Java异常

若尘

Java 异常 异常处理 520单身福利

高可用 Keycloak,K8s

Zhang

MySQL k8s keycloak

致我的青春我的感情故事

Changing Lin

520单身福利

NULS + NerveNetwork,让公链生态全面实现跨链互通

区块链小八歌

区块链 跨链 NULS

UCloud一站式智能大数据平台USDP免费版正式发布!

UCloud技术

hadoop CDH

牛掰!腾讯强推Netty速成笔记(2021最新版)限时开源,从头到尾全是精华!

程序员小毕

Java 程序员 架构 面试 Netty

3、深潜KafkaProducer核心架构

杨四正

kafka 消息队列 kafka架构 kafka源码分析

Gartner预测全球芯片供应短缺将持续到2022年第二季度

Geek_bacee5

Gartner Gartner预测 全球芯片供给 数据分析预测 gartner信息技术研究

【干货分享】开放原子超级链动态内核XuperCore核心技术揭秘

百度开发者中心

区块链 超级链

毫秒级的竞技PK | 电信行业需要的5G速度

VoltDB

大数据 数据分析 5G 实时计算

全网疯传!堪称最强!4000页计算机、网络、算法知识教程总结

周老师

Java 编程 程序员 架构 面试

百度 Serverless 架构揭秘与应用实践

百度开发者中心

百度 云原生

配置、使用、监控、部署一键搞定!阿里新产SpringBoot速成小册太香了!

Java王路飞

Java 程序员 架构 面试 springboot

2021金三银四Java岗大厂面试经验总结(附面试真题)

北游学Java

Java 面试题 面试经验

iOS 面试策略之系统框架-并发编程

iOSer

ios 并发编程 系统框架

采用DevOps的7个主要障碍,你一定不知道!

禅道项目管理

DevOps

【签约计划】试用期名单公布

InfoQ写作平台官方

活动专区 签约计划

GitHub标星235k!这份阿里P9纯手写的Java并发核心手册堪称无敌了

Java架构之路

Java 程序员 架构 面试 编程语言

CompusBulider (模模搭)学习笔记7:3D场景中第一人称行走

森友小锘

3D可视化 数字孪生

包容的回答者

王辉

个人成长 沟通 团队文化 批判性思维 正念

分库分表 springboot+dubbo+mybatisPlus+shardingSphere

try catch

dubbo 分库分表 springboot ShardingSphere MyBatisPlus

官方出手,一针见血!Spring Boot官方手册来袭:从入门到实战

Java架构之路

Java 程序员 架构 面试 编程语言

Gartner在线研讨会:后疫情时代金融服务企业技术领导者的成功之路

Geek_bacee5

Gartner Gartner在线研讨会 金融服务行业 gartner洞察见解 后疫情时代企业应对策略

BSC Daily首页报道Rabbit Finance:一款让传统金融行业关注的DeFi项目

区块链小八歌

区块链 defi BSC

作业二:分析微信朋友圈高性能复杂度

刘丽

架构训练营

520 表白,因一个分号被拒

悟空聊架构

520单身福利

ipfs质押币和gas费降低?ipfs挖矿的最新消息?

v:IPFS456

ipfs质押币和gas费降低? ipfs挖矿的最新消息?

淘宝网能抗住“千亿级”并发量的奥秘是什么?

Java架构师迁哥

一条“老咸鱼”与生物学家的 Battle 之旅-InfoQ