10 月 23 - 25 日,QCon 上海站即将召开,现在购票,享9折优惠 了解详情
写点什么

一条“老咸鱼”与生物学家的 Battle 之旅

  • 2021-03-17
  • 本文字数:1781 字

    阅读完需:约 6 分钟

一条“老咸鱼”与生物学家的 Battle 之旅

从上帝捏土为人,到女娲造人,东西方似乎达成了神奇的共识:人是泥土做的。经历过十余年综合教育的“五好青年”知道,人是从大海里来的。


然而,陆生迁徙说一直没得到确切的理论支持。


直到人们发现了一种既长着鳃又长着肺的鱼——“肺鱼”,并将其带进实验室测序。


一测吓一跳。以澳洲肺鱼为例,其基因组居然包含约 430 亿个 DNA 碱基对,是人类 14 倍,身体 1 亿多年没变化!


作为可能的“脊椎动物登陆”见证者,这条“老咸鱼”仿佛在对生物学家炫耀地摇着尾巴。



基因测序没那么简单


肺鱼没想到的是,基因测序技术的进步竟然如此之快。肺鱼基因秘密很快就被大量揭开。

2021 年 1 月 18 日,Axel Meyer 等人在 《Nature》 发表了论文,确定了最大的染色体质量的动物基因组。十多天后,著名刊物 《Cell》 发表了两篇论文,分别解析了原始辐鳍鱼类,以及非洲肺鱼共五个物种的基因组。

二者背后都有一个“神秘”的中国公司在提供基因测序技术支持:三代测序企业——武汉希望组

一个有机体 DNA 的完整序列称为一个基因组,以人为例,对基因组测序,解读遗传物质,能大大降低遗传疾病发生率,实现对疾病预防以及个体化诊疗。好莱坞女星安吉丽娜·朱莉发现自己带有家族遗传癌症基因,于是预防性地切除了乳腺。

基因测序并不简单。人体有 23 对染色体,31.6 亿个碱基对,一次 30 倍的全基因组测序的数据量约 90Gb,质控、拼接、比对、注释等流程,用一台高性能服务器需要运行 30 多个小时才能完成。

这对存储、算力、网络以及数据安全性都提出了极高的要求:


1、数据容量巨大。数十 TB 的原始数据,要求测序公司提供超大容量的数据存储以及大容量单文件存储的支持。且原始数据通常来自于珍贵样本,数据安全性要求极高。


2、高并发读写能力要求高。原始数据导入到系统之后,需要通过各种类型生物信息学 Pipeline 分析,海量数据的传输需求对用户数据交付是极大的挑战。


3、对数据挖掘和机器学习的需求高。基因比对、组装、变异分析需要使用深度学习或机器学习,通过数据挖掘发现更多成果。


4、对计算存储的连续性要求高。一次测序耗时长,需要存储系统满足 7*24h 连续无故障作业的要求。


比起给人类测序,肺鱼测序明显更难,它的基因组是迄今为止报道的最大的动物基因组(约 40Gb),基因组中>60%的重复序列进一步增加了组装难度。



针对以上的需求,希望组首席生信技术官、联合创始人胡江带领团队历时 2 年自主研发了 NextDenovo/NextPolish 系列三代测序组装软件。这套软件集比对、矫正、组装功能于一体,不但解决了现有三代测序数据组装工具资源占用大、运行时间长、组装质量不稳定的瓶颈,还实现了单 Contig 一条染色体和超大型基因组组装的突破,为利用三代数据组装基因组扫清了组装算法的障碍。


目前该系列软件已在 GitHub 上开源。其中 NextDenovo 一开源就引起国内外广泛使用和报道,截止 2021 年 3 月,下载次数超过 4000 次。


自主研发软件的背后


如今的生命科学研究竞赛,已经变成了一场“算力”的比拼。


基因测序行业动辄 PB 级别的数据,需要极高的带宽需求,及快速扩缩容能力。同时,对 PB 级别数据存储还包含规划、分配、回收、归档等过程。安全、运维和成本都面临巨大的挑战。目前基因测序行业普遍采用定制化的云计算服务,华为云鲲鹏云服务,满足了希望组对多元算力需求,助力测序软件与方案落地。


此外,华为云联创营提供的技术共创服务。对于创新业务,成果不等于简单的技术服务累加,深度共创往往更能解决问题。


例如,在技术层面,希望组采用了华为云基因容器服务 GCS,将基因测序和容器技术结合在一起,通过综合运用华为云提供的 Docker、ARM 等技术,将部分应用性能提升 5-10 倍,同时大大降低了运维压力,整体运维成本下降 30%。另外还基于华为云鲲鹏云的 HPC 解决方案 ,将内存带宽使用率提升了 40%,算力提升了 25%。



数字背后,是双方力出一孔的合作。单是基因测序流程在华为云鲲鹏云上的国产化适配,希望组核心技术骨干李净净、秦建虎等就与华为云的技术专家召开了 12 次会议。双方团队紧密协作两个多月,保障了整个项目提前顺利上线。


现在,NextDenovo 即将上架华为云严选商城,面向全球基因测序行业从业者以及学术研究机构开放,以期推动整个基因行业的进步。


作为华为云联创营会员,希望组还会深度参与后续的合作。双方将在基因测序场景下,继续孵化改变行业的解决方案。


2021,华为云联创营还在继续,与智者同行,共创美好新未来。




2021-03-17 17:121918

评论

发布
暂无评论
发现更多内容

面试被问:OOM类型有哪些?怎么答?

程序员小富

Java 面试

构建企业级“数字化中台”:以低代码能力为核心

星云低代码中间件

低代码 开发工具 企业系统

KaiwuDB X 智慧燃气:远传表管理系统优化升级

KaiwuDB

数据库

YashanDB数据库如何帮助企业应对海量数据挑战

数据库砖家

有关智能锁,你必须要知道的十大品牌

新消费日报

零基础上手:Cursor + MCP 爬取 YouTube 视频数据

不叫猫先生

爬虫 agent cursor MCP

YashanDB数据库容量扩展策略及操作指南

数据库砖家

见证民族重卡力量!黄河H7震撼上市,智启高效物流新纪元

科技热闻

令牌桶VS漏桶:谁才是流量控制的“最优解”?

程序员小富

Java 面试

社区动态 | Apache Pulsar 的社区规划和演进

AscentStream

新签约 | 千万级测点零故障运行,新奥数能的升级选择

TDengine

tdengine 时序数据库 国产时序数据库

智能平权下,燃油车如何升级?

脑洞汽车

AI

YashanDB数据库日志审计功能及合规应用指南

数据库砖家

岂止产品发布,更是500+成功验证:北森AI Family 2.0引领HR进入AI新纪元

人称T客

小红书笔记评论API数据解析(附代码)

tbapi

小红书API 小红书笔记评论接口 小红书笔记评论采集 小红书笔记评论api

YashanDB数据库日志分析与安全审计方法

数据库砖家

YashanDB数据库如何帮助企业实现数据价值最大化

数据库砖家

出海品牌传播为什么需要与海外舆情监测系统联动?

沃观Wovision

出海企业 沃观Wovision 海外舆情监测

YashanDB数据库容灾备份设计及实施经验分享

数据库砖家

YashanDB数据库容错机制解析,保障企业数据稳定

数据库砖家

YashanDB数据库容灾恢复策略及演练流程

数据库砖家

Dify平台Agent开发入门指南

测吧(北京)科技有限公司

端侧模型 Marvis TTS,支持实时语音克隆与流式合成;实时生成虚拟环境的动感单车:集成世界模型和语音教练丨日报

声网

抖音基于Flink的DataOps能力实践

Apache Flink

大数据 flink 实时计算

YashanDB数据库日志审计与安全合规实用教程

数据库砖家

案例实践 | 如何做好 Apache Pulsar 的运维?ASP 产品简介

AscentStream

消息队列

YashanDB数据库容灾备份自动化实施指南

数据库砖家

百度智能云长三角首个大模型数据标注基地落地滁州

科技热闻

CST软件如何查看和提取电路模型的SPICE (txt转换cir)

思茂信息

电磁仿真 CST软件 CST Studio Suite

转化率始终上不去?用户行为分析来帮你

ClkLog

开源 数据分析 埋点 用户行为分析 用户画像

YashanDB数据库日志配置与故障诊断技巧

数据库砖家

一条“老咸鱼”与生物学家的 Battle 之旅_服务革新_InfoQ编辑部_InfoQ精选文章