阿里、蚂蚁、晟腾、中科加禾精彩分享 AI 基础设施洞见,现购票可享受 9 折优惠 |AICon 了解详情
写点什么

从引进到自研,腾讯大数据平台每日数据计算量超 30 万亿

  • 2019-11-11
  • 本文字数:2049 字

    阅读完需:约 7 分钟

从引进到自研,腾讯大数据平台每日数据计算量超30万亿

在 11 月 6 日召开的 Techo 开发者大会上,腾讯云副总裁、腾讯数据平台部总经理蒋杰博士正式对外披露腾讯大数据平台 10 年技术演进历程。经过 10 年的积累,腾讯大数据平台的算力资源池目前已有超过 20 万台的规模,每天实时数据计算量超过 30 万亿条,腾讯已经成为中国实时数据计算量最大的公司。并且,随着资源管理平台核心 TKE 和分布式数据库 TBase 正式对外开源,腾讯正在成为大数据领域开源最全面的公司。



腾讯云副总裁、腾讯数据平台部总经理蒋杰


作为全球最大的互联网公司之一,腾讯的数据量在短短 5、6 年时间增长了几千倍,目前每天产生的数据量超过几十万亿条数据在产生。为了应对这种爆炸式增长,腾讯走出了一条技术引进+改造+自研的道路。经过长达十年的不断升级和完善,腾讯大数据平台已经经历了四代演进。针对最新的大数据和人工智能技术发展趋势,腾讯正在下一代计算平台中,探索批流融合、ABC 融合以及数据湖和联邦学习等前沿技术。

十年四次升级 建立“大数据+AI”双引擎技术架构

腾讯内部目前有超过 100 万台服务器,腾讯云联合所有业务部门,利用业务空闲资源打造一套算力共享平台,该算力弹性资源池有 20 万的规模,大数据平台每天有 1500 万的分析任务、30 万亿次的实时计算量,并且每天数据接入条数达 35 万亿条数据。此外,腾讯云的分布式机器学习平台,能支撑 1 万亿维度的数据训练。


能支撑如此大规模数据的接入和运算,是腾讯在大数据技术领域超过 10 年的积累,其核心的大数据平台已经完成了三次迭代。从以 Hadoop 为核心的离线计算时代到以 Spark、Storm、Flink 为核心的实时计算时代,再到如今的机器学习和深度学习时代,腾讯从无到有研发了分布式的机器学习引擎 Angel,以及一站式 AI 开发平台智能钛 TI,用来解决数据训练和算法的问题。目前,腾讯正在研究以批流融合、ABC 融合、以及数据湖和联邦学习为方向的下一代大数据平台的研究,该平台将具备混合部署、跨域数据共享和边缘计算等能力。


据了解,为支撑海量业务发展,腾讯已经建立了“大数据+AI”的双引擎技术架构,其中,最底层为分布式存储层,存储结构化及非结构化数据,第二层是资源调度层,做 CPU、GPU 和 FPGA 的管理,第三层是计算层、分析层、数据采集层,而顶层则是业务应用层。通过四层完整的技术架构,自下而上为腾讯的整个应用生态保驾护航,保障亿万用户能安全顺畅地享受到腾讯的优质服务。

从局部优化到自主研发 在实践中不断创新

从开始的技术引进、局部优化到如今的自主创新,腾讯的大数据技术在实践中不断完善、不断创新。十年前,腾讯管理几百个节点都很困难,调度性能差,规模上不去。为了有效解决计算能力和大规模集群问题,腾讯自研调度器,相对原生调度器性能提升 150 倍,大大提升了集群可扩展性。2016 年,腾讯打破 Sort Benchmark 四项世界纪录,标志着算力已经达到世界领先水平。


由于腾讯 20 万台弹性资源池的机器分布在多个数据中心,不同地区甚至是不同国家,为了降低数据使用壁垒,去年自研了漂移计算引擎 SuperSQL,作为统一的数据分析入口,通过智能 CBO 优化器,将计算下推到分布在各地的异构数据源,数据分析性能提高很多倍,并且数据量越大优势越明显。


数据应用越来越深入,腾讯对数据挖掘的需求也越来越多。随着模型的增大,最初用来做数据训练的 MR、Spark 已经不能满足上亿的模型维度的需求。2015 年初,腾讯开始自研高性能的分布式机器学习平台 Angel,采用 PS 架构,能支持 10 亿维度。目前 Angel 发展到 3.0 版本,能支持万亿维度,也可以兼容 Spark、PyTorch、TensorFlow 等生态,进一步降低了使用门槛。此外,Angel 今年还新增了对深度学习、图计算等的支持。

腾讯正成为大数据领域开源最全面厂商

技术迭代不断加速,企业建设大数据平台和机器学习平台,不仅成本高昂,而且缺乏相应的专业人才,面临种种问题。


云时代,这些问题得到有效解决。目前,腾讯已经把网络、存储、数据库等 IaaS 能力,大数据、机器学习等 PaaS 的能力,以及上层的图像、语音、NLP、BI 等 SaaS 能力,通过腾讯云对外开放。在大数据和 AI 两个领域,腾讯推出了以 TBDS 和智能钛 TI 为首的双引擎。让每个企业,不需要专业的大数据和 AI 团队,也能便捷用上领先的大数据和 AI 的能力。


另外,腾讯也通过开源和广大开发者共享技术成果。从 2014 开始,将第一代平台的核心,腾讯版的 Hive 进行了开源,2017 年,更是把第三代平台的核心 Angel 开源。今年,腾讯加快了开源的脚步,在内部推开源协同的战略推动下,腾讯所有的技术栈,后续会越来越开放。


2 个月前,腾讯在 ApacheCon 2019 上,面向全球开发者正式宣布开源自身核心平台——实时数据采集平台 TubeMQ,并捐献给 Apache 社区。此次在 Techo 大会现场,再次重磅宣布正式开源资源管理平台核心 TKE 和分布式数据库 TBase,随着在大数据开源领域的开源逐步加速,腾讯正在成为中国大数据领域开源最全面的厂商。


“目前,已经有数百万的开发者在腾讯云上构建应用,相信后面会有越来越多开发者加入,我们将和所有开发者一起,共建云上的应用生态”,蒋杰表示。


公众号推荐:

2024 年 1 月,InfoQ 研究中心重磅发布《大语言模型综合能力测评报告 2024》,揭示了 10 个大模型在语义理解、文学创作、知识问答等领域的卓越表现。ChatGPT-4、文心一言等领先模型在编程、逻辑推理等方面展现出惊人的进步,预示着大模型将在 2024 年迎来更广泛的应用和创新。关注公众号「AI 前线」,回复「大模型报告」免费获取电子版研究报告。

AI 前线公众号
2019-11-11 14:552080

评论

发布
暂无评论
发现更多内容

毫末DriveGPT再获证明!斩获nuSecnces自动驾驶公开数据集NDS最佳成绩

Geek_2d6073

敏捷开发最佳实践:质量维度实践案例之接口级自动化测试

PingCode

敏捷开发 敏捷实践

Ollama:打造本地开源大模型聊天应用的实践

百度开发者中心

人工智能 大模型 openai

度小满与哈工大共同推出SmartTrim,自适应剪枝技术提升多模态大模型效率

科技热闻

敏捷开发最佳实践:学习与改进维度实践案例之会诊式培养敏捷教练

PingCode

敏捷开发 敏捷实践

深入理解Sora技术原理

得物技术

AIGC sora

Partisia区块链推出MOCCA方案,让资产管理更加可信化且可编程

威廉META

Acrobat Pro DC 2023 for mac(专业PDF编辑软件)

iMac小白

Solidity案例详解(六)食品溯源合约

BSN研习社

区块链 Solidity

Downie 4 for Mac(视频下载工具)兼容14系统 v4.7.6中文版

iMac小白

AWE2024,中国家电智能化的《山海经》

白洞计划

智能家居

【AAAI 2024】M2Doc:文档版面分析的可插拔多模态融合方法

阿里云大数据AI技术

东郊到家服务系统开发

l8l259l3365

Photoshop 2024 for mac(ps 2024) v25.5.1中文激活版

iMac小白

微信多开 WechatTweak for Mac(微信多开、消息防撤回工具) v3.8.7(28245)中文集成版

iMac小白

一文读懂Partisia区块链的MOCCA 方案:让资产管理可信且可编程

西柚子

Redis集群模式和常用数据结构

EquatorCoco

数据库 redis 集群

软通咨询杨念农:数智赋能物流行业高速发展,开启数智化物流新时代

软通咨询

人工智能 数字化转型 #物流 数字化咨询 数智化物流

如何在Docker容器启动时自动运行脚本

华为云开发者联盟

Docker 开发 华为云 华为云开发者联盟

Snagit for mac(最强大的屏幕截图软件) v2024.2.2中文版

iMac小白

Mistral AI vs. Meta:两大 Top 开源模型的对比

Baihai IDP

程序员 AI LLM 白海科技 Baihai IDP

After Effects 2024 for Mac(AE2024视频特效) v24.2.1中文激活版

iMac小白

EndNote 21 for Mac(文献管理软件) v21.2激活版

iMac小白

深度解读:商品计划管理系统为鞋服企业带来的卓越价值

第七在线

Termius for Mac(多协议远程管理软件) 8.4.0激活版

iMac小白

敏捷开发最佳实践:客户价值实践案例——用户画像的应用

PingCode

敏捷开发 敏捷实践

作为程序员需要配蓝光眼镜吗?

小魏写代码

EMQX ECP + NeuronEX 产品发布会:从边到云的实时工业互联数据平台

EMQ映云科技

mqtt mqtt broker

利用RAG技术打破大模型幻觉

百度开发者中心

人工智能 图谱 大模型

OmniReader Pro for mac(专业电子书阅读器) v2.8.1激活版

iMac小白

Lightroom Classic 2024 for Mac(LRC2024) v13.1.0中文激活版

iMac小白

从引进到自研,腾讯大数据平台每日数据计算量超30万亿_服务革新_云加社区_InfoQ精选文章