NVIDIA 初创加速计划,免费加速您的创业启动 了解详情
写点什么

ArchSummit 主题演讲:Ashish Thusoo 介绍大数据发展趋势和 Facebook 的大数据处理平台

  • 2012-07-23
  • 本文字数:1966 字

    阅读完需:约 6 分钟

Ashishi Thusoo 是 Qubole 联合创始人兼 CEO。Qubole 是一个建设云平台进行数据分析和处理的创业企业。在创办 Qubole 之前,ASHISH 负责 Facebook 数据基础设施团队。在他的领导下,团队创造了世界上最大的数据分析与处理平台。该平台实现了公司内部分析师,工程师以及数据科学家得以访问数据的目标。在这一过程中,他帮助推动创造“大数据”部署工具,技术和模板的实现 – 这已经成为主流“大数据”革命的构件。在 Ashish 的协助下,2007 年,他加入 Facebook 时用户只有 5 千万人,当他离开 Facebook 时,用户已经成长到 8 亿人。他也是 Apache Hive 项目的联合创始人,并作为该项目的 Apache 软件基金会的创始副总裁。在 ArchSummit 深圳 2012 大会上,我们也很荣幸邀请到 Ashishi 现场分享,现在报名参加大会可享超低折扣,3 人以上团购享更多优惠。

在这些年从事大数据处理工作的经验中,他总结过以下六点:

  1. 从“该抓哪些数据”转变成“有这么多数据可以做什么”:除了少数状况外,简单的算法搭配大量数据,计算出来的结果远比复杂的算法搭配少量数据更好;这相当类似统计的概念,意即在样本数够大的情况下可以忽略误差。
  2. 尽可能简化分析工具,让普通用户也能使用自如
  3. 大量用户可以让你的分析工具更加完善:第 2 和 3 点相辅相成。当你把分析工具设计得足够简单,一般用户自然乐意使用,而且这些人的加入,会使某些极端的问题一一浮现;例如一个写很烂的查询就会瘫痪整个系统,因此你必须花更多心思另外处理、配置资源,以及管理安全性和权限。
  4. 协作模式同样使用大数据处理:刻意把分析工具设计地带有合作的成分,如此一来当用户分享他们的分析,就会从讨论中得到更多的成果。
  5. 没有一种架构适用所有情况:我们经常在开发的过程中遇到从未见过的问题,与其硬是将它纳入现有的架构,直接设计一个新解决方案会是更好的选择。
  6. 维护服务比开发软件更难:我们花了很多的时间跟心力才让服务正常运作,一方面必须提高系统负载量,同时还要保留弹性,最重要的是要经常监控系统状态是否异常。

在今年的 ArchSummit 深圳 2012 大会上,他将把这六点经验放在融汇于两个演讲之中,包括第一天上午第一个主题演讲,题目是:大数据的技术趋势和演变,在这个演讲中,他将分享:

大数据相关的问题正在变得越来越广泛。很多公司都在面对并试图解决海量数据相关的问题。它几乎充斥了我们的耳朵:传感器和移动设备的不断涌现,产生着越来越多的数据。从根本上说,大数据已经站住脚了,而且正在得到越来越广泛的使用。观察它的演化过程,从 2007 年开始到现在,应该说它颠覆了很多东西,越来越多的人开始尝试。它可以在以下 5 个领域产生巨大影响:创造透明度、通过实验来发现需求和增强绩效、细分人群并采取灵活行动、用自动算法代替或者帮助人工决策、创新商业模式产品和服务。

那么,目前这一代大数据架构的主要驱动力有哪些?这些架构的演化遵循了什么样的路径?未来面临哪些最大的挑战?这些架构将会向什么方向演化?这些都是 Ashish 将会在本演讲中回答的问题。他会分析业界的使用案例,谈谈哪些系统表现出色,哪些系统还不够好。他还会谈及在云上运行这些系统面临的挑战,并就如何克服这些问题提供一些建议。

另外一个演讲,是在第二天下午的“海量数据之快准狠”专题之中,演讲题目是: Facebook 的海量数据架构演变过程,他将会讲到:

作为世界上最大的社交网络,Facebook 公司一天积聚的数据比很多大公司一年产生的数据还要多。 据 2010 年 3 月的博客显示,Facebook 公司的 Hadoop 集群成为世界上最大的计算机集群。这个集群由 2000 台计算机,800 台 16 核系统和 1200 台 8 核系统组成。集群中每个系统存储了大概 12 万亿到 24 万亿字节的数据。

一年前,Facebook 的集群存储了 30 千万亿字节的数据,大概是美国国会图书馆存储信息数量的 3000 倍。Facebook 数据中心在过去一年里增长了三分之一还多。 今年 4 月份,Facebook 耗资 4.5 亿美金建设的新数据中心也已经投入使用。

从 2007 年到 2011 年,Facebook 的大数据处理架构是如何演变的?在一个变动异常频繁,并且快速增长的环境里,都要面临哪些挑战?Facebook 使用了一些组件和技术,让公司大部分部门都可以根据不同的目的访问、分析、使用数据,背后的驱动力是什么?Ashish Thusoo 在本演讲中将会回答这些问题,同时会介绍从 Facebook 的经验中的一些重要收获。

如果您想了解大数据相关技术的发展趋势和具体实践,Ashish Thusoo 的演讲不可错过。

现在个人报名购票可享受 9 折优惠,节省 360 元。团购单位享有更多优惠,ArchSummit 深圳 2012 大会提供针对团队(3 人以上)购票优惠策略。详情请将公司参会信息发邮件至:arch@cn.infoq.com(邮件标题注明“团队购票”),或致电 010-89880682、010-64738142。有关 ArchSummit 全球架构师峰会 2012 的更多信息请访问官方网站: www.ArchSummit.com

2012-07-23 22:042253
用户头像

发布了 479 篇内容, 共 152.6 次阅读, 收获喜欢 47 次。

关注

评论

发布
暂无评论
发现更多内容

供应商企业在线询价招投标管理系统

金陵老街

用友承建!居然之家人力资源数智化项目成功上线!

用友BIP

「X」Embedding in NLP|Token 和 N-Gram、Bag-of-Words 模型释义

Zilliz

nlp NLP 大模型 Milvus AIGC

多语言网站SEO和hreflang标签

九凌网络

机器学习-ROC曲线:技术解析与实战应用

快乐非自愿限量之名

人工智能 机器学习 深度学习

如何理解微服务体系结构中的 CQRS

快乐非自愿限量之名

数据库 微服务

王文京与厦航董事长、党委书记赵东交流座谈,共商助力智慧民航建设

用友BIP

中企全球化:王文京与新加坡建筑企业集永成共谋数智化新发展

用友BIP

招聘IT人才vs IT外包,怎么选?

Ogcloud

外包 IT 外包公司 项目外包 IT 运维

AI大模型爆发后,智能计算的需求有多强烈?

Finovy Cloud

人工智能 AI AI模型 AI 模型编译器 ChatGPT

债务管理一体化领先实践,全面提升融资管理效率,有效防控风险

用友BIP

微信小程序 WXSS 是如何编译的?

FN0

小程序 小程序容器

每日一题:LeetCode-322. 零钱兑换

半亩房顶

面试 算法 LeetCode 动态规划 贪心算法

探索Web前端技术的变革与未来发展

EquatorCoco

前端 Web 技术开发

文心一言 VS 讯飞星火 VS chatgpt (150)-- 算法导论12.2 6题

福大大架构师每日一题

福大大架构师每日一题

人工智能技术:一文带你了解何谓AIGC

不在线第一只蜗牛

人工智能 AI技术 AIGC 人工智能技术

String 拼接字符串效率低?是真的吗?

红袖添香

Java 字节码 字符串拼接

IPQ5018 IPQ6010 IPQ8072 Support Wallystech Latest Opensource Code Repository

wallyslilly

IPQ6010 IPQ8072 ipq5018

云计算与低代码:加速应用开发与创新的双核引擎

快乐非自愿限量之名

云计算 云原生 低代码

软件测试/人工智能|Python算术运算符:入门指南

霍格沃兹测试开发学社

Path Finder mac(可以替代访达的文件管理器) v2163永久激活版

mac

苹果mac Windows软件 Path Finder 文件管理和操作工具

低代码/无代码火热的缘由

这我可不懂

软件开发 低代码 JNPF

软件测试/人工智能|Python运算符:初学者指南

霍格沃兹测试开发学社

如何为 3D 模型制作纹理的最佳方法

3D建模设计

材质 纹理 贴图 3D模型纹理贴图

软件测试/人工智能|Python Pip 常用命令大全

霍格沃兹测试开发学社

10种谷歌seo排名优化的方法

九凌网络

制作红木家具3d模型

3D建模设计

3D模型 材质贴图 纹理贴图 材质纹理

走软件开发的捷径——低代码之路

树上有只程序猿

软件开发 低代码 JNPF

少写代码,用更便捷的方式开发程序

代码生成器研究

3D模型制作木质纹理贴图

3D建模设计

3D模型 材质贴图 纹理贴图 材质纹理

Java多线程系列4:线程协同

BigBang!

Java多线程

ArchSummit主题演讲:Ashish Thusoo介绍大数据发展趋势和Facebook的大数据处理平台_Meta_郑柯_InfoQ精选文章