2025上半年,最新 AI实践都在这!20+ 应用案例,任听一场议题就值回票价 了解详情
写点什么

Kylin 在携程的实践(下)

  • 2020-11-27
  • 本文字数:1587 字

    阅读完需:约 5 分钟

Kylin 在携程的实践(下)

案例分享


离线分析案例



携程之前使用的是 OpenTSDB+Hive。采用 Kylin 前,先从 Hive 先生成聚合表,然后导入 HBase,通过 OpenTSDB 去分析,现在积累了接近百亿的数据,随着数据的增长,老的方案已经无法满足业务需求了,而且同步数据成本高,OpenTSDB 没办法支持精准去重响应时间也很差。用了 Kylin 之后,现在的业务规模已经可以支撑上百亿了,目前已经配有 200 个左右的线上活跃的 Cube。


实时分析案例



这个是去年 3、4 月份用户提的新需求。Kylin 现在是上图所示的 Streaming-Cube 的架构,Kylin 接入的是携程的 Hermes,Hermes 是 Kafka 的一个封装。我们现在支持原生 Kafka 接入和 Hermes 接入,底层沿用 MR,因为我们测试过 Spark,其实很多的场景上和 MR 相当,效果不是特别明显。



这部分主要是用于度假预订状态告警,度假团队需要去分析用户预订的情况,准确实时地发送给客服人员任何预订失败等错误状况,所以这块对于数据构建落地的时间敏感度比较高。目前,通过一系列优化,Streaming 的构建基本保持在 5 分钟左右,可以满足一部分业务的需求。但是,更大的挑战是达到一分钟以内,也就是说秒级构建,所以对于我们来说 Streaming-realtime 会是一个值得尝试的方向。


展望


携程针对 Kylin 主要有两方面的展望。


1 支持自动构建 Cube


这块我们目前在调研,通过分析应用采集的元数据、SQL 特征,可以自动地为用户构建 Cube,为用户节约 Kylin 的学习成本,同时减少重复查询对于 MPP 的压力。


2 Real-time Streaming 的调研和落地


为了能够更加丰富 Kylin 的使用场景,我们打算对 eBay 为 Kylin 贡献的实时流处理技术做进一步调研和落地工作。


Q&A


Q:演讲中提到的构建的 Cube 有 20 个指标,这种情况下去重,是精准去重还是近似去重?有多少个指标呢?


A:用户配的是精确。精确去重指标不会太多。


Q:演讲中提到 20 个维度的响应时间是亚秒级,有 20 个维度。请问你们做了哪些优化的工作来达到如此快的响应时间?


A:我们构建的时候,对于这种维度多的情况,建议当用户采取了以下 3 种措施来优化查询:


  • 使用 Mandatory Dimension;

  • 实现分布式缓存;

  • 配置高基维度的时候,会建议他们把高基维度往前移,这样会更高效地命中 Cube,并减小扫描的数据范围)。


Q:配了 20 个维度,最终产生的 Cube 单日有多大?


A:最大的 Cube 日产生 13 T 的数据。


Q:刚刚提到的监控方案是你们自主研发的,还是有开源的方案可以用?


A:监控是我们自主研发的。我们接入了公司已经成熟的监控平台,避免反复造轮子。


Q:分享里提到的实时 5 分钟构建一次,我理解是采用批操作,并不是真正的流,而是把流几分钟拆成一个批次。是吗?


A:对的。


Q:前面讲到底层用的 MR,没用 Spark,因为觉得时间上并没有什么节省。这个是 Spark 本身的原因,还是因为你们的任务还不是很大的量?因为每次 Spark 启任务的时间和 MR 相比有差别?


A:离线这块目前可以达到要求,所以还没有转成 Spark。我们在实时这块用 Spark 的过程中,就是像你说的,每次提交任务就很慢,达不到要求。


Q:是因为频繁提交的问题?不是因为它本身?


A:对,不是因为它本身。我们也在调研如何避免每个构建过程都启动一次 driver。


Q:在我之前的应用场景里,有一个维度特别的高基维,每天增量就很大,我们查询机制里这个维度是必选的。比如说是人的工号,里面放了很多人,然后我们要去预计算,如果说这个维度非常高,数据量会非常大,这种情况下你们会采取什么办法呢?


A:高基字段可以设置下 shard by。


Q:携程每天预计算的集群大概是有多大?


A:离线集群是 2 台物理机,每台 100 多 G 的物理机,查询节点放了 4 台虚机。实时这块,因为用户量目前不多,所以都是建在虚机上,所以内存也不大。


Q:在维度特别大,数据量又很大的情况下,剪枝的话,Cuboid 大概会控制在多少?


A:维度特别大的情况,我们最多是 4096 个 Cuboid。


本文转载自公众号 apachekylin(ID:ApacheKylin)。


原文链接


Kylin 在携程的实践(下)


2020-11-27 10:101392

评论

发布
暂无评论
发现更多内容

Python实现钉钉/企业微信自动打卡

sum56

Python python 爬虫 打卡

阿里架构师经验分享!写给互联网大厂员工的真心话,最全的BAT大厂面试题整理

欢喜学安卓

android 程序员 面试 移动开发

全球区块链与数字经济领军课程

CECBC

数字经济 科技

学习总结之HTML5剑指前端(建议收藏,图文并茂)

我是哪吒

学习 程序员 面试 大前端 2月春节不断更

史上最全的技术手册整理总结,编程小白都从这篇文章迅速成为大牛

孙叫兽

Java 大前端 技术手册 开发文档

用python提前预测jvm cpu100%自动dump thread

程序员石磊

JVM Thread cpu 100%

即使技术再精,面试时一问这个必挂!!

冰河

面试 类加载器 我要进大厂 Java类加载

婚恋交友软件开发

luluhulian

驱动力读书笔记之四

张老蔫

28天写作

产品 0 期 - 第四周作业

vipyinzhiwei

大作业2-知识总结

arcyao

百度网盘限速解决方案

孙叫兽

解决方案 百度网盘 限速

“五年饮冰,难凉热血”,一名专科生的求学历程

不脱发的程序猿

程序人生 心路历程 2月春节不断更 大学总结 2020年度总结

Elasticsearch multi-index 搜索

escray

elastic 七日更 死磕Elasticsearch 60天通过Elastic认证考试 2月春节不断更

期末大作业一

心在那片海

简金秋:区块链技术构建服装行业全新商业模式

CECBC

区块链 服装行业

2020年末总结,脚踏实地,一步一个脚印——致敬自己一年的心酸历程

孙叫兽

孙叫兽 年度报告 引航计划

大作业1-同城快递业务系统设计

arcyao

如何制作和使用自签名证书

soulteary

Docker SSL证书

话题讨论 | 云原生应用应该是什么样子?面临的技术挑战有哪些?

xcbeyond

微服务 云原生 Service Mesh 话题讨论

1. 这才是 Python 学习的正确起手姿势,滚雪球学 Python

梦想橡皮擦

Python python 爬虫 2月春节不断更 python入门 python学习

OpenCV简介及其工程应用-游戏色块检测

行者AI

OpenCV

股票配资系统开发

v16629866266

让人“眼前一亮、不明觉厉”的互联网技术PPT

不脱发的程序猿

程序人生 PPT 2月春节不断更 互联网技术PPT 互联网工具

复盘银行的区块链实践:从分布式账本,到产业数字化

CECBC

大数据 银行

重磅发布 | 2021年OpenAtom XuperChain开源技术路径

开放原子开源基金会

区块链 百度 开源 开放原子开源基金会

程序员养家活口接私活必备网站(顺便用技术改变世界)

孙叫兽

程序员 网站 私活

使用APICloud敏捷式开发总结,回顾开发一个完整APP过程。

孙叫兽

App 开发 APICloud 引航计划

话题讨论 |互联网软件技术培训,靠谱吗?

不脱发的程序猿

程序员 程序人生 话题讨论 互联网培训 技术培训

从零开始学Android!15个经典面试问题及回答思路,这原因我服了

欢喜学安卓

android 程序员 面试 移动开发

期末大作业二

心在那片海

Kylin 在携程的实践(下)_架构_apachekylin_InfoQ精选文章