阿里、蚂蚁、晟腾、中科加禾精彩分享 AI 基础设施洞见,现购票可享受 9 折优惠 |AICon 了解详情
写点什么

influxDB 集群模式实践

  • 2019-12-09
  • 本文字数:2004 字

    阅读完需:约 7 分钟

influxDB集群模式实践

1 基础概念

TSDB 与传统 DB 比较

  1. 传统数据库多用于记录数据的当前值。

  2. 时序数据库记录基于时间的一系列数据。

TSDB 应用场景

由时序产生,并且需要展现其历史趋势、周期规律、异常性的,进一步对未来做出预测分析的,都是时序数据库适合的场景。具体场景:各类设备的监控数据,医学中的血糖、血压、心率的监控数据,金融业中交易、成交数据等。

为什么选择 influxdb

  1. 开发者社区活跃,使用者众多,开源时间较长。性能经过检验;

  2. 类 SQL 的插入、查询语言,不会增加太大的学习成本;

  3. 原生 HTTP 接口支持各类语言调用;

  4. 仅仅作为存储方案,可插拔。

influxdb 之 TSM 存储引擎概述

  • TSM 存储引擎主要由几个部分组成:

  • cache。在内存中是一个简单的 map 结构默认配置文件中为 1g。

  • wal。记录内容和 cache 一样,目的是为了持久化 cache 数据,influxdb 启动时会加载 wal 的数据到内存。

  • tsm file。用于数据存储。

  • compactor。主要进行两类操作:

  • cache->snapshot->tsm;

  • 合并小 tsm 成为大的 tsm。

Shard——TSM 存储引擎之上的概念


  1. 按时间戳所在不同范围创建不同 Shard;

  2. 根据时间可以快速定位要查询的数据资源,加快查询的过程;

  3. 让根据时间的批量删除操作变得非常简单且高效。

2 项目由来

  1. influxdb 社区版默认并未提供集群解决方案。

  2. 官方开源的 influxdb-relay 仅仅支持双写功能,并未支持负载均衡能力。

  3. 饿了么开源的 influx-proxy 集群方案组件众多,安装部署、后期维护成本高、复杂度大。

  4. 360 公司内部需求:提供十万台主机的两百个监控项数据的实时出图、访问,基于这些监控项的告警以及故障预测。

  5. 基于上述需求,于是有了 influxDB-HA 项目。

3 程序架构

官方开源 influxdb-relay 方案


未解决的问题:


  1. 采用双写仅仅解决了数据备份的问题,并未解决 influxdb 读写性能的问题;

  2. 只是写入了数据,查询还是需要去读 influxdb。增加了配置文件的复杂度不易维护;

  3. 并未对写入失败的数据做任何重试机制的处理。

饿了么 influxdb 高可用解决方案


优势:


  1. influx-proxy 是饿了么在 influxdb-relay 满足不了其性能要求、配置维护要求痛定思痛后重构的产物;

  2. influxdb 机器支持动态扩缩;

  3. 增加了强大的请求失败后的重试机制。


劣势:


  1. 架构中使用的组件较多,增加了使用者的学习成本,且不易于后期的维护;

  2. 请求失败重试本身是双刃剑,试想机器性能达到极限,重试无形中又增加了机器的负载;

  3. 与自身场景需求不相符,我们内部只是做监控数据的持久化存储,应该是最简单的接入和与 influxdb 最小的架构改造。

360 内部 influxDB-HA 解决方案


优势:


  1. 以 measurement 为最小拆分单元,从而保证以时序查询 influxdb 的高效性。

  2. 支持业务层动态的拆库、拆表操作。

4 性能比较

与单机 influxdb 磁盘 IO 对比。



与单机 influxdb CPU 使用对比。


5 业务方接入 influxDB-HA 说明

influxDB-HA 管理 influxdb 实例配置。



Grafana 接入 influxDB-HA 说明。



三方程序接入 influxDB-HA 写入数据说明。


  1. 完全兼容 influxdb 原生的/write 接口方式写入,且支持原生查询接口的所有参数;

  2. 如果您说您以前习惯了使用 influxdb 的 SDK 方式写入,那也恭喜您。influxDB-HA 支持任何语言的 influxdb SDK 接入。

6 后期迭代计划

一个优秀的项目需要经历无数的版本迭代和优化,而对于开发者而言,能兼容各类需求、适应各类场景是沉淀、提升技术的不二法门。鉴于此,我们应该不断完善 influxDB-HA 以支持 360 内部各类使用场景。接来下,仅提出未来可见的优化点:


  1. 接入 kafka、RabbitMQ 做写入请求之前的缓冲,降低数据丢失的风险;

  2. influxDB-HA 配置文件的热加载(目前已经通过 golang 的 fsnotify 库实现,将来更大规模的 influxDB-HA 集群应该通过 etcd 等外部的配置统一管理来实现);


对接业务方分表,以支持更大数据规模场景下的解决方案,measurement 始终作为 influxDB-HA 集群中可拆分的最小单元,避免不同 measurement 的合并排序问题。

7 influxdb 使用注意事项

经过一段时间(近一个多月)的实践和对 influxdb 性能的综合观察,总结出以下结论供我们大家一起探讨:


1、continuous queries/select:


笔者看见很多对于 influxdb 的不满来自于对其性能的诟病。然而有目共睹的是其写入性能是极其优秀的,那究竟查询性能如何呢?


实践总结:对于超过 10 万样本数据的查询操作而言,我们通过索引(即 influxdb 中的 tag)查询将能够节省机器性能,大大降低查询时间。查询操作往往耗死机器的根本原因是:OOM(Out Of Memory)


那么在配置 CQ 时,应该:


  • 尽可能使用 tag;

  • 应该拿写好的 CQ 充分模拟线上环境的测试,证明性能没问题后再上线。


2、retention policy:


配置数据的留存策略好处是数据持久化,但数据量较大时劣势也非常明显,会占用很大的 CPU,造成读写数据异常。所以配置 RP 时我们必须注意:


  • 尽量在读写并发量较小的时刻去操作;

  • 可以在 influxdb slave 库中反复设置 RP 实践出最佳方式再上线。


本文转载自公众号 360 云计算(ID:hulktalk)。


原文链接:


https://mp.weixin.qq.com/s/erNqCgUTEIVygNknydlPag


2019-12-09 10:055809

评论 1 条评论

发布
用户头像
说了别人为啥不高可用,但却没说自己哪里高可用了
2021-07-14 09:13
回复
没有更多了
发现更多内容

攻克美颜、虚拟背景、眼神接触多个难题,腾讯会议技术领先的秘诀找到了

科技热闻

iofod - 为攻城师们打造的低代码平台

iofod jude

低代码 实用工具

兼容认证|天融信太行云与观测云完成产品兼容性互认证

观测云

头脑风暴:完全平方数

HelloWorld杰少

算法 LeetCode 数据结构, 8月月更

15条建议,把技术成果写成一篇高质量学术论文

阿里技术

经验分享

自研发RTC退退退!接入第三方RTC才是真的香

擎声科技

RTC 实时音视频 社交APP出海 泛娱乐出海 擎声Qtt

故障复盘后的告警如何加出效果?浙江移动等老司机总结了6条注意事项

TakinTalks稳定性社区

开源一夏 | 使用 CSS 的仿 GitHub 登录页面

海拥(haiyong.site)

开源 8月月更

Gartner:云安全面临的三大挑战以及三个对应策略

WorkPlus

如何开发一款基于 Vite+Vue3 的在线表格系统(上)

葡萄城技术团队

Vue 前端 vite 框架 系统开发

Tapdata 与麒麟软件完成兼容性互认证,国产化生态布局再跃步

tapdata

Tapdata Tapdata架构

Apache Doris 助力网易严选打造精细化运营 DMP 标签系统

SelectDB

数据分析 OLAP Doris 多维分析 DMP

一文讲透研发,SRE,运维,DevOps 的区别

Bytebase

DevOps SRE dba database

重新定义容器化 Serverless 应用的数据访问

阿里巴巴中间件

云计算 阿里云 Serverless 容器 云原生

【LeetCode】设计有序流Java题解

Albert

LeetCode 8月月更

EMQX企业版正式上架华为云OSC,助力企业实现云原生MQTT Broker的全生命周期管理

EMQ映云科技

物联网 华为云 mqtt emqx 8月月更

LeaRun.Java微服务快速开发平台

力软低代码开发平台

当云走向行业垂直化,企业该如何应对?

WorkPlus

合并两个有序单链表,对象析构这一着我实在没想到。

清风莫追

8月月更

【数独 1】不回溯,试试候选数法1ms高效解数独谜题-C++实现

清风莫追

8月月更

大数据培训中心哪家比较靠谱

小谷哥

政企组织为什么更需要私有化的IM即时通讯平台?

WorkPlus

灵感宝盒图谱全新改版!代码实验室开启报名丨RTE NG-Lab 双周报

声网

人工智能 RTE NG-Lab

Seata-php 入门与下半年展望

apache/dubbo-go

个推漫话数据智能 | 《天才基本法》中的贝叶斯网络及原理解读

个推

人工智能 机器学习 深度学习 算法模型

排查 log4j2 安全漏洞的一次经历

观测云

融云 | 企业通讯录的设计与实现

融云 RongCloud

通信 企业

音视频大佬离职后,我是如何在短时间内在音视频开发做出一个性价比高的最优方案

擎声科技

开发者 RTC sdk 实时音视频 擎声Qtt

Jedis 客户端

武师叔

8月月更

<T>和<?>区别

六月的雨在InfoQ

开源 T 8月月更

科创板的一束“海光”,正在让中国半导体发展之路更清晰

脑极体

influxDB集群模式实践_文化 & 方法_360云计算_InfoQ精选文章