写点什么

博睿数据发布新一代统一告警平台 OneAlert:多源事件统一接入、海量告警降噪收敛

  • 2022-03-01
  • 本文字数:1787 字

    阅读完需:约 6 分钟

博睿数据发布新一代统一告警平台OneAlert:多源事件统一接入、海量告警降噪收敛

近日,博睿数据正式推出了一款多源事件统一接入、海量告警降噪收敛、故障统一管理的新一代告警平台——OneAlert。该平台可以帮助企业在构建数字化运维体系过程中,降低运维成本、提升工作效率,为业务的稳定运行保驾护航。


当前,随着企业数字化转型进程加速,企业的 IT 运行环境日趋复杂,尤其是随着信息化建设的不断深入,信息系统越来越多,各类系统越来越复杂,数据处理量也成倍的增长,极容易产生大面积事件的告警风暴。


为了快速发现自身平台故障,需要使用多个监控平台满足不同场景的监控需求,但各个平台往往互相独立,经常需要在多个平台查看和处理告警,事前发现、事中处理、事后审计都很难统计所有告警信息,使相关人员工作难度加大,导致运维管理成本较高,工作效率低下,运维人员苦不堪言。


博睿数据产品管理部高级总监孙丽在接受 InfoQ 等在内的少数几家媒体采访时表示,当前运维市场监控孤岛化现象非常严重,很多客户监控平台可能达到十几家,包括云厂商监控、容器监控、业务方监控,以及 APM、NPM、DM 厂商监控等等。未来,ITOM 的市场趋势就是统一。因此,统一事件告警平台 OneAlert 应运而生。

数字化趋势下传统 IT 运维的挑战


在数字化趋势下,传统的运维管理流程相关工具暴露了诸多问题。孙丽在接受采访时表示,当前主要存在以下三大问题:


  • 第一,现有的运维系统不是面向业务与用户体验的,而是面向于资源与应用程序的。

  • 第二,孤岛化现象非常严重。尤其是云延伸发展以后,整个环境动态化包括依赖关系特别强,企业业务已经不可观测了。现在监控其实满足不了运维需求,而是需要一个统一的可观测平台。

  • 第三,不够智能。运维工作需要投入大量的精力,如何通过人工智能的方式把运维同学的运维体验和效率提升上去,是一个需要持续思考的问题。总的来说,运维的终级状态就是智能运维,整体上人投入的精力非常低。


博睿数据认为,智能运维绝不仅局限于技术或产品,更是一种理念和策略。智能运维当以数据为基础,以监控为预警,以自动化为导向,以流程为管理,以算法为支撑,以可视化为辅助。基于此,博睿数据发布新一代统一告警平台 OneAlert,助力企业数字化转型。

统一化、规范化、智能化告警管理


据悉,OneAlert 平台是一个集告警接入、告警收敛、告警通知、告警处理、告警分析为一体的统一管理平台,产品整体架构分为事件源的采集层到接入层、存储层、处理层、展示层。



博睿数据首席架构师李骅宸在接受采访时表示,OneAlert 算法框架上层是数据输入,框架里可能有一个接口或者模块,不管是在线实时数据还是离线数据,进行数据传输,数据输入模块之下还有数据计算,主要是在线的聚合实时计算跟指标相关的一些计算技术。下层还要基于过去的日级别、月级别数据,并大量通过 Spark、Haddoop 这种大数据引擎去做一些计算,计算完之后,输出精确的 AI 算法结果的输出模块。


具体而言,OneAlert 平台主要具备以下三大能力:


1、多源事件统一接入,全方位监控覆盖


OneAlert 平台支持对主流运维监控告警源(ZABBIX、Prometheus、阿里云监控等)提供统一的事件接入功能,并对接入的多源异构数据提供标准化的映射处理功能,实现了运维异常事件的全方位监控,避免因自身监控数据相互独立导致重大事件无人发现的监控死角。


2、运维故障标准处理,提升工作效率


接入多来源的告警数据后,OneAlert 平台支持提供统一、实时的故障信息展示,运维人员不再需要登录多个平台查看故障情况,从而提升了异常事件的处理效率;同时,OneAlert 支持针对不同的通知要求选用不同的通知方式,实现将故障快速通知到相关负责人,保证故障及时响应,缩短故障处理时间,最小程度降低对业务的影响;最后,OneAlert 支持对故障进行处理跟踪,实现故障生命周期的闭环管理,使运维故障处理从以前的无序到有序流程化,提升一线运维人员、运维管理人员的整体工作效率。


3、海量告警智能收敛,降低运维成本


OneAlert 平台还支持通过告警降噪功能,对海量杂乱的异常事件进行降噪处理,大大降低了故障分析的信息量;并通过自定义标签收敛、智能 AI 收敛的功能,识别出异常事件之间的关联性,将多个关联事件归并处理成一个故障,从而辅助运维人员聚焦处理关键故障信息,避免告警风暴,极大程度降低整体运维成本。


整体来说,基于博睿数据在运维行业多年的技术积累,OneAlert 平台率先实现了对故障(事前)及时发现、统一管理;(事中)快速响应、精准处理;(事后)分析统计的全生命周期完整管控。

2022-03-01 11:353267

评论

发布
暂无评论
发现更多内容

书单推荐|不惧复工,工作轻松

图灵教育

书单 复工

即将开营|报名获取跨平台与热更新技术操作秘籍!

字节跳动终端技术

flutter 移动开发 插件化 动态化 SDK热更新

这道JS经典面试题不要背,今天带你彻底搞懂它!

茶无味的一天

JavaScript 面试

Java 函数式编程

Ayue、

java8

上海锡鼎正式加入openGauss社区

2022-10-8

留白的艺术

什么是DataOps?DataOps与DevOps 有什么区别?

雨果

DataOps

浪潮信息成为龙蜥理事单位,共建开放计算生态和行业方案

OpenAnolis小助手

开源 操作系统 产业链 龙蜥社区 浪潮信息

企业应该如何进行知识管理?

Baklib

知识管理 知识库

leetcode 94. Binary Tree Inorder Traversal 二叉树的中序遍历(中等)

okokabcd

LeetCode 数据结构与算法

2022最强Java面试八股文,大厂offer直通车(跳槽天花板就是你)

程序知音

java面试 后端技术 Java面试八股文 Java后端开发 后端架构开发

OpenStack第26版Zed已发布

极客天地

小程序该怎么挖掘App流量

Geek_99967b

小程序

小程序插件其实很简单

Geek_99967b

小程序 小程序插件

大数据ELK(十七):Elasticsearch SQL 订单统计分析案例

Lansonli

10月月更 Elasticsearch SQL

《软件开发的201个原则》思考:8.与客户/用户沟通

非晓为骁

个人成长 软件工程 软件开发201原则

详解MySQL之事务

C++后台开发

MySQL mysql事务 中间件 后端开发 C++开发

Dubbo Mesh 总体技术架构方案

阿里巴巴云原生

阿里云 云原生 dubbo

数据工程师吐槽:数据API开发的那些烦心事

雨果

数据api

【愚公系列】2022年10月 Go教学课程 022-Go容器之字典

愚公搬代码

10月月更

技术管理 之 技术

码猿外

技术管理

DeepRec 大规模稀疏模型训练推理引擎

阿里云大数据AI技术

深度学习 推理 稀疏模型 企业号十月 PK 榜

开拓“流程智能蓝海”丨九科信息董事&产品VP傅恺受邀分享流程挖掘实践案例

九科Ninetech

AI RPA 数字化转型 企业服务 流程挖掘

微信朋友圈高性能复杂度分析

Geek_1264yp

书单推荐|不惧复工,工作轻松

图灵社区

书单 复工

【Nacos源码之配置管理 七】服务端增删改配置数据之后如何通知集群中的其他机器

石臻臻的杂货铺

nacos 10月月更

5 分钟完成 ZooKeeper 数据迁移

阿里巴巴云原生

阿里云 微服务 云原生 MSE

学会一行CSS即可提升页面滚动性能

茶无味的一天

CSS JavaScript chrome 前端 js

借助小程序框架打破APP开发壁垒

Geek_99967b

小程序

《高性能MySQL 第四版》正式上市

MySQL 数据库

Qt|编译QuaZip以及程序应用

中国好公民st

c++ qt 10月月更

博睿数据发布新一代统一告警平台OneAlert:多源事件统一接入、海量告警降噪收敛_文化 & 方法_凌敏_InfoQ精选文章