写点什么

博睿数据发布新一代统一告警平台 OneAlert:多源事件统一接入、海量告警降噪收敛

  • 2022-03-01
  • 本文字数:1787 字

    阅读完需:约 6 分钟

博睿数据发布新一代统一告警平台OneAlert:多源事件统一接入、海量告警降噪收敛

近日,博睿数据正式推出了一款多源事件统一接入、海量告警降噪收敛、故障统一管理的新一代告警平台——OneAlert。该平台可以帮助企业在构建数字化运维体系过程中,降低运维成本、提升工作效率,为业务的稳定运行保驾护航。


当前,随着企业数字化转型进程加速,企业的 IT 运行环境日趋复杂,尤其是随着信息化建设的不断深入,信息系统越来越多,各类系统越来越复杂,数据处理量也成倍的增长,极容易产生大面积事件的告警风暴。


为了快速发现自身平台故障,需要使用多个监控平台满足不同场景的监控需求,但各个平台往往互相独立,经常需要在多个平台查看和处理告警,事前发现、事中处理、事后审计都很难统计所有告警信息,使相关人员工作难度加大,导致运维管理成本较高,工作效率低下,运维人员苦不堪言。


博睿数据产品管理部高级总监孙丽在接受 InfoQ 等在内的少数几家媒体采访时表示,当前运维市场监控孤岛化现象非常严重,很多客户监控平台可能达到十几家,包括云厂商监控、容器监控、业务方监控,以及 APM、NPM、DM 厂商监控等等。未来,ITOM 的市场趋势就是统一。因此,统一事件告警平台 OneAlert 应运而生。

数字化趋势下传统 IT 运维的挑战


在数字化趋势下,传统的运维管理流程相关工具暴露了诸多问题。孙丽在接受采访时表示,当前主要存在以下三大问题:


  • 第一,现有的运维系统不是面向业务与用户体验的,而是面向于资源与应用程序的。

  • 第二,孤岛化现象非常严重。尤其是云延伸发展以后,整个环境动态化包括依赖关系特别强,企业业务已经不可观测了。现在监控其实满足不了运维需求,而是需要一个统一的可观测平台。

  • 第三,不够智能。运维工作需要投入大量的精力,如何通过人工智能的方式把运维同学的运维体验和效率提升上去,是一个需要持续思考的问题。总的来说,运维的终级状态就是智能运维,整体上人投入的精力非常低。


博睿数据认为,智能运维绝不仅局限于技术或产品,更是一种理念和策略。智能运维当以数据为基础,以监控为预警,以自动化为导向,以流程为管理,以算法为支撑,以可视化为辅助。基于此,博睿数据发布新一代统一告警平台 OneAlert,助力企业数字化转型。

统一化、规范化、智能化告警管理


据悉,OneAlert 平台是一个集告警接入、告警收敛、告警通知、告警处理、告警分析为一体的统一管理平台,产品整体架构分为事件源的采集层到接入层、存储层、处理层、展示层。



博睿数据首席架构师李骅宸在接受采访时表示,OneAlert 算法框架上层是数据输入,框架里可能有一个接口或者模块,不管是在线实时数据还是离线数据,进行数据传输,数据输入模块之下还有数据计算,主要是在线的聚合实时计算跟指标相关的一些计算技术。下层还要基于过去的日级别、月级别数据,并大量通过 Spark、Haddoop 这种大数据引擎去做一些计算,计算完之后,输出精确的 AI 算法结果的输出模块。


具体而言,OneAlert 平台主要具备以下三大能力:


1、多源事件统一接入,全方位监控覆盖


OneAlert 平台支持对主流运维监控告警源(ZABBIX、Prometheus、阿里云监控等)提供统一的事件接入功能,并对接入的多源异构数据提供标准化的映射处理功能,实现了运维异常事件的全方位监控,避免因自身监控数据相互独立导致重大事件无人发现的监控死角。


2、运维故障标准处理,提升工作效率


接入多来源的告警数据后,OneAlert 平台支持提供统一、实时的故障信息展示,运维人员不再需要登录多个平台查看故障情况,从而提升了异常事件的处理效率;同时,OneAlert 支持针对不同的通知要求选用不同的通知方式,实现将故障快速通知到相关负责人,保证故障及时响应,缩短故障处理时间,最小程度降低对业务的影响;最后,OneAlert 支持对故障进行处理跟踪,实现故障生命周期的闭环管理,使运维故障处理从以前的无序到有序流程化,提升一线运维人员、运维管理人员的整体工作效率。


3、海量告警智能收敛,降低运维成本


OneAlert 平台还支持通过告警降噪功能,对海量杂乱的异常事件进行降噪处理,大大降低了故障分析的信息量;并通过自定义标签收敛、智能 AI 收敛的功能,识别出异常事件之间的关联性,将多个关联事件归并处理成一个故障,从而辅助运维人员聚焦处理关键故障信息,避免告警风暴,极大程度降低整体运维成本。


整体来说,基于博睿数据在运维行业多年的技术积累,OneAlert 平台率先实现了对故障(事前)及时发现、统一管理;(事中)快速响应、精准处理;(事后)分析统计的全生命周期完整管控。

2022-03-01 11:353306

评论

发布
暂无评论
发现更多内容

前端基础二之css篇

ベ布小禅

8月日更

使用账号密码来操作github? NO!

程序那些事

Java GitHub 程序那些事

centos8 mediasoup 搭建

webrtc developer

WebRTC mediasoup

又翻车了?列表点击事件采集那些你不知道的坑!

神策技术社区

数据库 大前端 后端 代码

MaxCompute执行引擎核心技术DAG揭秘

阿里云大数据AI技术

Go1.17正式发布--切片转为数组指针

草原狼

Go 语言

解读短小精悍的 Then 框架

fuyoufang

ios swift 阅读代码 8月日更

用Python爬取《王者荣耀》英雄皮肤数据并可视化分析,用图说话

Python研究者

8月日更

The Data Way Vol.2 | 做个『单纯』的程序员还真不简单

SphereEx

数据库 开源

MySQL 系列教程之(六)DML 操作:数据的增删改

若尘

数据库 MySQL 数据库 8月日更

网络货运平台要智能,安全的数据底座少不了

华为云开发者联盟

数据库 华为云 物流 智慧物流 可视化追踪

OPPO数据湖统一存储技术实践

安第斯智能云

大数据 数据湖 存储

Go语言chan实现原理,彻底搞懂chan读写机制

微客鸟窝

Go 语言 8月日更

史上最大DDoS攻击之争:这三次攻击,谁才是「最大」?

百度开发者中心

最佳实践 方法论 信息安全 案例分析 行业深度

webrtc Rtp/rtcp (1)

webrtc developer

LeetCode题解:217. 存在重复元素,哈希表,JavaScript,详细注释

Lee Chen

算法 大前端 LeetCode

Android技术分享| 自定义ViewGroup实现直播间大小屏无缝切换

anyRTC开发者

android 音视频 实时通信 Android开发 大小屏切换

如何理解 Java 多线程

HoneyMoose

【LeetCode】学生考勤Java题解

Albert

算法 LeetCode 8月日更

价值连城 图灵奖得主Yoshua Bengio约书亚·本吉奥的采访 给AI从业者的建议 John 易筋 ARTS 打卡 Week 60

John(易筋)

ARTS 打卡计划

千亿级模型在离线一致性保障方案详解

百度Geek说

百度 测试 后端

Vue进阶(四十):ref ($refs) 用法详解

No Silver Bullet

Vue 8月日更

老板不让用 AFNetworking,我该怎么办?

神策技术社区

大前端 后端 数据 数据采集

从“人工”到“人工智能”,聊一聊本届东京奥运会的AI黑科技

行者AI

webrtc AlrDetector

webrtc developer

Java 为什么设计成 String 不能用 == 来进行比较

HoneyMoose

七步实现列表点击事件的采集

神策技术社区

大前端 后端 代码

大一一个学期学多少编程算正常?

沉默王二

编程

如何找到程序崩溃的 “凶手” ?

神策技术社区

数据库 程序员 埋点

linux工具之TC

webrtc developer

基于KubeEdge实现中国移动10086客服云边协同平台

华为云原生团队

云计算 开源 运维 边缘计算 边缘技术

博睿数据发布新一代统一告警平台OneAlert:多源事件统一接入、海量告警降噪收敛_文化 & 方法_凌敏_InfoQ精选文章