有奖征文 | 火山引擎开发者社区联合 InfoQ 写作社区第四届征文大赛来袭! 了解详情
写点什么

Nurse:LinkedIn 的运维自动化修复系统

  • 2015-08-03
  • 本文字数:1541 字

    阅读完需:约 5 分钟

目前,LinkedIn 已经成为全球最大的职业社交网站,其会员人数超过 3.6 亿。随着网站的迅速发展,其维护成本也不断增加,公司员工从几百人增加到数千人。为了维护网站能够正常运转和发展,LinkedIn 设置了一个专门的运维工程师团队,来充分了解网站的每个组件,并确保能够迅速解决网站的问题。然而,近些年网站遇到问题的数量增加了十几倍,使得人工解决问题越来越难。于是,LinkedIn 近期开发了自动修复系统—— Nurse
接下来,本文就 LinkedIn 的自动修复系统进行介绍。

LinkedIn 的网站可靠性工程师 Brian Cory Sherwin 表示,LinkedIn 之前都是采用人工手段来探测和解决网站运行中出现的问题。站点的稳定全都依靠工程师的双眼进行发现,然后利用双手进行手动。然而,从 2010 年到 2015 年,网站遇到问题的数量增加了 18 倍,而工程师数量却只增加了个位数。为了网站的稳定发展,LinkedIn 高层面临了一个重要选择——是相应的增加工程师数量还是设计一个自动的系统来完成大部分工作。当然,根据诸多网站发展的经验,LinkedIn 选择了后者。

作为开发自动修复系统的第一步,开发工程师们需要确定如何利用计算机算法来发现并解决问题。之前,LinkedIn 已经建立一个单独的监控系统。该系统包括了几十万个传感器,能够迅速发现网站异常,并向工程师们发出警告。然而,对于一个自动修复系统,只是发现问题肯定是远远不够的。该系统需要能够自行解决一些比较简单和常见的问题。只有对于无法自动解决的复杂问题,系统进行分类和简单分析后,将其提交给工程师解决。

那么,在发现一个问题之后,系统如何进行分析和解决呢?例如,对于一个具体的问题,基于现象的警告只能说明表相——服务器无法登陆或者应用掉线等。然而,其背后的原因可能多种多样,包括进程失效、服务器崩溃等等。在人工处理情况下,运维工程师会进一步详细分析这些现象,发掘出具体的原因,并相应的执行不同的修复步骤。自动修复系统采用了类似的处理方法。LinkedIn 团队把监控系统所发现的问题送到具体的请求工作流中。这些工作流再根据工程师之前内置的算法和动作来修复网站。以应用程序掉线为例,监控系统发现一台机器处于异常状态,无法服务数据流。之后,数据流会收集事件发生的原因、根据内置算法重启相关进程并把整个数据流的结果放置到卡片中。通过这些自动化的流程,工程师就可以避免把大量精力用在简单问题的处理上,从而把更多精力放置到复杂、深入问题方面的分析和研究中,保证网站长期健康发展。

此外,LinkedIn 已经把 Nurse 与其他系统进行了完美集成。在多个系统中间,Nurse 扮演着中间人的角色。监控系统会把修复工作流的请求发送到该 Nurse,进行问题修复。目前,LinkedIn 已经把代码部署系统、售票系统、远程执行系统等与 Nurse 集成在一起。而且,公司允许站点运维工程师和运维工程师把解决常见问题的方法放置到系统中,供系统自动学习。

在实际测试中,LinkedIn 已经证实了 Nurse 系统的用途。 Sherwin 表示,针对突然断电导致的大量服务器掉线的情况,Nurse 在数分钟即完成了服务器状态的恢复,执行速度大大优于人工解决的情况。而且,Nurse 目前每周会执行 150 个小时的修复工作流,大大节约了工程师的时间和精力。

未来,LinkedIn 会继续对 Nurse 进行改进。其考虑增加和完善的功能包括减少监控系统的资源消耗、减少从异常状态恢复的时间以及允许运维工程师更多的关注基于现象的警告等。而且,该系统为同类型公司和其他网站提供了一定的借鉴。相信未来会有更多的公司推出自动修复系统。


感谢徐川对本文的审校。

给InfoQ 中文站投稿或者参与内容翻译工作,请邮件至 editors@cn.infoq.com 。也欢迎大家通过新浪微博( @InfoQ @丁晓昀),微信(微信号: InfoQChina )关注我们,并与我们的编辑和其他读者朋友交流(欢迎加入 InfoQ 读者交流群)。

2015-08-03 07:392659
用户头像

发布了 268 篇内容, 共 116.2 次阅读, 收获喜欢 24 次。

关注

评论

发布
暂无评论
发现更多内容

代码写的烂才是原罪?字节三面+微信四面+PayPal四面,大厂面经分享

Java 程序员 架构 面试

本科毕业六年,备战一个月,四面阿里巴巴定级P7

Java架构师迁哥

从底层原理出发,了解Linux内核之内存管理

Linux服务器开发

后端 操作系统 内存管理 Linux内核 底层原理

花了三个小时把一份GitHub上标星115k的《Java超全进阶教程》整理成了PDF文档。

Java架构之路

Java 程序员 架构 面试 编程语言

如何在 Electron 上实现 IM SDK 聊天消息全文检索

网易云信

全文检索 Electron IM

即时通讯系列-WorkPlus简介

WorkPlus

开源 即时通讯 IM 办公自动化

不愧是清华大佬,一个联机对战游戏就把23种设计模式给抽丝剥茧了

Java架构师迁哥

别乱打日志了,这才是正确的打日志姿势!

xcbeyond

日志 规范 6月日更

入职美团定级P7,总结2021年最新180道高级岗面试题及答案

Java架构师迁哥

从零开始学习3D可视化之坐标系

ThingJS数字孪生引擎

物联网 可视化 数字时代 3D模型 3D可视化

干货:ANR日志分析全面解析

vivo互联网技术

android 堆栈 日志分析 anr

聚焦机器同传前沿进展,第二届机器同传研讨会将在NAACL举办

百度大脑

人工智能 机器

探讨AI人才培养新思路,2021北京智源大会百度AI人才培养论坛召开

百度大脑

AI 人才培养

京东T8Java架构师呕心沥血总结整理的《15w字的Java面试手册》免费开放分享给大家复习。

Java架构之路

Java 程序员 架构 面试 编程语言

老同学突然升到了阿里P7,只因偷偷掌握了JVM的奥秘?

Java架构师迁哥

一文读懂开源项目 OpenHarmony2.0

科技热闻

@成都的Coder

蚂蚁集团移动开发平台 mPaaS

flutter 移动开发 mPaaS

阿里都会问些什么?4面阿里余额宝Java高级技术岗

Java架构师迁哥

上云就上百度智能云,百度智能计算峰会召开,AI原生云全新升级

百度大脑

AI 智能云 峰会

java中的NIO和IO到底是什么区别?20个问题告诉你答案

华为云开发者联盟

Java io nio buffer channel

带你遨游银河系的十种分布式数据库

悟空聊架构

数据库 分布式 分布式数据库 6月日更

解读革命性容器集群CCE Turbo:计算、网络、调度全方位加速

华为云开发者联盟

容器 华为云 CCE Turbo 集群服务器

看Kunpeng BoostKit 使能套件如何实现大数据场景倍级性能提升

华为云开发者联盟

大数据 开源 鲲鹏 鲲鹏计算 Kunpeng BoostKit

iOS开发-Objective-C 中的 MVVM 模式介绍

iOSer

ios objective-c MVVM ios开发

普通二本,吃透这份阿里高级专家的《Java面试手册21版》成功拿下腾讯offer

Java架构师迁哥

2021版最新!字节跳动3面+腾讯6面一次过,谈谈我的大厂面经

Java架构之路

Java 程序员 架构 面试 编程语言

博客

vincentjia

双非本科逆袭记,阿里技术四面+交叉面+HR面,成功拿到offer

Java架构师迁哥

限流篇,欣赏阿里开源Sentinel

下雨喽

架构 设计 sentinel 限流

大陆集团携手亚马逊云科技打造创新的汽车软件平台

亚马逊云科技 (Amazon Web Services)

学历不够,技术来凑,8年开发经验,逆袭拿到阿里P7岗

Java架构师迁哥

Nurse:LinkedIn的运维自动化修复系统_语言 & 开发_张天雷_InfoQ精选文章