2025上半年,最新 AI实践都在这!20+ 应用案例,任听一场议题就值回票价 了解详情
写点什么

AWS 发生故障:多处光缆被挖断,历经 11 小时完全修复

  • 2019-06-02
  • 本文字数:1766 字

    阅读完需:约 6 分钟

AWS发生故障:多处光缆被挖断,历经11小时完全修复

北京时间今日凌晨,AWS 多个可用区发生故障,官方发表声明称因多处光缆被挖断。截至今天下午 13:48,AWS 表示所有故障已经完全恢复。


北京时间今日凌晨 2:00,AWS 多个可用区发生故障,相关用户无法连接 Internet。随后,AWS 发表声明表示:“由于 CN-NORTH-1 区域有多处光纤在昨晚的道路施工中被挖断,导致该区域的第一个可用区中 EC2 实例不能访问,同时不能在整个 CN-NORTH-1 区域中新建 EC2 实例。维修团队已找到具体断点,正在尽力恢复。”



据网友爆料,受事故波及影响,三星服务器全线崩溃。用户登录三星部分服务器时,页面报错且无法显示正常状态。打开 Bixy 的时候只会显示 LOGO 然后就闪退,根本无法进入 Bixby,三星商店则一直处于网络错误状态。此外,国内也有多家公司的服务受到影响,VIPKID 通过官方微博表示:“目前已经启动替代方案,受影响区域的线上课程正在陆续恢复,受此影响未能正常完成的课程不会消耗您的课时。”


企业如何自救?

每逢云服务出现宕机,多云这个话题都会被提起,不少用户认为多云可以有效规避单一云服务故障引发的不可用问题。在知乎上,也有不少与多云相关的探讨:



对此,业内专家在接受 InfoQ 采访时表示,作为云服务的采用者,企业首先需要仔细考虑清楚自己的战略,同时了解这些挑战最终可能带来的复杂性、成本和陷阱。在多云部署中,成本可能会成倍增加,这不仅仅是云订单的价格,还有运维成本。虽然一开始通过利用多个云计算提供商来实现成本效率似乎是合理的,但长远来看,缺乏工具和标准以及其他低效率培训和跟踪云平台使用的成本可能代价高昂。


目前,多云支持能力的供应商成熟度差异非常大。虽然一些供应商是早期采用者和开拓者,但彼此之间存在全方位差异,而这种差异使得采用过程非常复杂和低效。此外,从安全性和合规性角度来看,缺乏集成身份和访问管理也是一项重要挑战。


对于云服务故障,企业需要明白,无论是传统环境还是云环境,都不能做到绝对的“持续可用”。大部分情况下,云环境的可用性和可靠性都比传统环境要高,这主要是因为云平台的运维更加专业。既然任何环境都有出现故障的可能,那么需要重视的问题就是“发生故障时,应该怎么办”。


接受风险,这一点很重要。对于现阶段国内的云计算发展进程来看,上云是不可避免的,在这种情况下,企业应该保持正确的心理,毕竟只要是系统,都会发生故障。国内主流云计算厂商已经投入了大量精力和成本在可用性和可靠性层面,这肯定要优于不少技术能力不足、成本有限的企业自建服务器。如果出现这种情况,那么走应急预案,用非系统的方式尽量降低风险。例如,某个服务宕机了,及时在官网做出声明。


其次,分散风险。云环境的同城双活、异地灾备等方案基本就绪,尽量在经济和人员条件可行的情况下使用这些分散风险的方法。如果故障只出在一个服务器集群,采用异地灾备方案可以在最快时间切换到另一个集群,从而保持系统可用。虽然还是会有中断,但是可以最快时间恢复。


按照此模式,云下系统做云上灾备也是防范传统环境出现可用性问题的一种重要手段。作为企业的 IT 人员,日常做到以下四点可以尽可能避免云故障带来的损失。


1、备份、备份,还是备份,要异机异地;


2、数据容灾;


3、业务双活;


4、定期对灾备和双活进行演练。

AWS 历史故障

在过去十年,AWS 也曾发生过几次因不可抗力造成的服务故障。根据不完全统计,2010 年 5 月 11 日,AWS 曾因停电事故出现故障,致使美国东部的少量用户失去服务近一个小时,其事故原因是一辆汽车撞倒了 AWS 数据中心附近的高压电线杆,数据中心的配电开关未能成功切换至内部备用发电机。


2011 年 8 月,亚马逊在北弗吉尼亚州的 EC2 服务发生断网故障,使许多使用亚马逊 Web 服务云计算基础设施的网站和服务临时中断。根据当时的声明,该事故是由于北爱尔兰都柏林出现闪电引起数据中心停电。


2012 年 6 月 14 日,雷暴导致亚马逊在该地区的设施运转异常,发电机无法正常运行,应急电源被消耗,从而导致 Amazon RDS 上近千个 MySQL 数据库宕机,影响了 AWS 多项云服务以及其上的 Quora 等知名网站。


2015 年 9 月 20 日,AWS 的一个数据中心遭遇停电事故,影响了 Netflix,Tinder,Airbnb 等应用程序的在线服务。


2016 年 6 月,澳大利亚悉尼遭遇风暴,AWS 在该地区的设施停电,众多 EC2 实例及为知名公司托管关键负载的 EBS 卷接连出现故障,这次服务中断持续了近 10 个小时。


2019-06-02 17:5117787
用户头像
赵钰莹 极客邦科技 总编辑

发布了 894 篇内容, 共 678.1 次阅读, 收获喜欢 2694 次。

关注

评论 1 条评论

发布
用户头像
AWS不同服务的恢复时间不同,可根据官网日志进行查看,全部恢复于13:48
2019-06-02 18:31
回复
没有更多了
发现更多内容

什么是交叉编译

IT蜗壳-Tango

IT蜗壳教学 6月日更

毕业5年的同学突然告诉我,他已经是年薪50W的Java架构师了

Java架构师迁哥

【案例】构建应急指挥体系,实现生产过程实时监控

星环科技

获5项大奖,发布《云计算开放应用架构标准》,阿里云持续领航云原生

阿里巴巴中间件

Overbit Flash|5 月加密货币市场风暴抹去了 90% 以上的 NFT 交易量

Overbit学院

比特币 加密货币 NFT Overbit 保证金交易

☕【JVM技术之旅】全流程化分析Java对象的创建过程

码界西柚

JVM 6月日更 对象布局 内存结构

三位一体:打造软硬服一体化的区块链平台

趣链科技

区块链 联盟链 Baas 一体机 底层平台

和12岁小同志搞创客开发:如何驱动各类型传感器?

不脱发的程序猿

DIY 传感器 如何驱动各类型传感器? 创客

为鸿蒙OS说两句公道话(我对鸿蒙OS的一些看法)

Phoenix

难忘阿里,4面技术5面HR附加笔试面,走的真艰难真心酸

Java 编程 程序员 面试 架构师

小树量化机器人系统开发(马丁策略)

薇電13242772558

区块链 数字货币

亮相Google I/O,字节跳动是这样应用Flutter的

字节跳动技术团队

ETL工程师必看!超实用的任务优化与断点执行方案

敏捷调度TASKCTL

大数据 ETL算法 ETL ETL任务 ETL系统

GitHub火到糊!这份阿里内部10W字Java面试总结,让你薪资翻倍

Java架构追梦

Java 架构 面试 跳槽

新手小白必须知道的Linux基础:常用命令(1)

学神来啦

Linux linux命令 linux运维 linux 文件权限控制 Linux教程

从一面就被拒到收割字节offer,我花了一年时间,功夫不负有心人

Java架构师迁哥

【LeetCode】连续数组Java题解

Albert

算法 LeetCode 6月日更

华为云IoT设备接入服务全体验

华为云开发者联盟

物联网 IoT 华为云 智能IoT边缘服务 华为云IoT云服务

2021年阿里/腾讯/美团/字节1万道Java中高级面试题汇总,新鲜出炉

Java架构师迁哥

anyRTC Web SDK 实现音视频呼叫功能

anyRTC开发者

音视频 WebRTC RTC sdk

有道精品课全链路测试的改进和思考

有道技术团队

测试 有道精品课

【融云技术】超大规模并发下自定义属性的设置与分发

融云 RongCloud

Java日志的心路历程

程序猿阿星

Java log4j logback log4j2框架 Java日志

前后端分离浅析以及分离教程

北游学Java

前后

一文回顾 Java 入门知识(中)

逆锋起笔

Java 后端 JAVA开发 java基础 javase

Qcon全球软件开发大会 融云分享SDK交付质量保障经验

融云 RongCloud

【星环案例】我们用TDH+Sophon把工厂“搬”进高校实验室,推进产学研一体化

星环科技

一周信创舆情观察(5.24~5.30)

统小信uos

Fabric架构演变之路

趣链科技

区块链 fabric 联盟链架构 演变

将DataX执行结果通过钉钉上报

白粥

DataX

踩准时钟节拍、玩转时间转换,鸿蒙轻内核时间管理有妙招

华为云开发者联盟

鸿蒙 时间管理 计数器 时间转换 计时

AWS发生故障:多处光缆被挖断,历经11小时完全修复_服务革新_赵钰莹_InfoQ精选文章