写点什么

NASA 太难了:将 247 PB 数据放到 AWS 却付不起高额下载成本

  • 2020-04-07
  • 本文字数:2363 字

    阅读完需:约 8 分钟

NASA太难了:将247 PB数据放到AWS却付不起高额下载成本

本文首发于 InfoQ Pro,更多精彩内容抢先看,尽在 InfoQ Pro


单是这一项决策失误,就让 NASA 的云战略从天堂瞬间跌进了地狱。


到 2025 年,美国宇航局(NASA)计划新增 215 PB 数据存储空间,并希望 AWS 能够提供其中大部分云存储的容量。但让 NASA 没想到的是:把数据迁移至云端之后,出口端的数据下载成本却大幅激增,而他们并没给这笔投入做预算。


换句话说,以后科学家们必须得付费才能下载这些本就属于他们的数据。


单是这一项决策失误,就让 NASA 的云战略从天堂瞬间跌进了地狱。


按原定计划,NASA 到 2025 年将拥有 247 PB 的数据处理能力,这些数据放在云端。NASA 跟 AWS 签下的是一笔多大的单子呢?每月花费达 543.9 万美元。到 2025 年,除 6500 万美元的原有交易额外,NASA 每年还得额外向 AWS 支付约 3000 万美元的新增云服务开销。


NASA 忘了一个前提——云端数据下载成本

受到影响的数据主要来自 NASA 下辖的地球科学数据与信息系统(ESDIS)计划,此项计划旨在从与地球观测相关的众多空间任务中收集信息。收集完成后,相应读数将由地球观测系统数据与信息系统(EOSDIS)向各研究机构交付。


为了存储所有数据并支持整套 EOSDIS,NASA 运营有 12 处分布式主归档中心(DAAC),并借此带来安全稳定的冗余和备份。但沉重的基础设施管理负担也让宇航局倍感压力,因此在 2019 年,他们决定选择 AWS 托管所有基础设施,并逐步通过 Earthdata Cloud 项目将观测记录迁移至亚马逊云。从本地存储向云端的首次数据迁移,原本计划在 2020 年第一季度进行,剩余部分则后续分批处理。宇航局方面希望能在未来几年内,陆续将全部数据迁移至云环境当中。


NASA 当然很清楚,接下来还将有 PB 级别的数据洪流不断涌来。后期预计约有 15 个即将上线的新任务考验这套新的基础设施,包括 NASA-ISRO 合成孔径雷达(NISAR),以及用于检测地表水与海洋地形(SWOT)的专用卫星,它们每天都将产生超过 100 TB 的数据。这里之所以着重强调 SWOT 与 NISAR,是因为二者将成为首批直接将数据转为存储至 Earthdata Cloud 的空间科研项目。


按预定计划发展,宇航局方面到 2025 年将拥有 247 PB 的数据处理能力,远远高于目前的 32 PB。


宇航局对这项云端计划本来是颇为兴奋的,并在迁移项目文档中提到:


美国宇航局地球科学数据的研究员与商业用户将得以快速访问并处理大量数据,加快研究与分析速度。以往在地理层面相互孤立的数据现在可以通过云端统一访问,从而节约时间与资源。


但他们忘了一个前提——数据下载成本。


这是一个现实但却极易被忽视的问题,NASA 监察长在今年 3 月发布的审计报告中注意到:EOSDIS 并没有在这项云端计划当中正确核算数据在出口端被下载产生的费用。


监察长办公室评论道,“具体来看,NASA 忽略了从云端传出数据所带来的成本大幅提升这一问题。”目前,在用户通过 DAAC 访问数据时,宇航局方面并不会承担额外的成本。“但如果最终用户从 Earthdata Cloud 处下载数据,那么每次数据传出都会给 NASA(而非用户)增加对应的成本。”


“这意味着 ESDIS 将面临巨大的“云出口”成本。最终,ESDIS 将同时面临 12 处 DAAC 的成本,外加云资源使用成本(包括出口费用)。”

NASA 为何总犯这样愚蠢的错误?

更糟糕的是,宇航局方面“还没有确定具体需要将哪些数据迁移至 Earthdata Cloud,也尚未根据运营经验、使用情况与出口指标组织成本模型。”


“结果就是,现有的预估成本可能会远远低于未来运营中的实际成本:把数据迁移到云端反而会令整个体系变得成本高昂且难以管理。”


不止如此,监管机构得出的结论是,“总体而言,如果出于成本控制的考量而对数据输出量加以限制,那么宇航局的最终用户很可能无法获得必要的科学数据。”


最重要的是,这份报告还发现项目的组织方并没有进行过充分咨询,没能遵循 NIST 提出的数据完整性标准,甚至因为审计团队中的半数成员都直接参与到项目当中,而未能在内部审计流程中充分考虑到成本节约的问题。


下面是审计机构提出的三点建议:


一旦 NISAR 与 SWOT 投入运行并产生足够的数据,宇航局方面应对其进行独立分析,借此确定在保持现有 DAAC 设施之外推动云迁移与云运营,是否具备长期的财务可持续性。


结合相关机构提供的指导,宇航局应在数据管理计划制定期间之内,特别是 ESDIS 与 OCIO 任务的生命周期早期,对这两个项目的运营需求进行协调。


确保在 DAAC 分类过程中考虑到所有适用的信息类型,确定在哪些条件下适合使用本地基础设施,并将这种分类程序组织为新的标准。


通过以下账目,可以看到 NASA 跟 AWS 签下的是一笔多大的单子:通过亚马逊方面提供的云成本计算器,我们发现在 S3 服务当中存储 247 PB 数据(配合即用即付计费模式),如果不包括 12% 的套餐折扣的话,每月的花费高达惊人的 543.9 万美元。审计结果同时显示,到 2025 年,除了高达 6500 万美元的原有交易额外,NASA 每年还得额外向 AWS 支付约 3000 万美元的新增云服务开销。


我们用不着像火箭科学家那么聪明,也能轻松理解数据出口端成本这个基本概念。这就更让人惊讶了,像 NASA 这样一个能够把真人送入地球轨道、甚至向火星发射探测器的顶尖机构,居然也会犯下这样愚蠢的错误。


事实证明,NASA 犯的错可不止这么一点。就在前几天,我们还从他们移动发射架项目的审计报告中发现了新的猛料。有些朋友可能不太熟悉,所谓移动发射架,专为 SLS 及 Orion 火箭及太空舱组装、运输与发射所设计的大型运载工具。


审计报告显示,该项目在“ML-1 的开发过程已经造成严重的成本超支,且项目进度远远落后于预期。截至 2020 年 1 月,为满足 SLS 要求而对 ML-1 进行的改造工作已经花费 6.93 亿美元,而宇航局方面 2014 年 3 月给出的初步预算仅为 3.08 亿美元。与此同时,项目的当前进度也比原定计划落后了三年有余。”


参考链接:


https://www.theregister.co.uk/2020/03/19/nasa_cloud_data_migration_mess/?



2020-04-07 09:273782

评论

发布
暂无评论
发现更多内容

计算机视觉和滤帧技术

鲸品堂

计算机视觉 图像 企业号 7 月 PK 榜

3D云渲染的优点和缺点是什么?

Finovy Cloud

直播回顾|用户增长之路,如何兼具体验和点击率?

HarmonyOS SDK

HMS Core

亚信科技荣任「DBL电信行业工作组」副组长单位,AntDB数据库连年入选《中国数据库产品图谱》

亚信AntDB数据库

AntDB 数据库· AntDB数据库 企业号 7 月 PK 榜

ChatGPT的探索与实践-业务应用篇 | 京东云技术团队

京东科技开发者

人工智能 ChatGPT 企业号 7 月 PK 榜

再获肯定!柏睿数据通过国家级专精特新“小巨人”企业复核

新消费日报

ChatGPT助力DevOps的优势与局限

互联网工科生

DevOps 自动化运维 ChatGPT

直播软件源码开发搭建提高安全性方案——山东布谷科技创作

山东布谷科技

源码 软件 软件开发 直播 源码搭建

火山引擎DataLeap如何解决SLA治理难题(二):申报签署流程与复盘详解

字节跳动数据平台

大数据 数据中台 数据研发

DDD架构为什么应该首选六边形架构? | 京东云技术团队

京东科技开发者

分层架构 架构设计 企业号 7 月 PK 榜 六边形架构

百度 APP iOS 端包体积 50M 优化实践 (四) 代码优化

百度Geek说

ios 代码优化 企业号 7 月 PK 榜

使用 JavaScript 脚本来进行复杂的查询改写

极限实验室

Java JavaScript

自动化接口回归测试神器 AREX 使用初体验

AREX 中文社区

自动化测试 AWS 流量回放

认识高性能服务治理框架 Kmesh

openEuler

Linux 开源 操作系统 openEuler 服务网格

MobPush Android For Unity

MobTech袤博科技

开发者 前端 Unity Android; Java’

华为云CodeArts Check代码检查新手操作指南

华为云PaaS服务小智

云计算 代码规范 华为云 代码检查

TDengine 的查询性能与老牌时序数据库相比如何?来看看

爱倒腾的程序员

数据库

国赛线下开赛!全国智能车百度智慧交通创意组区域赛今日正式拉开帷幕!

飞桨PaddlePaddle

人工智能 百度 paddle 飞桨 百度飞桨

高性能网络设计秘笈:深入剖析Linux网络IO与epoll

华为云开发者联盟

后端 开发 华为云 华为云开发者联盟 企业号 7 月 PK 榜

聊聊Spring注解@Transactional失效的那些事 | 京东云技术团队

京东科技开发者

spring Transactional @Transactional 企业号 7 月 PK 榜 注解失效

缕析条分Scroll属性 | 京东云技术团队

京东科技开发者

前端 DOM ScrollView ScrollView(滚动条) 企业号 7 月 PK 榜

抓住风向“猪”持续飞,还是维持在风向的高度上?

Bonaparte

产品 产品经理 产品需求 产品培训

NASA太难了:将247 PB数据放到AWS却付不起高额下载成本_服务革新_Simon Sharwood_InfoQ精选文章