2025上半年,最新 AI实践都在这!20+ 应用案例,任听一场议题就值回票价 了解详情
写点什么

在 Amazon EMR 中构建由 Spark 支持的 Amazon SageMaker Notebook

  • 2019-10-31
  • 本文字数:3016 字

    阅读完需:约 10 分钟

在 Amazon EMR 中构建由 Spark 支持的 Amazon SageMaker Notebook

在 2017 年 AWS re:Invent 上介绍的 Amazon SageMaker 可以为数据科学和机器学习工作流程提供完全托管服务。Amazon SageMaker 的其中一个重要组成部分是功能强大的 Jupyter Notebook 接口,该接口可用来构建模型。通过将 Notebook 实例连接到 Amazon EMR 上运行的 Apache Spark 集群,可以增强 Amazon SageMaker 的功能。Amazon EMR 是一个用于处理大量数据的托管框架。通过将二者结合,可以基于大量数据构建模型。


Spark 是一个可以快速处理大数据的开源集群计算框架,并且包含适用于机器学习工作负载的 MLlib。为了方便在 Amazon SageMaker Notebook 与 Spark EMR 集群之间建立连接,需要使用 Livy。Livy 是一个开源 REST 接口,无需 Spark 客户端便可从任何位置与 Spark 集群交互。


本博文将向您介绍如何运行 Spark EMR 集群,如何配置必要的安全组以便在 Amazon SageMaker 与 EMR 之间进行通信,以及如何打开 Amazon SageMaker Notebook,最后还会介绍如何使用 Livy 将该 Notebook 连接到 EMR 上的 Spark。此设置将使用 PySpark、PySpark3、Spark 和 SparkR notebook。

设置 EMR Spark 和 Livy

打开 AWS 管理控制台,然后从屏幕顶部的服务菜单中选择“分析”部分下的 EMR。选择创建集群。转到高级选项 (位于顶部,其旁边是 Create Cluster – Quick Options (创建集群 – 快速选项)),取消选中所有选项。然后,专门选中 LivySpark。选择 Next



网络下方,选择您的 VPC。在本博文示例中,我的 VPC 名为 sagemaker-spark。此外,您还需要记下您的“EC2 子网”,因为稍后需要该信息。



选择下一步,然后选择创建集群。可以根据需要随意将您认为可能适合的其他任何选项加入集群中,例如,向集群添加用于对节点进行远程访问的密钥对,或者是自定义名称。


现在,您需要为您的 Spark 集群的节点获取私有 IP 地址。


依次选择服务EMR。等到您的集群被标记为正在等待 (绿色) 后选择所创建的集群。选择 Hardware (硬件) 选项卡。



选择您的主 ID,然后向右滚动,找到私有 IP 地址。保存该信息供稍后使用。在本博文示例中,我的私有 IP 地址为 10.0.0.65,但您的地址会有所不同。


设置安全组并打开端口

下面,我们需要设置安全组并打开相关端口,这样一来,Amazon SageMaker Notebook 方能通过端口 8998 上的 Livy 与 Spark 集群进行通信。


在控制台中,依次选择服务EC2。在左侧导航窗格中,选择安全组。然后,选择创建安全组按钮。


设置安全组名称 (我的是 sagemaker-notebook)、描述以及用于您的 EMR 集群的 VPC (我的是 sagemaker-spark)。



选择创建


这将创建安全组,使我们能够仅打开此组中的实例的端口。我们仍需要在 ElasticMapReduce-master 组中打开该端口。


仍然在安全组中,获取您的 SageMaker notebook 安全组的组 ID。我的是 sg-35610640,但您的将会有所不同。保存该值供稍后使用。



我们需要修改在创建 EMR 集群时自动创建的 EMR 主安全组。选择您的 ElasticMapReduce-master 组,然后选择入站选项卡。选择编辑按钮,然后选择添加规则按钮。


我们需要在端口 8998 上创建自定义 TCP 规则,然后将安全组 ID 设置为我们先前收集的 SageMaker notebook 安全组中的“组 ID”。请记住,我的是 sg-35610640。以下示例是完成操作后字段的显示情况:



选择保存按钮。现在,您已经打开了重要端口,因此,您的 SageMaker Notebook 实例可以通过 Livy 与您的 EMR 集群进行通信。

设置 SageMaker Notebook

现在,我们可以使用通过 Livy 运行的 EMR Spark 集群以及相关端口。接下来,我们来启动和运行 Amazon SageMaker Notebook 实例。


依次选择服务Amazon SageMaker。选择 Create Notebook Instance (创建 Notebook 实例) 按钮。


您需要设置 Notebook instance name (Notebook 实例名称),然后选择 Notebook instance type (Notebook 实例类型)。请注意,Notebook 实例名称有一些命名约束:最多包含 63 个字母数字字符,可以包含连字符但不能包含空格,并且在 AWS 区域中您的帐户内必须是唯一的。您还需要设置一个 IAM 角色,该角色具有 AmazonSageMakerFullAccess 权限,并且还有权访问任何必要的 Amazon Simple Storage Service (Amazon S3) 存储桶。您需要指定该角色对哪些存储桶具有访问权限,但可以让 Amazon SageMaker 为您生成该角色。



之后,您需要确保设置的 Notebook 实例与 EMR 集群位于相同的 VPC 中 (我的是 sagemaker-spark)。另外,还要选择与 EMR 集群相同的子网 (之前在创建 EMR 时,您应该已经记下了该信息)。最后,将您的安全组设置为之前为 Notebook 实例创建的组 (我的是 sagemaker-notebook)。


选择 Create Notebook Instance (创建 Notebook 实例)



耐心等待,直到 EMR 完成集群配置,SageMaker Notebook 状态显示 InService (正在服务)

将 Notebook 连接到 Amazon EMR

现在,我们的 EMR Spark 集群和 Amazon SageMaker Notebook 均已运行,但它们彼此还无法通信。下一步是在 SageMaker 中设置 Sparkmagic,以便它知道如何找到我们的 EMR 集群。


仍然在 Amazon SageMaker 控制台中,转到 Notebook Instances (Notebook 实例),然后在已配置的实例上选择打开


在 Jupyter 控制台中,依次选择 New (新)Terminal (终端)



键入以下命令:




然后,您需要编辑 config.json,并将“localhost”的各个实例替换为之前使用的 EMR 主实例的私有 IP。我的是 10.0.0.65,之前我们看到过,但您的会有所不同!


我使用了以下命令:


  • nano config.json

  • ctrl+\

  • localhost

  • <您的 EMR 主实例的私有 IP>

  • a

  • ctrl+x

  • y

  • enter


这样应该会替换三个内核凭证的“url”字段中 localhost 的三个实例。您可以根据自己的喜好随意使用任何编辑器,然后保存更改。



继续操作之前,我们应该先测试通过 Livy 与 EMR 的连接。为此,我们运行以下命令 (将 EMR 主实例私有 IP 替换为您实例的 IP 地址):


  • curl <EMR 主实例私有 IP>:8998/sessions


您的输出应类似以下内容:



如果出现错误,可能意味着您的端口尚未在安全组中打开,因此,建议您返回检查这些设置!


我们将终端关闭。键入 exit,然后关闭浏览器选项卡和终端。打开 Jupyter 的选项卡,依次选择 New (新)Sparkmagic (PySpark) 以打开 PySpark notebook。为了进行确认,我们依次选择内核重启以重新启动内核。



让我们在第一个单元中使用以下命令来测试连接:


  • %%info


同时键入 shiftenter 以运行该单元,显示的输出应该如下所示:



恭喜您!Sparkmagic 内核现在已在您的 Jupyter Notebook 中运行,因而可以使用 Livy 与您的 EMR Spark 集群进行通信。


作者介绍


Thomas Hughes 是 AWS 专业服务组织的一名数据科学家。他获得了加州大学圣巴巴拉分校的博士学位,解决了社会科学、教育学和广告学方面的诸多难题。目前正致力于解决机器学习在遇到大数据时出现的一些最为棘手的问题。



Stefano Stefani 是 AWS 的首席高级工程师,也是 AWS 众多服务领域的主管技术专家:Amazon SimpleDB、Amazon DynamoDB、Amazon Redshift 和 Amazon Aurora。目前,他在以下 Amazon AI 领域担任相同的职位:Amazon Lex、Amazon Rekognition、Amazon SageMaker、Amazon Transcribe 等。


本文转载自 AWS 技术博客。


原文链接:


https://amazonaws-china.com/cn/blogs/china/build-amazon-sagemaker-notebooks-backed-by-spark-in-amazon-emr/


2019-10-31 08:00718

评论

发布
暂无评论
发现更多内容

深圳派发数字人民币红包!个人数字人民币钱包即将亮相

CECBC

数字货币 数字人民币

MySQL-技术专题-连接查询和子查询

码界西柚

【硬件篇之功耗测试】

良知犹存

硬件

诺奖以上,真相未满:追捕黑洞二百年

脑极体

TensorFlow安装

菜鸟小sailor 🐕

学习

创新者谈

善宝橘

创新

区块链赋能医疗产业报告

CECBC

区块链 大数据 医疗

建议将区块链产业纳入国家“十四五规划”

CECBC

区块链 新基建

Redis-技术专题-Jedis实战入门

码界西柚

架构师第一期作业(第四周)

Cheer

课程作业

云服务时代,未来怎么样保障自己的核心竞争力?

boshi

个人成长 职业规划 云服务

手写SpringIOC

彭阿三

spring源码 sping springioc

某Java程序员在外包公司每天读写删改几年后,发现跳不出来了

Java架构之路

Java 程序员 面试 算法 编程语言

Java并发编程-线程基础

程序员 并发编程 java 14 架构师训练

程序员在中国是青春饭?扯!看看阿里资深架构师是怎么说的!

Java架构师迁哥

Java 程序员 面试

开源监控系统open-falcon搭建笔记

卓丁

监控 监控管理平台 Open-Falcon 监控告警

反射API

彭阿三

反射

延迟满足

时间是一个人最好的证明

延迟满足感 成功

手把手教你AspNetCore WebApi:数据验证

AI代笔

ASP.NET Core web api 数据验证

能够让机器狗学会灭火, ModelArts3.0让AI离我们又近一步

华为云开发者联盟

人工智能 AI 机器狗

来碗小面

葱小白

美食 旅行

阿里巴巴内部“Java成长笔记”,看完才发现自己和阿里大牛的差距真的太远了!

Java架构之路

Java 阿里巴巴 程序员 面试 编程语言

系统架构第四周总结「架构师训练营第 1 期」

天天向善

一文搞懂PV、UV、VV、IP及其关系与计算

冰河

多线程 高并发 流量 并发流量

实用威胁建模指南(二)

亚伦碎语

敏捷 安全 系统安全架构 系统安全 威胁建模

七千字的线性回归模型指南,建议收藏!

计算机与AI

数据挖掘 学习 线性回归

论软件工程师的自我修养:角色、重构与质量

华为云开发者联盟

软件 开发 工程师

系统架构第四周作业「架构师训练营第 1 期」

天天向善

《我想进大厂》之Redis夺命连环11问

艾小仙

Java redis 面试 程序语言

MySql领域经典之作,“不敢自诩为MySql专家,岂敢错过这本神书”

Java架构之路

Java MySQL 程序员 面试 编程语言

2020国庆我花了 7 天给大家撸了一篇云南旅游攻略

程序猿石头

美食 旅行

在 Amazon EMR 中构建由 Spark 支持的 Amazon SageMaker Notebook_语言 & 开发_亚马逊云科技 (Amazon Web Services)_InfoQ精选文章