【AICon】探索RAG 技术在实际应用中遇到的挑战及应对策略!AICon精华内容已上线73%>>> 了解详情
写点什么

Amazon Comprehend 发布异步批处理操作

  • 2019-10-21
  • 本文字数:1864 字

    阅读完需:约 6 分钟

Amazon Comprehend 发布异步批处理操作

我的同事 Jeff Barr 最近写了一篇关于 Amazon Comprehend 的文章,这是一项用于发现文本中的见解和关系的服务,在 2017 年的 AWS re:Invent 大会上发布。如今,在反复研究客户反馈之后,我们将发布适用于 Comprehend 的全新异步批量推理功能。异步批处理操作可处理存储在 Amazon Simple Storage Service (S3) 存储桶中的文档,并可执行所有常规 Comprehend 操作,例如实体识别、关键短语提取、情绪分析和语言检测。与单文档 API 和批处理 API 相比,这些新的异步批处理 API 支持的文档要大得多,从而减少了客户截断文档以获取服务的需求。当然,所有单文档 API 和批处理同步 API 操作仍可用于提供实时结果。通过增加异步操作,开发人员可以选择最适合其应用程序的工具。让我们深入了解一下这一新型 API。

异步 API 操作

新的批处理 API 遵循与 Amazon Comprehend 的 TopicDetection API 相同的异步调用结构。在分析一系列文档时,我们首先要调用某个 Start* API,例如 StartDominantLanguageDetectionJobStartEntitiesDetectionJobStartKeyPhrasesDetectionJobStartSentimentDetectionJob


这些 API 中的每一个都采用 InputDataConfig 和 OutputDataConfig,用以指定传入数据的格式和位置,以及相关结果应存储在 S3 的哪个位置。InputDataConfig 用于指定应将输入数据视为每个文件一个文档还是每行一个文档。


另外,我们还可以给任务命名并添加一个用于同步用途的唯一请求标识符。如果我们不提供这些信息,Comprehend 服务将自动生成它们。


在撰写本文时,对于实体和关键短语检测、语言检测及情绪检测,异步操作支持的最大单个文档大小分别为 100KB、1MB 和 5KB。批处理中所有文件的总大小必须小于 5GB,而且对于每个批次,我们提交的单独文件数不能超过 100 万个。


现在我们已经了解了 API 的功能,接下来我们来看看更新后的控制台并启动任务!

Amazon Comprehend 分析控制台

首先,我将导航到 AWS 管理控制台并打开 Amazon Comprehend。接下来,我将选择新的分析控制台。



在此,我可以单击控制台右上角的“创建”按钮来创建一个新的分析任务。我将创建一个实体检测任务并选择英语作为我的文档语言。然后,我会指示控制台选择一些示例数据。



现在,我将配置输出数据的位置,并确保所选服务角色有权访问该 S3 存储桶。然后,我将启动任务!



在如下页面上,我可以看到在控制台中启动的操作,并可等到操作完成后再查看详细结果。



在任务页面上,我可以看到任务的状态和输出位置。如果我从 S3 位置下载结果,则可以查看示例文本中检测到的实体。



在这里,我已截断结果,但大多数情况下它们如下所示:


Json


{  "Entities": [    {      "BeginOffset": 875,      "EndOffset": 899,      "Score": 0.9936646223068237,      "Text": "University of California",      "Type": "ORGANIZATION"    },    {      "BeginOffset": 903,      "EndOffset": 911,      "Score": 0.9519965648651123,      "Text": "Berkeley",      "Type": "LOCATION"    },    {      "BeginOffset": 974,      "EndOffset": 992,      "Score": 0.9981470108032227,      "Text": "Christopher Monroe",      "Type": "PERSON"    },    {      "BeginOffset": 997,      "EndOffset": 1010,      "Score": 0.9992995262145996,      "Text": "Mikhail Lukin",      "Type": "PERSON"    },    {      "BeginOffset": 1095,      "EndOffset": 1099,      "Score": 0.9990954399108887,      "Text": "2017",      "Type": "DATE"    }  ],  "File": "Sample.txt",  "Line": 8}
复制代码


很酷吧!我们可以通过类似的步骤进行情感检测或关键短语检测。由于我们可以在一个批次中提交多达 5GB 的数据,因此客户将花费较少的时间来转换和截断文档。


我个人推荐使用 AWS Step Functions 之类的工具,以编程方式检查任务状态。设置和构建编程分析管道非常简单。



正如我们在 Roy Hasson 撰写的这篇博客文章中提到的,您还可以使用 AWS Glue 将 Comprehend 作为您常规 ETL 操作的一部分加以调用。

附加信息

您可以在该文档中找到有关这些新 API 的详细信息,并了解有关限制和最佳实践的更多信息。


如前所述,同步批处理 API 仍然可用,并且适合用于较小的文档集和较小的文档。


和往常一样,欢迎随时在这里或在 Twitter 上分享您的反馈。


作者介绍:


Randall Hunt


AWS 全球高级布道师。此前供职于 NASA, SpaceX 及 MongoDB。


本文转载自 AWS 技术博客。


原文链接:


https://amazonaws-china.com/cn/blogs/china/amazon-comprehend-launches-asynchronous-batch-operations/


2019-10-21 08:00545

评论

发布
暂无评论
发现更多内容

我上了个假“中台”!

雨果

数据中台

互联网安全体制的挑战与机遇

阿泽🧸

互联网安全 11月月更

数据中台选型必读(二):数据中台如何搭建元数据管理中心

雨果

数据中台

【LeetCode】最长递增子序列的个数Java题解

Albert

算法 LeetCode 11月月更

设计模式之美-面向对象、设计原则、设计模式、编程规范、重构的关系

GalaxyCreater

设计模式

史海峰:成为技术领导者 从技术到管理的必经之路丨声网开发者创业讲堂 • 第 5 期

声网

技术管理 人工智能’

订单里的充值卡消费和积分抵扣怎么处理?

产品海豚湾

产品经理 产品设计 电商系统 分析设计 11月月更

433MHz自发电无线控制器

不脱发的程序猿

物联网 嵌入式 无线通信 ​433MHz自发电无线开关

如何快速优雅的用Know Streaming创建Topic

石臻臻的杂货铺

11月月更

Go 云原生实战:如何增加应用配置模块

宇宙之一粟

云原生 配置 Go 语言 Web应用开发 10月月更

一文了解openEuler SIG组角色划分与管理运作

openEuler

开源

专访微盟CTO黄骏伟:WOS将为去中心化商业提供一整套数字基建

B Impact

速报|StarRocks亮相云栖大会,携手阿里云EMR 打造极速数据湖分析新体验

StarRocks

数据库

Edge 浏览器提供了一个站点信息的按钮

HoneyMoose

MySQL能力全开放,OceanBase 社区版 4.0 正式上线

OceanBase 数据库

Spring Boot「23」DAO 模式

Samson

Java spring Spring Boot 学习笔记 11月月更

设计模式之美-代码评价标准

GalaxyCreater

设计模式

视图的创建

攻城狮Wayne

Python 视图 11月月更

数据中台选型必读(一):元数据管理是数据使用与共享的根基

雨果

数据中台

InnoDB与MyISAM的使用,该如何选择?

想要飞的猪

Vue组件入门(十五)异步组件

Augus

vue3.0 11月月更

详解CAN总线:CAN总线通信优先级机制

不脱发的程序猿

汽车电子 CAN总线 详解CAN总线 CAN总线通信优先级机制 CAN优先级

华为云从入门到实战 | 云容器服务

TiAmo

华为 华为云 云开发 11月月更

小白一键出片,三分钟成为修图大师的秘诀。

淋雨

ps LR 磨皮插件 滤镜插件

以开发之名 | bilibili会员购让IP在眼前动起来

HMS Core

Jenkins 构建的时候提示 DOCKER_HOST 错误

HoneyMoose

使用 Goland 开发 dubbogo 项目时如何自动快速格式化 import 代码块

apache/dubbo-go

2022-11-03:给定一个数组arr,和一个正数k 如果arr[i] == 0,表示i这里既可以是左括号也可以是右括号, 而且可以涂上1~k每一种颜色 如果arr[i] != 0,表示i这里已经确

福大大架构师每日一题

算法 rust 福大大

简述机器学习库

穿过生命散发芬芳

机器学习 11月月更

论坛回顾|FlyFish 一周年开源圆桌论坛圆满落幕

云智慧AIOps社区

开源项目 开源软件 开源治理 开源贡献 开源运营

数仓、湖仓、数据中台都没解决的企业数字化难题,却被它解决了

雨果

数据中台 数据仓库 DaaS数据即服务 数仓一体

Amazon Comprehend 发布异步批处理操作_语言 & 开发_亚马逊云科技 (Amazon Web Services)_InfoQ精选文章