【ArchSummit架构师峰会】探讨数据与人工智能相互驱动的关系>>> 了解详情
写点什么

谷歌 Text-to-Speech 普遍可用,同时发布 Speech-to-Text 更新

  • 2018-09-09
  • 本文字数:1914 字

    阅读完需:约 6 分钟

谷歌宣布了 Cloud Text-to-Speech 普遍可用,允许开发人员在设备或应用程序中添加自然发声的语音。此外,谷歌还发布了 Cloud Speech-to-Text 的一组更新,增加了更多功能和增强的可用性和可靠性。

Cloud Text-to-Speech 最早于今年 3 月发布,之后客户要求为 WaveNet 语音提供更多语言支持——这是一种通过模仿人类声音让语音听起来更自然的技术。谷歌预计将增加 17 种新的 WaveNet 语音,让用户可以使用更多语言构建应用程序。目前,Cloud Text-to-Speech 支持 14 种语言和变体,共有 56 种语音,包括 30 种标准语音和 26 种 WaveNet 语音。

谷歌 Cloud Text-to-Speech 利用了多种技术,包括 WaveNet——一种用于生成原始音频波形的深度神经网络,能够生成更好听、更逼真的语音。此外,谷歌还提供与 Text-to-Speech 转换相配套的音频配置文件(测试版),让用户能够针对不同类型硬件的回放进行优化。谷歌在发布公告中表示:

你现在可以指定音频是通过电话线、耳机还是扬声器进行播放,我们将为回放提供音频优化。例如,如果你的应用程序产生的音频主要通过耳机收听,就可以通过专为耳机优化的 Cloud Text-to-Speech API 创建合成语音。

来源: https://cloud.google.com/blog/products/ai-machine-learning/announcing-updates-to-cloud-speech-to-text-and-general-availability-of-cloud-text-to-speech  

在 7 月份的 Google Cloud Next 大会上,谷歌发布了 Cloud Speech-to-Text 的新功能,现在可以在测试服务中使用这些功能。开发人员可以通过语言自动检测使用多种语言,通过说话者分类(diarization)和多通道识别分离不同的说话者,以及更高的词级置信度来构建应用程序。

谷歌 Text-to-Speech 主要是一种转录服务,通过解析声音来记录人类所说的内容。此外,这项服务可以正确地在文本输出中添加逗号和句点等标点符号。现在,谷歌将通过新的多声道识别功能进一步发展该服务,用于转录来自多个发言者的音频,包括使用 Cloud Natural Language 进行情感分析。当无法通过通道分离音频样本时,开发人员可以使用说话者分类的功能,输入说话者数量作为 API 参数——并且通过机器学习,如发布公告所述:

Cloud Speech-to-Text 将使用说话者数量来标记每个单词。随着接受到越来越多的数据,附加到每个单词的说话者标签不断被更新,Cloud Speech-to-Text 在识别说话者以及他们的讲话内容方面将会变得越来越准确。

来源: https://cloud.google.com/blog/products/ai-machine-learning/announcing-updates-to-cloud-speech-to-text-and-general-availability-of-cloud-text-to-speech  

除了说话者分类和多声道识别功能外,Cloud Speech-to-Text 还可以接受多种语言并进行自动检测。开发人员可以使用该功能的语音和命令功能,在每个查询中将最多四个语言代码发送到 Cloud Speech-to-Text。随后,API 将自动确定目标语言,并返回目标语言的转录文本。另一个功能是单词级置信度分数,开发人员可以突出显示特定单词,然后在必要的时候根据置信度分数向用户显示并让用户重复这些单词。

谷歌 Text-to-Speech 服务并不是公共云中唯一可用的服务,亚马逊在 AWS 上提供了 Polly ,可以列出 54 种可用语音,而微软也提供了他们的 Text to Speech 服务预览版,提供 45 种语言的 75 种语音。此外,与谷歌 Speech-to-Text 将与 AWS 的 Amazon Transcribe 展开竞争,这是一项功能丰富且通用的服务。而微软的 Speech to Text 服务也仍然只提供了预览版。除了它们之间的竞争,这些服务的用户也表现出了一些喜好,并对它们展开了讨论。在 Hacker News 的一个有关谷歌文本和语音服务的帖子中,一位用户表示:

几乎所有主要的云服务提供商都以一定的价格提供文本转语音服务,那为什么还要构建自己的系统呢,除非云服务提供商的定价占了总成本很大的比例。为什么不继续使用谷歌的这项服务?我们可以等到谷歌把价格提高了再决定后续该怎么做。毕竟,它只是一个 API 调用而已。

Mike Wheatley 最近在 Silicon Angle 的一篇文章中称,谷歌将通过云端文本转语音服务瞄准三个主要市场:

1. 呼叫中心的语音响应系统,Cloud Text-to-Speech 可以为之提供实时的自然语言对话。

2. 物联网领域,特别是汽车信息娱乐系统、电视和机器人等产品,让这些类型的设备能够与 3. 用户交流。播客和有声读物等应用程序,可将文本转换为语音。

开发人员可以尝试使用 Speech-to-Text 和 Cloud Text-to-Speech 服务。有关 Speech-to-Text 服务的定价信息,请参阅定价页面。Text-to-Speech 服务的定价细节也可在相应的定价页面上找到。

查看英文原文 Google Announces General Availability of Cloud Text-to-Speech and Updates to Cloud Speech-to-Text

公众号推荐:

跳进 AI 的奇妙世界,一起探索未来工作的新风貌!想要深入了解 AI 如何成为产业创新的新引擎?好奇哪些城市正成为 AI 人才的新磁场?《中国生成式 AI 开发者洞察 2024》由 InfoQ 研究中心精心打造,为你深度解锁生成式 AI 领域的最新开发者动态。无论你是资深研发者,还是对生成式 AI 充满好奇的新手,这份报告都是你不可错过的知识宝典。欢迎大家扫码关注「AI前线」公众号,回复「开发者洞察」领取。

2018-09-09 19:002896
用户头像

发布了 731 篇内容, 共 433.7 次阅读, 收获喜欢 1997 次。

关注

评论

发布
暂无评论
发现更多内容

修改系统时间,导致 sem_timedwait 一直阻塞的问题解决和分析

小林coding

Linux 编程 问题处理

为什么直播系统不用RTP协议

soolaugust

WebRTC 直播 RTMP rtp

大数据技术发展(一):大数据技术的起源

cristal

Java 大数据 hadoop

C++ 赋值运算符‘=‘的重载(浅拷贝、深拷贝)

小林coding

c++ 编程 浅拷贝和深拷贝

C++ 手把手教你实现可变长的数组

小林coding

c++ 编程 数组

C++ 流插入和流提取运算符的重载

小林coding

c++ 编程

SpringCloud(Netflix)-技术专题-微服务入门介绍

洛神灬殇

从根上学习Git

书旅

git 工具 版本控制 版本管理工具

优化教育体验 智微智能高品质录播系统

InfoQ_967a83c6d0d7

第二次推荐笔记:wolai

申屠鹏会

国内首家 ABM 营销技术服务商火眼云完成5000万元A轮融资

人称T客

字节跳动想招什么样的技术人?

池建强

C++ 一篇搞懂多态的实现原理

小林coding

c++ 编程 封装、继承、多态

Web 全栈开发利器: 强大的在线 Cloud IDE

华为云开发者联盟

Web python3.x 全栈 编码 CloudIDE

2020大厂web前端面试常见问题总结

华为云开发者联盟

CSS 面试 响应式 大前端 浏览器

让类/进程/脚本「单身」的方法

小林coding

c c++ Shell 设计模式 单例模式

超超超全递归技巧讲解,这次带你拿下递归

多选参数

数据结构 算法 递归 数据结构与算法

SpreadJS 纯前端表格控件应用案例:铭天预算执行系统

葡萄城技术团队

SpreadJS 预算执行系统

音画同步体验有多好,来看看即构的自研互动白板就知道啦

ZEGO即构

在线教育 SVG canvas

HTTP协议-进阶

Jaykey

大前端 HTTP

精美前端UI(VUE)界面,ASP.NET通用工作流开发分享

雯雯写代码

工作流 可视化

「C++ 篇」答应我,别再 if else 走天下了可以吗

小林coding

c++ 编程 设计模式 编程习惯 编程风格

HTTP协议-基础

Jaykey

大前端 HTTP

C++ 深入浅出工厂模式(进阶篇)

小林coding

c++ 设计模式 工厂模式

C++ 运算符重载的基本概念

小林coding

c++ 编程

C++ 深入浅出工厂模式(初识篇)

小林coding

c++ 设计模式 工厂模式

C++ this指针的理解和作用

小林coding

c c++ 指针

C++ 一篇搞懂继承的常见特性

小林coding

c++ 编程 继承

C++ static 与 const 的认识

小林coding

c++ 编程 static关键字

Go语言专家测试,80%的人第一题就挂了!

博文视点Broadview

云原生 评测 Go 语言

全球移动服务生态的暗涌与新机

脑极体

谷歌Text-to-Speech普遍可用,同时发布Speech-to-Text更新_DevOps & 平台工程_Steef-Jan Wiggers_InfoQ精选文章