谷歌通过定制的深度学习模型升级了其语音转文字的服务_Google_Alexis Perrier

【AICon】AI 基础设施、LLM运维、大模型训练与推理，一场会议，全方位涵盖！ >>> 了解详情 



 写点什么

看新闻很累？看技术新闻更累？试试下载 InfoQ 手机客户端，每天上下班路上听新闻，有趣还有料！

一个月前，谷歌宣布在源于 Magenta 项目的文字转语音（Text-to-Speech，简称TTS）技术上取得代际突破，接着该公司又对其语音转文字（Speech-to-Text，简称STT）API 云服务进行了重大升级。更新后的服务利用语音转录的深度学习模型，根据特定用例量身定制：短语音命令、打电话或视频，在所有其他上下文中都有一个默认模型。如今，升级后的服务可以处理120 种语言以及不同模型可用性和功能级别的变体。商业应用范围包括电话会议、呼叫中心和视频转录。转录的准确性在有多个扬声器和明显背景噪音的情形下有了改进提高。

另外两个因素构成了本次升级。标准服务水平协议（the standard service level agreement，简称SLA）现在承诺有99.9% 的可用性。该服务含有一种新机制来标记转录工作并向谷歌团队提供反馈。

专用模型是根据音频媒体的特点来采样，从而产生带宽 %E5%92%8C%E4%BF%A1%E5%8F%B7%E6%8C%81%E7%BB%AD%E6%97%B6%E9%97%B4%E3%80%82%E7%94%B5%E8%AF%9D%E9%9F%B3%E9%A2%91%E7%9A%84%E9%87%87%E6%A0%B7%E9%A2%91%E7%8E%87%E6%98%AF8Khz%EF%BC%8C%E5%9B%A0%E6%AD%A4%E9%9F%B3%E9%A2%91%E8%B4%A8%E9%87%8F%E8%BE%83%E4%BD%8E%EF%BC%8C%E8%80%8C%E6%9D%A5%E8%87%AA%E8%A7%86%E9%A2%91%E7%9A%84%E9%9F%B3%E9%A2%91%EF%BC%8C%E9%87%87%E6%A0%B7%E9%A2%91%E7%8E%87%E9%80%9A%E5%B8%B8%E6%98%AF16Khz%E3%80%82%E5%9B%A0%E6%AD%A4%EF%BC%8C%E9%9C%80%E8%A6%81%E9%92%88%E5%AF%B9%E6%AF%8F%E7%A7%8D%E5%AA%92%E4%BD%93%E7%B1%BB%E5%9E%8B%E8%BF%9B%E8%A1%8C%E4%BC%98%E5%8C%96%E7%9A%84%E6%A8%A1%E5%9E%8B%E3%80%82">https://en.wikipedia.org/wiki/Bandwidth_(signal_processing) 和信号持续时间。电话音频的采样频率是 8Khz，因此音频质量较低，而来自视频的音频，采样频率通常是 16Khz。因此，需要针对每种媒体类型进行优化的模型。

众包真实世界音频样本是谷歌改进其模型战略的核心，随着所谓数据记录的可选程序的发布，用户可以选择跟谷歌共享他们的音频，以帮助改进模型。数据记录的启用让用户可以访问具有更好性能的增强模型。谷歌宣布，与标准电话模型相比，词汇错误减少了54%，而对于增强视频模型，错误减少了64%。

就最佳实践而言，谷歌建议使用无损耗编码器（如 FLAC ）压缩后的音频数据，采样频率为 16Khz，避免任何音频预处理，比如降噪或自动增益控制。

词汇错误减少不是提升语音转文字整体质量的唯一因素。标点符号的预测仍然是语言转录面临的重要挑战。谷歌的语音转文字API 现在能够给转录后的文本添加标点符号，进一步提高了转自长音频序列的文本的可读性。这种自动添加标点符号的功能是利用了 LSTM 神经网络模型。

正如最近来自谷歌研究（Google Research）关于语音合成和语音识别的研究成果显示，用于语音转文字的深度学习经常是基于序列到序列（sequence-to-sequence，也可简写为Seq2seq）的神经网络模型，这些模型也可以应用于机器翻译和文本摘要。简而言之， Seq2seq 模型使用第一个 LSTM 对音频输入进行编码，第二个 LSTM 以输入序列为条件，对数据进行解码，并把数据转换成转录文本。

其他现有的语音转文字服务包括支持29 种语言的微软语音识别 API、支持 7 种语言的 IBM Watson API ，以及 2017 年 11 月发布的亚马逊Transcribe ，到目前为止，其只支持美式英语和西班牙语。来自佛罗里达技术学院（the Florida Institute of Technology）对其中这些服务的比较显示，谷歌服务API 的错误率较低。另一组比较测试强调了语音转录服务延迟的重要性。

阅读英文原文： Google Upgrades Its Speech-to-Text Service with Tailored Deep-Learning Models

公众号推荐：

跳进 AI 的奇妙世界，一起探索未来工作的新风貌！想要深入了解 AI 如何成为产业创新的新引擎？好奇哪些城市正成为 AI 人才的新磁场？《中国生成式 AI 开发者洞察 2024》由 InfoQ 研究中心精心打造，为你深度解锁生成式 AI 领域的最新开发者动态。无论你是资深研发者，还是对生成式 AI 充满好奇的新手，这份报告都是你不可错过的知识宝典。欢迎大家扫码关注「AI前线」公众号，回复「开发者洞察」领取。

发布

暂无评论

创作场景

谷歌通过定制的深度学习模型升级了其语音转文字的服务

公众号推荐：

评论

代码随想录Day49 - 动态规划（十）

ARTS 打卡第 13 天

【聚梦想创非凡】首场荣耀开发者沙龙（上海站）圆满落幕

透彻了解 JavaScript 闭包：使用场景和常见问题解答

R语言之数据获取操作

科兴未来 | 百万奖金！香港科大，2023人工智能国际创业大赛启动！

NineData中标！移动云数据库传输项目（2023）

Kyligence Copilot 登陆海外，斩获 Product Hunt 日榜 TOP 2

避雷干货丨初创或中小企业公司该如何选择云服务器？

全链路压测与普通压测的区别

ARTS 打卡第 2 周（8.21~8.27）

如何在App里拉起小程序？

数据分析实战│价格预测挑战

电商店铺管理，为何需要华为云云耀云服务器L实例

代码随想录Day48 - 动态规划（九）

KaiwuDB 荣获哈佛商业评论 2023“高能韧性团队奖”

云原生批量计算引擎 Volcano社区v1.8.0版本正式发布

字节跳动基于DataLeap的DataOps实践

MurmurHash 真的比 MD5 速度快吗？

HTML文本编辑器：BBEdit for Mac注册码激活

选择LED显示屏的点间距指南

Parallels Desktop 19 for Macv19.0.0启动器激活教程无需关闭SIP

IEEE-802.11be-QSDK-IIOT-IPQ9574-IPQ9554-QCN9274-QCN6274-Throughput 30Gbps-4096-QAM-16x16 MIMO

龙蜥白皮书精选：云原生混部资源隔离技术

专业PDF编辑和阅读软件：PDF Expert for mac激活中文

利用大模型反馈故障的解决方案

Parallels Desktop 19 Mac 虚拟机值得更新吗

探索GreatADM：图形化部署MGR的全新体验

直播APP开发，协议盘点（五）：实时传输协议RTP

2024CITE中国电子信息博览会（电博会）

轻松玩转70亿参数大模型！借助Walrus在AWS上部署Llama2

创作场景

谷歌通过定制的深度学习模型升级了其语音转文字的服务

公众号推荐：

评论

更多内容推荐

推荐阅读

电子书

大厂实战PPT下载