写点什么

继 Stability AI、AI21 Labs 和 LG AI 之后,TII 也用亚马逊云科技训练大模型

  • 2023-06-08
    北京
  • 本文字数:2297 字

    阅读完需:约 8 分钟

继Stability AI、AI21 Labs和LG AI之后,TII也用亚马逊云科技训练大模型

2023 年 6 月 7 日,亚马逊云科技宣布,位于阿联酋首都阿布扎比的全球领先科研中心 TII(Technology Innovation Institute)在亚马逊云科技上训练了其性能卓越的开源模型 Falcon 40B。

 

据悉,TII 是一家全球领先的科研中心,一直致力于探索前沿的知识领域。TII 的科学家、研究员和工程师团队竭力提供探索性科学成果和变革性技术。据 TII 介绍,基于一万亿个字符(token)训练的 TII Falcon 大语言模型不仅在性能上表现突出,同时具有超高的成本效益。

 

Falcon 大语言模型项目地址:

 

https://www.tii.ae/news/abu-dhabi-based-technology-innovation-institute-introduces-falcon-llm-foundational-large

 

Falcon 40B 是什么?

 

Falcon 40B 是拥有 400 亿参数的大语言模型(LLM),在 Apache 2.0 许可下提供,并在 Hugging Face 的开源大语言模型排行榜上位列榜首(该排行榜在多个基准测试中跟踪、排名和评估大语言模型,最终评选出最佳模型)。

 

Falcon 大语言模型提供两种不同规模的开源版本——Falcon 40B 和 Falcon 7B, 两者均是使用 Amazon SageMaker 的数据预处理和模型训练任务从零开始构建。开源的 Falcon 40B 让用户能够构建和定制满足独特用户需求的 AI 工具,便于无缝集成,并确保长期保存数据资产。模型权重可供下载,检查和部署在任何地方。

 

为了提高科学质量和训练速度方面的水准,该项目在各个层面都进行了前所未有的定制创新。其中,TII 在所有深度学习训练系统层级上都进行了优化。

 

从 6 月 7 日起,两个开源 Falcon 大语言模型也将在 Amazon SageMaker JumpStart 中可用。这是 SageMaker 的机器学习中心,它提供了预训练模型、内置算法和预构建的解决方案模板,可以帮助用户快速上手机器学习。用户只需在 SageMaker Studio 中轻点鼠标就可以部署和使用 Falcon 模型,或者通过 SageMaker Python SDK 以编程方式使用。

 

SageMaker 是一个托管 API 集合,用于开发、训练、调优和托管机器学习(ML)模型,包括大语言模型。许多用户使用 SageMaker 处理其大语言模型工作负载,例如Stability AI, AI21 LabsLG AISageMaker Training提供了具有用户自定义硬件配置和代码的计算集群。计算作业按运行次数计费,按秒分配任务,这意味着用户在未使用服务时无需为 GPU 资源付费。TII 使用 SageMaker Training API 提供的瞬态集群来训练 Falcon 大语言模型,最多支持 48 个 ml.p4d.24xlarge 实例(384 个英伟达 A100 GPU)。现在,TII 正在训练下一代 Falcon 大语言模型,将训练扩展到 3136 个 A100 GPU(392 个 ml.p4d 实例)。

 

TII 跨 AI 研究中心执行总监、代理首席 AI 研究员兼大语言模型项目负责人 Ebtesam Almazrouei 博士表示:“我们自豪地宣布 Falcon 40B 开源版正式发布,这是 TII 开发的世界一流的开源语言模型。Falcon 40B 超过了 Hugging Face 开源大语言模型排行榜上的 LLaMA-65B、StableLM、RedPajama 和 MPT 等知名模型,展示了无需专门微调的卓越性能。”

 

参数越大,性能越好?

 

大语言模型是经过训练以完成自然文本序列的软件算法。得益于庞大的规模和与之交互的训练数据量,大语言模型拥有出色的文本处理能力,包括总结摘要、问题回答和上下文学习等能力。

 

2020 年年初,全球各地的研究机构都将研究重点放在模型大小上,并观察到准确性与参数数量之间存在关联。例如,GPT-3(2020)和 BLOOM(2022)拥有约 1750 亿个参数,Gopher(2021)拥有 2300 亿个参数, MT-NLG(2021)拥有 5300 亿个参数。

 

但是最近两年,情况似乎有所不同。2022 年,Hoffman 等人观察到当前模型参数和数据集大小之间的计算平衡不是最优的,并发表了经验性的缩放定律,建议将计算预算转向使用更多数据训练的较小模型,可以获得性能更好的模型。他们在拥有 700 亿参数的 Chinchilla(2022)模型中实践了这一想法,结果显示该模型的表现超过了更大的模型。

 

由此可见,模型性能的好坏并不能和参数的多少完全正相关。

 

大模型之战正酣,亚马逊云科技从未缺席

 

在关注大模型参数和性能之余,大模型应用和生成式 AI 开发才是当前 AI 领域的主旋律。

 

日前,全球市场分析机构 Gartner®发布《2023 云 AI 开发者服务魔力象限》报告,亚马逊云科技被评为“领导者”,且在执行能力轴上排名最高。

 

榜单之外,Amazon SageMaker 功不可没。

 

今年 4 月,亚马逊云科技还重磅推出了 Amazon Bedrock 托管服务和 Amazon Titan 模型。借此,亚马逊云科技提供了非常简单的途径,让开发者借助基础模型构建和扩展生成式 AI 应用程序。

 

Amazon Bedrock 让开发者可以通过 API 访问 AI21Labs、Anthropic 和 Stability AI 等热门 AI 公司的预训练基础模型,还提供对亚马逊云科技开发的基础模型系列 Amazon Titan 的独家访问。

 

Amazon Bedrock 提供的无服务器体验可以让客户轻松找到适合自身业务的模型,快速上手,在确保数据安全和隐私保护的前提下,使用自有数据基于基础模型进行定制,并使用已经熟悉的亚马逊云科技工具和能力,将定制化模型集成并部署到应用程序,无需自己管理基础设施。

 

此外,亚马逊云科技的 AI 编程助手 Amazon CodeWhisperer 面向个人开发者免费开放。

 

Amazon CodeWhisperer 从数十亿行公开代码中学习之外,还基于亚马逊的代码进行了训练,可以为 Amazon EC2、Amazon Lambda 和 Amazon S3 等云服务生成最准确、最快和最安全的代码。开发者使用 Amazon CodeWhisperer,完成任务的速度平均快 57%,成功率高 27%。

 

埃森哲已经开始用 Amazon CodeWhisperer 加快编码任务,作为其 Velocity 平台软件工程最佳实践计划的一部分。CodeWhisperer 可以帮助不太熟悉亚马逊云科技的开发人员更快地熟悉使用亚马逊云科技服务开发的项目。借助 CodeWhisperer,埃森哲新的开发人员就能够为 Amazon S3 和 Amazon DynamoDB 等亚马逊云科技服务编码。在短时间内,他们就能够高效工作并为项目做出贡献。

2023-06-08 18:488195

评论

发布
暂无评论
发现更多内容

【Rust学习】内存安全探秘:变量的所有权、引用与借用

京东科技开发者

spring rust slice 企业号 2 月 PK 榜 可变引用

前端图片最优化压缩方案

凉城

前端 图片处理 图片压缩 前端图片压缩

嘉为蓝鲸携手麒麟软件共建国产化一站式DevOps解决方案

嘉为蓝鲸

DevOps 自动化运维 嘉为蓝鲸

成熟的自动化运维平台是怎样练成的?

嘉为蓝鲸

自动化运维 嘉为蓝鲸

算力新话题,畅聊算力之新民生

鲸品堂

算力网络 企业号 2 月 PK 榜

《数字经济全景白皮书》出海篇:选对路径下好棋,热点出海行业如何实现增长?

易观分析

数字化 经济 出海

十年老程序员:再见了Navicat,以后多数据库管理就看这款SQL工具

雨果

sql navicat 数据库管理工具

极客时间运维进阶训练营第十三周作业

9527

Java高手速成 | 单例模式实现方式——枚举

TiAmo

单例模式 枚举 Java 开发

对线面试官:浅聊一下 Java 虚拟机栈?

王磊

java面试

状态机的概念与设计

timerring

FPGA

MASA Stack 1.0 发布会讲稿 —— 产品篇

MASA技术团队

.net 云原生 MASA MASA Blazor

架构实战营 10 期 - 作业 6

炮仗

高校数据库/SQL教学用什么样的SQL工具?管理更方便,学习更轻松

雨果

数据库管理工具 :MySQL 数据库 SQL开发工具

重识Flutter 用于解决复杂滑动视窗问题的Slivers - part1

编程的平行世界

flutter 前端 an'droid

100 行 shell 写个 Docker

vivo互联网技术

Docker Shell

全新视觉,升维体验!全栈可观测中心嘉为鲸眼产品全新体验升级

嘉为蓝鲸

可观测 自动化运维 嘉为蓝鲸

嘉为科技蝉联信创工委会“卓越贡献成员”荣誉称号

嘉为蓝鲸

自动化运维 嘉为蓝鲸

关于小程序游戏变现方式你还知道哪些?

没有用户名丶

前端开发 小程序游戏

我的快速调优线上服务器CPU利用率通用办法,震惊面试官

KINDLING

Java cpu 服务器 性能调优 ebpf

Sugar BI 增强分析能力全场景解析

XxinQi

数据分析 可视化 BI 商务智能 预测模型

第六周作业-拆分电商系统为微服务

不爱学习的程序猿

ChatGPT集成之前,让我们复习一下即将过时的知识

newbe36524

搜索引擎; ChatGPT

支付对接常用的加密方式介绍以及java代码实现

京东科技开发者

Java 安全 哈希算法 加密算法 非对称加密算法

有关TCP协议,这是我看过讲的最清楚的一篇文章了!

程序员小毕

程序员 TCP 程序人生 计算机网络 架构师

小游戏内测|小游戏脱离微信运行在其它 App

Onegun

微信小程序 小游戏 小游戏开发 微信小程序-游戏

继Stability AI、AI21 Labs和LG AI之后,TII也用亚马逊云科技训练大模型_AI&大模型_李冬梅_InfoQ精选文章