2025上半年,最新 AI实践都在这!20+ 应用案例,任听一场议题就值回票价 了解详情
写点什么

继 Stability AI、AI21 Labs 和 LG AI 之后,TII 也用亚马逊云科技训练大模型

  • 2023-06-08
    北京
  • 本文字数:2297 字

    阅读完需:约 8 分钟

继Stability AI、AI21 Labs和LG AI之后,TII也用亚马逊云科技训练大模型

2023 年 6 月 7 日,亚马逊云科技宣布,位于阿联酋首都阿布扎比的全球领先科研中心 TII(Technology Innovation Institute)在亚马逊云科技上训练了其性能卓越的开源模型 Falcon 40B。

 

据悉,TII 是一家全球领先的科研中心,一直致力于探索前沿的知识领域。TII 的科学家、研究员和工程师团队竭力提供探索性科学成果和变革性技术。据 TII 介绍,基于一万亿个字符(token)训练的 TII Falcon 大语言模型不仅在性能上表现突出,同时具有超高的成本效益。

 

Falcon 大语言模型项目地址:

 

https://www.tii.ae/news/abu-dhabi-based-technology-innovation-institute-introduces-falcon-llm-foundational-large

 

Falcon 40B 是什么?

 

Falcon 40B 是拥有 400 亿参数的大语言模型(LLM),在 Apache 2.0 许可下提供,并在 Hugging Face 的开源大语言模型排行榜上位列榜首(该排行榜在多个基准测试中跟踪、排名和评估大语言模型,最终评选出最佳模型)。

 

Falcon 大语言模型提供两种不同规模的开源版本——Falcon 40B 和 Falcon 7B, 两者均是使用 Amazon SageMaker 的数据预处理和模型训练任务从零开始构建。开源的 Falcon 40B 让用户能够构建和定制满足独特用户需求的 AI 工具,便于无缝集成,并确保长期保存数据资产。模型权重可供下载,检查和部署在任何地方。

 

为了提高科学质量和训练速度方面的水准,该项目在各个层面都进行了前所未有的定制创新。其中,TII 在所有深度学习训练系统层级上都进行了优化。

 

从 6 月 7 日起,两个开源 Falcon 大语言模型也将在 Amazon SageMaker JumpStart 中可用。这是 SageMaker 的机器学习中心,它提供了预训练模型、内置算法和预构建的解决方案模板,可以帮助用户快速上手机器学习。用户只需在 SageMaker Studio 中轻点鼠标就可以部署和使用 Falcon 模型,或者通过 SageMaker Python SDK 以编程方式使用。

 

SageMaker 是一个托管 API 集合,用于开发、训练、调优和托管机器学习(ML)模型,包括大语言模型。许多用户使用 SageMaker 处理其大语言模型工作负载,例如Stability AI, AI21 LabsLG AISageMaker Training提供了具有用户自定义硬件配置和代码的计算集群。计算作业按运行次数计费,按秒分配任务,这意味着用户在未使用服务时无需为 GPU 资源付费。TII 使用 SageMaker Training API 提供的瞬态集群来训练 Falcon 大语言模型,最多支持 48 个 ml.p4d.24xlarge 实例(384 个英伟达 A100 GPU)。现在,TII 正在训练下一代 Falcon 大语言模型,将训练扩展到 3136 个 A100 GPU(392 个 ml.p4d 实例)。

 

TII 跨 AI 研究中心执行总监、代理首席 AI 研究员兼大语言模型项目负责人 Ebtesam Almazrouei 博士表示:“我们自豪地宣布 Falcon 40B 开源版正式发布,这是 TII 开发的世界一流的开源语言模型。Falcon 40B 超过了 Hugging Face 开源大语言模型排行榜上的 LLaMA-65B、StableLM、RedPajama 和 MPT 等知名模型,展示了无需专门微调的卓越性能。”

 

参数越大,性能越好?

 

大语言模型是经过训练以完成自然文本序列的软件算法。得益于庞大的规模和与之交互的训练数据量,大语言模型拥有出色的文本处理能力,包括总结摘要、问题回答和上下文学习等能力。

 

2020 年年初,全球各地的研究机构都将研究重点放在模型大小上,并观察到准确性与参数数量之间存在关联。例如,GPT-3(2020)和 BLOOM(2022)拥有约 1750 亿个参数,Gopher(2021)拥有 2300 亿个参数, MT-NLG(2021)拥有 5300 亿个参数。

 

但是最近两年,情况似乎有所不同。2022 年,Hoffman 等人观察到当前模型参数和数据集大小之间的计算平衡不是最优的,并发表了经验性的缩放定律,建议将计算预算转向使用更多数据训练的较小模型,可以获得性能更好的模型。他们在拥有 700 亿参数的 Chinchilla(2022)模型中实践了这一想法,结果显示该模型的表现超过了更大的模型。

 

由此可见,模型性能的好坏并不能和参数的多少完全正相关。

 

大模型之战正酣,亚马逊云科技从未缺席

 

在关注大模型参数和性能之余,大模型应用和生成式 AI 开发才是当前 AI 领域的主旋律。

 

日前,全球市场分析机构 Gartner®发布《2023 云 AI 开发者服务魔力象限》报告,亚马逊云科技被评为“领导者”,且在执行能力轴上排名最高。

 

榜单之外,Amazon SageMaker 功不可没。

 

今年 4 月,亚马逊云科技还重磅推出了 Amazon Bedrock 托管服务和 Amazon Titan 模型。借此,亚马逊云科技提供了非常简单的途径,让开发者借助基础模型构建和扩展生成式 AI 应用程序。

 

Amazon Bedrock 让开发者可以通过 API 访问 AI21Labs、Anthropic 和 Stability AI 等热门 AI 公司的预训练基础模型,还提供对亚马逊云科技开发的基础模型系列 Amazon Titan 的独家访问。

 

Amazon Bedrock 提供的无服务器体验可以让客户轻松找到适合自身业务的模型,快速上手,在确保数据安全和隐私保护的前提下,使用自有数据基于基础模型进行定制,并使用已经熟悉的亚马逊云科技工具和能力,将定制化模型集成并部署到应用程序,无需自己管理基础设施。

 

此外,亚马逊云科技的 AI 编程助手 Amazon CodeWhisperer 面向个人开发者免费开放。

 

Amazon CodeWhisperer 从数十亿行公开代码中学习之外,还基于亚马逊的代码进行了训练,可以为 Amazon EC2、Amazon Lambda 和 Amazon S3 等云服务生成最准确、最快和最安全的代码。开发者使用 Amazon CodeWhisperer,完成任务的速度平均快 57%,成功率高 27%。

 

埃森哲已经开始用 Amazon CodeWhisperer 加快编码任务,作为其 Velocity 平台软件工程最佳实践计划的一部分。CodeWhisperer 可以帮助不太熟悉亚马逊云科技的开发人员更快地熟悉使用亚马逊云科技服务开发的项目。借助 CodeWhisperer,埃森哲新的开发人员就能够为 Amazon S3 和 Amazon DynamoDB 等亚马逊云科技服务编码。在短时间内,他们就能够高效工作并为项目做出贡献。

2023-06-08 18:487427

评论

发布
暂无评论
发现更多内容

开源一夏 | Java格式化日期 微秒

六月的雨在InfoQ

开源 8月月更

不是吧?还有人不会定位线上MySQL慢查询问题?

Java永远的神

Java MySQL 数据库 程序员 面试

COSCon'22城市/学校/机构出品人征集令

开源社

#开源 COSCon'22

行云管家荣获第十一届中国财经峰会“2022杰出品牌形象奖”

行云管家

云计算 多云管理 财经峰会

数据结构与算法完整版 | 超详细图解,看这一篇就够了

冉然学Java

字节跳动 java; 技术分享 编程、 算法与数据结构

NLP 论文领读|无参数机器翻译遇上对比学习:效率和性能我全都要!

澜舟孟子开源社区

人工智能 自然语言处理 机器学习 深度学习 机器翻译

sync-diff-inspector 使用实践

TiDB 社区干货传送门

6.x 实践

一次多表关联顺序的慢查询——TiDB 关联特性

TiDB 社区干货传送门

性能调优

shell脚本,帮你提升摸鱼时间!

工程师日月

签约计划第三季 8月月更

踩坑了!mysql明明加了唯一索引,还是产生了重复数据

程序员小毕

Java MySQL 数据库 程序员 后端

centOS7.3 安装启用 iptables 记录

JavaPub

Linux centos7 iptables

自从用了 Kiali 以后才知道,配置 Istio 的 流量管理 是如此容易

万猫学社

云原生 istio envoy kiali

我和 TiDB 的故事 | 横看成岭侧成峰

TiDB 社区干货传送门

人物访谈

leetcode 240. Search a 2D Matrix II 搜索二维矩阵 II(中等)

okokabcd

数组 LeetCode 数据结构与算法

【Spring Boot 四】启动之准备系统环境environmentPrepared

石臻臻的杂货铺

Spring Boot 8月月更

CVE-2021-37580 Apache ShenYu 身份验证绕过漏洞复现

美创科技

漏洞

vue-router 如何实现支持外部链接

Five

vue-router 路由 8月月更

RT-Thread记录(二、RT-Thread内核启动流程 — 启动文件和源码分析)

矜辰所致

RTT RT-Thread 8月月更

【Spring Boot 三】SpringBoot中事件与通知

石臻臻的杂货铺

Spring Boot 8月月更

手摸手带你 在 Windows 系统中安装 Istio

万猫学社

云原生 istio windows

后台权限系统的设计以及主流的五种权限模型详解

Java全栈架构师

Java 程序员 架构 面试 后端

文盘Rust -- 配置文件解析

TiDB 社区干货传送门

开发语言

我和 TiDB 的故事 | 学tidb半年,社区治好了我的精神内耗

TiDB 社区干货传送门

人物访谈 社区活动

对话庄表伟:开源第一课

开源社

#开源

国密是什么意思?属于商密还是普密?

行云管家

信息安全 国密

2022年6月互联网医疗领域月度观察

易观分析

医疗 市场

酷炫一款动态背景+鼠标点击效果(HTML +js canvas)

Five

Hexo js 动效 canvas 8月月更

自己动手制作elasticsearch-head的Docker镜像

程序员欣宸

Java Docker elasticsearch 8月月更

内存问题难定位,那是因为你没用ASAN

华为云开发者联盟

云计算 开发 内存

我和TiDB的故事 | 遇上你是我的缘

TiDB 社区干货传送门

人物访谈 社区活动

荆棘与玫瑰:基础服务架构师的成⻓之路

九叔(高翔龙)

架构师 全球架构师峰会

继Stability AI、AI21 Labs和LG AI之后,TII也用亚马逊云科技训练大模型_AI&大模型_李冬梅_InfoQ精选文章