写点什么

效率提升 11 倍,PODsys 如何快速部署大模型 AI 算力平台?

  • 2023-11-09
    北京
  • 本文字数:1875 字

    阅读完需:约 6 分钟

大小:957.59K时长:05:26
效率提升11倍,PODsys如何快速部署大模型AI算力平台?

大模型是通用人工智能的底座,但大模型训练对算力平台的依赖非常大。大模型算力平台是指支撑大模型训练和推理部署的算力基础设施,包括业界最新的加速卡、高速互联网络、高性能分布式存储系统、液冷系统和高效易用的大模型研发工具和框架。在算力平台的部署过程中,大模型研发机构常常需要面对一系列的问题:大模型算力平台是什么样的?如何快速构建大模型算力平台?如何确保算力平台稳定可靠?如何提升部署效率?如何提升算力平台的性能……这些问题能否顺利解决,直接关系到大模型研发和应用落地的速度。

 

为了帮助用户加速大模型的技术创新与应用落地,浪潮信息发布了大模型智算软件栈 OGAI(Open GenAI Infra)。OGAI 由 5 层架构组成,从 L0 到 L4 分别对应于基础设施层的智算中心 OS 产品、系统环境层的 PODsys 产品、调度平台层的 AIStation 产品、模型工具层的 YLink 产品和多模纳管层的 MModel 产品。

 

其中 L1 层 PODsys 是一个为客户提供智算集群系统环境部署方案的开源项目,具备基础设施环境安装、环境部署、用户管理、系统监控和资源调度等能力。用户只需执行两条简单的命令,即可完成大模型算力平台的部署,将大模型算力平台部署效率提升 11 倍,帮助用户顺利迈出大模型研发的第一步。(下载地址:https://podsys.ai/

大模型算力平台部署难题亟待求解

 

大模型参数量和训练数据复杂性快速增加,对 AI 算力平台的建设提出了新的要求,即需要从数据中心规模化算力部署的角度,统筹考虑大模型分布式训练对计算、网络和存储的需求特点,并集成平台软件、结合应用实践,充分关注数据传输、任务调度、并行优化、资源利用率等,设计和构建高性能、高速互联、存算平衡的可扩展集群系统,以满足 AI 大模型的训练需求。

 

强大的大模型算力平台不仅需要高性能的 CPU、GPU、存储、网络等硬件设备,还需要考虑不同硬件和软件之间的兼容性和版本选择,确保驱动和工具的适配性和稳定性。当算力平台的规模从十几台服务器扩展到几百台,平台部署难度会呈指数级上升。

 

首先,算力平台部署需要的相关驱动程序、软件包往往高达数十个,正确安装、部署并优化这些驱动程序与软件,需要专业的运维工程师和大量调试时间,严重影响部署效率。其次,为了确保算力平台的高性能和稳定运行,需要验证不同硬件环境下的软件适配,优化 BIOS、操作系统、底层驱动、文件系统和网络等多项指标,找到最优的选择,这一工作同样费时费力。此外,算力平台的资源状态处于时刻的变动中,如果不进行合理的资源调度与管理,很容易影响平台的资源利用率。

如何快速部署大模型算力平台?

 

PODsys 专注于大模型算力平台部署场景,提供包括基础设施环境安装、环境部署、用户管理、系统监控和资源调度在内的完整工具链,旨在打造一个开源、高效、兼容、易用的智算集群系统方案。

 

PODsys 整合了大模型算力平台部署所需的数十个驱动、软件等安装包以及对应的依赖和兼容关系,并提供了一系列的简化部署的脚本工具。使用这些工具只需要简单 2 个步骤,PODsys 即可帮助用户快速部署大模型算力平台。



步骤 1:使用 docker run 命令快速启动 PODsys 系统。

 

PODsys 系统集成了大模型算力平台部署所需的操作系统、GPU 驱动、网卡驱动、通信加速库等数十个驱动程序、软件和安装包,并提供了一系列脚本工具来简化部署,让用户可以快速安装、配置和更新集群环境。PODsys 大量选用了业界广泛使用的主流开源系统、工具、框架和软件,来保障整个部署方案的开放性、兼容性和稳定性。

 

步骤 2:使用 install_client 命令快速部署大模型算力平台的并行软件环境。

 

PODsys 将单机部署方式改成集群部署方式,可将部署效率提升 11 倍以上。在管理节点运行一句简单的命令(install_client.sh),即可完成大模型算力平台的环境配置,集成了高速文件系统接口、自动化运维工具、NVDIA CUDA 编程框架、NCCL 高性能通信库,支持 NGC 加速平台等功能。并能实现多用户、多租户管理集群。

 

PODsys 提供了全面的系统监控和管理,帮助用户实时监控集群的状态和性能指标。通过可视化的界面,用户可以查看集群资源的使用情况、作业的执行情况和性能瓶颈,从而及时调整集群配置和优化作业性能,来保证算力平台的高性能和稳定运行。



此外,PODsys 具备高效的资源调度和作业管理功能,可以根据用户的需求自动调度和管理作业,确保集群的资源利用率和作业的执行效率。

 

伴随着大模型的快速应用,算力平台的鲁棒性、易用性、部署效率成为用户关注的首要问题。针对商业用户,PODsys 还提供专业的算力平台性能调优服务。总之,PODsys 提供了一套完整的工具链,将大模型平台部署变得像系统安装一样简单,让用户省时、省力地部署大模型算力平台,助力大模型创新走好第一步。

2023-11-09 17:185659

评论

发布
暂无评论
发现更多内容

政务一体化平台的小程序化构建路径:生态融合驱动下的数字化转型创新实践

xuyinyin

通义灵码2.5 | 一个更懂开发者的 AI 编程助手

阿里云云效

阿里云 通义灵码

开放创新,昇腾 CANN 再向深处

极客天地

Nessus Professional 10.9 Auto Installer for Windows

sysin

Nessus

伊克罗德信息助力傲雷部署飞连平台,全球化管理效能全面升级

伊克罗德信息科技

屏蔽海外流量是什么意思

网络安全服务

CDN 防火墙 waf DDoS 攻击 海外IP

低成本创业新方向:使用现成源码搭建游戏陪玩小程序平台

DUOKE七七

MySQL uniapp thinkphp

时序数据库 TDengine × Looker Studio:不懂设计也能做出高颜值报表

TDengine

tdengine 数据分析 可视化 时序数据库 时序数据库tdengine

Tenable Nessus 10.9.0 (macOS, Linux, Windows) - 漏洞评估解决方案

sysin

Nessus

扫描全能王联合上海电影博物馆发起特色探馆活动,AI助力存档百年光影

合合技术团队

人工智能 算法 #大数据

白鲸开源斩获「创业新星企业奖」,双开源项目同步摘奖!

白鲸开源

数据库 大数据 开源 DataOps 白鲸开源

网站访问分析30分钟实战指南:ClkLog开源社区版

ClkLog

开源 埋点 sdk 用户行为分析 画像

某医药集团月结之战:从“数据泥潭”到“秒级决胜”的破局之路

YMatrix 超融合数据库

财务 HTAP 超融合数据库 HTAP 场景实践 YMatrix

Nessus Professional 10.9 Auto Installer for Ubuntu 24.04

sysin

Nessus

Nessus Professional 10.9 Auto Installer for macOS Sequoia

sysin

Nessus

商品中心—缓存与DB一致性的技术文档

不在线第一只蜗牛

Java 数据库

DNS解析中的TTL值的设置方法和注意事项

防火墙后吃泡面

搭建Coze扣子文档智能问答Bot工作流,保姆级教程来了!

合合技术团队

人工智能 算法 #大数据

淘宝图搜接口功能解析,精准搜索相似商品

tbapi

淘宝图片搜索接口 淘宝拍立淘接口 淘宝图片api

Studio 3T 2025.12 发布,新增功能简介

sysin

Studio 3T

Nessus Professional 10.9 Auto Installer for RHEL 9, AlmaLinux 9, Rocky Linux 9

sysin

Nessus

Nextcloud Android 客户端 - 安全高效的文件同步与管理

qife122

开源 Nextcloud

捷途汽车6月销售汽车55741辆,上半年累销突破299368辆

科技热闻

CAD图纸填充不完整是怎么回事?快试试这种方法!

在路上

cad cad看图

基于华为开发者空间 - 开发平台,构建AI会议助手

华为云开发者联盟

welink 华为云FunctionGraph 华为开发者空间 MCP Server

好消息!Apache DolphinScheduler 荣获上海上海菁英荟优秀开源项目奖

白鲸开源

大数据 开源 Apache DolphinScheduler 上海 大数据调度

通义灵码2.5 | 一个更懂开发者的 AI 编程助手

阿里巴巴云原生

阿里云 通义灵码

喜讯!Apache SeaTunnel 荣获上海开源创新菁英荟优秀开源项目奖

白鲸开源

开源 ETL 数据集成 Apache SeaTunnel 上海

AI驱动,治理升级!数造科技亮相中博会,打造一站式数据开发治理新范式

数造万象

人工智能 数据治理 数据开发 热门推荐 AI 智能体

新《公司法》实施周年实务挑战加剧,Alpha系统「公司法专题库」破解律师专业升级困局

科技汇

FinClip驱动App轻量化重构:组件化生态赋能前端效能跃迁

xuyinyin

效率提升11倍,PODsys如何快速部署大模型AI算力平台?_AI&大模型_Pu QIN_InfoQ精选文章