写点什么

AI 推理规模上升后,华为开始重新定义“存储”的位置

  • 2026-08-10
    北京
  • 本文字数:2434 字

    阅读完需:约 8 分钟

AI摘要

华为提出AI数据中心数据基础设施五层架构,聚焦模型与Agent规模化落地后的数据存储、管理与持续调用挑战。

AI数据湖需统一纳管多源异构数据,并支撑清洗、标注、检索等AI就绪处理;五层架构中数据安全与韧性贯穿始终;AI基础设施重心正从算力/模型向数据层迁移。

适合AI平台工程师、数据基础设施架构师、企业AI运维负责人阅读。

当 AI 从模型训练进入大规模推理和 Agent 落地阶段,数据中心的瓶颈也在发生变化。

 

8 月 6 日,2026 华为数据存储用户精英论坛暨 OceanClub 嘉年华在无锡举行。

 

会上,华为围绕 AI 数据湖、AI 数据平台、算力、模型和 Agent 五个层次,进一步介绍了 AI DC 数据基础设施全栈方案,并公布过去一年针对用户反馈进行的 TOPN 专项改进。

 

与过去更多强调单一存储产品不同,这次华为讨论的核心问题是:当企业开始部署大量模型和 Agent 之后,数据应该如何被存储、管理和持续调用。

 

华为公司副总裁、数据存储产品线总裁袁远在会上提出,AI 发展的重点正在从算力、模型逐渐延伸到数据。

 

在他的划分中,企业 AI DC 数据基础设施可以分为五层:底层是 AI 数据湖,向上依次是 AI 数据平台、算力层、模型层以及 Agent 平台,数据安全和韧性则贯穿整个架构。

 

这套架构并非此次无锡会议首次提出。华为此前已经发布相关 AI DC 数据基础设施方案,此次论坛更多是针对国内企业的实际部署,对各层能力进行了进一步拆解。

 

从“把数据存下来”,到让数据进入推理过程

最底层的 AI 数据湖首先解决数据分散的问题。

 

企业内部的数据通常散落在不同数据中心、服务器和业务系统中,而且包含文本、图像、视频等不同类型。进入 AI 阶段之后,这些数据还要进一步经过清洗、标注、检索和转换,最终成为模型训练和 Agent 调用的语料与知识。

 

因此,华为希望通过 OceanStor Pacific、Omni-Dataverse 等产品,将原本分散的数据形成统一数据空间。

 

但此次论坛更值得关注的变化发生在 AI 数据平台层。

 

随着推理规模扩大,Agent 运行过程中产生的上下文数据急剧增加,仅依靠 HBM 显存和 DRAM 内存已经开始面临容量和成本压力。

 

华为提出了业界首个面向大规模推理、支持异构算力的上下文记忆存储 CMS,是一种 G3.5 存储。

 

随后,在媒体沟通会上,InfoQ 关注到一个更具体的问题:当前 AI 行业通用的存储层级,普遍遵循 G1(HBM)-G2(DRAM)-G3(本地 SSD)-G4(共享存储)的四层架构。相比继续增加显存、服务器内存或者本地 SSD,G3.5 这一类新的存储形态究竟在什么情况下才有优势?

 

华为数据存储产品线相关负责人吴俊杰表示“G3.5 存储是在大模型推理数量大幅上升的情况下产生出来的一个新事物。HBM 和内存在价格、容量上不能满足 Token 数量以及序列长度要求的时候,就需要一种新的存储形态。”

 

按照他的判断,当推理集群进入超节点以及千卡、万卡规模,需要构建 PB 级共享 KV Cache 池时,这类外置上下文存储的收益才会更加明显。

 

也就是说,G3.5 并不是简单用 SSD 代替显存,而是置于 G3 层与 G4 层之间,在 G1 层(HBM)、G2 层(DRAM)之外增加一个高速、容量更大、可以共享的中间缓冲层,把不需要始终驻留显存的数据保存下来,减少重复计算。

 

存储由此开始从传统的数据持久化设备,进入到模型推理的路径之中。

为什么突然强调“全栈”

 

过去一年,华为已经陆续发布 AI 数据湖、UCM 推理记忆数据管理以及 AI 数据平台等技术。

 

因此,一个自然的问题是:今年开始频繁强调“全栈”,是否意味着存储战略发生变化?

吴俊杰对此表示,整体方向并没有改变。

 

“所有动作的核心始终只有一个——推动 AI 落地。”

 

在他的解释中,过去更多是在具体场景中做单点突破,例如 KV Cache、知识库和行业联合创新;现在所谓全栈,是把此前形成的不同能力整合到统一架构中。

 

“战略是没有变化的,我们应该说是在逐步深化。”

 

这种变化也意味着华为数据存储产品线正在向传统存储边界之外延伸。

 

例如,ModelEngine 开始覆盖模型部署以及 GPU、NPU 资源调度;Nexent 则进一步进入 Agent 开发和运行环境。华为希望将数据、算力、模型和 Agent 之间原本分散的环节连接起来。

 

对于企业而言,更现实的问题是:过去已经投入大量资金建设的数据中心怎么办?

 

吴俊杰表示,华为提过了多种灵活部署方式,以 AI 数据平台为例,目前提供两种方式。

 

新建 AI 数据平台的客户可以使用 OceanStor A800;而已经部署 OceanStor Dorado 的客户,可以通过增加数据引擎节点,在保留原有存储投资的基础上增加 AI 能力。

 

这实际上反映了当前企业 AI 基础设施的一个普遍状态:传统数据库、ERP 等业务不会因为 AI 出现而消失,未来相当长时间内,传统 IT 和 AI 工作负载仍然会共存。

 

因此,AI 数据中心更多会是渐进式改造,而不是一次性重建。

“AI 下半程关键是数据”

此次论坛上,华为和存储用户都多次提到一个判断:AI 的下半程关键在于数据。

 

吴俊杰对此作了进一步解释。

 

他认为,算力仍然是 AI 发展的基础,但当企业逐渐完成第一阶段算力部署,模型能力也越来越成熟之后,决定 AI 最终效果的因素会越来越多地落到数据上。

 

以医疗为例,一家医院过去可能只需要把 CT、病理片保存在各个科室的服务器中;但如果要训练病理大模型,这些历史数据就需要重新汇集、治理并形成可以被模型使用的数据集。

 

科研、汽车、制造等行业也面临类似情况。

 

过去很多数据“存下来就结束了”,现在则需要重新成为模型的知识、Agent 的上下文以及长期记忆。

 

这也是为什么存储厂商开始关注 KV Cache、向量检索和 Agent Memory,而不仅仅讨论容量和 IOPS。

 

AI 需求增长的另一面,是存储价格和供应变化。

 

那么,这一轮存储周期究竟会持续多久?

 

在媒体沟通会上,吴俊杰表示,全球存储厂商目前都受到上游供应变化影响。

 

对于市场周期,他给出了一个相对明确的判断:按照目前的需求情况,这一轮存储周期可能持续至 2028 年上半年左右。

 

但他同时强调,这并不是一个确定结论。如果 AI 产业热度下降、基础设施需求回归常态,存储价格也可能随之趋于平稳。

 

因此,与其说 AI 让存储“摆脱周期”,不如说它正在增加一批新的存储需求。

 

包括训练语料、向量数据、KV Cache、Agent 上下文以及长期记忆,都在扩大 AI 系统需要管理的数据总量。

 

此次华为提出的 AI DC 数据基础设施参考架构,本质上也是对这一变化的回应。

 

过去存储主要解决“数据能不能可靠保存”;进入 Agent 和大规模推理阶段后,它开始进一步影响数据能不能被模型快速找到、上下文能保存多久,以及推理过程中是否需要反复计算。

 

对于存储行业而言,这可能比单纯的容量增长更值得关注。