写点什么

西部数据 Tim Rausch:AI 不是只有 GPU,数据最终还要回到存储系统

  • 2026-07-22
    北京
  • 本文字数:3358 字

    阅读完需:约 11 分钟

AI摘要

AI推理阶段持续产生大量需长期保存的数据,推动存储架构从单纯计算导向转向数据生命周期管理。HBM/DRAM/SSD/HDD的边界正被重构,核心挑战在于匹配数据访问模式与介质特性以优化每TB全周期成本。

AI推理产生的缓存、日志、审计等数据需分级持久化,非训练阶段数据量不亚于训练本身。

存储介质选型需基于数据访问频次、保留时长和成本敏感度,而非仅看带宽或延迟。

HDD在AI数据生命周期中承担关键角色,尤其适用于推理衍生数据的冷热分层存储。

适合AI基础设施工程师、存储架构师、云平台SRE阅读

在大模型产业的讨论中,GPU、HBM 和高速互联通常占据舞台中央,机械硬盘则常被视为远离计算核心的“冷数据仓库”。但随着 AI 从模型训练走向大规模推理,这种判断正在变得过于简单。

7 月 19 日,在 2026 世界人工智能大会期间举行的一场分论坛上,西部数据开发工程高级副总裁 Tim Rausch 试图说明一个容易被忽略的事实:AI 不仅是计算系统,也是一套不断制造、复制、迁移和回收数据的系统。模型规模越大、用户越多、生成内容越丰富,对存储容量和分层管理的要求反而越高。

这并不意味着 HDD 会取代 SSD,更不意味着所有 AI 数据都应该回到机械硬盘。真正发生的变化是,HBM、DRAM、SSD 和 HDD 之间的边界正在重新划分。AI 基础设施竞争的下一阶段,不只是购买更多 GPU,还包括如何把数据放在合适的介质上,并控制每 TB 数据在整个生命周期内的成本。

AI 推理结束后,数据并没有消失

一个 AI 模型的生命周期通常从数据摄取开始。文本、图片、视频和其他训练资料首先被收集并保存,随后进入清洗、去重、偏差检查和标注等准备环节。训练开始后,数据从大容量存储迁移至 SSD、内存和 GPU 附近,供计算集群高频读取。

但训练完成并不是数据生命周期的终点。进入推理阶段后,系统还会产生用户提示词、上下文缓存、生成结果、调用日志、追踪记录、安全审计、合规信息、遥测数据和水印记录。这些数据中的一部分只在内存中短暂停留,另一部分则需要长期保存。

Rausch 在演讲中演示了一个视频生成请求:让 AI 生成一段 8 秒、720p 的短片。最终下载的视频大小只有 3.97MB,但按照其展示的系统估算,生成过程中约有 44GB 数据经过 GPU 处理,涉及约 40GB 模型权重、4GB 潜在张量以及解码后的原始帧。

更值得关注的是请求完成后的数据留存。按照这一案例的估算,平台保存的编码输出、中间结果、推理追踪、请求日志、合规记录、会话信息和元数据合计约 509MB,约为最终下载文件的 130 倍。

这一比例显然不能直接外推到所有 AI 应用,不同平台对中间结果、日志和合规数据的保留策略差异很大。但它揭示了一个普遍现象:用户看到的生成结果,只是 AI 数据足迹的一小部分。

生成内容还会被继续复制。一段视频可能保存在生成平台、个人云盘、即时通信软件和社交网络中;平台还可能再次使用 AI 进行内容理解、审核、推荐、字幕生成或广告匹配。每一次上传、转发和处理,都可能形成新的副本、索引、向量和日志。

因此,AI 带来的存储需求并不只来自训练集增长,也来自推理规模扩大和内容副本增多。GPU 反复处理数据,而数据本身则不断沉淀下来。

四层存储栈取代“SSD 加 HDD”的简单划分

传统互联网应用通常在闪存和 HDD 之间进行权衡:高频访问的数据放在 SSD 上,访问频率较低的内容逐步迁移到 HDD。AI 系统延续了这一原则,但存储层级变得更多,数据迁移也更加频繁。

最靠近 GPU 的是 HBM 和 DRAM,承担模型计算过程中的高速数据供给。其下一层是 KV 缓存,相当于模型在推理过程中的短期记忆,需要保存上下文和中间状态,目前主要由 DRAM 和 SSD 承载。

再往下是向量、嵌入、知识库和检索增强生成数据。这些数据既要求持久化,也需要较低延迟和较高随机读写性能,因此通常部署在 SSD 上。最底层则是训练数据、用户生成内容副本、日志、审计记录和归档数据,容量大、保存时间长,但并非始终需要高频访问,更适合放在 HDD 中。

这种分层并不是厂商人为划定的产品边界,而是由性能和经济性共同决定。没有大型 AI 系统会把所有数据长期保存在 HBM 或 DRAM 中,也不可能把需要高并发随机访问的数据全部放到 HDD 上。数据必须根据热度,从内存迁移到闪存,再进入容量层。

对大型云计算厂商而言,单位成本的微小差异会被数据规模迅速放大。

Rausch 举例称,假设某种介质每 GB 只贵 1 美分,在 1TB 手机上只是约 10 美元差价;但当一家企业管理 100EB 数据时,同样的差价将接近 10 亿美元。

这也是 AI 存储不能只讨论单盘价格的原因。真正需要计算的是总体拥有成本,包括硬盘、服务器、机架、交换机、线缆、电力、制冷、机房空间和运维人员等长期支出。容量密度越低,企业需要部署的硬盘、服务器和机架就越多,外围成本也会随之增加。

Rausch 援引的数据称,目前约 80%的 AI 相关内容存储在 HDD 上,约 20%位于 SSD。这个比例并不意味着两种介质正在争夺同一块固定市场。随着训练数据、生成内容和日志持续增加,HDD 和 SSD 更可能同步增长,只是承担不同任务。

百 TB 硬盘背后,不只是容量竞赛

为了应对数据规模上升,西部数据公布了一条同时推进能量辅助垂直磁记录和热辅助磁记录的路线。按照公司规划,40TB 级 ePMR 和 HAMR 硬盘已经进入客户送样阶段,44TB HAMR 样品计划于 2026 年晚些时候提供;两条路线预计在 2028 年前后达到 60TB,长期则逐步转向 HAMR,并以 2029 年实现 100TB 级硬盘为目标。

HAMR 的核心思路,是利用微型激光瞬间加热记录介质,使磁性晶粒能够进一步缩小,从而提升单位面积内的数据密度。西部数据称,目前单张盘片可以实现约 4TB 容量,未来希望提升至 7TB 乃至 10TB。同时,通过缩小激光头和其他组件,在一块硬盘中容纳更多盘片。按照其设想,14 张 7TB 盘片可接近 100TB,14 张 10TB 盘片则可能达到 140TB。

不过,容量增加也会带来新的问题。如果单盘容量翻倍,但读写性能没有同步提升,完成一次全盘扫描、数据重建或故障恢复所需的时间也会明显延长。在大规模存储集群中,这会直接影响系统可用性。

因此,西部数据同时展示了高带宽硬盘和双枢轴技术。前者通过多级执行器同时访问多条磁道,目前宣称可将随机读写吞吐量提升至传统 HDD 的 1.7 倍,顺序读写吞吐量提升至 2 倍,并规划向更多并发磁道扩展。后者则在一块硬盘中配置两套独立执行器,使 IOPS 和顺序 I/O 能力提升。

按照西部数据的路线,两种技术组合后,顺序 I/O 性能有望达到传统设计的 4 倍。高带宽硬盘已经进入客户验证,双枢轴产品预计在 2027 年至 2028 年初开始送样。

这些设计反映出容量型硬盘面临的真正挑战:未来的竞争不会只看“每块盘能装多少数据”,还要看单位容量对应的带宽、功耗和故障恢复效率。否则,更大的单盘容量可能只是把性能瓶颈集中到更少的设备中。

降低每 TB 成本,也意味着改变软件架构

除了等待更高容量硬盘,大型数据中心还可以通过 SMR 和可变容量提高现有设备的容量利用率。

SMR 通过让相邻磁道像屋瓦一样部分重叠,在相同盘片面积上增加约 20%的容量。但其代价是写入方式发生变化。传统 CMR 硬盘可以直接改写任意磁道,SMR 则需要按照分区顺序写入。删除数据后,系统还要读取分区中的有效内容,将保留数据与新数据重新写回,完成垃圾回收。

这意味着 SMR 并不是简单替换硬盘即可获得 20%容量。主机和存储软件必须理解分区状态、管理顺序写入,并根据业务负载安排垃圾回收。它更适合写入模式可预测、大文件占比较高,或者软件栈能够进行针对性改造的超大规模存储系统。

按照 Rausch 展示的简化模型,一个五年 TCO 为 100 万美元、容量为 40PB 的机架,每 TB 综合成本约为 25 美元。更换为 SMR 后,假设总成本上升到 110 万美元,而容量增至 48PB,每 TB 成本将下降到约 22.9 美元,降幅约 8.4%。

可变容量则试图释放制造过程中被固定容量档位舍弃的空间。传统硬盘通常按照 30TB、32TB 等标准容量出售,即使部分硬盘实际可稳定使用的容量高于标称值,多出的空间也不会被客户使用。在可变容量模式下,每块硬盘可以按照实测容量交付,例如 30.6TB、31TB 或 29.8TB。

如果一批产品平均实际容量为 30.9TB,相比统一配置为 30TB,系统总容量可增加约 3%。随着制造工艺成熟,同一款已认证硬盘的平均可用容量还可能继续提升,客户无需重新认证一套全新硬件设计。

代价同样落在软件层。传统 RAID 和存储系统往往默认同一资源池中的硬盘容量一致,而可变容量要求调度、冗余和数据布局算法能够管理不同大小的设备。

由此可见,AI 时代的存储优化并不存在免费的容量。无论是 SMR 还是可变容量,都是以软件复杂度换取更高密度和更低单位成本。硬盘厂商可以提供更大的介质,但客户能否真正获得 TCO 收益,取决于存储系统是否愿意改变数据写入、回收和调度方式。

AI 基础设施正在把行业带回一个并不新鲜、却更加迫切的问题:昂贵的计算资源需要高速数据供给,但不断累积的数据又不可能全部留在高性能介质中。未来的数据中心必须在速度、容量、功耗和成本之间进行更精细的分层。

GPU 决定模型能够算多快,存储系统则决定这些计算产生的数据能否被长期、经济地保存和再次利用。随着 AI 生成内容进入持续复制和循环训练阶段,存储不再只是计算之后的配套环节,而正在成为规模化 AI 能否维持经济性的关键约束。