Dropbox 分享十年基础设施优化工作如何帮助公司应对 AI 带来的不断增长的需求,而并非单纯依靠新增数据中心算力来解决问题。优化工作包括需求预测、机群利用率、存储密度、硬件生命周期以及机架级电力输送,其中大部分工作早在当前这波 AI 热潮兴起之前就已落地。
国际能源署预测,随着 AI 工作负载的扩展,到 2030 年全球数据中心电力消耗将大约翻一番,这使得从现有基础设施中提取更多可用容量的能力变得越来越有价值。

IEA (2025),全球数据中心电力消耗,按设备划分,基准情景,2020-2030 年,IEA,巴黎
Dropbox 将其 Magic Pocket 存储系统与托管数据中心相结合,在托管数据中心中管理自己的服务器和网络设备。这使得工程师能够实现从上层软件工作负载,一直到机架、供电和制冷系统的全链路可视性,从而可以在技术栈的多个层级解决容量瓶颈问题。
Dropbox 的优化工作在硬件部署阶段之前就已启动,提前数月甚至数年预测需求,以便有计划地增加容量,同时为故障、维护和不断变化的工作负载保留余量。
硬件投入运行后,Dropbox 的 Deep Sleep 系统会关闭空闲服务器或将未使用的磁盘置于待机状态。服务器可在几分钟内恢复服务,实现在保留备用容量的同时无需为持续运行所有已分配硬件承担全额电力开销。
当尚有容量但分布不均时,Dropbox 会选择在机群中迁移工作负载。资源重新平衡可以防止局部热点触发额外的硬件采购,而此时基础设施其他地方仍存在未使用的容量。
存储规模增长带来了另一个问题:如何将更多数据装入相同的物理空间。Dropbox 采用了包括叠瓦式磁记录在内的技术手段来提高存储密度,让每个机架可以承载更多数据,无需按照用户需求的增速同步扩容。
公司使用每 PB 瓦特数作为衡量指标,并表示自 2020 年以来其存储基础设施的能效提高了 50% 以上。Dropbox 使用这一指标的原因在于:即使存储每 PB 数据所需的电量持续下降,随着服务增长,总电力消耗仍可能增加。
硬件更换也成为效率提升工作的一部分。Dropbox 表示,它不是仅根据固定使用年限淘汰设备,而是根据观察到的可靠性和故障率来确定系统可以服役多长时间。延长硬件有效使用周期能够在维持既定容量水平的前提下减少新设备采购量。
当 Dropbox 推出第七代服务器时,遇到了机房物理条件的瓶颈。这些服务器更高的电力需求超出了现有机架设计,因此工程师将每个机架的配电单元数量增加了一倍,同时保留了现有的母线槽,而不是重建底层数据中心基础设施。
随着 AI 系统不断推高机架密度,这类瓶颈可能会变得更加普遍。Gartner 预测,到 2027 年,AI 优化服务器的电力消耗将超过传统数据中心服务器,这不仅对计算容量造成压力,也对电力输送和冷却造成压力。
Dropbox 的经验表明,应对不断增长的基础设施需求,并非只有新建更多数据中心这一条路。挖掘容量还可以通过关停闲置硬件、迁移工作负载、将更多数据装入现有机架、延长可靠硬件的使用寿命以及围绕更密集的系统调整物理基础设施来实现。
查看英文原文:https://www.infoq.com/news/2026/09/dropbox-datacenter/





