面對生成式 AI 浪潮帶來的海量運算與儲存需求,大多數企業的直覺反應是擴建資料中心或增加硬體採購。然而,雲端儲存巨頭 Dropbox 提出了一種不同的觀點:透過對現有基礎設施進行深度的效率優化,可以在不盲目擴張物理空間的情況下,為 AI 工作負載創造必要的資源空間。根據國際能源總署(IEA)的預測,全球資料中心的電力消耗在 2030 年前將幾乎翻倍,這使得如何在既有設備中榨出更多效能,成為企業降低成本與維持永續發展的關鍵。
基礎設施的全面掌控與需求預測
Dropbox 的優化策略建立在對底層硬體的極高掌控力之上。該公司結合了自有的 Magic Pocket 儲存系統與託管資料中心(Colocated Data Centers),這意味著工程師可以從上層的軟體工作負載,一路向下監控到機櫃、電力供應以及冷卻系統。這種全棧的可視性讓他們能精準地在不同層級解決容量瓶頸。
在硬體部署之前,Dropbox 採取的是長期預測機制。他們會提前數月甚至數年預估需求,確保新增容量是經過深思熟慮的,而非應急式採購。這種做法能確保系統在面對設備故障、例行維護或工作負載劇烈波動時,依然保有足夠的緩衝空間(Headroom),避免因資源吃緊而導致服務不穩定。
動態資源調度與儲存密度提升
為了將電力成本降至最低,Dropbox 開發了名為 Deep Sleep 的系統。該系統能自動將閒置的伺服器關機,或將未使用的硬碟置於待機模式。由於伺服器可以在數分鐘內重新啟動,公司能夠在保留備用容量的同時,避免為所有設備支付全額的能耗費用。此外,當資源分布不均導致局部過熱或過載時,他們會透過重新平衡(Rebalancing)將工作負載在整個設備集群中移動,防止因單一機櫃壓力過大而觸發不必要的硬體採購。
在儲存密度方面,Dropbox 導入了 SMR(Shingled Magnetic Recording,疊瓦式磁記錄)技術。這是一種透過讓磁軌像屋頂瓦片一樣重疊排列,來增加單一硬碟儲存容量的技術。這使得每個機櫃能容納更多數據,而不需要與客戶需求的增長速度同步擴張物理空間。為了量化成效,Dropbox 使用每 PB 瓦數(Watts per Petabyte)作為指標,結果顯示自 2020 年以來,其儲存基礎設施的電力效率提升了 50% 以上。
硬體生命週期管理與物理限制突破
除了軟體調度,硬體汰換策略也被納入效率考量。Dropbox 並非單純根據設備年限來決定汰換時間,而是根據實際觀測到的可靠性與故障率來決定系統的服役期限。透過延長可靠硬體的生命週期,能有效減少維持相同容量所需的新設備數量。
然而,隨著硬體性能提升,物理限制也隨之而來。當 Dropbox 引入第七代伺服器時,發現其高功耗超過了既有機櫃的設計上限。為了避免重建整個資料中心的基礎設施,工程師採取了針對性的改造:在保留原有匯流排(Busways,電力傳輸通道)的前提下,將每個機櫃的 PDU(Power Distribution Units,電源分配單元)數量增加一倍。這種在既有框架下進行局部升級的做法,在未來 AI 伺服器推高機櫃功率密度的趨勢下,將會變得更加普遍。
實務意義與未來挑戰
Dropbox 的經驗證明,應對 AI 帶來的基礎設施壓力,並不等同於單純地建造更多資料中心。透過關閉閒置硬體、優化工作負載分佈、提升儲存密度、延長硬體壽命以及靈活調整物理電力配置,企業可以創造出大量的隱形容量。
根據 Gartner 的預測,到 2027 年,AI 優化伺服器的耗電量將遠高於傳統伺服器。這意味著未來企業面臨的挑戰將不再僅僅是運算能力(Compute Capacity),而是電力供應與散熱效率。Dropbox 的案例提供了一個重要的參考模型:在追求 AI 擴張的同時,將基礎設施的效率極大化,才是確保技術迭代與成本控制能達成平衡的唯一路徑。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。