GPU 調度

從 FIFO 到約束感知調度:如何透過優化 GPU 分配順序提升 33% 利用率

作者

該方案展現了極高工程實踐價值,成功將硬體瓶頸問題轉化為可計算的組合優化問題,其對『非對稱懲罰機制』的設計精準捕捉了企業對低延遲的剛需。然而,系統的高度效能建立在預測模型的準確率之上,若預測端出現系統性偏差,其滾動優化策略可能導致資源調度震盪,因此該方案的穩定性取決於預測模型的魯棒性。

從 FIFO 到約束感知調度:如何透過優化 GPU 分配順序提升 33% 利用率

在企業級 AI 運作中,真正的瓶頸往往不在於模型本身的智能程度,而是在於 GPU 資源的利用率。許多組織在管理 GPU 集群時,傾向於使用簡單的 FIFO(First-In-First-Out,先入先出)調度機制,即請求先到的任務優先獲得資源。然而,這種方式在資源競爭激烈時會造成巨大的浪費。Dharma AI 在其技術分享中指出,僅僅透過改變資源分配的順序與邏輯,在相同的硬體與工作負載下,GPU 利用率最高可提升 33 個百分點,而優先權加權的產出(Priority-weighted output)平均提升了 52%。

背景與問題:FIFO 調度的隱形成本

在資源充足的情況下,FIFO 調度看似高效,因為所有任務都能順利執行。但當集群進入資源競爭狀態時,FIFO 的缺陷會顯現為兩種主要的成本損耗。

首先是預留資源的浪費。即時推論(Real-time inference)任務對延遲極其敏感,無法等待資源釋放。在 FIFO 體系中,為了保證可用性,管理員通常會根據該應用全天最高峰值的需求量來預留固定數量的 GPU。例如,某應用中午需要 6 顆 GPU,但凌晨僅需 2 顆,在預留模式下,這 6 顆 GPU 全天都被佔用,導致在非高峰時段有 4 顆 GPU 處於閒置且無法被其他批次任務使用的狀態。

其次是分配順序導致的容量碎片化。FIFO 不考慮任務的優先級或資源形狀(例如某些訓練任務需要連續的 GPU 區塊)。當資源被隨機分配給先到但低優先級的任務後,後到且高優先級的任務可能會因為缺乏足夠的連續空間而無法執行,即便集群整體仍有剩餘容量。這就像航空公司將飛機隨機分配給先預約的包機,導致真正高獲利的航線反而沒有飛機可用。

核心解決方案:約束感知調度器

為了克服上述問題,Dharma AI 開發了一套約束感知(Constraint-aware)的 GPU 分配器。該系統不再將即時推論視為一個固定的預留上限,而將其視為一條隨時間波動的需求曲線。

該調度器將工作負載分為兩類:一類是批次型(Batch-like),包含模型訓練、批次推論與量化(Quantization),這類任務一旦啟動就必須持有連續的 GPU 區塊直到結束;另一類是彈性型,即即時推論,其資源需求隨流量動態增減。

為了在數學上解決這個 NP-hard 的組合優化問題,系統定義了五項法律約束:每顆 GPU 在同一時間僅能服務一個任務、任務必須符合需求範圍、批次任務需佔用 2 的冪次方大小的連續區塊、即時任務在時間步之間的 GPU 切換數量有上限,以及啟動後的任務不可被中斷。

在目標函數上,系統引入了優先權與懲罰機制。將 GPU 分配給批次任務會獲得基於優先級的獎勵,而未能滿足即時推論需求則會承受高額懲罰(懲罰權重通常是獎勵的 5 到 10 倍)。這種不對稱設計確保了系統在追求利用率的同時,能優先保障低延遲的服務水準。

技術實作與運作方式

由於調度決策必須在極短的時間內完成(API 請求之間的間隙),系統採取了雙軌架構。在熱路徑(Hot path)上運行一個基於形式化模型設計的啟發式算法(Heuristic),確保產出的分配方案在構造上即為合法且快速,決策時間僅需 1 到 15 毫秒。而完整模式(Full mode)則將此結果作為起點,利用形式化模型進行週期性的優化審核。

此外,精準的預測是調度的前提。系統針對不同工作負載建立了專門的預測模型: 訓練任務:考慮 22 個特徵,區分全量微調或 LoRA 等 10 種變體,因為不同技術對顯存與時間的需求差異可達數千倍。 量化任務:根據參數規模與算法(如 AWQ, GPTQ)獨立預測,將其視為可調度的正式任務而非背景雜務。 即時推論:基於每週小時級流量歷史建立動態需求概況,取代傳統的峰值預留。

為了避免優化器僅考慮短期利益而損害未來(即所謂的終局效應 End-of-world effect),系統採取滾動優化策略:每次優化涵蓋 24 小時的視窗,但僅對當前時間步進行承諾,每 30 到 60 分鐘重新運行一次。這樣可以利用最新的數據修正預測誤差,而不會導致資源調度劇烈震盪。

實務意義與限制

實驗結果顯示,在訓練密集型場景中,利用率從 53.6% 提升至 87.0%,產出價值翻倍。即使在所有任務優先級相同的對照組中,利用率依然從 76.8% 提升至 87.5%,證明了全局規劃(Planning across the horizon)本身就比 FIFO 具有更高的效率。

這項技術的實務意義在於,它證明了在硬體設備已經折舊且固定不變的情況下,透過軟體層面的調度邏輯優化,能挖掘出巨大的隱藏容量。然而,該方案的限制在於高度依賴預測模型的準確性。如果對訓練時間或流量需求的預測出現嚴重偏差,調度器可能會做出錯誤的資源分配。因此,將專業化的預測模型與約束感知調度器結合,才是實現 GPU 資源最大化利用的完整路徑。

本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。