在人工智慧的發展過程中,大多數人的注意力集中在大型語言模型(LLM)的運算能力上,然而對於 Meta 這樣規模的社群平台而言,推薦系統與排序模型的效率同樣至關重要。這類模型與 LLM 的運算特性截然不同,其瓶頸往往不在於純粹的浮點運算吞吐量,而是在於海量數據在不同加速器之間傳輸的通訊壓力。為了突破這個瓶頸,Meta 推出了其首款針對訓練排序與推薦模型優化的自研加速器 MTIA 300,將其自研晶片策略從單純的運算核心擴展到了網路層級的整合。
推薦模型的特殊挑戰與通訊壓力
推薦模型的核心在於嵌入表(Embedding Tables),這類表格儲存了大量特徵資訊,Meta 指出,嵌入表往往佔據了推薦模型 99% 以上的參數。當這些模型在數百個加速器上進行分散式訓練時,會頻繁觸發集體通訊(Collective Communication)操作,例如 AllReduce(所有節點同步累加結果)、AllToAll(所有節點互換數據)以及 AllGather(將所有節點數據收集到每個節點)。
在傳統的硬體架構中,網路介面卡(NIC)通常位於 PCIe 匯流排的另一端,數據必須經過多次跳轉才能到達運算核心。這種設計在處理 LLM 時尚可接受,但在推薦模型這種「通訊密集型」的工作負載中,網路傳輸速度往往會成為限制整體效能的關鍵,導致運算單元在等待數據傳輸時處於閒置狀態。
MTIA 300 的硬體創新:將網路直接整合進晶片
為了消除傳輸延遲,Meta 在 MTIA 300 中採取了激進的整合策略,將網路介面直接納入加速器封裝之中。MTIA 300 包含了兩個網路晶片組(Network Chiplets),每個晶片組內建六個自研的 800 Gbps RDMA 網路介面卡(NIC)。RDMA 是一種遠端直接記憶體存取技術,允許電腦直接讀寫另一台電腦的記憶體而無需經過作業系統核心,從而大幅降低延遲並提升吞吐量。
透過這種設計,MTIA 300 實現了高達 1.2 TB/s 的總 I/O 頻寬,且數據傳輸完全不需要跨越 PCIe 匯流排。此外,這十二個 NIC 同時支援機架內的 Scale-up(垂直擴展)通訊以及機架間的 Scale-out(水平擴展)流量。這種靈活性讓 Meta 能在不重新設計晶片的情況下,根據需求調整頻寬的分配比例。
解耦通訊與運算:專用訊息引擎的導入
除了提升頻寬,Meta 還解決了資源爭搶的問題。在傳統 GPU 架構中,集體通訊操作往往會占用與模型訓練相同的運算資源,導致兩者在同時執行時會互相干擾。MTIA 300 則設計了 16 個專用的訊息引擎(Message Engines),這些引擎獨立於主運算網格之外,專門處理通訊任務,並配備了針對縮減操作(Reduction Operations)的近記憶體硬體。
這種硬體層級的解耦帶來了顯著的效能提升。Meta 的測試數據顯示,當大型矩陣運算與集體通訊同時運行時,MTIA 300 的運算吞吐量下降幅度低於 0.5%;相比之下,傳統 GPU 架構在相同情境下的效能損耗則超過 20%。
軟硬協同設計與 HCCL 函式庫
硬體的強大需要軟體的精準調度,因此 MTIA 300 是與 Meta 自研的集體通訊函式庫 HCCL 共同設計的。在傳統模式下,主機 CPU 必須在作業執行期間全程編排每一次的通訊操作,這會增加 CPU 負荷並引入額外的延遲。
HCCL 改變了這一流程,它將集體通訊操作編譯成子圖(Subgraphs),直接交付給 MTIA 300 的訊息引擎自主執行。一旦指令傳達至加速器,主機 CPU 就不再參與後續的通訊驅動過程。在實際生產環境中,HCCL 在機架內可達到 940 GB/s 的通訊頻寬。針對一個擁有 1,500 億參數的推薦模型,在 40 個加速器上運行時,MTIA 300 的總通訊時間較同等級的 GPU 集群縮短了 3.9 倍。
自研晶片策略的實務意義與產業趨勢
MTIA 300 的推出標誌著 Meta 自研晶片計畫的深化。目前 Meta 已部署數十萬顆用於推理(Inference)的 MTIA 加速器,並計劃在未來兩年內推出四代新產品,涵蓋排序、推薦及生成式 AI 等多樣化工作負載。
Meta 並非完全放棄外部供應商,而是採取一種組合策略(Portfolio Strategy),在與 Broadcom 合作開發未來 MTIA 世代的同時,依然採購 NVIDIA 與 AMD 的產品。這種趨勢在超大規模雲端服務商(Hyperscalers)中日益明顯,例如 Google 的 TPU、Amazon 的 Trainium 以及 Microsoft 的 Maia。
MTIA 300 的核心啟示在於:當 AI 工作負載達到一定規模且具有特定特性(如推薦模型)時,網路不再僅僅是支持運算的基礎設施,而應被視為運算本身的一部分。將運算、通訊硬體與集體通訊軟體進行深度共構,才能真正解決大規模分散式訓練中的數據移動瓶頸。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。