時間序列預測在企業營運中至關重要,無論是需求預測、能源負荷分析還是設備遙測監控,傳統做法通常需要針對每個不同的數據集獨立訓練並維護專屬模型。這種方式不僅耗時且對數據量要求高。為了改變這一現狀,IBM 推出了 Granite Time Series 基礎模型系列,旨在透過預訓練模型實現零樣本預測(Zero-shot Forecasting),讓使用者無需針對特定任務進行微調,即可直接對未見過的新數據生成準確預測。
近期 IBM 發佈了該系列的最新版本 PatchTST-FM-r2。這是一個擁有約 3.85 億個參數的模型,不僅在性能上有所提升,更重要的是它採用了對商業友好的開放授權(Apache 2.0 與 OpenMDW 1.0),讓企業能更放心地將其整合進生產環境。
核心技術與架構演進
PatchTST-FM-r2 在繼承前代 PatchTST-FM-r1 的分塊表示法(Patch-based representation)基礎上,對內部架構進行了重大重新設計。最核心的改變在於將標準的 Transformer 層替換為 Conformer 層。Conformer 是一種最初應用於語音處理的架構,它將多頭自注意力機制(Multi-head Self-attention)與時間卷積(Temporal Convolution)結合在一起。
在時間序列分析中,這兩種機制扮演互補角色。自注意力機制擅長捕捉長距離的全局依賴關係,而卷積層則能提供一種歸納偏置(Inductive Bias),專注於捕捉局部時間結構和短期互動。在實際的注意力模式分析中可以發現,標準 Transformer 往往將大量注意力集中在對角線附近(即局部關係),而 Conformer 則能將局部處理交給卷積層,讓注意力機制更有效地聚焦於遠距離的時間關聯。
此外,為了提升預測的平滑度與準確性,PatchTST-FM-r2 引入了 50% 重疊的分塊設計,並結合 Hamming 窗權重與重疊相加(Overlap-and-add)的預測方法,有效解決了分塊邊界的跳變問題。模型規模也從 20 個區塊擴展至 30 個,最高支持 8,192 個時間步長的上下文長度,並能透過 99 分位數預測頭提供機率預測(Probabilistic Forecasting),不僅給出單一預測值,還能提供不確定性區間。
性能表現與基準測試
為了驗證模型的通用能力,IBM 使用了 GIFT-Eval 這一綜合性時間序列預測基準測試。在僅限於零樣本、可複現且無測試集洩漏的模型類別中,PatchTST-FM-r2 在 CRPS(連續排位概率分數)和 MASE(平均絕對縮放誤差)兩項關鍵指標上均排名第二,且在所有採取寬鬆商業授權的模型中排名第一。
值得注意的是,即使將其與那些允許使用基準測試訓練數據的預訓練模型(Pretrained models)相比,PatchTST-FM-r2 依然展現出強大的競爭力,在 CRPS 指標上排名第三,MASE 排名第四,甚至超越了部分參數規模更大的模型。這證明了該模型在面對完全陌生數據集時,具有極強的泛化能力。
數據透明度與商業部署
對於企業級應用,模型的透明度與法規合規性與性能同樣重要。IBM 明確披露了 PatchTST-FM-r2 的預訓練數據來源,包括 GiftEvalPretrain 選定集、基於 KernelSynth 的自定義合成數據、排除 GIFT-Eval 評估集的 TSMixup 語料庫,以及約 50 萬條合成的 CauKer 序列。這種透明度讓企業在進行模型治理與授權審查時,能清楚了解模型可能的偏好與限制。
在實務部署方面,該模型不僅支持靜態數據框(DataFrame)的批處理預測,還透過與 Confluent 的合作,將 Granite Time Series 模型整合進 Confluent Cloud。利用 Apache Flink 的流處理能力,企業可以直接在數據流中進行即時預測與異常檢測,而無需將數據搬運至獨立的機器學習環境中,大幅降低了生產環境的延遲與複雜度。
限制與實務意義
雖然 PatchTST-FM-r2 在零樣本場景下表現卓越,但使用者仍需注意其對數據頻率與採樣規律的依賴。該模型最適合處理定期採樣的時間序列數據。儘管它提供了強大的通用預測能力,但在極端特殊或高度領域專業的數據集上,適度的微調(Fine-tuning)可能仍能帶來進一步的提升。
總體而言,PatchTST-FM-r2 的發佈降低了企業部署高性能時間序列預測系統的門檻。它將預測任務從繁重的單獨模型訓練,轉向以基礎模型為核心、結合流式處理的現代化架構,為需求預測、電網負荷分析及工業監控提供了更高效且低成本的解決方案。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。