LLM

突破量化精度損失:Liquid AI 透過量化感知蒸餾提升 LFM2.5 邊緣端效能

作者

此技術方案在『效能-品質』權衡上取得了極高水準的突破,將量化損失控制在 3% 內且提升了吞吐量,屬於極具實踐價值的工程優化。然而,其優勢建立在供應商端高昂的蒸餾訓練成本之上,這意味著該方案僅適用於擁有強大算力且追求極致終端體驗的模型開發商,而非一般中小規模的微調使用者。

突破量化精度損失:Liquid AI 透過量化感知蒸餾提升 LFM2.5 邊緣端效能

在大型語言模型(LLM)的部署過程中,模型的大小與運算需求始終是核心挑戰。為了讓模型能運行在記憶體有限的邊緣裝置上,開發者通常會採用量化(Quantization)技術。量化是指將模型權重從高精度的浮點數(例如 BF16)轉換為低精度的整數(例如 4-bit),以減少記憶體佔用並提升推理速度。然而,傳統的量化方法往往會導致模型精度的顯著下降,形成一種效能與品質的權衡。

為了克服這個問題,Liquid AI 近期發布了 LFM2.5 系列模型的 Q4_0 版本權重,並引入了一項關鍵技術:量化感知蒸餾(Quantization-Aware Distillation, QAD)。這項技術旨在讓模型在維持 4-bit 低記憶體佔用的同時,盡可能地恢復因量化而損失的推理能力。

量化感知蒸餾的核心運作邏輯在於改變了量化權重的生成方式。傳統的量化通常採用訓練後量化(Post-Training Quantization, PTQ),即在模型訓練完成後直接對權重進行截斷或捨入,這容易造成資訊遺失。而 QAD 則採取了一種教師與學生模型協作的模式:由一個高精度的教師模型(Teacher Model)將其知識傳遞給一個已經量化的學生模型(Student Model)。

在 QAD 的過程中,學生模型在量化狀態下進行學習,試圖模仿教師模型的高精度輸出。這種方式讓模型在訓練階段就適應低精度的權重分佈,而非在訓練後強行壓縮。透過這種機制,Liquid AI 成功地讓 LFM2.5 系列模型在 4-bit 量化後,能夠恢復約 97% 因量化而損失的 BF16 平均準確率。

這項技術的實務意義在於打破了低位元量化與高精度之間的矛盾。根據 Liquid AI 的測試結果,針對 LFM2.5-230M、350M、1.2B-Instruct 以及 2.6B 這四款模型,QAD 版本的 Q4_0 權重在推理、指令遵循、工具使用以及代理能力(Agentic Capabilities)等多項基準測試中,表現遠優於傳統 PTQ 量化版本。

具體而言,在 LFM2.5-230M 與 350M 的小型模型中,QAD Q4_0 的品質已能媲美更高精度的 Q5_K_M 量化版本,但解碼吞吐量(Decode Throughput)反而提升了 4% 到 33%。對於較大的 1.2B 與 2.6B 模型,QAD Q4_0 的品質則能達到 Q4_K_M 的水準,且吞吐量提升了 3% 到 14%。這意味著開發者可以使用更少的記憶體,獲得更快的反應速度,且幾乎不需要犧牲模型的智能程度。

在實際的邊緣硬體部署上,這類優化至關重要。Liquid AI 在 MacBook Pro、NucBox EVO-X2(使用 GPU 推理)、Samsung Galaxy S26 Ultra 以及 Raspberry Pi 5(使用 Arm CPU 推理)等設備上進行了驗證。結果顯示,QAD 權重能有效降低對硬體資源的依賴,讓複雜的 LLM 能夠在手機或單板電腦等嵌入式設備上流暢運行。

目前,這些 QAD Q4_0 權重已以 GGUF 格式發布在 Hugging Face 上。GGUF 是一種針對 llama.cpp 等推理框架優化的文件格式,旨在簡化模型載入過程並提升邊緣端執行效率。開發者可以直接使用支援 GGUF 的運行環境載入這些權重,將 LFM2.5 部署到各種極端受限的硬體環境中。

儘管 QAD 帶來了顯著的提升,但其限制在於訓練成本。相較於 PTQ 這種不需要重新訓練的快速量化方法,QAD 需要額外的蒸餾訓練過程,這意味著模型供應商必須投入更多的運算資源來預先生成這些優化權重。然而,對於終端使用者而言,這種預先投入換來的是在邊緣端部署時極高的效率與穩定性。

本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。