Liquid AI

邊緣運算新突破:解析 Liquid AI 的高效能視覺語言模型 LFM2.5-VL-3B

作者

該模型在參數規模與端側性能之間取得了極高效率的權衡,成功將 VLM 的實用門檻降低至手機端。其在 UI 解析與吞吐量上的表現足以定義為『邊緣端領先』,但其『直接回答』的設計邏輯雖提升了速度,卻是以犧牲深層鏈式推理(CoT)能力為代價,因此僅適用於任務導向的代理場景,而非複雜的知識研發。

邊緣運算新突破:解析 Liquid AI 的高效能視覺語言模型 LFM2.5-VL-3B

在當前的人工智慧發展趨勢中,將大型模型從雲端移至裝置端(On-device)的邊緣運算,是實現即時回應與隱私保護的關鍵。然而,視覺語言模型(Vision-Language Model, VLM)由於需要同時處理圖像與文本資訊,通常對運算資源要求極高,導致在手機或筆記型電腦等邊緣設備上運行時,常面臨延遲過高或記憶體不足的問題。為了打破這個瓶頸,Liquid AI 推出了 LFM2.5-VL-3B,這是一款專為邊緣端設計、兼顧速度與能力的輕量化視覺語言模型。

背景與設計目標

LFM2.5-VL-3B 的核心目標是在維持低延遲的前提下,提供強大的視覺理解能力。與許多傾向於透過複雜推理過程來獲取答案的模型不同,LFM2.5-VL-3B 採取直接回答的模式,旨在滿足即時應用場景的需求。該模型在設計上重點強化了四個關鍵維度:首先是螢幕與使用者介面(UI)的理解,使其能精準解析不同設備的數位畫面;其次是 Grounding(視覺定位),即能根據自然語言指令在圖像中精確標出物體位置;第三是多圖輸入能力,提升跨影像的邏輯推理;最後是 Function Calling(函數呼叫),使其在純文字或視覺文本情境下,能更精準地調用外部工具執行任務。

技術架構與訓練過程

在技術組成上,LFM2.5-VL-3B 採用了 SigLIP2 400M NaFlex 作為視覺編碼器(Vision Encoder),視覺編碼器的作用是將圖像資訊轉換為模型可理解的向量特徵。而其文本處理部分則延用了 LFM2.5-2.6B 文本模型的預訓練骨幹(Backbone)。

為了提升模型的泛化能力,Liquid AI 使用了約 34 兆(34T 個 Token 進行預訓練,且視覺數據量較前代提升了四倍,涵蓋了精心篩選的圖像描述、光學字元辨識(OCR)、視覺定位以及指令遵循等合成數據集。針對多語言支持,團隊並未從零開始重新訓練,而是透過擴展分詞器(Tokenizer)將詞彙量增加至 128K,以有效支持非拉丁系文字。

在後訓練階段,模型經歷了兩個步驟。第一階段是監督式微調(SFT),其中引入了來自更大規模教師模型的知識蒸餾(Knowledge Distillation),將大模型的知識轉移至小模型中,並結合 Antidoom 訓練法。第二階段則是採用多獎勵強化學習(Multi-reward Reinforcement Learning, RL),進一步優化輸出的品質與對齊度。

實測性能與邊緣端表現

根據基準測試結果,LFM2.5-VL-3B 在同尺寸模型中表現優異。在視覺理解方面,它在 RealWorldQA 等現實世界圖像任務中領先同級模型,且在處理數位內容(如圖表、文件、UI 元素)時具有極強的閱讀能力。特別是在 ScreenSpot-v2 等螢幕理解測試中,其表現遠超前代 LFM2-VL-3B。

在推理速度上,該模型展現了極高的效率。在 M5 Max 晶片上可達到每秒 228 個 Token 的解碼速度,在 Ryzen AI Max+ 395 上則為 116 Token/s,甚至在 Galaxy S26 Ultra 手機上也能維持每秒 20 Token 的運行速度。記憶體佔用僅約 3 GB,使其能完全在裝置端本地運行。此外,在 GPU 高併發環境下,其輸出吞吐量可達每秒 11,000 個 Token,約為同類 4B 規模模型的兩倍,單張 H100 顯卡一天可產出近 10 億個輸出 Token。

實務意義與限制

LFM2.5-VL-3B 的出現,為需要處理大量工作負載且要求低延遲的邊緣端智能應用提供了新選擇。它不僅能處理基礎的圖像描述與視覺問答,更能將視覺能力與工具調用結合,使其能作為自動化代理(Agent)在本地端操作軟體或分析複雜文件。

然而,作為一個 3B 規模的輕量化模型,其能力上限仍受限於參數數量。雖然在多項基準測試中領先同級模型,但在極高複雜度的科學推理或深層邏輯分析上,可能仍不及參數規模更大的模型。此外,雖然它支持多語言,但在極少數冷門語言的理解深度上可能仍有提升空間。儘管如此,對於追求速度、成本與隱私的邊緣端應用而言,LFM2.5-VL-3B 在效能與資源消耗之間取得了極佳的平衡。

本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。