在目前的生成式 AI 浪潮中,混合專家模型 Mixture-of-Experts,簡稱 MoE,已成為開發頂尖大模型的主流架構。MoE 的核心邏輯在於將模型分為多個專家網路,每次處理 Token 時僅激活其中一小部分參數,從而以較低的運算成本獲得巨大的模型容量。然而,這種架構在消費級硬體上部署時面臨嚴峻挑戰。雖然每次運算僅需部分參數的一小部分,但在解碼階段,系統必須在數千億個權重中快速路由並切換專家。在資料中心環境中,這可以透過 NVLink 等高頻寬互連技術解決,但在家用電腦上,受限於 PCIe 匯流排的傳輸速度與主記憶體延遲,權重在記憶體與 GPU 之間的搬運往往成為嚴重的效能瓶頸。
為了打破這一僵局,來自 UC Berkeley 與 MIT 的研究團隊,包含 Databricks 共同創辦人 Matei Zaharia 與 Ion Stoica 以及 Song Han 等學者,開發了一款名為 FreeToken 的開源推論引擎。這項技術的核心在於將個人電腦不再視為受限的資料中心節點,而是一個彈性的異質運算框架,旨在讓消費級顯卡也能高效執行前沿的巨型 MoE 模型。
核心技術與運作機制
傳統的邊緣端運行環境通常採用靜態卸載策略,將不常用的專家權重存放於系統記憶體中,當需要時才同步串流至 GPU。這種方式在發生快取缺失時會導致 GPU 完全停擺,等待數據傳輸完成。FreeToken 則引入了一套名為 q* policy 的動態協同調度機制。該機制不再讓 GPU 被動等待,而是根據即時的互連頻寬,將 Token 的運算量在 CPU 核心與 GPU Tensor Core 之間進行動態拆分。
為了支持這種高效率的調度,FreeToken 導入了快速權重格式 Fast Weight Format 以及全層雙緩衝技術。這使得權重透過 PCIe 進行串流傳輸的過程,能夠與當前層的運算完全重疊,從而消除了傳輸等待時間。此外,系統配備了一個彈性記憶體管理器,能在運行時動態調整視訊記憶體 VRAM 在 KV Cache 緩存與專家權重槽位之間的分配,而無需重新載入模型。
針對現代 AI 代理人或編碼助手頻繁修改提示詞、調用工具等導致上下文視窗不斷變動的特性,FreeToken 提出了語義錨點檢查點 Semantic Anchor Checkpointing 技術。傳統引擎在前綴內容變動時會捨棄線性 KV Cache 並觸發昂貴的全序列重新計算,而 FreeToken 則在邏輯任務邊界快照中間的注意力狀態。當使用者修改工具參數或注入外部執行結果時,系統能直接複用已有的子序列狀態,大幅提升反應速度。
效能表現與業界對比
根據研究論文的基準測試,FreeToken 在效能上展現出顯著優勢。在相同的 MoE 模型下,其解碼速度比傳統工具快 3 到 4 倍,預填充 Prefill 速度甚至快 6 到 30 倍。具體實測數據顯示,使用僅有 8GB VRAM 的 RTX 4060 筆電即可在每秒約 39 個 Token 的速度下執行 Qwen3.6-35B 模型;在 RTX 5090 桌機上則能運行 DeepSeek-V4-Flash(284B),甚至在單台工作站 GPU 上處理 GLM-5.2(753B)等巨型模型。
與其他知名推論框架相比,FreeToken 的定位截然不同。例如 Ollama 與 llama.cpp 雖然優化了量化與層級卸載,但缺乏針對稀疏專家的動態負載拆分能力;vLLM 與 SGLang 則專為資料中心設計,假設環境擁有極高頻寬,不適合記憶體層級複雜的異質硬體。而 KTransformers 雖然支持 CPU 與 GPU 卸載,但其規則是靜態的,無法像 FreeToken 那樣即時計算每一層的最優拆分比例。
影響、限制與實務意義
FreeToken 的出現對本地 AI 生態產生了深遠影響。對於開發者而言,這意味著可以利用二手 RTX 3090 或 4080 等相對低廉的硬體,搭配標準的 DDR4 或 DDR5 記憶體,在不支付雲端 API 費用且能確保知識產權隱私的前提下,部署具備前沿推理能力的本地代理人。
然而,技術社群在認可其潛力的同時也提出了質疑。在 Hacker News 與 LocalLLaMA 等論壇中,工程師們討論 q* 的閉式解計算在現實環境中是否能精準反映 CPU 調度延遲與記憶體爭搶的問題,尤其是在多個代理人併發運行的複雜場景下。此外,部分使用者也對其與經過高度手工調優的 llama.cpp 基準測試對比結果持有保留意見。
儘管存在爭議,FreeToken 標誌著一個範式轉移:邊緣端的異質運算編排已成為擺脫私有 API 綁定、降低迭代成本並保護數據隱私的關鍵路徑。透過將運算壓力在 CPU 與 GPU 之間動態平衡,本地硬體終於能承載原本僅屬於伺服器等級的巨型 MoE 模型。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。