Thinking Machines 近期發佈了名為 Inkling 的開源模型,這是一個規模極其龐大的多模態大語言模型(Multimodal LLM)。對於開發者而言,Inkling 最顯著的特點在於它能「原生」地處理圖像、文本和音訊輸入,且擁有高達 1 兆(1T)的參數規模以及 100 萬個 token 的超長上下文視窗。
這類模型旨在解決傳統多模態模型依賴外部編碼器(Encoder)而導致的信息損耗問題,讓模型能直接在統一的空間中理解不同類型的數據。
模型架構深度解析
Inkling 採用的是 Decoder-only(僅解碼器)架構,這是目前主流 LLM 的標準做法,支持因果自回歸生成。為了在維持巨大參數量的同時兼顧推理速度,它引入了多項關鍵技術。
首先是 Mixture of Experts (MoE,混合專家模型)。Inkling 總共有 975B 個參數,但並非每次推理都激活全部參數,而是透過路由機制僅激活 41B 個參數。這種稀疏激活機制讓模型在擁有海量知識儲備的同時,能以較低的計算成本運行。
其次是混合注意力機制 (Hybrid Attention)。模型在層級上交替使用全域注意力 (Global Attention) 和滑動視窗注意力 (Sliding Window Attention),比例為 5:1。全域注意力確保模型能掌握長文本的整體脈絡,而滑動視窗注意力則降低了計算複雜度,提升了處理效率。
此外,Inkling 使用了相對注意力 (Relative Attention) 取代常見的 RoPE (Rotary Positional Embedding) 來編碼位置信息,並引入了短卷積 (Short Convolution, SConv)。SConv 負責處理局部特徵,將注意力機制和 MoE 模組從瑣碎的局部表示中解放出來,專注於更高層次的邏輯推理。
多模態處理流程
不同於許多模型使用獨立的視覺或音訊編碼器,Inkling 的多模態塔 (Multimodal Towers) 設計相對精簡。
視覺理解方面,它使用分層 MLP Patchifier 將圖像像素逐步合併,最終將圖像塊轉換為 Embedding。
音訊理解方面,它將音訊片段轉換為離散的梅爾頻譜 (Mel Spectrogram) 並進行分類,再將其映射為 Embedding。
這種設計使得圖像、音訊和文本最終都被轉換為統一的向量形式,讓模型能像處理文字一樣處理多模態數據,實現跨模態的推理能力。
實務部署與推理建議
由於模型體積巨大,硬體需求極高。BF16 精度版本需要 2 TB 的 VRAM,而 NVFP4 量化版本則需要 600 GB。對於大多數工程師,建議採取以下部署路徑。
如果是企業級集群部署,推薦使用 SGLang 或 vLLM,這些框架支持張量並行 (Tensor Parallelism),可將模型分片到多張 GPU 上運行。
如果是本地測試或資源受限環境,可以使用 llama.cpp 加載由 Unsloth 提供的 1-bit 量化版本,這能將 VRAM 消耗降低約 95%,雖然會損失部分精度,但極大地降低了進入門檻。
在調用模型時,Inkling 提供了一個 reasoning_effort 參數(可選值如 low, medium, high, max),允許開發者在生成速度與推理深度之間做權衡。
推理加速與後訓練
為了提升生成速度,Inkling 引入了 MTP (Multi Token Prediction,多 token 預測) 層。這就像是一個預測草稿本,在推理時作為 Speculative Decoding(投機採樣)的草擬器,一次預測多個 token,從而顯著提升生成速度而不影響輸出質量。
在後訓練 (Post-training) 方面,Thinking Machines 推薦使用 tinker 工具進行微調或蒸餾。對於想要將 Inkling 能力遷移到端側小模型的工程師,可以使用 GOLD 算法進行知識蒸餾,將 Inkling 作為教師模型,利用其強大的文檔理解能力來提升小模型的表現。
總結
Inkling 代表了開源多模態模型向超大規模演進的方向。它不僅在參數量上達到 1T,更在架構上通過 MoE、混合注意力與原生多模態塔,試圖在推理能力、上下文長度與多模態融合之間找到平衡。對於需要處理複雜音訊分析、長文檔視覺推理的應用場景,Inkling 提供了一個強有力的基礎底座。
來源:huggingface.co
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。