對於開發者來說,追求模型能力的提升通常意味著更高的運算成本與延遲。然而,OpenAI 在 GPT-5.6 系列模型中提出了一個核心目標:在維持前沿智能的同時,大幅降低推理成本。這不僅是單一模型的演進,而是一場從模型訓練、推理底層到 Agent 框架的全棧優化。
對於工程師而言,理解這篇文章的關鍵在於:效率不是靠單一的技巧,而是透過模型自優化(Self-optimization)與系統工程的複合效應來實現。
模型家族的分級策略
GPT-5.6 並非單一模型,而是一個針對不同成本與性能需求設計的家族。頂級模型 Sol 專注於極高推理能力,在編碼代理基準測試中以不到一半的成本超越競爭對手;Terra 則在維持 GPT-5.5 智能水平的同時將價格減半;而 Luna 則是追求速度與極低成本的選擇。
這種分級設計的核心在於優化 intelligence-per-token(單個 token 的智能密度),讓模型在訓練階段就學習如何用更直接、更精簡的路徑完成任務,減少不必要的冗餘計算。
推理棧的深度優化:榨乾硬體每一分性能
推理(Inference)是指模型將訓練好的權重轉化為實際輸出結果的過程。在運算資源受限的情況下,OpenAI 透過以下幾個維度提升了硬體利用率:
負載平衡與路由優化 系統會根據地理位置、硬體類型(GPU 或專用晶片)以及快取可用性,將請求分發到最合適的實例中。GPT-5.6 Sol 被用來分析生產環境的流量,找出不平衡的瓶頸並自動調整路由策略,從而降低服務成本。
內核優化(Kernel Optimization) Kernel 是直接在 GPU 上執行數學運算的底層代碼。即使模型算法高效,如果內存移動過多或數據佈局不合理,GPU 仍會處於閒置狀態。OpenAI 讓 GPT-5.6 Sol 使用 Triton 和 Gluon 這兩種 GPU 程式語言,自主重寫並優化生產環境的內核代碼,直接將端到端服務成本降低了 20%。
投機採樣(Speculative Decoding) 這是一種加速生成速度的技術。系統會同時運行一個體積較小、速度較快的草稿模型(Draft Model)來預測接下來的幾個 token,再由主模型一次性進行並行驗證。如果預測正確,一次主模型運算就能產出多個 token,大幅減少昂貴的序列計算。GPT-5.6 Sol 甚至自主設計並實驗了數百個草稿模型架構,將生成效率提升了 15% 以上。
KV 快取與工作負載調優 KV Cache(Key-Value Cache)用於儲存已處理 token 的狀態,避免重複計算。然而,最佳的快取配置(如批處理大小、分片方式)會隨任務長度而變。過去工程師依賴經驗法則(Heuristics),現在則由 GPT-5.6 Sol 分析實際工作負載,為不同場景生成最優的配置參數。
Agent 框架的精簡化:減少重複勞動
當模型被封裝成 Agent(代理)時,一個用戶請求可能會觸發數十次模型調用與工具執行。如果每次請求都傳遞全部上下文,會導致 Context Bloat(上下文膨脹),增加成本並干擾模型推理。
為了解決這個問題,OpenAI 在 Rust 語言編寫的 Agent 協調層中實施了以下策略:
延遲發現機制(Deferred Discovery) 並非所有工具定義和插件都要一次性塞入上下文,而是僅在模型真正需要時才將其顯現,防止上下文窗口被不必要的資訊佔滿。
精確前綴快取(Prompt Caching) 為了最大化快取命中率,系統將所有模型可見的歷史紀錄設為 append-only(僅限追加)。新訊息、工具結果永遠加在末尾,而不會插入中間。同時,工具的呈現順序被固定化,確保 Prompt 的前綴保持一致,從而讓 GPU 能直接複用之前的計算結果。
總結:智能驅動效率的正向循環
GPT-5.6 最令人驚訝的地方在於,它不僅是被優化的對象,更是優化的執行者。OpenAI 利用 Sol 模型來分析流量、重寫內核、調優快取以及設計草稿模型。這種由 AI 優化 AI 的閉環,讓技術演進的速度從線性的工程改進變成了指數級的自我加速。
對於開發者來說,這提醒我們:在構建 AI 應用時,除了關注模型本身的 Prompt,更應關注如何減少重複計算、管理上下文膨脹以及優化數據流轉,才能在成本與性能之間找到最佳平衡點。
來源:openai.com
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。