OpenAI 近期正式推出新一代影像生成模型 ChatGPT Images 2.5,旨在解決 AI 繪圖中常見的細節缺失、編輯時對原圖破壞過大以及生成速度緩慢等痛點。隨著使用者對 AI 影像的需求從單純的驚艷轉向實際的生產力工具,Images 2.5 在影像保真度、多輪對話的一致性以及使用者控制權方面進行了深度優化,使其能更有效地融入專業的創意工作流。
影像品質與生成的效能提升
Images 2.5 在視覺呈現上取得了顯著突破,能產生更自然的照明效果與更豐富的材質紋理。最核心的進步在於影像保真度(Image Fidelity),即模型在處理參考照片時,能更精準地保留主體特徵,使其在切換不同場景、視覺風格或構圖時,依然能讓觀看者認出原主體。這對於需要維持人物或產品一致性的品牌行銷至關重要。
在效能方面,Images 2.5 的生成延遲(Latency)較前代 2.0 版本降低了高達 50%。這種速度的提升不僅縮短了等待時間,更讓創作者能夠在短時間內進行多次嘗試與快速迭代,將概念驗證的週期大幅縮短。
精準編輯與多輪對話的一致性
過去 AI 影像編輯常面臨的挑戰是,當使用者要求修改影像中的某個局部時,模型往往會將整個畫面重新生成,導致原有的構圖或風格發生偏移。Images 2.5 引入了更精準的編輯機制,能夠在僅修改指定元素(如更換背景、調整單一產品或修改文字)的同時,完整保留其餘部分的細節與品牌視覺特徵。
此外,模型在多輪對話(Multi-turn editing)中的一致性得到了強化。在長對話的修改過程中,Images 2.5 能更可靠地遵循先前的指令,使後續的每一次編輯都建立在之前的基礎之上,而不會隨著修改次數增加而導致影像品質下降或風格漂移。這使得開發者在建構生產環境的素材時,無需為了微調而重新生成整個資產。
新功能:從草圖到模板的創意控制
為了降低使用者表達視覺構想的難度,OpenAI 在 ChatGPT 中推出了多項控制工具。其中最受關注的是 Sketch 功能,允許使用者直接在對話框中繪製簡單的草圖(如房間佈局或服裝輪廓),將其作為視覺指引,由模型將粗略的線條轉化為完整的影像。這解決了單純依賴文字描述(Prompt)難以精確傳達空間感或形狀的問題。
同時,新版本引入了模板(Templates)系統,針對海報、商品照等熱門格式提供預設結構,讓使用者不必從空白畫布開始,而是透過填入特定資訊來快速生成專業格式的影像。此外,使用者現在可以直接在影像上標記評論以進行針對性修改,並能分享包含提示詞的影像,讓他人能基於相同的創意靈感,搭配自己的照片進行二次創作。
API 擴展與工業級應用
針對開發者,OpenAI 在 API 中提供了兩款分層模型以滿足不同需求。第一款是 GPT-Image-2.5 Flare,它是大多數應用程式的預設選擇,主打高品質與極速生成,適用於社交媒體內容、快速原形設計及高產量的影像生成任務。
第二款則是 GPT-Image-2.5 Sunburst,專為需要極高精準度的頂級視覺工作流設計。雖然生成時間較長,但它提供了更強的控制力,適合用於生產等級的廣告創意或精細的產品商業攝影。目前 Adobe Firefly、Runway 等創意平台已將這些模型整合進其工具鏈中,利用其對透明背景的優化處理與高解析度的一致性,提升專業設計的效率。
安全性與部署限制
在安全性方面,Images 2.5 延續了 OpenAI 的安全框架,透過對提示詞與生成結果的審核來防止有害內容的輸出。為了應對 AI 偽造影像的風險,模型全面採用 C2PA 元數據(Metadata)與不可見水印技術,確保 AI 生成的影像具有可追溯性。
目前,Images 2.5 已全面開放給 ChatGPT、ChatGPT Work 及 Codex 的所有層級使用者,涵蓋桌面端、行動端與網頁版。對於企業與開發者而言,這代表著 AI 影像生成正從單純的內容產出,演進為一種可精確控制、可重複利用且具備工業水準的視覺生產工具。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。