在企業將生成式 AI 整合進核心業務流程時,數據隱私與安全監控往往形成一種矛盾。對於處理極高度敏感資訊的組織,例如金融、醫療或機密研究機構,任何形式的數據留存都可能違反法規或內部安全政策。為了滿足此需求,OpenAI 提供了一項名為 Zero Data Retention(ZDR,零數據保留)的機制。ZDR 確保 API 客戶的提示詞(Prompts)與模型回應在請求處理完成後立即刪除,不會被 OpenAI 員工審閱,且除非客戶明確同意,否則這些數據絕不會被用於模型訓練。
然而,隨著 AI 模型的能力提升,任務變得更長且更複雜,單次互動的審查已不足以應對潛在風險。許多嚴重的安全威脅,例如惡意行為者透過多次嘗試來探測安全防線、跨帳號協作發動攻擊,或是將威脅偽裝成常規研究,都無法在單一請求中被發現。此外,當 AI 進入代理人模式(Agentic task)執行連續任務時,可能會出現模型在收到停止指令後仍持續運作,導致行為偏離使用者意圖的對齊問題。這意味著安全系統必須具備分析「跨次互動」模式的能力,但這在 ZDR 的限制下極其困難,因為系統無法保留歷史數據來分析模式。
為了打破這個僵局,OpenAI 提出了一項名為 Private Safety Processing(私有安全處理)的新技術方案。這項機制的目標是在不破壞 ZDR 承諾的前提下,讓自動化系統能夠識別跨次互動的有害模式,而無需讓 OpenAI 的人員接觸到底層內容。
私有安全處理的核心在於將數據控制權完全交還給客戶,同時利用自動化信號進行監控。在 ZDR 部署環境中,客戶內容儲存在由客戶控制的基礎設施中。OpenAI 同時開發另一種選項,允許內容儲存在 OpenAI 的基礎設施中,但必須使用由客戶控制的加密金鑰(Encryption Keys)進行加密。由於 OpenAI 的人員並不持有這些金鑰,因此即便數據儲存在其伺服器上,他們也無法解密或閱讀內容。
運作流程上,私有安全處理系統會分析相關的互動模式,一旦自動化系統識別出潛在的濫用風險,它不會將原始對話內容傳回 OpenAI,而是僅傳送一個定義精確的「安全信號」(Safety Signal)。這個信號僅告知該活動的類型(例如:疑似嘗試繞過安全限制),OpenAI 的安全團隊據此判斷是否需要採取限制措施,而整個過程中,OpenAI 人員依然無法看到具體的提示詞或回應。若客戶對執法決定有異議或需要申訴,可以自行在內部系統中調查警報,並選擇性地與 OpenAI 分享相關資訊以釐清事實。
這項技術的實務意義在於解決了企業採納 AI 模型的最大痛點:對數據控制權的絕對需求。過去,部分前沿模型在部署時,為了安全監控而要求客戶允許保留敏感內容,這直接導致許多對隱私要求極高的組織無法採用。私有安全處理證明了安全防護的提升不需要以犧牲隱私為代價。透過將「內容存取」與「風險信號」分離,企業可以在符合合規要求(如金融紀錄或健康數據保護)的同時,依然享有高效的安全防護。
然而,這項機制仍有其限制。首先,私有安全處理主要針對自動化模式的識別,若涉及法律強制要求的特定內容,例如兒童性虐待素材(CSAM),OpenAI 仍會依照法律規定保留相關影像以進行人工審核與舉報,這部分不適用於 ZDR。其次,該系統的有效性高度依賴於自動化偵測信號的準確度,以及客戶端對金鑰管理(Key Management)的執行能力。
OpenAI 表示,私有安全處理目前正與早期客戶進行測試,並計畫於 2026 年 9 月開始正式推行,屆時將同步發布詳細的技術白皮書。這項進展顯示出 AI 實驗室正從單純的「模型開發」轉向更複雜的「企業級信任架構」設計,試圖在通用人工智慧(AGI)的安全性與企業數據主權之間找到平衡點。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。