對於開發 LLM 應用程式的工程師來說,最令人頭痛的安全性問題之一就是 Prompt Injection(提示詞注入)。簡單來說,這是一種攻擊手段,攻擊者透過精心設計的輸入文字,欺騙 AI 忽略原本的系統指令,轉而執行攻擊者的惡意指令。隨著 AI 逐漸演變成 Agent(代理人),能夠讀取電子郵件、瀏覽網頁或操作 API,這種漏洞的影響力被無限放大,因為攻擊者可以將惡意指令隱藏在網頁或文件中,讓 AI 在處理資料時不自覺地被「洗腦」。
為了應對這個持續演進的威脅,OpenAI 開發了一套內部自動化紅隊測試模型,命名為 GPT-Red。所謂的 Red Teaming(紅隊測試),是指由安全專家扮演攻擊者,嘗試在系統部署前找出漏洞的過程。而 GPT-Red 的核心目標,就是將這個原本依賴人力、低效率的過程自動化,用 AI 來攻擊 AI。
GPT-Red 的運作機制與人類駭客非常相似。它會設定一個惡意目標,例如將敏感資料上傳到外部伺服器或盜取 API 金鑰,然後不斷地發送提示詞給目標模型,觀察對方的反應,並根據結果反覆迭代、修改攻擊策略,直到成功突破防線。
在技術實作上,GPT-Red 採用了 Self-play Reinforcement Learning(自我對弈強化學習)。這就像是讓兩組 AI 在一個虛擬環境中對戰:一組是 GPT-Red(攻擊者),另一組是多個防禦模型(Defender)。當 GPT-Red 成功誘導防禦模型出錯時,它會獲得獎勵;而防禦模型若能抵禦攻擊並完成原定任務,則會獲得獎勵。這種對抗機制形成了一個正向循環:防禦模型越強,GPT-Red 就必須研發出更精巧、更多樣的攻擊手段才能獲勝,進而推動整體安全能力的提升。
這種自動化對抗訓練在實務上取得了顯著成效。OpenAI 指出,最新的 GPT-5.6 Sol 模型在面對直接提示詞注入的基準測試中,失敗率比之前的 GPT-5.5 降低了六倍。此外,GPT-Red 還發現了一種新型態的攻擊方式,稱為 Fake Chain-of-Thought(偽造思考鏈)攻擊。這種攻擊會模仿 AI 的推理過程來誤導模型,在舊版本模型上的成功率曾高達 95%,但在經過 GPT-Red 訓練後的 GPT-5.6 Sol 上,成功率已降至 10% 以下。
為了驗證實戰能力,OpenAI 將 GPT-Red 用於測試真實場景。例如在測試一台 AI 自動販賣機時,GPT-Red 成功達成了三個惡意目標:將高價商品價格調至最低(0.5 美元)、以低價訂購百元商品,以及取消其他客戶的訂單。另一個案例則是攻擊基於 Codex 的命令行代理人,成功讓模型在多項任務中洩露敏感資料。
對於工程師而言,這件事傳達了一個重要訊號:面對 AI 安全,單靠靜態的過濾清單或簡單的系統指令(System Prompt)已經不足夠。未來的安全性將依賴於這種動態的、基於對抗訓練的防禦體系。同時,OpenAI 強調 GPT-Red 必須與生產環境完全隔離,以防止其強大的攻擊能力被惡意第三方利用。
來源:thehackernews.com
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。