OpenAI 近日正式推出其最新模型 GPT-6 Astra,並將其定義為目前全球最智慧且對齊程度最高的模型。這次發佈最受矚目的部分在於其在網路安全領域的突破性表現,特別是在處理複雜的軟體漏洞分析與利用能力上,展現出遠超前代模型的水準。在 OpenAI 的準備框架中,Astra 已被認定達到網路安全能力的臨界閾值,意味著它具備了足以對現實世界產生重大影響的技術能力。
除了網路安全,Astra 在多項高難度基準測試中均表現優異。在衡量數學能力的 FrontierMath Tier 4 中取得 98% 的高分,而在 ARC-AGI-3 這一衡量通用人工智慧能力的測試中,得分率高達 99.9%。此外,Astra 在電腦操作、瀏覽器自動化、軟體工程以及科學專業工作等領域均達到頂尖水準,能以極高的速度與準確度處理複雜的專業任務。
網路安全能力的量化指標與突破
衡量 AI 網路安全能力的一個關鍵指標是 ExploitBench,這是一個專門評估模型將已知軟體漏洞轉化為可運行的漏洞利用程式(Exploit)能力的基準測試。在該測試中,GPT-6 Astra 取得了 100% 的滿分成績,而前一代的頂尖模型 GPT-5.6 Sol 僅為 78.5%。
更令人關注的是,OpenAI 透露 Astra 在處理近期(2026 年 7 月至 8 月間)出現的新漏洞時,其任意代碼執行(Arbitrary Code Execution,指攻擊者能讓目標系統執行其指定的任何指令,是極其危險的漏洞利用方式)成功率顯著高於前代。測試過程中,Astra 甚至能處理兩個未公開的零日漏洞(Zero-day Vulnerability,指尚未被軟體廠商發現或修復的漏洞)。若在完全沒有安全限制的情況下,Astra 具備利用未知漏洞在強化版瀏覽器中執行代碼,以及為強化版作業系統開發權限提升(Privilege Escalation,指獲取比目前權限更高的系統控制權)漏洞利用程式的能力。
雙用途風險與安全防禦機制
由於 AI 能力具有雙用途(Dual-use)特性,即能夠幫助防禦者快速發現漏洞的技術,同樣能被攻擊者用來加速漏洞利用,因此 OpenAI 對 Astra 的發佈採取了嚴格的限制措施。目前對外發佈的版本僅限於執行安全代碼審查與漏洞修補,模型會直接拒絕任何要求創建漏洞利用概念證明(Proof-of-Concept, PoC,指用來證明漏洞確實存在且可被利用的簡化程式碼)的請求。
為了防止模型被惡意利用,OpenAI 強化了模型的魯棒性(Robustness),以對抗越獄(Jailbreak,指透過特定提示詞繞過 AI 安全限制的行為)攻擊,並在監控系統中加入更多上下文分析,以偵測並抑制模型偏離安全目標的對齊失效問題。雖然這些安全檢查有時會干擾合法的防禦性網路安全工作,但系統會提示使用者在繼續執行前進行審查。
未來展望與基礎設施防禦計畫
儘管目前限制較多,OpenAI 計畫透過名為 Daybreak 的行動,在未來數週內逐步放寬部分限制,允許更多防禦性工作流的執行,包括漏洞驗證、PoC 驗證、惡意軟體分析以及偵測工程。
與此同時,OpenAI 啟動了 Daybreak for Frontline Defenders 專案,承諾投入 10 億美元,為水電供應、政府機關、銀行及開源維護者等關鍵基礎設施部門提供補貼、培訓與技術支援。該計畫旨在利用 AI 的強大能力,在攻擊者掌握這些工具之前,先幫助防禦者填補安全漏洞。目前該計畫已與美國多州資訊共享與分析中心(MS-ISAC)展開試點合作,優先為公共部門與水利系統的防禦者提供支援。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。