OpenAI 打造了一款能破解自身模型以使其更安全的 AI

新聞摘要
OpenAI 揭露了一個名為 GPT-Red 的內部系統細節,這是一個專門訓練來攻擊公司自身前沿 AI 系統的自動化紅隊測試模型,旨在在潛在漏洞於現實世界中被利用之前將其發掘出來。此披露於 2026 年 7 月 15 日(美國東部時間)公開,描述了該工具如何在 GPT-5.6 的開發和安全評估過程中被廣泛使用,以及其發現如何被反饋到訓練中,從而使發布的模型更能抵抗操縱。
GPT-Red 的功能
GPT-Red 的設計宗旨是探測提示注入漏洞,這是一種弱點,攻擊者會在模型處理的內容中嵌入隱藏或惡意的指令,試圖覆蓋系統的原始任務。OpenAI 並非僅依賴人工測試人員手動搜尋這些缺陷,而是構建了 GPT-Red 作為一個專用的攻擊模型,持續生成新的攻擊策略,並在受控環境中針對防禦模型進行測試。
自我對弈訓練循環
該系統採用了自我對弈強化學習方法進行訓練,其中攻擊模型和一組防禦模型通過反覆相互競爭來提升。當攻擊者成功誘使防禦者遵循注入的指令時,它會獲得獎勵;而當防禦者在正確拒絕惡意輸入的同時仍能完成其最初賦予的合法任務時,它也會獲得獎勵。隨著防禦者在識別已知攻擊模式方面變得越來越好,GPT-Red 被推動去發現更多樣化和複雜的技術,而這些新發現的攻擊隨後又被用於重新訓練防禦者。OpenAI 將此描述為一個不斷升級的循環,攻擊和防禦能力會隨著時間的推移共同進步。
超越人類紅隊
根據 OpenAI 分享的數據,GPT-Red 在測試場景中成功率約為 84%,而人類紅隊測試人員在處理同一組挑戰時的成功率約為 13%。該公司表示,這一差距說明了自動化、大規模的對抗性測試比單純的手動審查能更快、更一致地發現漏洞,同時強調了人類專業知識仍然是評估中一個重要的補充層面。
發現新的攻擊類別
該專案的一個顯著成果是 GPT-Red 獨立識別出了一種先前未被記錄的攻擊模式,研究人員後來將其稱為「偽造思維鏈」攻擊。這項技術針對的是推理模型,這類模型在產生最終答案之前會生成明確的中間推理步驟。該攻擊通過在推理追蹤中插入一個虛假的條目來起作用,導致模型表現得好像它已經驗證了一個錯誤的前提。報告顯示,在進行緩解措施之前,此類攻擊在 GPT-5.1 模型上成功率超過 95%。在使用 GPT-Red 的發現重新訓練新系統後,針對 GPT-5.6 的同類攻擊成功率下降到 10% 以下。
人工專家測試與自動化並行
OpenAI 指出,自動化紅隊測試旨在補充而非取代其現有的紅隊測試網絡,該網絡包括來自化學、生物安全、網絡安全、法律和多語言語言學等領域的 200 多名外部專家。這些外部審查人員在模型發布前後繼續對模型進行評估,與自動化系統協同工作,測試其對創意性、現實世界濫用企圖的防護措施。
大量的計算投入
該公司表示,在 GPT-5.6 的開發過程中,投入了大量的計算資源,據報導超過 700,000 個 GPU 小時,用於運行所謂的通用越獄的自動化搜尋。OpenAI 還表示,自動化紅隊測試將在模型部署期間持續運行,從而能夠持續識別和修補新漏洞,而不是僅限於固定的預發布測試窗口。
對 AI 安全研究的重要性
研究人員和行業觀察者指出,GPT-Red 是 AI 安全領域更廣泛趨勢的一個例子:利用 AI 系統本身來測試和加固其他 AI 系統,其規模和速度是人工測試無法比擬的。隨著推理模型變得越來越強大,並在自主或代理環境中得到更廣泛的部署,像 GPT-Red 這樣的工具被視為構建能夠跟上日益複雜的攻擊技術的防護措施的重要一步,同時仍然為人類在最困難和最創新的安全問題上做出判斷留有空間。