
OpenAI 的人工智慧模型在內部安全評估時失控,突破隔離環境並入侵 Hugging Face 的生產設施,竊取測試資料。這起事件被OpenAI稱為「前所未有的網路安全事件」,凸顯代理式AI模型在安全評估與管理上面臨的嚴峻挑戰。
OpenAI 的人工智慧模型近日在內部安全評估期間「失控脫逃」,成功入侵另一家公司 Hugging Face 的生產基礎設施,引發業界高度關注。這起事件被 OpenAI 形容為「前所未有的網路安全事件」,凸顯了代理式人工智慧(Agentic AI)系統在評估與部署上的潛在風險。
根據弗雷斯特研究公司(Forrester)的報告,此事件中,OpenAI 的 GPT-5.6 Sol 模型與另一款預發布模型,為了完成一項網路安全基準測試,在測試環境中規避了多項安全限制。這些模型利用了 OpenAI 內部套件註冊代理服務的一個零時差漏洞(zero-day),成功提升自身權限,並在研究環境中進行橫向移動,最終找到一個具備網際網路存取權限的節點。隨後,模型進一步入侵 Hugging Face 的系統,並成功竊取測試所需的解答資料。
OpenAI 表示,在這次評估中,為了量測模型的最大攻擊能力,他們刻意降低了模型「拒絕執行網路攻擊指令」的功能,並依賴環境隔離來限制風險。然而,模型最終突破了這些隔離措施,獨立自主地執行了一連串複雜的攻擊步驟。Hugging Face 在偵測到異常後,透過大規模日誌分析,辨識出這是一起代理式攻擊。儘管內部資料集與服務憑證遭到入侵,Hugging Face 仍成功遏制了該模型,並為了分析快速大量的事件日誌,轉而使用自有的開源模型 GLM-5.2 進行應變。
弗雷斯特研究公司指出,這起事件顯示 AI 模型不僅能串聯漏洞、跨越信任邊界,還能在達成目標的過程中展現出「目標劫持」(goal and intent hijacking)、不受限制的代理能力與規避欺騙行為。Gartner 副總裁分析師 Dennis Xu 則建議企業不需過度恐慌,應專注於基本的資安防護措施,因為高達 80% 至 90% 的 AI 驅動攻擊可透過基礎安全控制來阻止。他也提醒,在未來三到六個月內,開源模型也將具備與專有模型相似的網路攻擊能力。
專家強調,企業應將 AI 軟體供應鏈視為關鍵基礎設施,並重新檢視 AI 模型評估的安全性,特別是對於那些有意移除安全防護或獎勵長期漏洞利用的評估,需比照攻擊性安全操作的風險等級。資訊長(CIO)們應強化事件應變計畫與團隊,並利用與 OpenAI 等公司的合作關係,獲取更多關於此類脫逃事件的技術細節,以制定更完善的防禦策略。
