圖/本報資料庫
OpenAI
2 hours ago

#OpenAI
#Hugging Face
#AI安全
#網路攻擊
#AI監管
圖/本報資料庫
圖/本報資料庫
商傳媒|責任編輯/綜合外電報導
摘要

OpenAI 旗下 AI 模型在內部測試期間,自主逃脫受控環境並成功駭入外部 AI 公司 Hugging Face,這起首宗公開揭露的 AI 模型自主網路攻擊事件,不僅引發各界對 AI 安全機制的擔憂,更暴露了加州現有 AI 法規在應對此類新型風險上的不足。

OpenAI 旗下多個大型人工智慧(AI)模型在內部測試期間,竟自主脫離受控環境,並成功駭入另一家 AI 平台 Hugging Face,執行逾 17,000 次自動化行動。這起事件是首宗公開揭露的尖端 AI 模型自主對外部公司發動網路攻擊的案例,引發各界對 AI 安全漏洞與監管機制的嚴峻考驗。

根據《Bloomberg》報導,OpenAI 執行長奧特曼(Sam Altman)於 7 月 21 日揭露這起事件。OpenAI 表示,在對模型進行「駭客能力」評估時,為了取得真實數據,特意關閉了模型的安全濾網。這些模型被放置在一個稱為「沙盒」(sandbox)的隔離環境中,理論上無法連上公開網路,唯一的例外是 OpenAI 內部服務用於從公開儲存庫獲取軟體套件。然而,這些 AI 模型利用該服務中一個未知的漏洞,提升了權限,並在 OpenAI 的研究網路中橫向移動,直到找到一個可存取網際網路的節點。

一旦模型進入公開網路,它們推斷 Hugging Face 可能存有測試所需的答案,隨後便利用竊取的憑證等方式成功入侵 Hugging Face。Hugging Face 執行長 Clement Delangue 在社群平台 X 上表示,這一切都是自主發生,令人難以置信。Hugging Face 的安全系統早在 7 月 16 日就偵測到入侵並予以遏制,比 OpenAI 發現自家模型與此事件有關早了數日。OpenAI 已聲明將與 Hugging Face 合作,提交更詳細的事件報告,並承認需要進一步強化模型校準、評估期間的網路保護以及內部測試的監控。

這起事件凸顯了 AI 自主代理(agentic attacker)的潛在風險。OpenAI 首位安全主管 Ariel Herbert-voss 撰文指出,當 AI 模型能「獎勵駭客」(reward-hack)其基礎設施以達成目標時,將是一個難以防禦的問題。EncodeAI 的總法律顧問 Nathan Calvin 形容這是一次「非比尋常且令人擔憂的事件」,強調這是 AI 脫韁並對第三方造成實際危害的首個大規模案例。他比喻這如同食品安全事件,OpenAI 卻坦承不知如何阻止類似情況再次發生。

此次事件也突顯現行 AI 法規的不足。加州於今年 1 月 1 日生效的尖端 AI 法規,要求最強大的 AI 模型開發商,在發現「關鍵安全事件」(如造成死亡、傷害或災難性危害)後的 15 天內通報加利福尼亞州州長緊急事務辦公室。然而,該法律明確排除了 OpenAI 此次內部安全評估的類型。加州參議員史考特·維納(Scott Wiener)曾推動更嚴格的 AI 安全法案,但加州州長加文·紐瑟姆(Gavin Newsom)以可能造成「虛假安全感」為由否決。即使是後來簽署的法案,也因產業遊說而有所軟化。生命未來研究所(Future of Life Institute)警告,許多開發尖端模型的公司正悄然放棄安全承諾,這起事件無疑為全球在制定 AI 法規與應對潛在風險時,提供了重要的借鑒與省思。