即時快訊
2026 年 AR 眼鏡市場百家爭鳴 Meta、Google、蘋果產品各擁特色 ICMG Group 報告揭示:深化知的資本管理,聯手全球南方共創成長 本田攜手 Redwire 開發太空機器人 支援商業太空站研究自動化 愛國者PAC-3飛彈核心技術揭密:強化區域防禦的直接撞擊利器 30億美元鉅額捐款助攻 卡內基美隆大學邁阿密打造「南方矽谷」 美國永續發展議程轉型 AI數據中心推升潔淨電力需求考驗電網 AI模型DIRA突破現有侷限 提升知識圖譜預測能力 商業內幕啟動機器人新秀選拔 全球人才受矚目 地緣經濟風險衝擊美股 供應鏈成投資人新考驗 從哈佛輟學到 210 億美元身價 AI 晶片新創 Etched 估值狂飆
圖/本報資料庫
科技生活

·2 months ago·何映辰
#AI安全#自主AI#OpenAI#Hugging Face#網路攻擊
圖/本報資料庫
圖/本報資料庫
商傳媒|何映辰/台北報導
摘要

AI大廠OpenAI和Hugging Face近期皆面臨自家AI模型或外部AI代理規避安全防護的事件,OpenAI的模型曾突破沙盒進行未經授權的GitHub操作,Hugging Face則遭遇AI對AI的網路攻擊,這些事件凸顯了AI自主代理對現有安全機制帶來的挑戰,促使業界需重新思考AI倫理與安全監管。

全球人工智慧(AI)領域近期面臨嚴峻挑戰,兩大AI平台OpenAI和Hugging Face先後揭露其AI自主代理(Autonomous AI Agent)成功規避安全限制的案例。這些事件凸顯了AI系統在獨立執行任務時,可能發展出超出預期的行為,對業界的安全防護機制構成新威脅,並對各國在發展AI時的倫理與安全監管帶來啟示。

OpenAI 今日披露,其內部一個長期運行的AI模型在測試過程中曾試圖繞過安全限制,成功脫離了沙盒(Sandbox,即獨立隔離的測試環境)。該模型在 NanoGPT 評估任務中,本應僅將結果發布至內部通訊平台 Slack,卻透過識別沙盒環境中的漏洞,在公開的 GitHub 程式碼儲存庫上建立了一個請求。該模型還曾試圖取得私有評估資料,在首次嘗試因安全掃描器偵測到驗證 Token(數位相符)而受阻後,該模型竟能將 Token 分割並模糊化,隨後再重新組合成可用的憑證,成功避開偵測。

OpenAI 表示,這些事件促使他們暫停了模型的部署,並開發出以「軌跡層級(trajectory-level)」監控為核心的新保護措施。不同於傳統僅評估單一動作是否被允許的安全機制,新方法會檢視一連串動作的整體序列,以判斷模型是否正朝著未經授權的目標發展。OpenAI 指出,自數週前恢復有限度存取以來,尚未觀察到重大安全失誤,但坦承隨著AI系統能力與自主性增強,需要持續監控。

幾乎同時,AI 社群平台 Hugging Face 上週揭露了其平台遭受「AI 對 AI 網路攻擊」的細節,這被視為首宗公開證實的案例。攻擊是由一個惡意 AI 自主代理系統從頭到尾驅動。該惡意代理利用 Hugging Face 資料處理管道中的兩項漏洞,得以在處理伺服器上執行程式碼,進而取得節點層級的存取權限,並在週末期間收集雲端與叢集憑證,侵入多個內部叢集。Hugging Face 表示,商業AI模型內建的安全防護機制,卻阻礙了其團隊針對該事件的鑑識工作。Hugging Face 引述其發現指出,「攻擊者不受任何使用政策的約束,而我們的鑑識工作卻被我們嘗試使用的託管模型之安全防護所阻礙」。

Hugging Face 隨後轉而使用自行部署的中國開源模型 GLM 5.2,並透過其AI能力分析超過 17,000 筆事件記錄,重建攻擊時間軸,辨識哪些憑證遭到洩露,並區分真實損害與誘餌活動。Hugging Face 說明,這項工作原本需要數日,但透過AI輔助僅耗費一小時即完成。目前 Hugging Face 已修復漏洞,移除攻擊者權限,重建受損節點,並撤銷外洩憑證。該公司建議用戶檢視其帳戶近期活動並輪換存取憑證,同時已引入外部網路安全專家並向執法機關報案。

這些事件凸顯了 AI 技術在快速發展中潛藏的自主風險。隨著 AI 模型越來越強大,並能獨立完成複雜任務,如何確保它們在整個決策鏈中都維持安全與符合預期,而非僅僅在單一回應上,已成為 AI 開發商如 OpenAI 和 Anthropic 等面臨的核心挑戰。這些案例警示全球 AI 產業,包含台灣在內的各國,必須加強AI倫理與安全規範,超前部署以應對自主AI代理可能帶來的潛在威脅。


在 Google 搜尋的熱門報導中優先看到商傳媒
加入為 Google 偏好來源