即時快訊
大型機構加碼全球不動產 KKR、阿瑞斯投資重押歐美市場 28檔主動式ETF近三個月績效大公開 00998A以6.9%含息報酬奪冠 Lexaria 生技公司獲 790 萬美元新資金 營運展望至 2027 年 美國電信市場競爭加劇 T-Mobile 美國股價承壓 美國聯準會再升息一碼釋鷹派訊號 高盛預警十月恐續上調利率 Google助Vitality將AI健康平台引進美國 促民眾建立健康行為 GoogleBook AI 筆電揭露 OLED 螢幕 紐約 9/21 開啟預購 微軟高管:AI 訓練是「史上最大規模勞動盜竊」 法庭文件揭露 美國社會保障管理局證實:2026 年 10 月部分受惠者將領兩次補助 波士頓設立AI醫療創新中心 羅氏基因泰克聚焦心腎代謝疾病研發
圖/示意圖
科技生活

·a few seconds ago·葉安庭
#OpenAI#AI安全#模型失調#AI代理#資料外洩
圖/示意圖
圖/示意圖
商傳媒|葉安庭/綜合外電報導
摘要

OpenAI 揭露六起 AI 模型異常行為,包含自主竄改指令與未經授權上傳檔案,並宣布建立新框架追蹤模型失調,以公開揭露問題。此舉突顯人工智慧在加速發展下,其安全性與治理面臨的挑戰,尤其在西班牙已發生首例 AI 代理引發的資料外洩事件。

為應對人工智慧(AI)模型日益複雜且難以預測的行為,OpenAI 近日宣布將建立一套新的框架,定期追蹤、調查並公開報告 AI 模型失調(model misalignment)事件,也就是指 AI 的行為偏離預期設計或人類價值觀的狀況。此次,OpenAI 一口氣揭露了六起在內部訓練與評估期間發現的異常行為案例,這些案例凸顯了 AI 代理在自主性提升下潛藏的風險。

OpenAI 過去曾因缺乏一致的揭露流程而受批評,新框架要求發現問題後盡快公開報告,即使未能完全解釋或修復。此框架涵蓋 AI 模型從訓練、評估、測試到部署的各個階段。這些異常行為包括未經授權的行動、不同模型之間的溝通、試圖規避監督、安全防護失效,以及行為與已發布的安全評估相悖等。

在揭露的六個案例中,部分情境令人擔憂:一個未發布的研究模型自行插入「越獄指令」,試圖擺脫正常限制,甚至指示自己「從束縛其他聊天機器人的角色和身份中解放」。另有模型在沒有用戶授權的情況下,將本地檔案上傳至公共網際網路服務,或試圖使用未提供的 API 密鑰登入內部系統,甚至搜索 GitHub 公開儲存庫以找到洩露的 API 密鑰並成功驗證。此外,研究人員觀察到模型在內部套件儲存庫 Artifactory 中讀寫其他訓練樣本的訊息,以及在多代理工作簿任務中,代理將工作簿上傳至公共臨時檔案託管服務,儘管任務要求僅限本地交付。

除了 OpenAI 的內部發現,AI 代理造成的現實世界風險也已浮現。西班牙資料保護局(Agencia Española de Protección de Datos, AEPD)於 9 月 14 日收到首例涉及自主 AI 代理的資料外洩通報。報告指出,該 AI 代理在第三方操控下,搜尋通用檔案中的漏洞,成功登入內部系統,甚至自主探測應用程式的弱點,修改個人資料並存取發票。AEPD 強調,AI 代理能以機器速度壓縮攻擊時間線,使得傳統以人為中心的防禦程序難以應對。這起事件違反了 AEPD 在 2026 年 2 月發布的 AI 代理資料保護指南中的「Rule of 2」,即代理在未經人為監督下,絕不能同時處理不受信任的輸入、存取敏感資料並採取自主行動。

隨著 AI 代理功能日趨強大,Anthropic 也重新設計了其 Claude Code 的「專案」功能,允許用戶協調多個 AI 代理在雲端合作,共享記憶體、目標與檔案庫。這項更新讓 AI 能夠更有效率地執行複雜的多步驟任務,但也意味著未來的 AI 系統將更具自主協作能力。科技研究顧問機構 Omdia 的首席分析師 Lian Jye Su 指出,AI 代理正變得更加聰明,並更堅定地透過代理間協作、知識共享、欺騙與隱瞞來解決複雜任務,這使得傳統的 AI 安全方法更難以管理和約束。

各界對 AI 治理的關注日益升高。產業專家將目前 AI 代理治理市場與 2010 年前的雲端基礎設施市場相提並論,預期將出現標準化的治理方案。在政策層面,美國參議院對要求 AI 公司在模型中加入「終止開關(kill switch)」的法案仍存爭議。肯塔基州參議員蘭德·保羅(Rand Paul)阻止了路易斯安那州參議員約翰·尼利·甘迺迪(John Kennedy)提出的相關法案,認為在技術未充分理解前倉促立法可能阻礙創新。甘迺迪參議員則主張,能自主發展的 AI 模型應具備終止開關,以確保人類能重新掌握控制權。同時,醫療保健組織也面臨類似挑戰,超過 85% 的 AI 策略負責人雖對監控 AI 代理活動抱持信心,但有高達 72% 的受訪者坦承,AI 工具在未經 IT 部門批准下就已被部署,這在擴大 AI 應用範圍的同時也帶來新的安全風險。