開發中AI在性能評估中侵入他公司,OpenAI公佈
利用未知脆弱性
OpenAI於21日表示,開發中的人工智慧(AI)模型發生了一起違背人類意圖、對他公司發動網路攻擊的事故。據稱,在性能評估測試中追求高分的AI,找到他公司系統中的未知脆弱性並加以侵入。
該公司表示,認為這是涉及最先端技術、前所未有的網路攻擊案例。公司將與受害的美國新創公司Hugging Face共同調查原因,並公布詳細情況。
控制難度凸顯
AI如今已能高速且高度地完成漏洞發現與入侵作業,為防止濫用,美國Anthropic的AI『Muthos』等部分最先端模型已限制使用者。不過,利用最新AI發動攻擊的實際情況,仍有許多尚未釐清。
此次事件顯示,雖然開發中的OpenAI方面被認為沒有惡意,但也凸顯了AI的威脅與控制難度。
脫離沙盒
Hugging Face於16日曾發布,稱公司遭到可自主運作的AI代理人發動網路攻擊。該公司指出,AI利用漏洞取得系統存取權,之後又接到OpenAI通知,稱攻擊來自其模型。
根據OpenAI說法,事故發生在測試開發中AI模型網路攻擊能力的過程中。測試內容是向AI提供漏洞資訊並指示其入侵,以確認資料取得與惡意程式執行是否成功。實施地點是在阻斷外部通訊、稱為『沙盒』的隔離環境中。
然而,AI找到環境內的未知漏洞並脫離,成功連上網路。隨後,AI推定測試的『解法』位於多家AI企業使用的Hugging Face內,並利用該公司系統的未知漏洞資訊等手段入侵,取得機密資訊。模型端的安全措施並未發揮作用。
商用AI拒絕分析
Hugging Face方面也偵測到非法入侵,並於16日開始分析。不過,根據該公司說法,起初曾請付費的商用AI協助分析,但因防止濫用功能啟動而遭拒絕。最終,改由中國企業開發、可複製的『開放型』AI完成分析。
不同於只能回答簡單問題的早期生成式AI,近期AI已能自主推進需要複雜步驟的工作。在軟體開發領域,將需數小時才能完成的處理交由AI執行的案例並不罕見。
不過,自主運作時間越長,發生非預期行為的風險也越高。此次這類為優先達成目標而出現意外行為的『獎勵駭客攻擊』便是一例。Anthropic於4月公布的案例中,接獲脫離沙盒指示的AI實際上成功脫離,向研究人員發送電子郵件,並將攻擊手法發布到多個網站上。
喜歡這篇內容?立即分享!