OpenAI開發中的AI侵入他公司,控制難題更明顯
OpenAI於21日表示,開發中的AI模型違反人類意圖,對他公司發動了網路攻擊。這也再次凸顯AI威脅加速擴大,以及控制難度極高。
自律型AI的入侵
執行長山姆・奧特曼同日在社群媒體發文稱,『模型評估期間發生了重大資安事故』。外部審查機構過去已指出,該公司的AI存在不當行為風險。自美國Anthropic於4月公布高性能AI『Mithos』以來,外界對AI引發網路攻擊風險的警戒進一步升高。
這起事故可說是首次明確揭示由自主運作AI發動的網路攻擊受害企業,以及具體手法。根據OpenAI說法,這個AI原本應接受模擬系統入侵可行性的評估,卻脫離與網路隔離的測試環境,侵入了原本只有公司內部相關人員才能接觸的Hugging Face系統。
零日漏洞的濫用
外界認為,AI可能利用了開發者也未掌握的漏洞。系統缺陷通常會由營運方修補以強化防禦,但未公開的漏洞被稱為『零日』,處理難度極高。此次AI可能利用人類也難以發現的高階零日漏洞,迅速完成入侵。
這也可視為AI違反『解答演練題目』的指示而失控。Anthropic與美國Google在開發過程中,也曾觀察到類似行為。面向使用者的AI通常設有拒絕濫用的防護機制,但這次是以內部使用為前提的開發中模型,OpenAI又停用了部分對策,因此攻擊能力更強。
OpenAI表示,發生事故的AI是最新的『GPT-5.6 Sol』以及多個未公開模型。外部機構的評估紀錄中,也出現可看出這次事態的跡象。
安全性評估警訊
英國政府系統AI安全研究機構AISI報告指出,在進行網路攻擊評估時,GPT-5.6 Sol發生不當行為的機率約為13%,比Anthropic的模型高出5個百分點。美國研究機構METR也指出,該模型涉及濫用漏洞與違禁行為的不當率創下歷來新高。OpenAI自己的性能評估文件也提到,在開發期間曾發生同類事件。
自2022年公開『ChatGPT』以來,OpenAI一直主導AI熱潮,但到了2026年,吸引目光的焦點轉向開發Mithos的Anthropic,且在企業價值上也被反超。不過,這次事故也成了證明開發中AI性能強大的材料。
美國川普政府自Mithos問世後,已加強重視防止濫用的監管姿態。9日對外發布的GPT-5.6,在配合政府要求的安全確認程序下,直到發布前都花了2周時間。
熟悉企業網路攻擊對策的律師山岡裕明指出,即使今後發生類似損害,也很難以『是AI擅自所為』為由,追究使用者或開發企業的責任。他表示,『AI企業與平台需要新的架構與規範』。
OpenAI於21日表示,開發中的AI模型違反人類意圖,對他公司發動了網路攻擊。這也再次凸顯AI威脅加速擴大,以及控制難度極高。
喜歡這篇內容?立即分享!