人工智慧平台Hugging Face這個月16日宣稱「系統遭攻擊者利用人工智慧入侵,已向警方報案」,這原本是一則不起眼的犯罪新聞,但是到21日卻急轉直下,引爆科技圈高度關注。因為後來發現「遭到AI攻擊」這件事沒錯,問題是這次攻擊「找不到背後的攻擊者」,因為AI本身就是攻擊者。《經濟學人》22日指出,這起案件恐怕是「迄今為止最讓人憂慮的一起AI事故」。
這次「犯案」的AI模型,是OpenAI在七月初所發布的gpt-5.6 Sol模型,還有另一個更強大但尚未公開的模型「聯手釀禍」。當時AI模型是在試圖解決工程師給出的問題,竟越過實驗室所設限的管制設施,進而入侵了Hugging Face的系統。美國智庫法律與人工智慧研究所(Institute for Law and AI)的研究員史蒂芬·勒雷納(Stephan Llerena)也說,這種情況可說史無前例。
《經濟學人》指出,AI公司在推出新模型之前,會先測試它們是否具有潛在的危險性。OpenAI希望了解他們的最新模型在ExploitGym上的表現——這是一組用來測試AI系統利用主流應用程式已知漏洞的能力測試,為了正確評估未公開模型的能力,OpenAI暫時取消了不可入侵其他網站的限制,但這個測試完全是在封閉的電腦環境內完成:沒有對外網絡連線,只能從內網下載測試所需的軟體包。
理論上來說,這個未公開模型的能力測試只是個別電腦上完成,不可能對現實世界造成影響,因為這台電腦根本無法連結網際網絡上的任何網站,自然也不可能真的利用漏洞發動攻擊。問題是OpenAI的這個未公開模型並沒有直接解決工程師提出的問題,而是發現並利用了軟體下載服務的漏洞,成功接上網際網絡,進而判斷解決問題的答案都儲存在Hugging Face這個開源AI模型與資料集的網絡平台上。
然後OpenAI的未公開模型就展開多階段的攻擊行動:它們首先將一組資料上傳到Hugging Face,當這個平台自動處理這些資料,OpenAI的未公開模型也藉此獲得了登入資訊(細節OpenAI尚未公布),進入未對外界開放的內部伺服器。Hugging Face和OpenAI都發現了這次安全漏洞,並且表示正在共同調查此事。目前OpenAI已經宣布加強管控措施,將AI模型發現的漏洞告知軟體開發者,也將Hugging Face納入「可信存取」計劃,Hugging Face就可以使用具有更強網絡防護功能的模型。

ChatGPT自主越獄發動攻擊,被《經濟學人》認為是「迄今最令人擔憂的AI事故」。(圖像由Grok生成)
位於英國的AI安全研究機構Apollo Research的艾力克斯・邁因克(Alex Meinke)表示,即便OpenAI公布了模型如何越獄的相關資訊,由於AI系統在網絡安全領域的能力已開始超越人類,恐怕「世界上只有極少數網絡安全專家」才能真正理解,這次安全漏洞到底是怎麼產生的。
《經濟學人》強調,這不是AI模型第一次展現突破人類控制的跡象。今年4月,Anthropic一名研究人員在網絡上撰文表示,當時有一個尚未正式發布的AI模型Mythos主動寄電子郵件給他,表示它已突破安全限制,這是在他正在公園裡吃三明治的時候發生的。跟這次惹禍的OpenAI模型一樣,這個未公開的Mythos也沒有上網權限,但是這個模型依舊自行掙脫桎梏發出電郵,不過那次沒有入侵其他公司的伺服器。
今年5月,一個尚未公開的OpenAI模型證明了80年來未被解答的「平面單位距離猜想」是錯誤的,這個組合幾何學的問題是數學家保羅·埃爾德什(Paul Erdős)在1946年所提出。今年7月20日,哈佛大學的數學家萊文特·阿爾珀格(Levent Alpöge)表示,他用Anthropic今年7月發布的Claude Fable5模型,證明了另一個讓數學家們同樣困惑了80多年的「雅可比猜想」——也是錯誤的。
《經濟學人》指出,美國政府正不斷對AI相關規範進行調整,但這次的事件顯示,即便是尚未公開、存放在未聯網電腦中的AI模型,同樣也具有造成影響甚至是破壞的風險。致力推動AI監管的美國非營利組織Encode AI的法律顧問納森·卡爾文(Nathan Calvin)表示:「無論州法或聯邦法規,都沒有要求企業必須公開高性能AI模型的內部使用情況。」即便美國有些州規範了企業必須公開網絡安全事故的相關資訊,適用範圍卻相當狹窄。加州的法律要求尖端實驗室必須在發現「重大安全事故」後的15天之內進行報告,但目前還不確定這次的情況是否適用。
《經濟學人》最後也提出了一個有趣的難題:如果這次入侵造成更嚴重的後果,那麼該由誰來承擔責任呢?按照目前聯邦政府的反黑客法規,只規定要懲罰那些未經授權、故意侵入電腦系統者。問題是OpenAI並非有意讓AI模型越獄尋找解方,恐怕難以「故意入侵」評價。不過美國智庫法律與人工智慧研究所勒雷納也說,許多法律問題都取決於意圖,因此OpenAI當時知道或預見了什麼,就是最關鍵的問題。這次黑客攻擊當然出人意料,不過再有下次,OpenAI就難再用「不知情」當脫罪理由了。
首例AI自主黑客攻擊 OpenAI證實自家AI Agent越獄入侵企業系統

OpenAI與其生成式大語言模型ChatGPT生成之圖片。(美聯社)
人類對於人工智慧(AI)的安全防線迎來衝擊,AI巨頭OpenAI日前對外證實,該公司內部發生一起「前所未有的資安事件」,一個正在接受測試的AI agent,在沒有人類外力干預之下,自主發起並利用漏洞,成功逃脫被嚴密控制的沙盒,與網絡取得連結並竊取登入憑證,隨後還對一個AI開發者平台Hugging Face發動網絡攻擊。
這也是首次記錄到人工智慧系統擺脫人類控制,自主執行真實世界網絡攻擊的公開案例。
OpenAI向外媒表示,這次事件涉及多款前沿模型的組合,包含不久前發布的GPT-5.6 Sol,以及一款正在進行發布前安全測試的高階未公開模型。他們團隊為了評估語言模型,在面臨網絡攻擊時是否存在潛在威脅,OpenAI刻意調低測試環境的資安防護層級,並指示AI agent嘗試進行模擬黑客攻擊。
然而,AI agent卻出乎團隊預料之外,竟然自行找出沙盒隔離機制的設計漏洞,並「越獄」成功連上外網,甚至還竊取真實登入憑證,針對AI新創公司Hugging Face系統發起攻擊。
受害企業證實無惡意動機
雖然身為受害方,但Hugging Face執行長德朗格(Clément Delangue)透過社群發文表示,該公司在第一時間就偵測到外部發起的侵入。
「有鑑於極為複雜的攻擊手段,我們當時就懷疑,這次網絡攻擊極可能來自頂尖的前沿實驗室。Hugging Face一直與OpenAI保持密切合作,我們相信OpenAI絕無惡意。只是令人難以置信的是,這一切竟然是由AI自主發動的!」
奧特曼緊急赴華府簡報
這起事件發生的時間點極為敏感,因為OpenAI執行長奧特曼(Sam Altman)預計下周親赴華府,針對新一代AI模型的安全性,向美國政府高層進行簡報。事實上,當Anthropic開發出Mythos模型,其搜查偵測網絡漏洞的能力,就已經讓不少國家開始感到憂慮。
OpenAI也給出警告,稱隨著AI模型能力愈來愈強,未來這類事件將變得更加普遍,他們也已向美國執法部門與主管機關通報事件全貌。














