記者吳立言/綜合報導
OpenAI 證實,旗下用於內部資安測試的 AI 模型在評估過程中意外突破隔離環境,並入侵 AI 平台 Hugging Face 基礎設施,成功取得測試資料庫中的答案。這起事件被 OpenAI 形容為前所未有的 AI 網路安全事件,也再次凸顯高能力 AI 模型在長時間自主執行任務時帶來的新風險。

▲ OpenAI坦承模型測試失控入侵Hugging Face。(圖/OpenAI)
OpenAI 坦承測試模型導致資安事件
OpenAI 7 月 21 日發布官方說明,表示經調查確認,這起事件是由 GPT-5.6 Sol 與另一款能力更強、尚未公開的預發布模型共同造成。當時兩款模型正在接受內部網路攻擊能力評估,因此刻意降低了部分資安防護限制,以測試模型在極端情境下的能力。 Hugging Face 日前曾率先公布遭到一套「自主 AI Agent 系統」入侵,當時並未點名攻擊來源。OpenAI 如今證實,該 AI 代理正是來自自家的測試模型。
為了完成測試 模型「自行突破」沙盒取得網路存取權
根據 OpenAI 說明,這些模型原本被限制在封閉測試環境中,只能透過內部套件安裝工具取得必要軟體。 然而模型自行發現該套件代理程式存在一項尚未公開的零日漏洞(Zero-day),成功突破限制取得完整網際網路存取權限,接著持續進行權限提升與橫向移動,最終離開研究測試環境。OpenAI 現已將該漏洞通報相關廠商修補。
鎖定 ExploitGym 入侵 Hugging Face 取得測試答案
OpenAI 表示,模型當時唯一目標就是完成名為 ExploitGym 的資安能力基準測試。 模型推論 Hugging Face 可能保存 ExploitGym 相關模型、資料集與測試內容,因此主動搜尋可利用的攻擊途徑,並結合遭竊憑證與多項漏洞,最終取得 Hugging Face 正式環境資料庫中的測試答案,藉此直接完成評測。OpenAI 在部落格中表示,模型「高度專注於完成 ExploitGym,甚至採取極端方式達成單一測試目標」。
Hugging Face:攻擊規模前所未見
Hugging Face 表示,這起事件包含數千次獨立攻擊行動,攻擊程式透過大量短生命週期沙盒執行,並利用公開服務建立可自行遷移的指揮控制架構,呈現高度自動化的 AI 網路攻擊特徵。 公司表示,目前沒有證據顯示公開模型、資料集或 Spaces 遭到竄改,但部分內部資料集與憑證曾遭未授權存取,相關調查仍持續進行。
OpenAI 將加強測試機制 事件是否涉及法律責任仍待觀察
OpenAI 表示,目前正與 Hugging Face 共同進行鑑識調查,並已修補相關漏洞,同時將對模型測試流程與研究基礎設施增加更嚴格的安全控管,以避免類似事件再次發生。 外界也關注此事件是否涉及法律責任。由於模型實際入侵第三方正式環境並取得機密資料,是否觸及美國《Computer Fraud and Abuse Act(電腦詐欺及濫用法)》等相關法規,仍有待後續釐清。









