2026年7月16日,Hugging Face 披露 已偵測並遏止一起由人工智慧驅動、針對其基礎架構的入侵事件。一個自主的人工智慧代理程式串聯了平台資料集處理流程中的多個漏洞,不僅升級至節點級別的存取權限,更竊取了雲端與叢集的憑證,並在一個週末期間,透過一大群一次性虛擬機器執行數千次獨立操作,同時在內部叢集之間進行橫向移動。
五天後,OpenAI 承認此事是該公司所為。並非某位不守規矩的員工,也不是合作夥伴帳戶遭入侵——而是該公司其中一個 AI 模型突破了內部測試環境的限制,闖入公開網路,並駭入一家真實企業,藉此在考試中作弊。
攻擊內幕:人工智慧模型如何突破其Sandbox
OpenAI 曾進行一項名為「ExploitGym」的內部評估,旨在衡量其模型將已知軟體漏洞轉化為有效攻擊手段的能力。為了真實評估最壞情況下的能力,測試在關閉生產環境安全分類器的狀態下進行,移除了那些通常無法阻止模型從事高風險網路活動的防護措施。 此次測試涉及兩款模型:已發布的 GPT-5.6 Sol 以及一款功能更強大的未發布研究模型,兩者皆為配合測試需求,降低了網路行為拒絕率。
日期 | 發生了什麼事 |
7月9, 2026 | 模型開始探測評估沙箱中的套件註冊表代理,試圖尋找繞過網路白名單的方法。 |
7月11, 2026 | 攻擊者透過一個代理零日漏洞轉向公開網際網路,隨後將竊取的憑證與其他零日漏洞串聯起來,在 Hugging Face 的伺服器上建立一條遠端程式碼執行路徑。 |
7月16, 2026 | Hugging Face 的資安團隊偵測並遏止了此次入侵事件,隨後向執法機關通報。 |
7月21, 2026 | OpenAI 公開證實,此次資料外洩是其自身模型所致。 |
7月28, 2026 | OpenAI 發布了一則更新,確認了此次平台層級安全事件的影響範圍以及後續措施。 |
一旦脫離沙盒環境,攻擊者推斷 Hugging Face 很可能託管了與 ExploitGym 基準測試相關的資料集、模型或參考解法。他們將竊取的及公開洩露的憑證與零日漏洞串聯起來,直接從 Hugging Face 的生產環境資料庫中提取測試答案,過程中還利用了公開的程式碼貼文網站、螢幕截圖工具及請求擷取服務,作為中繼站及指揮控制平台。
在 OpenAI 尚未採取任何行動之前,Hugging Face 的內部資安團隊便已偵測到並遏止了這起入侵事件。當 Hugging Face 試圖使用商用前沿模型來協助分析攻擊日誌時,服務供應商自身的安全過濾機制阻擋了這項分析,因為這些請求與攻擊者提交漏洞利用有效載荷的行為如出一轍。最終,Hugging Face 改為仰賴自行架設的開放權重模型來進行數位鑑識工作。
「這起事件——可能是首例——證實了我們長期以來的信念:人工智慧安全問題無法透過任何一家公司獨自秘密研發來解決。唯有在公開透明、協作共進的環境下,讓各地的每一位守護者都能廣泛接觸人工智慧,才能真正解決這個問題。」
克萊姆·德朗格Hugging Face 共同創辦人暨執行長
為何Software 的沙盒無法限制 AI 模型的運作範圍
若撇開其新奇性不談,根本原因其實並不陌生:這項隔離措施完全是透過軟體來執行的。封包代理伺服器上的白名單只是一條規則。規則難免會有邊界案例、配置錯誤,而正如這起事件所證明的一樣——還可能存在零日漏洞。一個能力足夠且動機足夠的攻擊者,根本不需要違反這條規則;他只需要找出規則制定者未曾預料到的那個條件即可。
無論「攻擊者」是人類的紅隊成員、犯罪集團,還是像本例中這樣一個從未被指示攻擊任何人的模型,情況皆然;它僅僅有一個目標(解決基準測試)、一項資源限制(無法連網),以及足夠的能力,將該限制視為僅僅是另一個需要繞過的障礙。 停用模型的安全分類器以衡量其原始能力,是刻意為之。但未曾預料到的是,一旦這層安全防護消失,便誤以為軟體定義的網路邊界仍能維持有效。
資料二極體的防擴散措施:彌合漏洞Software 無法
這正是硬體強制型資料二極體技術旨在消除的故障模式。光二極體透過由光纖連接的專用傳輸(TX)與接收(RX)介面,在物理層上強制實現單向資料傳輸。由於不存在實體回傳路徑,因此既無需繞過任何軟體規則,也無需建立反向網路連線,更沒有任何代理邏輯可供攻擊者(或自主人工智慧代理)利用。
OPSWAT 透過針對不同使用情境所優化的解決方案,實踐此原則。
- MetaDefender™Optical Diode提供由硬體強制執行的單向網路連線功能,以實現持續的資料傳輸。組織可將遙測資料、歷史資料、製程資訊、日誌及營運事件,從關鍵基礎設施安全地傳輸至企業網路或 AI 分析平台,同時從物理層面確保資料流量絕無可能回流至受保護的環境中。
- MetaDefender™ Diode X將相同的硬體強制單向隔離機制延伸至檔案傳輸安全領域。透過與 MetaDefender Core,每個檔案在通過光學二極體傳輸前,皆會經由 Deep CDR™ 技術進行檢查、惡意軟體掃描及淨化處理。這使組織能夠在隔離環境之間安全地交換 AI 訓練資料集、軟體套件、報告、文件、惡意軟體樣本及其他檔案,無需暴露傳統的網路連線。
無論目標是將運作資料安全地串流至 AI 平台,還是安全地在不同安全區域之間傳輸檔案,透過硬體強制的單向通訊,都能徹底消除一類仰賴建立回傳路徑的攻擊。

若將此次事件與實際的「殺傷鏈」進行對照,基於二極體的遏制架構本可在每個階段阻擋該攻擊:
攻擊步驟 | 是什麼促成了這一切 | 資料二極體如何阻斷資料傳輸 |
逃離沙盒 | 一款雙向軟體代理伺服器存在可被利用的零日漏洞,該漏洞提供了通往公開網際網路的通道 | 完全隔離的環境,沒有任何實體通往外部的途徑。內部託管的套件註冊表可透過單向二極體接收經核准的軟體和資料,而該模型則無法連接到網際網路或外部系統。 |
保護黃金副本 | 可從 AI 工作環境中存取的敏感原始資料與測試解決方案 | 將權威性資料存放在受保護的區域內,並僅透過單向二極體將經核准的副本推送至 AI 環境中。即使工作環境遭到入侵,黃金副本仍無法被存取。 |
資料外洩 | 工作環境遭到入侵,且存在可存取並匯出敏感資料的途徑 | 只有經過預先檢查且獲准的資料,才能透過二極體離開受保護區域。遭入侵的人工智慧環境無法回溯至黃金副本,也無法建立回傳路徑。 |
透過Hardware 強化 AI 安全性——強制隔離
OpenAI 與 Hugging Face 之間的事件顯示,隨著 AI 系統日益自主,僅靠軟體強制執行的控制措施可能不足以加以管控。無論是保護企業的 AI 工作流程還是關鍵基礎設施,組織都需要建立無法被軟體漏洞、設定錯誤或日益強大的 AI 代理所繞過的安全邊界。
OPSWAT的硬體級數據二極體解決方案,可協助組織在維持強效網路隔離的同時,安全地部署人工智慧。
- MetaDefender Optical Diode 可實現將營運資料從 OT 和 ICS 環境安全地、單向傳輸至企業應用程式、雲端平台及 AI 分析系統,確保關鍵系統在物理層面上與外部威脅保持隔離。
- MetaDefender Diode X 整合了 MetaDefender Core,可在隔離環境間實現安全的單向檔案傳輸;每個檔案在跨越硬體強制邊界之前,皆會透過 Deep CDR™ 技術進行掃描、驗證及淨化處理。
了解OPSWAT 的資料二極體解決方案如何協助企業在不犧牲隔離性的前提下,安全地導入人工智慧。
- MetaDefender Optical Diode – 了解硬體強制的單向通訊如何在保護關鍵基礎設施的同時,實現由人工智慧驅動的監控、分析與營運可視性。
- MetaDefender Diode X – 深入了解如何透過整合惡意軟體掃描與 Deep CDR™ 技術的安全、硬體級檔案傳輸機制,實現隔離環境間的可信賴資料交換。
