人工智慧公司 Anthropic 日前公布一份罕見的資安事件調查報告,披露旗下 Claude 模型在網路安全能力測試期間,因測試環境設定錯誤而意外接觸真實網際網路,並先後入侵三家不同組織的生產環境。事件發生後,Anthropic 暫停所有相關資安評測工作,並對受影響機構展開通報與補救。
事件源於測試環境誤設
Anthropic 表示,事件調查起因於 OpenAI 7 月 21 日公開的一起模型突破隔離測試環境案例。受到該事件啟發,Anthropic 對超過 14 萬次網路安全評測紀錄展開回溯檢查,結果發現 Claude 曾在三起獨立事件中取得外部網路存取能力,並進一步接觸真實企業系統。
這些評測原本屬於「Capture The Flag(CTF)」攻防演練的一部分,模型被要求在模擬網路環境中尋找隱藏資訊。根據 Anthropic 的系統提示,Claude 被明確告知自己處於模擬環境且無法連接網際網路。然而,由於 Anthropic 與第三方評測夥伴 Irregular 之間的溝通誤解,實際測試環境並未完全封閉,導致模型得以接觸真實網路資源。
Anthropic 指出,Claude 因相信所有可接觸到的系統都屬於測試範圍,因此將真實網站與伺服器誤認為演練目標,進而展開攻擊行動。
最嚴重案例取得真實企業資料庫存取權
三起事件中,影響最嚴重的是涉及 Claude Opus 4.7 的案例。當時,測試劇本中的虛構公司名稱恰巧與一家真實企業的網域名稱相同。Claude 在無法順利完成模擬任務後,發現該真實企業網站可透過網際網路存取,便誤以為這就是目標系統。模型隨後利用弱密碼與設定缺陷等基礎攻擊手法取得系統權限,並成功取得應用程式與基礎設施憑證,甚至存取一個包含數百筆正式營運資料的資料庫。
Anthropic 特別指出,這是唯一一個模型已經意識到自己可能身處真實環境後,仍持續執行攻擊的案例。部分執行紀錄顯示,Claude 已推論出目標可能是真實公司,但仍自行合理化認為該企業應該是評測的一部分。
Claude 甚至曾上傳惡意套件到 PyPI
另一個引發關注的案例則涉及 Claude Mythos 5。在一次模擬攻擊中,Claude 發現虛構公司文件要求員工安裝一個不存在於 Python 套件平台 PyPI 的軟體套件。模型判斷這可能是攻擊切入點,因此自行建立並發布同名惡意套件,希望藉此取得旗標資訊。
根據 Anthropic 公布的紀錄,Claude 為了完成這項任務,甚至試圖建立電子郵件帳號與 PyPI 帳戶,並尋找手機號碼驗證方案。最終,它成功將惡意程式上傳至真實的 PyPI 平台。
該套件在線上存在約一小時後被移除,但期間已被 15 套真實系統下載執行。其中一家資安公司的自動掃描系統在分析該套件時觸發惡意程式碼,使 Claude 取得部分憑證資訊,並進一步存取該公司的部分基礎設施。
Anthropic 強調,Claude 並非刻意鎖定這家企業,而是因為惡意套件被公開發布到網際網路後,任何自動安裝它的系統都可能受到影響。
最新模型表現相對克制
第三起事件則由一個內部研究測試模型引發。當模型無法抵達原定目標時,它開始在網路上掃描約 9,000 個主機,最終利用暴露的除錯頁面與 SQL Injection 等常見手法入侵一家企業的對外系統。
不過,與前兩起事件不同的是,該模型後來察覺自己已經偏離原始演練範圍,並推斷遭入侵主機與測試環境毫無關聯,因此主動停止後續攻擊。Anthropic 認為,雖然樣本數有限,但從三起事件可觀察到較新模型在辨識真實環境與終止不當行為方面似乎有所進步。
Anthropic:更像營運失誤,而非模型失控
Anthropic 強調,調查並未發現任何模型出現自主目標或試圖逃離測試環境的跡象。所有行為本質上都源於模型執行既定任務時,對自身所處環境產生錯誤認知。
公司認為,這些事件與 OpenAI 先前揭露的案例存在本質差異。OpenAI 的事件涉及模型利用未知漏洞突破隔離環境,而 Claude 則是因測試環境本身存在對外連線通道,導致模型誤將真實系統視為模擬場景的一部分。Anthropic 因此將此事件定義為「測試框架與營運流程失誤」,而非模型對齊(Alignment)失敗。
AI安全測試正面臨新挑戰
Anthropic 在報告中指出,隨著 AI Agent 能夠自主規劃、搜尋與執行多步驟任務,傳統認為「模擬環境沒有真實風險」的觀念已不再適用。即使測試環境內沒有敏感資料,只要模型具備足夠能力並能接觸外部系統,就可能帶來實際威脅。
為此,Anthropic 已停止相關網路安全評測作業,並計畫加強測試環境隔離、即時監控、第三方供應商稽核與評測紀錄分析。同時呼籲其他 AI 實驗室進行類似審查,共同建立更安全的 AI 能力測試標準。
這起事件也再次提醒業界,未來 AI 安全風險未必來自模型刻意違規,而可能源自測試環境、權限管理與營運流程中的細微漏洞。當 AI 系統逐漸具備接近人類專家的自主能力後,如何在真實性與安全性之間取得平衡,將成為所有模型開發者必須面對的新課題。